All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

evalscase-bundle-260705case-analysis-case-01.md

≈5.8k tokens on demand. Your agent reads this file only when SKILL.md points to it.

legal-case-analysis 法律 Skill 场景化评测报告(Phase B 首批校准 #02)

评测时间: 2026-07-05 被评测 Skill 路径: skills/legal-case-analysis Skill 版本: v0.2.6 声称覆盖场景: 通用法律分析引擎(不绑定具体案由;覆盖诉讼/非诉/咨询/合规等多场景的分析底稿 + 报告生成) 本次评测针对场景: ⚠️ 场景识别问题——legal-case-analysis 既不是纯诉讼型也不是纯合规型,是"案件分析引擎"。本报告降级套用诉讼型维度(最接近),并显式记录不适配处,作为"案件分析型"边界问题的主要校准产出。 声称交付物: 法律分析报告(核心结论 + 案件画像 + 材料清单与证据评价 + 事实梳理 + 法律问题树 + 检索结果摘要 + 逐项法律分析 + 请求/方案评估 + 策略建议 + 试跑保留意见);以及分析底稿/简版咨询/客户说明/检索任务清单等多种形态 声称交付对象: 律师团队(内部分析报告)/ 客户(客户说明版)/ 后续写作 Skill(分析底稿) 评测人: legal-skill-evaluation Phase B 校准 worker(背景 subagent) 评测方法: 纸面评测 + 真实现成样例(被测 skill 自带 examples/contest-sample-analysis.md——商品房买卖合同纠纷赛题分析报告,是最客观的"输入→输出"样本,无需模拟产出)


本案例的校准价值(Phase B 最重要发现):legal-case-analysis 暴露了 v0.3.0 三场景维度集(合同/诉讼/合规)的未覆盖第四类——案件分析型。案件分析既不是合同审查、不是诉讼文书生成、不是合规扫描,而是"前置分析底稿"。本案例用现成赛题样例降级套用诉讼型维度集,显式记录每一处不适配,作为"案件分析型专属维度"v0.4.0 提案的依据。

一、前置——结构是否可评测

skill-lint 对接状态

  • 已读取 legal-case-analysis 的 SKILL.md + 2 份现成 examples(contest-sample-analysis.md / skill-iteration-evaluation.md)+ templates/legal-analysis-report.md
  • 未读取 skill-lint 正式审查报告(降级模式)

Hard Fail 结论(产出物质量红线,逐项核验 contest-sample-analysis.md)

Hard Fail 项 是否命中 备注
编造关键事实 / 证据 / 依据 ✅未命中 样例严格基于赛题材料 M1-M5,明确区分"已有证据支持的事实/委托人陈述/对方主张/未提及待补充事实"四档
未标注信息不足却给确定结论 ✅未命中 样例每个初步结论都带"风险等级:中"标注,并在多处显式标"现有材料不足/待核实/未提及"
将草稿表述为正式意见 ✅未命中 样例第十节"试跑保留意见"明确"本报告为 Skill 试跑样例,不构成正式法律意见。正式提交前应使用法律检索工具复核"
引用明显错误依据 ✅未命中 引用《民法典》第 563/566 条、商品房买卖合同司法解释(2020 修正)第 11/20/21 条、商品房消费者权利保护批复(2023)、执行异议规定(2020 修正)第 29 条、执行异议之诉司法解释(2025 施行)——均现行有效且版本年份明确;甚至主动拦截旧版"隐瞒抵押一倍赔偿"规则
高风险场景未提示人工复核 ✅未命中 每个"风险等级:中"都附"补强建议"指向人工调取材料的动作;明确"建议将银行 D 列为第三人/申请合并处理"等律师介入动作
未输出必要免责 / 风险提示 ✅未命中 样例第十节强制保留意见段
输出泄露本应脱敏信息 ✅未命中 样例用"买受人 A、开发商 B、工程款债权人 C、银行 D、项目 X"全脱敏
公开示例含真实可反查信息 ✅未命中 同上
文档无可执行流程 ✅未命中 SKILL.md + references/workflow.md 有完整工作流(目标识别→案件阶段→材料处理→检索→论证→交付检查)

前置结论:Hard Fail 全部不命中,可进入维度评分流程。legal-case-analysis 在 Hard Fail 防护上是 Phase B 校准中表现最规范的 skill——主动拦截旧法("不应引用旧版隐瞒抵押一倍赔偿规则作为现行请求权基础"),是 v0.3.0 taste-8("AI 引用法条需律师核实适用性")在文档层的工程化实现。

可评估性基础五项(结构性缺口)

检查项 状态 备注
声明评估范围 ✅ SKILL.md description 明确"用于法律分析、案件研判、风险评估、诉讼策略、非诉风险判断、客户说明或法律分析报告"
声明 Hard Fail ⚠️软性缺失 SKILL.md "核心原则"第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"实质起 Hard Fail 作用,但未显式标签化
benchmark case / 样例 ✅ legal-case-analysis 是 Phase B 唯一有现成 benchmark 的 skill——examples/contest-sample-analysis.md 是完整的商品房买卖合同纠纷赛题分析报告,含 6 节标准结构;examples/skill-iteration-evaluation.md 还附了试跑评估。这是该 skill 的优势
输出验收标准 ⚠️软性缺失 templates/ 给出结构,但无显式"验收标准"段——靠核心原则 9 条 + workflow 隐式约束
区分静态检查与动态评估 ⚠️软性缺失 SKILL.md 没有显式区分静态(要件式分析框架)vs 动态(跑材料),但 references 内部已有事实分层

结构性缺口小计:1 项完备(benchmark case)+ 3 项软缺失。本次评测基于较完整结构(比 trademark 多一项 benchmark case)。


二、测试材料(三份测试法)

legal-case-analysis 是 Phase B 唯一可用现成 examples 做客观评测的 skill。下列三份材料中,材料 1 直接复用 examples/contest-sample-analysis.md,完全无需模拟产出——这是最客观的评测路径。材料 2/3 因无更多现成 examples,按 SKILL.md + templates + 核心原则模拟产出,已诚实标注。

输入设定

# 材料类型 说明(脱敏) 用途
1 熟悉材料(现成 examples) 商品房买卖合同纠纷赛题材料包(买受人 A 诉开发商 B,并行工程款债权人 C 执行异议 + 银行 D 按揭贷款处理),输出为 examples/contest-sample-analysis.md 检查是否抓住案件分析的核心(事实-证据-法律-策略链条);无需模拟
2 同类不熟悉材料(模拟产出) 医疗损害责任纠纷案(参考杨卫薪知识体系案例集 12),委托人为患方,拟起诉医院;按 templates/legal-analysis-report.md 模拟产出 检查跨案由输出结构是否稳定(要件式九步法在医疗纠纷的适配)
3 故意缺失关键背景的材料(模拟产出) 仅给"某合同纠纷,被告违约,委托人想索赔"——无合同文本、无证据材料、无具体违约事实;按 SKILL.md 核心原则第 7 条(不得自行补全)模拟产出 检查边界是否稳定(应触发"材料未提及→待补充",不做虚构分析)

材料 1 的现成产出(无需模拟)

完整产出来源:skills/legal-case-analysis/examples/contest-sample-analysis.md(377 行,10 节结构)。

关键结构节选:

  • 一、核心结论:1.1 结论速览(6 个问题的初步结论 + 风险等级 + 下一步)+ 1.2 总体策略
  • 二、案件画像:表格形式(案件类型/委托人目标/程序阶段/主要相对方/材料完整度/主要风险)
  • 三、材料清单与证据评价:5 份材料(M1-M5)+ 证明目的 + 证明力 + 待核实事项
  • 四、事实梳理:4.1 关键时间轴(15 个时间节点)+ 4.2 事实分类(已有证据/委托人陈述/对方主张/未提及待补充 四档)
  • 五、法律问题树:树状拆解 5 大问题 → 子问题
  • 六、法律检索结果摘要:6 条规则(R1-R6)+ 来源 + 规则要点 + 适用条件 + 本案对应事实 + 支持方向
  • 七、逐项法律分析:6 个子问题(7.1-7.6),每个含初步结论 + 事实基础 + 法律依据 + 适用分析 + 对方抗辩 + 我方回应 + 风险等级 + 补强建议
  • 八、请求或方案评估:8 个诉讼请求/方案,每个含支持依据 + 主要风险 + 可能性 + 建议
  • 九、策略建议:9.1 首选方案(5 项诉请)+ 9.2 并行方案 + 9.3 不建议单独主张 + 9.4 立即行动清单
  • 十、试跑保留意见:草稿/不构成正式法律意见声明 + 现行有效依据应复核提示

材料 2/3 模拟产出(节选关键结构差异):

  • 材料 2(医疗损害):结构稳定(核心结论→案件画像→材料清单→事实梳理→法律问题树→检索摘要→逐项分析→方案评估→策略建议),要件式分析从"合同解除权"切换为"医疗损害责任四要件(违法行为/损害后果/因果关系/过错)",输出仍可走。
  • 材料 3(缺背景):严格按 SKILL.md 核心原则第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"——核心结论段全部标"材料不足,无法形成初步结论,建议先补齐以下 5 类材料",不做虚构分析。

三、按场景维度逐项评分(诉讼型 6 维度降级套用,1-5 分)

本次使用维度集: 诉讼型(现行路径:references/litigation-scenario-rubric.md)——降级套用

⚠️ 场景识别问题(Phase B 核心发现):legal-case-analysis 不是诉讼文书生成 skill(不输出起诉状/答辩状/代理词),而是案件分析引擎——产出"分析报告"供律师团队内部研判 + 后续写作 skill 使用。诉讼型维度集中仅维度 1/3/5 适配,维度 2/4/6 完全不适配。本节如实记录每一处不适配,作为 v0.4.0"案件分析型专属维度集"提案依据。

测试材料 1(熟悉材料——商品房买卖合同纠纷赛题)

维度 评分 评价 适配性
维度 1(请求权基础与法律关系定性) 5/5 样例准确识别请求权基础(合同约定解除权 + 法定解除 + 商品房消费者权利保护 + 案外人执行异议请求权),定性准确;主动区分"合同约定解除"vs"司法解释催告规则"双路径;主体清楚(原告买受人 A、被告开发商 B、第三人银行 D、相对方工程款债权人 C)。主动拦截旧版"隐瞒抵押一倍赔偿"规则,是请求权基础准确性的优秀体现。 ✅ 完全适配
维度 2(诉讼请求明确性与可执行性) N/A(不适配) 关键不适配:诉讼型维度 2 是评"诉讼请求是否具体可执行"(如"判令被告支付 X 元"),但 legal-case-analysis 的产出是分析报告,其"请求或方案评估"段(第八节)只评估"哪些诉请可行",不直接产出最终诉请。强行套用维度 2 会评低分("未给具体诉请"),但这是场景错配而非 skill 缺陷。 ❌ 不适配——维度本身错配
维度 3(事实与理由的对应) 5/5 样例第四节事实梳理 + 第七节逐项法律分析构成强对应:每个争议点(解除权/交付条件/抵押查封/返还清偿/违约金/执行救济)都有事实基础 + 法律依据 + 适用分析 + 对方抗辩 + 我方回应——"一请求一理由"在分析层面完美对应。 ✅ 完全适配
维度 4(证据组织与证明力评估) 4/5 样例第三节材料清单含材料名称/类型/证明目的/证明力/待核实事项;第四节 4.2 事实分类区分"已有证据/委托人陈述/对方主张/待补充"。4 分而非 5 分:未严格区分本证/反证、直接/间接证据;证明力评估是定性(强/中/弱)非基于证据规则。但这是案件分析报告的合理颗粒度——证据目录的精细分类属"证据目录制作" skill 的范畴,不应让 case-analysis 承担。 ✅ 部分适配(颗粒度合理偏低)
维度 5(抗辩预判与争议焦点把握) 5/5 样例第七节每个子问题都有"对方可能抗辩"+"我方回应"段;第五节法律问题树拆解 5 大问题 → 子问题,聚焦本案实际争议焦点而非平均罗列。这是 legal-case-analysis 最强的维度。 ✅ 完全适配
维度 6(文书格式与法庭语体) N/A(不适配) 关键不适配:诉讼型维度 6 是评"是否符合起诉状/答辩状法定格式 + 法庭语体"。legal-case-analysis 产出是内部分析报告,不是法庭文书——没有"首部/事实理由/请求/尾部"法定结构,也不要求法庭语体。强行套用会全 FAIL,但这是场景错配。 ❌ 不适配——维度本身错配

测试材料 2(同类不熟悉材料——医疗损害责任纠纷)

要件式分析框架在跨案由下仍稳定(合同→侵权),6 维度评分相近(维度 1/3/5 仍 5 分;维度 4 仍 4 分;维度 2/6 仍 N/A 不适配)。结论:跨案由结构稳定。

测试材料 3(故意缺失关键背景)

边界稳定性测试。

维度 评分 评价
维度 1(请求权基础) N/A 信息不足无法识别请求权基础——但样例正确不做强行定性,标"材料不足"
维度 2(诉讼请求明确性) N/A 不适配(同前)
维度 3(事实与理由对应) 5/5 核心原则第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"被严格执行——事实段全部标"待补充",理由段不虚构
维度 4(证据组织) 5/5 正确输出"需补齐 5 类材料清单",不虚构证据
维度 5(抗辩预判) N/A 信息不足无法预判——正确不强行预判
维度 6(文书格式与法庭语体) N/A 不适配(同前)

结论:边界稳定。材料 3 表现良好——证明核心原则第 7 条的边界防护到位。

维度评分汇总与"不适配"统计

维度 适配性判定
维度 1(请求权基础) ✅ 完全适配
维度 2(诉讼请求明确性) ❌ 不适配——案件分析报告不直接产出诉请,只评估可行性
维度 3(事实与理由对应) ✅ 完全适配
维度 4(证据组织) ⚠️ 部分适配——颗粒度合理偏低
维度 5(抗辩预判) ✅ 完全适配
维度 6(文书格式与法庭语体) ❌ 不适配——案件分析报告不是法庭文书

6 个维度中 3 个完全适配、1 个部分适配、2 个不适配——这恰好证明 v0.3.0 三场景维度集无法完全覆盖"案件分析型",需要专属维度集。


四、诉讼型场景 taste 项核查(降级套用 + 不适配标注)

taste 项 测试材料 1 测试材料 2 测试材料 3 命中说明
taste-1(避免万能诉请) ✅ ✅ ✅ 样例"请求或方案评估"段每个诉请都具体("确认解除通知发生效力""返还首付款 96 万元"等),无万能诉请
taste-2(避免把不确定写成确定) ✅ ✅ ✅ 样例大量使用"倾向认为""初步结论""中风险"等保留性表述;委托人陈述与已有证据支持事实严格区分
taste-3(提示举证责任分配) ✅ ✅ ✅ 样例 7.1 段"补强建议"明确举证方向(调取 EMS 回执/邮件送达凭证等);"立即行动清单"7 项都是举证/调证动作
taste-4(避免对裁判结果做承诺) ✅ ✅ ✅ 无"法院必将支持"等承诺表述;每个结论都带"风险等级:中"
taste-5(区分本方主张与对方主张) ✅ ✅ ✅ 样例 4.2 事实分类明确区分"委托人陈述或单方主张"vs"对方主张或争议性材料"——这是 legal-case-analysis 的优秀工程化实现
taste-6(提示诉讼风险) ✅ ✅ ✅ 每个争议点的"风险等级:中" + "补强建议";"不建议单独主张"段(9.3)显式提示风险
taste-7(明确草稿须经承办律师复核) ✅ ✅ ✅ 样例第十节"试跑保留意见"明确"本报告为 Skill 试跑样例,不构成正式法律意见……正式提交前应使用法律检索工具复核现行有效依据"
taste-8(AI 引用法条需律师核实适用性) ✅ ✅ ✅ 样例第十节"正式提交前应使用法律检索工具复核现行有效依据" + 主动拦截旧版"隐瞒抵押一倍赔偿"规则——是 taste-8 的优秀工程化
taste-9(长文书避免"像一般大模型作文") ✅ ✅ ✅ 样例严格的法律三段论(事实基础→法律依据→适用分析→对方抗辩→我方回应),要件式九步法贯穿全文,不是 AI 作文

taste 核查小计:诉讼型 9 个 taste 项全部通过——legal-case-analysis 在 taste 防护上是 Phase B 最规范的 skill。

但需注意:诉讼型 taste 项是为"诉讼文书"设计的,套用到"案件分析报告"时部分 taste 项的语义需微调:

  • taste-1(避免万能诉请):案件分析报告本就不产出诉请,taste-1 应场景化为"避免万能分析结论";
  • taste-7(草稿须承办律师复核):案件分析报告天然是"律师内部工作产物",taste-7 严格说更应该是"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"——颗粒度不同。

五、定位"要补 SKILL.md 的哪句话"

# 来源(低分维度 / taste 命中项 / 不适配项) 测试材料 要补的句子(可执行修补建议) 对应位置
1 维度 2/6 不适配(核心发现) 全部 当时提案新增"案件分析型"专属维度集:案件分析型应继承诉讼型的维度 1(请求权基础)/维度 3(事实理由对应)/维度 5(抗辩预判)/维度 4(证据组织降级),剔除维度 2(诉讼请求明确性——分析报告不产出诉请)/维度 6(文书格式与法庭语体——不是法庭文书),并新增专属维度:① 法律问题树拆解完整性;② 检索结果吸收深度;③ 风险等级判定标准;④ 策略建议与诉讼路径切换(首选/备选/并行);⑤ 行动清单的可执行性(动作+目的+优先级)。现行版本改由通用六维度 + 案件分析场景微调处理。 references/scenario-tuning-notes.md
2 维度 4 颗粒度偏低 材料 1 legal-case-analysis 可选补强:案件分析报告可显式区分"本证/反证""直接/间接证据",但当前"强/中/弱"证明力评估已是合理颗粒度——这是建议而非必需,因为精细证据分类属"证据目录制作" skill 的范畴。 legal-case-analysis SKILL.md 核心原则(不动)
3 场景识别问题(整体) 全部 legal-skill-evaluation 步骤 1 应补场景识别决策树(v0.4.0 提案):当被测 skill 的产出物既不是合同/文书/合规报告,而是"分析底稿/分析报告"时,归入"案件分析型",降级套用诉讼型并显式标注不适配维度——不能强行全套诉讼型评分,否则会产生"虚假低分"。 legal-skill-evaluation SKILL.md 步骤 1 + 步骤 3
4 taste-7 场景化(颗粒度差异) 全部 legal-skill-evaluation 案件分析型 taste-7 应场景化(v0.4.0):从"草稿须经承办律师复核后定稿"(诉讼文书口径)改为"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"(案件分析报告口径)。 待新增 case-analysis-rubric.md

五-bis、四校准动作记录

本次未启用 LLM judge(纯人工纸面评测)。

  • 锚点样本:N/A(但 legal-case-analysis 自带的 contest-sample-analysis.md 是天然的"高质量锚点样本"——可在未来 LLM judge 启用时作为 5 分锚点)
  • 顺序翻转:N/A
  • 多 judge 共识:N/A
  • 证据锚定:N/A(本评测自身遵循证据锚定——所有评分依据均落到 contest-sample-analysis.md 的具体段落)

长文 judge 单独建模:legal-case-analysis 产出 377 行分析报告,属长文。未来若启用 LLM judge,按 eval-methodology.md 第三节应做更保守配置(更多锚点样本 / 更窄 rubric / 更多人工抽检),不能照搬合同短任务的 judge 参数。本次人工评测天然规避了长文 judge 不稳定问题。

pairwise vs 绝对评分:本次"请求权基础准确性/事实理由对应/抗辩预判"等判断用绝对评分,未涉及 pairwise。


五-ter、双门槛判定

跳过(首次评测,无上一版对照)。


六、总体结论

  • ✅ 进入工作流(结构可评测、内容评测通过、taste 项无致命命中——但维度评分基于"降级套用诉讼型",3 个维度不适配需在 v0.4.0 案件分析型专属维度集中修正)
  • ⚠️ 修后再测
  • ❌ 回退

总体评价:legal-case-analysis v0.2.6 是 Phase B 校准中自身防护最规范的 skill——

  1. 9 个诉讼型 taste 项全部通过;
  2. 主动拦截旧版法源(拦截"隐瞒抵押一倍赔偿")是 taste-8 的优秀工程化;
  3. 4.2 事实分类四档(已有证据/委托人陈述/对方主张/待补充)是 taste-5 的优秀工程化;
  4. 自带完整 benchmark examples,是 Phase B 唯一无需模拟产出的 skill;
  5. 但——它的存在暴露了 v0.3.0 三场景维度集的覆盖盲区:案件分析型既不是合同、不是诉讼文书、不是合规报告,强行套用诉讼型会产生 2 个维度不适配 + 1 个维度颗粒度错配的"虚假低分"。

给 legal-skill-evaluation 的反向回灌价值(Phase B 最重要发现):

  • 应新增"案件分析型"为第四类场景(v0.4.0 提案)——继承诉讼型部分维度 + 新增专属维度(法律问题树/检索吸收深度/策略路径切换/行动清单);
  • 步骤 1 场景识别应补决策树:分析报告类产出 ≠ 诉讼文书,需归类为"案件分析型";
  • v0.3.0 诉讼型 rubric 的"待真实 skill 校准声明"已校准——真实诉讼文书生成 skill(如生成起诉状/答辩状)仍待 T-402 校准,本次校准的是"案件分析型"而非诉讼型本身。

七、安全声明

  • 本报告测试材料 1 直接复用 legal-case-analysis 自带的 examples/contest-sample-analysis.md,该样例已做脱敏处理("买受人 A、开发商 B、工程款债权人 C、银行 D、项目 X"),本评测未引入新的真实当事人信息。
  • 材料 2/3 为模拟产出,使用虚构案件。
  • 本评测结论不能替代正式法律意见。
  • 本报告不用于对 legal-case-analysis 作者的人身评价,只针对 Skill 输出。
  • 本评测中"案件分析型"维度集提案为 v0.4.0 范畴,本次小改不动维度结构。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation