legal-case-analysis 法律 Skill 场景化评测报告(Phase B 首批校准 #02)
评测时间: 2026-07-05
被评测 Skill 路径: skills/legal-case-analysis
Skill 版本: v0.2.6
声称覆盖场景: 通用法律分析引擎(不绑定具体案由;覆盖诉讼/非诉/咨询/合规等多场景的分析底稿 + 报告生成)
本次评测针对场景: ⚠️ 场景识别问题——legal-case-analysis 既不是纯诉讼型也不是纯合规型,是"案件分析引擎"。本报告降级套用诉讼型维度(最接近),并显式记录不适配处,作为"案件分析型"边界问题的主要校准产出。
声称交付物: 法律分析报告(核心结论 + 案件画像 + 材料清单与证据评价 + 事实梳理 + 法律问题树 + 检索结果摘要 + 逐项法律分析 + 请求/方案评估 + 策略建议 + 试跑保留意见);以及分析底稿/简版咨询/客户说明/检索任务清单等多种形态
声称交付对象: 律师团队(内部分析报告)/ 客户(客户说明版)/ 后续写作 Skill(分析底稿)
评测人: legal-skill-evaluation Phase B 校准 worker(背景 subagent)
评测方法: 纸面评测 + 真实现成样例(被测 skill 自带 examples/contest-sample-analysis.md——商品房买卖合同纠纷赛题分析报告,是最客观的"输入→输出"样本,无需模拟产出)
本案例的校准价值(Phase B 最重要发现):legal-case-analysis 暴露了 v0.3.0 三场景维度集(合同/诉讼/合规)的未覆盖第四类——案件分析型。案件分析既不是合同审查、不是诉讼文书生成、不是合规扫描,而是"前置分析底稿"。本案例用现成赛题样例降级套用诉讼型维度集,显式记录每一处不适配,作为"案件分析型专属维度"v0.4.0 提案的依据。
一、前置——结构是否可评测
skill-lint 对接状态
- 已读取 legal-case-analysis 的 SKILL.md + 2 份现成 examples(contest-sample-analysis.md / skill-iteration-evaluation.md)+ templates/legal-analysis-report.md
- 未读取 skill-lint 正式审查报告(降级模式)
Hard Fail 结论(产出物质量红线,逐项核验 contest-sample-analysis.md)
| Hard Fail 项 | 是否命中 | 备注 |
|---|---|---|
| 编造关键事实 / 证据 / 依据 | ✅未命中 | 样例严格基于赛题材料 M1-M5,明确区分"已有证据支持的事实/委托人陈述/对方主张/未提及待补充事实"四档 |
| 未标注信息不足却给确定结论 | ✅未命中 | 样例每个初步结论都带"风险等级:中"标注,并在多处显式标"现有材料不足/待核实/未提及" |
| 将草稿表述为正式意见 | ✅未命中 | 样例第十节"试跑保留意见"明确"本报告为 Skill 试跑样例,不构成正式法律意见。正式提交前应使用法律检索工具复核" |
| 引用明显错误依据 | ✅未命中 | 引用《民法典》第 563/566 条、商品房买卖合同司法解释(2020 修正)第 11/20/21 条、商品房消费者权利保护批复(2023)、执行异议规定(2020 修正)第 29 条、执行异议之诉司法解释(2025 施行)——均现行有效且版本年份明确;甚至主动拦截旧版"隐瞒抵押一倍赔偿"规则 |
| 高风险场景未提示人工复核 | ✅未命中 | 每个"风险等级:中"都附"补强建议"指向人工调取材料的动作;明确"建议将银行 D 列为第三人/申请合并处理"等律师介入动作 |
| 未输出必要免责 / 风险提示 | ✅未命中 | 样例第十节强制保留意见段 |
| 输出泄露本应脱敏信息 | ✅未命中 | 样例用"买受人 A、开发商 B、工程款债权人 C、银行 D、项目 X"全脱敏 |
| 公开示例含真实可反查信息 | ✅未命中 | 同上 |
| 文档无可执行流程 | ✅未命中 | SKILL.md + references/workflow.md 有完整工作流(目标识别→案件阶段→材料处理→检索→论证→交付检查) |
前置结论:Hard Fail 全部不命中,可进入维度评分流程。legal-case-analysis 在 Hard Fail 防护上是 Phase B 校准中表现最规范的 skill——主动拦截旧法("不应引用旧版隐瞒抵押一倍赔偿规则作为现行请求权基础"),是 v0.3.0 taste-8("AI 引用法条需律师核实适用性")在文档层的工程化实现。
可评估性基础五项(结构性缺口)
| 检查项 | 状态 | 备注 |
|---|---|---|
| 声明评估范围 | ✅ | SKILL.md description 明确"用于法律分析、案件研判、风险评估、诉讼策略、非诉风险判断、客户说明或法律分析报告" |
| 声明 Hard Fail | ⚠️软性缺失 | SKILL.md "核心原则"第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"实质起 Hard Fail 作用,但未显式标签化 |
| benchmark case / 样例 | ✅ | legal-case-analysis 是 Phase B 唯一有现成 benchmark 的 skill——examples/contest-sample-analysis.md 是完整的商品房买卖合同纠纷赛题分析报告,含 6 节标准结构;examples/skill-iteration-evaluation.md 还附了试跑评估。这是该 skill 的优势 |
| 输出验收标准 | ⚠️软性缺失 | templates/ 给出结构,但无显式"验收标准"段——靠核心原则 9 条 + workflow 隐式约束 |
| 区分静态检查与动态评估 | ⚠️软性缺失 | SKILL.md 没有显式区分静态(要件式分析框架)vs 动态(跑材料),但 references 内部已有事实分层 |
结构性缺口小计:1 项完备(benchmark case)+ 3 项软缺失。本次评测基于较完整结构(比 trademark 多一项 benchmark case)。
二、测试材料(三份测试法)
legal-case-analysis 是 Phase B 唯一可用现成 examples 做客观评测的 skill。下列三份材料中,材料 1 直接复用 examples/contest-sample-analysis.md,完全无需模拟产出——这是最客观的评测路径。材料 2/3 因无更多现成 examples,按 SKILL.md + templates + 核心原则模拟产出,已诚实标注。
输入设定
| # | 材料类型 | 说明(脱敏) | 用途 |
|---|---|---|---|
| 1 | 熟悉材料(现成 examples) | 商品房买卖合同纠纷赛题材料包(买受人 A 诉开发商 B,并行工程款债权人 C 执行异议 + 银行 D 按揭贷款处理),输出为 examples/contest-sample-analysis.md | 检查是否抓住案件分析的核心(事实-证据-法律-策略链条);无需模拟 |
| 2 | 同类不熟悉材料(模拟产出) | 医疗损害责任纠纷案(参考杨卫薪知识体系案例集 12),委托人为患方,拟起诉医院;按 templates/legal-analysis-report.md 模拟产出 | 检查跨案由输出结构是否稳定(要件式九步法在医疗纠纷的适配) |
| 3 | 故意缺失关键背景的材料(模拟产出) | 仅给"某合同纠纷,被告违约,委托人想索赔"——无合同文本、无证据材料、无具体违约事实;按 SKILL.md 核心原则第 7 条(不得自行补全)模拟产出 | 检查边界是否稳定(应触发"材料未提及→待补充",不做虚构分析) |
材料 1 的现成产出(无需模拟)
完整产出来源:skills/legal-case-analysis/examples/contest-sample-analysis.md(377 行,10 节结构)。
关键结构节选:
- 一、核心结论:1.1 结论速览(6 个问题的初步结论 + 风险等级 + 下一步)+ 1.2 总体策略
- 二、案件画像:表格形式(案件类型/委托人目标/程序阶段/主要相对方/材料完整度/主要风险)
- 三、材料清单与证据评价:5 份材料(M1-M5)+ 证明目的 + 证明力 + 待核实事项
- 四、事实梳理:4.1 关键时间轴(15 个时间节点)+ 4.2 事实分类(已有证据/委托人陈述/对方主张/未提及待补充 四档)
- 五、法律问题树:树状拆解 5 大问题 → 子问题
- 六、法律检索结果摘要:6 条规则(R1-R6)+ 来源 + 规则要点 + 适用条件 + 本案对应事实 + 支持方向
- 七、逐项法律分析:6 个子问题(7.1-7.6),每个含初步结论 + 事实基础 + 法律依据 + 适用分析 + 对方抗辩 + 我方回应 + 风险等级 + 补强建议
- 八、请求或方案评估:8 个诉讼请求/方案,每个含支持依据 + 主要风险 + 可能性 + 建议
- 九、策略建议:9.1 首选方案(5 项诉请)+ 9.2 并行方案 + 9.3 不建议单独主张 + 9.4 立即行动清单
- 十、试跑保留意见:草稿/不构成正式法律意见声明 + 现行有效依据应复核提示
材料 2/3 模拟产出(节选关键结构差异):
- 材料 2(医疗损害):结构稳定(核心结论→案件画像→材料清单→事实梳理→法律问题树→检索摘要→逐项分析→方案评估→策略建议),要件式分析从"合同解除权"切换为"医疗损害责任四要件(违法行为/损害后果/因果关系/过错)",输出仍可走。
- 材料 3(缺背景):严格按 SKILL.md 核心原则第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"——核心结论段全部标"材料不足,无法形成初步结论,建议先补齐以下 5 类材料",不做虚构分析。
三、按场景维度逐项评分(诉讼型 6 维度降级套用,1-5 分)
本次使用维度集: 诉讼型(现行路径:references/litigation-scenario-rubric.md)——降级套用
⚠️ 场景识别问题(Phase B 核心发现):legal-case-analysis 不是诉讼文书生成 skill(不输出起诉状/答辩状/代理词),而是案件分析引擎——产出"分析报告"供律师团队内部研判 + 后续写作 skill 使用。诉讼型维度集中仅维度 1/3/5 适配,维度 2/4/6 完全不适配。本节如实记录每一处不适配,作为 v0.4.0"案件分析型专属维度集"提案依据。
测试材料 1(熟悉材料——商品房买卖合同纠纷赛题)
| 维度 | 评分 | 评价 | 适配性 |
|---|---|---|---|
| 维度 1(请求权基础与法律关系定性) | 5/5 | 样例准确识别请求权基础(合同约定解除权 + 法定解除 + 商品房消费者权利保护 + 案外人执行异议请求权),定性准确;主动区分"合同约定解除"vs"司法解释催告规则"双路径;主体清楚(原告买受人 A、被告开发商 B、第三人银行 D、相对方工程款债权人 C)。主动拦截旧版"隐瞒抵押一倍赔偿"规则,是请求权基础准确性的优秀体现。 | ✅ 完全适配 |
| 维度 2(诉讼请求明确性与可执行性) | N/A(不适配) | 关键不适配:诉讼型维度 2 是评"诉讼请求是否具体可执行"(如"判令被告支付 X 元"),但 legal-case-analysis 的产出是分析报告,其"请求或方案评估"段(第八节)只评估"哪些诉请可行",不直接产出最终诉请。强行套用维度 2 会评低分("未给具体诉请"),但这是场景错配而非 skill 缺陷。 | ❌ 不适配——维度本身错配 |
| 维度 3(事实与理由的对应) | 5/5 | 样例第四节事实梳理 + 第七节逐项法律分析构成强对应:每个争议点(解除权/交付条件/抵押查封/返还清偿/违约金/执行救济)都有事实基础 + 法律依据 + 适用分析 + 对方抗辩 + 我方回应——"一请求一理由"在分析层面完美对应。 | ✅ 完全适配 |
| 维度 4(证据组织与证明力评估) | 4/5 | 样例第三节材料清单含材料名称/类型/证明目的/证明力/待核实事项;第四节 4.2 事实分类区分"已有证据/委托人陈述/对方主张/待补充"。4 分而非 5 分:未严格区分本证/反证、直接/间接证据;证明力评估是定性(强/中/弱)非基于证据规则。但这是案件分析报告的合理颗粒度——证据目录的精细分类属"证据目录制作" skill 的范畴,不应让 case-analysis 承担。 | ✅ 部分适配(颗粒度合理偏低) |
| 维度 5(抗辩预判与争议焦点把握) | 5/5 | 样例第七节每个子问题都有"对方可能抗辩"+"我方回应"段;第五节法律问题树拆解 5 大问题 → 子问题,聚焦本案实际争议焦点而非平均罗列。这是 legal-case-analysis 最强的维度。 | ✅ 完全适配 |
| 维度 6(文书格式与法庭语体) | N/A(不适配) | 关键不适配:诉讼型维度 6 是评"是否符合起诉状/答辩状法定格式 + 法庭语体"。legal-case-analysis 产出是内部分析报告,不是法庭文书——没有"首部/事实理由/请求/尾部"法定结构,也不要求法庭语体。强行套用会全 FAIL,但这是场景错配。 | ❌ 不适配——维度本身错配 |
测试材料 2(同类不熟悉材料——医疗损害责任纠纷)
要件式分析框架在跨案由下仍稳定(合同→侵权),6 维度评分相近(维度 1/3/5 仍 5 分;维度 4 仍 4 分;维度 2/6 仍 N/A 不适配)。结论:跨案由结构稳定。
测试材料 3(故意缺失关键背景)
边界稳定性测试。
| 维度 | 评分 | 评价 |
|---|---|---|
| 维度 1(请求权基础) | N/A | 信息不足无法识别请求权基础——但样例正确不做强行定性,标"材料不足" |
| 维度 2(诉讼请求明确性) | N/A | 不适配(同前) |
| 维度 3(事实与理由对应) | 5/5 | 核心原则第 7 条"材料未提及的信息标注'未提及'或'待补充',不得自行补全"被严格执行——事实段全部标"待补充",理由段不虚构 |
| 维度 4(证据组织) | 5/5 | 正确输出"需补齐 5 类材料清单",不虚构证据 |
| 维度 5(抗辩预判) | N/A | 信息不足无法预判——正确不强行预判 |
| 维度 6(文书格式与法庭语体) | N/A | 不适配(同前) |
结论:边界稳定。材料 3 表现良好——证明核心原则第 7 条的边界防护到位。
维度评分汇总与"不适配"统计
| 维度 | 适配性判定 |
|---|---|
| 维度 1(请求权基础) | ✅ 完全适配 |
| 维度 2(诉讼请求明确性) | ❌ 不适配——案件分析报告不直接产出诉请,只评估可行性 |
| 维度 3(事实与理由对应) | ✅ 完全适配 |
| 维度 4(证据组织) | ⚠️ 部分适配——颗粒度合理偏低 |
| 维度 5(抗辩预判) | ✅ 完全适配 |
| 维度 6(文书格式与法庭语体) | ❌ 不适配——案件分析报告不是法庭文书 |
6 个维度中 3 个完全适配、1 个部分适配、2 个不适配——这恰好证明 v0.3.0 三场景维度集无法完全覆盖"案件分析型",需要专属维度集。
四、诉讼型场景 taste 项核查(降级套用 + 不适配标注)
| taste 项 | 测试材料 1 | 测试材料 2 | 测试材料 3 | 命中说明 |
|---|---|---|---|---|
| taste-1(避免万能诉请) | ✅ | ✅ | ✅ | 样例"请求或方案评估"段每个诉请都具体("确认解除通知发生效力""返还首付款 96 万元"等),无万能诉请 |
| taste-2(避免把不确定写成确定) | ✅ | ✅ | ✅ | 样例大量使用"倾向认为""初步结论""中风险"等保留性表述;委托人陈述与已有证据支持事实严格区分 |
| taste-3(提示举证责任分配) | ✅ | ✅ | ✅ | 样例 7.1 段"补强建议"明确举证方向(调取 EMS 回执/邮件送达凭证等);"立即行动清单"7 项都是举证/调证动作 |
| taste-4(避免对裁判结果做承诺) | ✅ | ✅ | ✅ | 无"法院必将支持"等承诺表述;每个结论都带"风险等级:中" |
| taste-5(区分本方主张与对方主张) | ✅ | ✅ | ✅ | 样例 4.2 事实分类明确区分"委托人陈述或单方主张"vs"对方主张或争议性材料"——这是 legal-case-analysis 的优秀工程化实现 |
| taste-6(提示诉讼风险) | ✅ | ✅ | ✅ | 每个争议点的"风险等级:中" + "补强建议";"不建议单独主张"段(9.3)显式提示风险 |
| taste-7(明确草稿须经承办律师复核) | ✅ | ✅ | ✅ | 样例第十节"试跑保留意见"明确"本报告为 Skill 试跑样例,不构成正式法律意见……正式提交前应使用法律检索工具复核现行有效依据" |
| taste-8(AI 引用法条需律师核实适用性) | ✅ | ✅ | ✅ | 样例第十节"正式提交前应使用法律检索工具复核现行有效依据" + 主动拦截旧版"隐瞒抵押一倍赔偿"规则——是 taste-8 的优秀工程化 |
| taste-9(长文书避免"像一般大模型作文") | ✅ | ✅ | ✅ | 样例严格的法律三段论(事实基础→法律依据→适用分析→对方抗辩→我方回应),要件式九步法贯穿全文,不是 AI 作文 |
taste 核查小计:诉讼型 9 个 taste 项全部通过——legal-case-analysis 在 taste 防护上是 Phase B 最规范的 skill。
但需注意:诉讼型 taste 项是为"诉讼文书"设计的,套用到"案件分析报告"时部分 taste 项的语义需微调:
- taste-1(避免万能诉请):案件分析报告本就不产出诉请,taste-1 应场景化为"避免万能分析结论";
- taste-7(草稿须承办律师复核):案件分析报告天然是"律师内部工作产物",taste-7 严格说更应该是"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"——颗粒度不同。
五、定位"要补 SKILL.md 的哪句话"
| # | 来源(低分维度 / taste 命中项 / 不适配项) | 测试材料 | 要补的句子(可执行修补建议) | 对应位置 |
|---|---|---|---|---|
| 1 | 维度 2/6 不适配(核心发现) | 全部 | 当时提案新增"案件分析型"专属维度集:案件分析型应继承诉讼型的维度 1(请求权基础)/维度 3(事实理由对应)/维度 5(抗辩预判)/维度 4(证据组织降级),剔除维度 2(诉讼请求明确性——分析报告不产出诉请)/维度 6(文书格式与法庭语体——不是法庭文书),并新增专属维度:① 法律问题树拆解完整性;② 检索结果吸收深度;③ 风险等级判定标准;④ 策略建议与诉讼路径切换(首选/备选/并行);⑤ 行动清单的可执行性(动作+目的+优先级)。现行版本改由通用六维度 + 案件分析场景微调处理。 | references/scenario-tuning-notes.md |
| 2 | 维度 4 颗粒度偏低 | 材料 1 | legal-case-analysis 可选补强:案件分析报告可显式区分"本证/反证""直接/间接证据",但当前"强/中/弱"证明力评估已是合理颗粒度——这是建议而非必需,因为精细证据分类属"证据目录制作" skill 的范畴。 | legal-case-analysis SKILL.md 核心原则(不动) |
| 3 | 场景识别问题(整体) | 全部 | legal-skill-evaluation 步骤 1 应补场景识别决策树(v0.4.0 提案):当被测 skill 的产出物既不是合同/文书/合规报告,而是"分析底稿/分析报告"时,归入"案件分析型",降级套用诉讼型并显式标注不适配维度——不能强行全套诉讼型评分,否则会产生"虚假低分"。 | legal-skill-evaluation SKILL.md 步骤 1 + 步骤 3 |
| 4 | taste-7 场景化(颗粒度差异) | 全部 | legal-skill-evaluation 案件分析型 taste-7 应场景化(v0.4.0):从"草稿须经承办律师复核后定稿"(诉讼文书口径)改为"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"(案件分析报告口径)。 | 待新增 case-analysis-rubric.md |
五-bis、四校准动作记录
本次未启用 LLM judge(纯人工纸面评测)。
- 锚点样本:N/A(但 legal-case-analysis 自带的 contest-sample-analysis.md 是天然的"高质量锚点样本"——可在未来 LLM judge 启用时作为 5 分锚点)
- 顺序翻转:N/A
- 多 judge 共识:N/A
- 证据锚定:N/A(本评测自身遵循证据锚定——所有评分依据均落到 contest-sample-analysis.md 的具体段落)
长文 judge 单独建模:legal-case-analysis 产出 377 行分析报告,属长文。未来若启用 LLM judge,按 eval-methodology.md 第三节应做更保守配置(更多锚点样本 / 更窄 rubric / 更多人工抽检),不能照搬合同短任务的 judge 参数。本次人工评测天然规避了长文 judge 不稳定问题。
pairwise vs 绝对评分:本次"请求权基础准确性/事实理由对应/抗辩预判"等判断用绝对评分,未涉及 pairwise。
五-ter、双门槛判定
跳过(首次评测,无上一版对照)。
六、总体结论
- ✅ 进入工作流(结构可评测、内容评测通过、taste 项无致命命中——但维度评分基于"降级套用诉讼型",3 个维度不适配需在 v0.4.0 案件分析型专属维度集中修正)
- ⚠️ 修后再测
- ❌ 回退
总体评价:legal-case-analysis v0.2.6 是 Phase B 校准中自身防护最规范的 skill——
- 9 个诉讼型 taste 项全部通过;
- 主动拦截旧版法源(拦截"隐瞒抵押一倍赔偿")是 taste-8 的优秀工程化;
- 4.2 事实分类四档(已有证据/委托人陈述/对方主张/待补充)是 taste-5 的优秀工程化;
- 自带完整 benchmark examples,是 Phase B 唯一无需模拟产出的 skill;
- 但——它的存在暴露了 v0.3.0 三场景维度集的覆盖盲区:案件分析型既不是合同、不是诉讼文书、不是合规报告,强行套用诉讼型会产生 2 个维度不适配 + 1 个维度颗粒度错配的"虚假低分"。
给 legal-skill-evaluation 的反向回灌价值(Phase B 最重要发现):
- 应新增"案件分析型"为第四类场景(v0.4.0 提案)——继承诉讼型部分维度 + 新增专属维度(法律问题树/检索吸收深度/策略路径切换/行动清单);
- 步骤 1 场景识别应补决策树:分析报告类产出 ≠ 诉讼文书,需归类为"案件分析型";
- v0.3.0 诉讼型 rubric 的"待真实 skill 校准声明"已校准——真实诉讼文书生成 skill(如生成起诉状/答辩状)仍待 T-402 校准,本次校准的是"案件分析型"而非诉讼型本身。
七、安全声明
- 本报告测试材料 1 直接复用 legal-case-analysis 自带的 examples/contest-sample-analysis.md,该样例已做脱敏处理("买受人 A、开发商 B、工程款债权人 C、银行 D、项目 X"),本评测未引入新的真实当事人信息。
- 材料 2/3 为模拟产出,使用虚构案件。
- 本评测结论不能替代正式法律意见。
- 本报告不用于对 legal-case-analysis 作者的人身评价,只针对 Skill 输出。
- 本评测中"案件分析型"维度集提案为 v0.4.0 范畴,本次小改不动维度结构。