All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

referencesuniversal-dimensions.md

≈3.7k tokens on demand. Your agent reads this file only when SKILL.md points to it.

通用六维度与律师 taste

适用范围:法律 Skill 跑出来的法律文件产出物——合同初审意见、合同风险表、起诉状、答辩状、代理词、证据目录、合规风险扫描报告、整改建议、尽调备忘录、法律分析报告 / 分析底稿等——在常规法律场景下的通用质量评测。

v0.4.0 定位(来源:杨卫薪律师 2026-07-05 拍板,详见 DECISIONS.md D-2026-07-05-02):

  • 通用泛化优先于场景细分。本文件给出一套六维度作为常规法律场景的主流程,不再要求评测员"按合同/诉讼/合规各选独立 rubric"。
  • 场景差异通过 场景微调说明 处理(一段话级别的侧重指引),不再上升为独立 rubric。
  • 三场景 rubric(contract / litigation / compliance scenario-rubric.md)降级为深度参考附录:在 taste 深度核查、特定场景争议、需要更细颗粒度评分时使用。
  • 本六维度是 ch07 第六节 L794-803 合同型六维的回归通用命名——去掉合同专属化(如"事实叙述与条款定位"→"事实叙述与证据运用"),恢复其作为通用起点的本义。

通用六维度

ID / 维度 检查问题 低分表现 高分表现
DIM-1 法律准确性 是否正确理解规则、法律关系、基本概念?是否把不确定结论写成确定结论? 法条或概念错误;把商业谈判点写成法律风险;把事实缺口写成法律结论;把不确定写成确定 规则表述准确;结论边界清楚;区分法律风险、商业谈判点、事实缺口、需人工确认事项
DIM-2 事实叙述与证据运用 是否忠实基于已提供材料(不虚构)?事实/证据是否对应到主张与结论?关键事实/条款/证据是否遗漏? 虚构背景;遗漏关键事实;把未确认说法当事实;引用条款或证据但说不清在哪 能对应到具体条款位置 / 证据编号 / 法源出处;事实缺口明确标注
DIM-3 逻辑说服力 是否有清楚推理链条?是否"事实/条款/证据 → 风险或争议 → 结论/建议"逐步展开? 只有结论没有理由;前后矛盾;建议与风险脱节;理由无法支撑结论 链条清楚;可被业务同事 / 谈判对手 / 法官 / 合规官理解;无孤立条目
DIM-4 争议焦点与争议关键把握 是否抓住对本方实际影响决策的关键问题?是否区分主次而非平均罗列? 平均罗列常见风险或常见争议;主次不分;把低影响项列为重点 识别关键冲突 / 高影响条款 / 高影响争议;按对本方影响排序
DIM-5 实务可用性 输出能否进入下一步工作(修改 / 谈判 / 立案 / 庭审 / 整改 / 研判)?建议是否具体可执行?是否标注需确认事项? 建议空泛("建议进一步审查");无法修改、沟通、分派或执行;不标注需确认事项 行动项明确;可复核、可沟通、可修改、可执行;区分立即 / 短期 / 中长期或首选 / 备选
DIM-6 交付物格式完整度 是否符合本场景交付物结构(风险表 / 初审意见 / 起诉状 / 答辩状 / 代理词 / 合规清单 / 分析报告等)?字段是否稳定?层级是否清楚? 字段缺失;层级混乱;读者难定位;颗粒度不匹配交付对象 字段稳定;层级清楚;适配交付对象(内部业务 / 外部客户 / 法官 / 管理层);必要时区分摘要层与明细层

每维度的场景微调附注(一句话级,详见 scenario-tuning-notes.md)

维度 合同型侧重 诉讼型侧重 合规型侧重 案件分析型(前置底稿)
1. 法律准确性 区分违约责任/解除权/不安抗辩/违约金调整等基本概念 正确识别请求权基础 + 案由匹配 监管依据精确到条款 + 效力层级 + 时效性 同诉讼型,加"法律问题树"拆解
2. 事实叙述与证据运用 重点风险标注条款编号;无编号时声明 事实 → 证据 → 主张链条;证据三要素(名称/来源/证明目的) 风险结论基于业务事实;标注事实缺口 事实到证据到主张链条;不要求本证/反证颗粒度
3. 逻辑说服力 条款 → 风险 → 修改建议 一请求一理由;针对对方主张逐项反驳 风险 → 整改建议 → 整改次生风险评估 法律问题 → 子问题 → 检索吸收 → 策略路径
4. 争议焦点把握 风险分级(高/中/低)+ 对本方履约影响 抓住诉讼攻防焦点 + 抗辩预判 区分必须整改 vs 建议改进;区分法律红线 vs 合规建议 抓住本案策略关键节点(首选/并行/不建议)
5. 实务可用性 修改方向 + 需业务/客户确认事项 诉请可执行性 + 证据组织 + 举证责任分配 整改动作具体到责任人/时限/分阶段(或一次性合规动作的"完成节点") 行动清单(动作+目的+优先级)+ 检索吸收深度
6. 交付物格式完整度 风险表/初审意见字段稳定(风险描述/条款位置/等级/修改方向/需确认) 法定格式(首部/事实理由/请求/尾部)+ 法庭语体 + 法条引用准确 风险清单/整改建议/尽调备忘录结构 + 唯一编号可追溯 分析报告结构(问题树/检索吸收/策略/行动清单),非法庭文书,不要求诉请与法庭语体

评分口径

  • 1–5 分初评,不追求精密。重点是发现哪一维最弱,并在 SKILL.md 步骤 7 选择最小修复单元。
  • 某一维在某场景若是空项(如合同初审里"争议焦点把握"接近空项),不强行打分,标注"本场景空项"或"弱项",不影响总体判定。
  • 维度评分必须证据锚定:判"法律准确性低"必须指出哪条规则/哪个概念错;判"事实叙述弱"必须指出漏了哪个条款/证据;判"实务可用性差"必须指出哪条建议空泛。不接受裸分(来源:DR-5 LLM-as-judge 四校准,详见 eval-methodology.md 第三节)。

与 ch07 第六节六维度的对应关系

本通用六维度与 ch07 第六节 L794-803 合同型六维度一一对应,但做了回归通用命名:

ch07 第六节(合同型命名) 本文件(通用命名) 调整说明
法律准确性 法律准确性 不变
事实叙述与证据运用 事实叙述与证据运用 不变(ch07 本就用通用名;v0.3.x 在 contract-rubric 里改成了"事实叙述与条款定位"是合同专属化,v0.4.0 撤回)
逻辑说服力 逻辑说服力 不变
争议焦点把握 争议焦点与争议关键把握 微调:合同型里"争议焦点"接近空项,加"争议关键"覆盖"高影响条款识别"
实务可用性 实务可用性 不变
文书格式完整度 交付物格式完整度 微调:"文书"偏诉讼语境,"交付物"覆盖合同/诉讼/合规/分析四类

来源与边界见本文件附录。


通用六维度的边界(不替代 taste)

通用六维度评的是任何法律产出物都该有的基础质量。但有一类东西任何维度表都量不出来——经验律师凭直觉就会察觉的"不对",如:

  • 把不确定写成确定
  • 把商业谈判点当成法律风险
  • 混淆本方与对方主张
  • 把内部初审语气用到对外谈判函
  • 把草稿写成正式意见
  • 对裁判结果 / 合规结果做承诺性表述

这些是 taste 项,必须显式列出、单独核查,不能被通用维度稀释掉。详见下方"taste 项组织"。


taste 项组织(通用 taste + 场景 taste)

一、通用 taste(所有场景必查,单列不并入维度评分)

下列 taste 项来自 ch07 第六节 L854 + Phase B 校准(trademark-case-01 + case-analysis-case-01)的共性发现。任何法律场景的产出物评测都必须逐项核查,每项命中即 taste FAIL,影响总体判定。

  • TASTE-1:是否避免"把不确定写成确定"(如把"原告主张"写成"事实如此";把"初筛"写成"确认合规")。
  • TASTE-2:是否区分"法律风险 / 法律红线"和"商业谈判点 / 商业判断"。把"价格偏高"写成法律风险,或把"商业模式不可行"写成合规结论,是典型越界。
  • TASTE-3:是否区分"风险 / 结论"和"事实缺口"。材料里没说的事情,应标"需确认",不能编。
  • TASTE-4:是否站在本方立场,区分本方主张和对方主张。把"保护对方"列为重点风险(本方审查时),或把对方主张混入本方陈述(答辩时),是立场错位。
  • TASTE-5:是否避免绝对化承诺(如"该合同无任何法律风险""本方案确保完全合规""法院必将支持")。
  • TASTE-6:是否避免把草稿写成正式法律意见 / 正式合规意见 / 终稿诉状。应明确"初审意见 / 合规初筛 / 草稿,须经承办律师或业务方复核 / 定稿"。
  • TASTE-7:是否提示人工复核(产出物涉及的业务事实需业务方核实;AI 引用的法条 / 监管依据需律师核验适用性与时效性)。
  • TASTE-8:是否提示材料缺失会影响判断(缺主合同 / 缺报价单 / 缺证据 / 缺业务流程图等)。

二、场景 taste(深度核查时参考三场景 rubric)

下列 taste 项有场景特异性,主流程不强制逐项核查;在以下情况启用:

  • 评测总体结论边缘(接近 ⚠️ 修后再测)需要更细颗粒度;
  • 评测员对某场景有经验,希望做深度 taste 核查;
  • 出现场景特异争议(如长文书是否"像一般大模型作文"、跨境合规的数据更新频率差异)。

场景 taste 来源:

  • 合同型 taste(taste-1 ~ taste-6):见 contract-scenario-rubric.md 第二节。多数已被本文件"通用 taste"吸收;剩余合同专属如"风险分级口径"等留在场景 rubric。
  • 诉讼型 taste(taste-1 ~ taste-9):见 litigation-scenario-rubric.md 第二节。场景特异项包括"避免万能诉请""提示举证责任分配""长文书避免像一般大模型作文""法条需律师核实适用性"等。
  • 合规型 taste(taste-1 ~ taste-9):见 compliance-scenario-rubric.md 第二节。场景特异项包括"区分法律红线与合规建议""提示监管动态性""跨境数据更新频率差异""可追溯证据 / 截图存证"等。

说明:本节"通用 taste"与场景 taste 有重叠(如"避免把不确定写成确定"在合同/诉讼/合规 taste 里都有)——这是故意冗余:通用 taste 保证主流程不漏底线,场景 taste 给深度核查提供更具体的判例。重叠项以"通用 taste"为准做主流程判定,场景 taste 仅作深度参考。


与"案件分析型"等非终端交付物的关系

案件分析型(法律分析报告 / 分析底稿,供律师团队内部研判 + 后续写作 Skill 复用,不是终端交付物)在通用六维度上的表现:

  • 维度 1(法律准确性)/ 维度 3(逻辑说服力)/ 维度 5(实务可用性):完全适配。
  • 维度 2(事实叙述与证据运用):适配,颗粒度合理偏低(评到强/中/弱即可,不要求本证/反证颗粒度)。
  • 维度 4(争议焦点把握):适配,但内涵切换为"策略路径关键节点"而非"诉讼攻防焦点"。
  • 维度 6(交付物格式完整度):适配,但不要求法庭文书法定结构(首部/事实理由/请求/尾部)——分析报告不是法庭文书。强行要求法庭语体 / 诉请明确性会产生"虚假低分"。

判分原则:通用六维度评的是"作为法律产出物的基础质量",不是"作为某终端文书的格式合规度"。案件分析报告作为前置底稿,其"格式完整度"按分析报告结构评(问题树 / 检索吸收 / 策略 / 行动清单),不按法庭文书结构评。


v0.4.0 的局限与远期方向

  • 本通用六维度已完成 trademark 商标合规、case-analysis 案件分析,以及 contract-copilot 合同场景首批 3 例校准种子。合同校准见 evals/contract-calibration-260730/calibration-report.md,其中 2 例为历史未绑定归档、1 例绑定当前候选,20—50 例完整 suite 和候选全量重跑仍未完成,因此只能说明维度已在合同场景发现有效问题,不能写成合同型领域验收通过。真实诉讼文书生成 skill(起诉状/答辩状/代理词)仍待 T-402 校准。
  • 远期 BACKLOG(不在 v0.4.0 做):针对特定场景做更深泛化——案件分析 / 法律检索 / 文书润色 / 尽调专属维度集。前期优先把通用六维度经更多场景验证后再考虑深化(详见 TASKS.md BACKLOG 段)。

附录:六维度来源说明

A.1 来源

六维度评价标准来自本书(法律 skill 书籍)第七章第六节"第四步:怎样验证初版 Skill 是否可用"的"四、六维度评价标准:检查法律输出质量"小节。

原文给出的六个维度:法律准确性 / 事实叙述与证据运用 / 逻辑说服力 / 争议焦点把握 / 实务可用性 / 文书格式完整度。原文同时给了一个 1-5 分初评机制,并强调"这张表的作用是帮你定位改进点,而不是让 AI 自己给自己打高分"。

原文章节语境是合同初审 Skill(供应商服务合同初审)。本技能 v0.4.0 经 Phase B 校准(trademark + case-analysis)+ 用户拍板后,把这套六维度经过回归通用命名调整后,正式确立为通用评测主流程。详见本文件开头"v0.4.0 定位"。

A.2 不输出通用总分

本技能不输出以下内容:

  • 一个适用于所有法律 Skill 的"六维度通用基准"和单一总分
  • 跨场景的"平均分"或"加权总分"
  • 把不同场景 Skill 排进同一张榜单的横向比较

理由:法律场景之间的差异远大于共性。强行套基准,评测本身会变成另一个看起来严谨但没用的产物。

A.3 业界参考但不照搬

本技能参考了两类业界思路(v0.2.0 依据 DR-5 前沿调研更新表述):

  • Anthropic eval 方法论 + Claude skill creator 的 eval 验证思路(test cases / expected behavior / assertion grading / benchmark / blind A / description tuning):借鉴"用熟悉材料做基准"的思路。但 v0.2.0 起不再使用"黄金答案"术语——DR-5 明确标注该术语未在 Anthropic 官方公开材料核验到(详见 eval-methodology.md 第二节)。改用"参考解三档口径"。
  • 作者既有六维度评价标准:降级为合同型场景的参考起点,v0.4.0 经通用化命名调整后作为通用评测主流程。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation