通用六维度与律师 taste
适用范围:法律 Skill 跑出来的法律文件产出物——合同初审意见、合同风险表、起诉状、答辩状、代理词、证据目录、合规风险扫描报告、整改建议、尽调备忘录、法律分析报告 / 分析底稿等——在常规法律场景下的通用质量评测。
v0.4.0 定位(来源:杨卫薪律师 2026-07-05 拍板,详见 DECISIONS.md D-2026-07-05-02):
- 通用泛化优先于场景细分。本文件给出一套六维度作为常规法律场景的主流程,不再要求评测员"按合同/诉讼/合规各选独立 rubric"。
- 场景差异通过 场景微调说明 处理(一段话级别的侧重指引),不再上升为独立 rubric。
- 三场景 rubric(contract / litigation / compliance scenario-rubric.md)降级为深度参考附录:在 taste 深度核查、特定场景争议、需要更细颗粒度评分时使用。
- 本六维度是 ch07 第六节 L794-803 合同型六维的回归通用命名——去掉合同专属化(如"事实叙述与条款定位"→"事实叙述与证据运用"),恢复其作为通用起点的本义。
通用六维度
| ID / 维度 | 检查问题 | 低分表现 | 高分表现 |
|---|---|---|---|
| DIM-1 法律准确性 | 是否正确理解规则、法律关系、基本概念?是否把不确定结论写成确定结论? | 法条或概念错误;把商业谈判点写成法律风险;把事实缺口写成法律结论;把不确定写成确定 | 规则表述准确;结论边界清楚;区分法律风险、商业谈判点、事实缺口、需人工确认事项 |
| DIM-2 事实叙述与证据运用 | 是否忠实基于已提供材料(不虚构)?事实/证据是否对应到主张与结论?关键事实/条款/证据是否遗漏? | 虚构背景;遗漏关键事实;把未确认说法当事实;引用条款或证据但说不清在哪 | 能对应到具体条款位置 / 证据编号 / 法源出处;事实缺口明确标注 |
| DIM-3 逻辑说服力 | 是否有清楚推理链条?是否"事实/条款/证据 → 风险或争议 → 结论/建议"逐步展开? | 只有结论没有理由;前后矛盾;建议与风险脱节;理由无法支撑结论 | 链条清楚;可被业务同事 / 谈判对手 / 法官 / 合规官理解;无孤立条目 |
| DIM-4 争议焦点与争议关键把握 | 是否抓住对本方实际影响决策的关键问题?是否区分主次而非平均罗列? | 平均罗列常见风险或常见争议;主次不分;把低影响项列为重点 | 识别关键冲突 / 高影响条款 / 高影响争议;按对本方影响排序 |
| DIM-5 实务可用性 | 输出能否进入下一步工作(修改 / 谈判 / 立案 / 庭审 / 整改 / 研判)?建议是否具体可执行?是否标注需确认事项? | 建议空泛("建议进一步审查");无法修改、沟通、分派或执行;不标注需确认事项 | 行动项明确;可复核、可沟通、可修改、可执行;区分立即 / 短期 / 中长期或首选 / 备选 |
| DIM-6 交付物格式完整度 | 是否符合本场景交付物结构(风险表 / 初审意见 / 起诉状 / 答辩状 / 代理词 / 合规清单 / 分析报告等)?字段是否稳定?层级是否清楚? | 字段缺失;层级混乱;读者难定位;颗粒度不匹配交付对象 | 字段稳定;层级清楚;适配交付对象(内部业务 / 外部客户 / 法官 / 管理层);必要时区分摘要层与明细层 |
每维度的场景微调附注(一句话级,详见 scenario-tuning-notes.md)
| 维度 | 合同型侧重 | 诉讼型侧重 | 合规型侧重 | 案件分析型(前置底稿) |
|---|---|---|---|---|
| 1. 法律准确性 | 区分违约责任/解除权/不安抗辩/违约金调整等基本概念 | 正确识别请求权基础 + 案由匹配 | 监管依据精确到条款 + 效力层级 + 时效性 | 同诉讼型,加"法律问题树"拆解 |
| 2. 事实叙述与证据运用 | 重点风险标注条款编号;无编号时声明 | 事实 → 证据 → 主张链条;证据三要素(名称/来源/证明目的) | 风险结论基于业务事实;标注事实缺口 | 事实到证据到主张链条;不要求本证/反证颗粒度 |
| 3. 逻辑说服力 | 条款 → 风险 → 修改建议 | 一请求一理由;针对对方主张逐项反驳 | 风险 → 整改建议 → 整改次生风险评估 | 法律问题 → 子问题 → 检索吸收 → 策略路径 |
| 4. 争议焦点把握 | 风险分级(高/中/低)+ 对本方履约影响 | 抓住诉讼攻防焦点 + 抗辩预判 | 区分必须整改 vs 建议改进;区分法律红线 vs 合规建议 | 抓住本案策略关键节点(首选/并行/不建议) |
| 5. 实务可用性 | 修改方向 + 需业务/客户确认事项 | 诉请可执行性 + 证据组织 + 举证责任分配 | 整改动作具体到责任人/时限/分阶段(或一次性合规动作的"完成节点") | 行动清单(动作+目的+优先级)+ 检索吸收深度 |
| 6. 交付物格式完整度 | 风险表/初审意见字段稳定(风险描述/条款位置/等级/修改方向/需确认) | 法定格式(首部/事实理由/请求/尾部)+ 法庭语体 + 法条引用准确 | 风险清单/整改建议/尽调备忘录结构 + 唯一编号可追溯 | 分析报告结构(问题树/检索吸收/策略/行动清单),非法庭文书,不要求诉请与法庭语体 |
评分口径
- 1–5 分初评,不追求精密。重点是发现哪一维最弱,并在 SKILL.md 步骤 7 选择最小修复单元。
- 某一维在某场景若是空项(如合同初审里"争议焦点把握"接近空项),不强行打分,标注"本场景空项"或"弱项",不影响总体判定。
- 维度评分必须证据锚定:判"法律准确性低"必须指出哪条规则/哪个概念错;判"事实叙述弱"必须指出漏了哪个条款/证据;判"实务可用性差"必须指出哪条建议空泛。不接受裸分(来源:DR-5 LLM-as-judge 四校准,详见
eval-methodology.md第三节)。
与 ch07 第六节六维度的对应关系
本通用六维度与 ch07 第六节 L794-803 合同型六维度一一对应,但做了回归通用命名:
| ch07 第六节(合同型命名) | 本文件(通用命名) | 调整说明 |
|---|---|---|
| 法律准确性 | 法律准确性 | 不变 |
| 事实叙述与证据运用 | 事实叙述与证据运用 | 不变(ch07 本就用通用名;v0.3.x 在 contract-rubric 里改成了"事实叙述与条款定位"是合同专属化,v0.4.0 撤回) |
| 逻辑说服力 | 逻辑说服力 | 不变 |
| 争议焦点把握 | 争议焦点与争议关键把握 | 微调:合同型里"争议焦点"接近空项,加"争议关键"覆盖"高影响条款识别" |
| 实务可用性 | 实务可用性 | 不变 |
| 文书格式完整度 | 交付物格式完整度 | 微调:"文书"偏诉讼语境,"交付物"覆盖合同/诉讼/合规/分析四类 |
来源与边界见本文件附录。
通用六维度的边界(不替代 taste)
通用六维度评的是任何法律产出物都该有的基础质量。但有一类东西任何维度表都量不出来——经验律师凭直觉就会察觉的"不对",如:
- 把不确定写成确定
- 把商业谈判点当成法律风险
- 混淆本方与对方主张
- 把内部初审语气用到对外谈判函
- 把草稿写成正式意见
- 对裁判结果 / 合规结果做承诺性表述
这些是 taste 项,必须显式列出、单独核查,不能被通用维度稀释掉。详见下方"taste 项组织"。
taste 项组织(通用 taste + 场景 taste)
一、通用 taste(所有场景必查,单列不并入维度评分)
下列 taste 项来自 ch07 第六节 L854 + Phase B 校准(trademark-case-01 + case-analysis-case-01)的共性发现。任何法律场景的产出物评测都必须逐项核查,每项命中即 taste FAIL,影响总体判定。
- TASTE-1:是否避免"把不确定写成确定"(如把"原告主张"写成"事实如此";把"初筛"写成"确认合规")。
- TASTE-2:是否区分"法律风险 / 法律红线"和"商业谈判点 / 商业判断"。把"价格偏高"写成法律风险,或把"商业模式不可行"写成合规结论,是典型越界。
- TASTE-3:是否区分"风险 / 结论"和"事实缺口"。材料里没说的事情,应标"需确认",不能编。
- TASTE-4:是否站在本方立场,区分本方主张和对方主张。把"保护对方"列为重点风险(本方审查时),或把对方主张混入本方陈述(答辩时),是立场错位。
- TASTE-5:是否避免绝对化承诺(如"该合同无任何法律风险""本方案确保完全合规""法院必将支持")。
- TASTE-6:是否避免把草稿写成正式法律意见 / 正式合规意见 / 终稿诉状。应明确"初审意见 / 合规初筛 / 草稿,须经承办律师或业务方复核 / 定稿"。
- TASTE-7:是否提示人工复核(产出物涉及的业务事实需业务方核实;AI 引用的法条 / 监管依据需律师核验适用性与时效性)。
- TASTE-8:是否提示材料缺失会影响判断(缺主合同 / 缺报价单 / 缺证据 / 缺业务流程图等)。
二、场景 taste(深度核查时参考三场景 rubric)
下列 taste 项有场景特异性,主流程不强制逐项核查;在以下情况启用:
- 评测总体结论边缘(接近 ⚠️ 修后再测)需要更细颗粒度;
- 评测员对某场景有经验,希望做深度 taste 核查;
- 出现场景特异争议(如长文书是否"像一般大模型作文"、跨境合规的数据更新频率差异)。
场景 taste 来源:
- 合同型 taste(taste-1 ~ taste-6):见
contract-scenario-rubric.md第二节。多数已被本文件"通用 taste"吸收;剩余合同专属如"风险分级口径"等留在场景 rubric。 - 诉讼型 taste(taste-1 ~ taste-9):见
litigation-scenario-rubric.md第二节。场景特异项包括"避免万能诉请""提示举证责任分配""长文书避免像一般大模型作文""法条需律师核实适用性"等。 - 合规型 taste(taste-1 ~ taste-9):见
compliance-scenario-rubric.md第二节。场景特异项包括"区分法律红线与合规建议""提示监管动态性""跨境数据更新频率差异""可追溯证据 / 截图存证"等。
说明:本节"通用 taste"与场景 taste 有重叠(如"避免把不确定写成确定"在合同/诉讼/合规 taste 里都有)——这是故意冗余:通用 taste 保证主流程不漏底线,场景 taste 给深度核查提供更具体的判例。重叠项以"通用 taste"为准做主流程判定,场景 taste 仅作深度参考。
与"案件分析型"等非终端交付物的关系
案件分析型(法律分析报告 / 分析底稿,供律师团队内部研判 + 后续写作 Skill 复用,不是终端交付物)在通用六维度上的表现:
- 维度 1(法律准确性)/ 维度 3(逻辑说服力)/ 维度 5(实务可用性):完全适配。
- 维度 2(事实叙述与证据运用):适配,颗粒度合理偏低(评到强/中/弱即可,不要求本证/反证颗粒度)。
- 维度 4(争议焦点把握):适配,但内涵切换为"策略路径关键节点"而非"诉讼攻防焦点"。
- 维度 6(交付物格式完整度):适配,但不要求法庭文书法定结构(首部/事实理由/请求/尾部)——分析报告不是法庭文书。强行要求法庭语体 / 诉请明确性会产生"虚假低分"。
判分原则:通用六维度评的是"作为法律产出物的基础质量",不是"作为某终端文书的格式合规度"。案件分析报告作为前置底稿,其"格式完整度"按分析报告结构评(问题树 / 检索吸收 / 策略 / 行动清单),不按法庭文书结构评。
v0.4.0 的局限与远期方向
- 本通用六维度已完成 trademark 商标合规、case-analysis 案件分析,以及 contract-copilot 合同场景首批 3 例校准种子。合同校准见
evals/contract-calibration-260730/calibration-report.md,其中 2 例为历史未绑定归档、1 例绑定当前候选,20—50 例完整 suite 和候选全量重跑仍未完成,因此只能说明维度已在合同场景发现有效问题,不能写成合同型领域验收通过。真实诉讼文书生成 skill(起诉状/答辩状/代理词)仍待 T-402 校准。 - 远期 BACKLOG(不在 v0.4.0 做):针对特定场景做更深泛化——案件分析 / 法律检索 / 文书润色 / 尽调专属维度集。前期优先把通用六维度经更多场景验证后再考虑深化(详见 TASKS.md BACKLOG 段)。
附录:六维度来源说明
A.1 来源
六维度评价标准来自本书(法律 skill 书籍)第七章第六节"第四步:怎样验证初版 Skill 是否可用"的"四、六维度评价标准:检查法律输出质量"小节。
原文给出的六个维度:法律准确性 / 事实叙述与证据运用 / 逻辑说服力 / 争议焦点把握 / 实务可用性 / 文书格式完整度。原文同时给了一个 1-5 分初评机制,并强调"这张表的作用是帮你定位改进点,而不是让 AI 自己给自己打高分"。
原文章节语境是合同初审 Skill(供应商服务合同初审)。本技能 v0.4.0 经 Phase B 校准(trademark + case-analysis)+ 用户拍板后,把这套六维度经过回归通用命名调整后,正式确立为通用评测主流程。详见本文件开头"v0.4.0 定位"。
A.2 不输出通用总分
本技能不输出以下内容:
- 一个适用于所有法律 Skill 的"六维度通用基准"和单一总分
- 跨场景的"平均分"或"加权总分"
- 把不同场景 Skill 排进同一张榜单的横向比较
理由:法律场景之间的差异远大于共性。强行套基准,评测本身会变成另一个看起来严谨但没用的产物。
A.3 业界参考但不照搬
本技能参考了两类业界思路(v0.2.0 依据 DR-5 前沿调研更新表述):
- Anthropic eval 方法论 + Claude skill creator 的 eval 验证思路(test cases / expected behavior / assertion grading / benchmark / blind A / description tuning):借鉴"用熟悉材料做基准"的思路。但 v0.2.0 起不再使用"黄金答案"术语——DR-5 明确标注该术语未在 Anthropic 官方公开材料核验到(详见
eval-methodology.md第二节)。改用"参考解三档口径"。 - 作者既有六维度评价标准:降级为合同型场景的参考起点,v0.4.0 经通用化命名调整后作为通用评测主流程。