诉讼型场景产出物评测维度清单
v0.4.0 起降级为深度参考附录。主流程见
universal-dimensions.md(通用六维度 + 通用 taste)+scenario-tuning-notes.md(诉讼型场景微调说明)。本文件在以下情况启用:taste 深度核查、诉讼型场景特异争议(如长文 judge 稳定性、中国法律语境三层)、需要比通用六维度更细颗粒度的评分。本文件内容作为 v0.3.x 沉淀供深度参考。
适用范围:起诉状、答辩状、代理词、反诉状、证据目录、质证意见、庭审提纲等以"诉讼文书"为处理对象的 Skill 产出物。
本清单与合同型清单不通用。诉讼文书的好坏,不在"风险分级",而在"请求权基础是否立得住、证据组织是否能支撑主张、诉讼请求与理由是否一一对应"。
v0.3.0 待真实 skill 校准声明:本清单的六个维度 + taste 项,由 DR-5 调研(
research/issue-123-skill-eval-deep-research-chatgpt.md,SWE-bench 双门槛、LLM-as-judge 四校准、参考解三档、长文 judge)+ 杨卫薪知识体系(source-material/杨卫薪知识体系/5. 案例集/16-答辩状与代理词生成.md、11-批量案件诉讼材料自动处理.md、15-证据目录制作.md、12-医疗损害责任纠纷分析.md)共同推导。未经真实诉讼 skill 校准——维度集的覆盖度、taste 项的命中分布、长文 judge 的稳定性参数都需要在真实诉讼型 skill 上跑过后回灌。校准任务见 TASKS.md T-301。校准回灌后维度可能调整、合并或新增,本版本不是终稿。v0.3.1 部分校准回灌(来源:legal-case-analysis v0.2.6 案件分析场景降级套用,见
evals/case-bundle-260705/case-analysis-case-01.md):本次校准的是案件分析型(法律分析报告),不是诉讼文书生成(起诉状/答辩状/代理词)。结论:诉讼型 6 维度在案件分析场景仅 3 个完全适配(维度 1/3/5)、1 个颗粒度偏低(维度 4)、2 个不适配(维度 2 诉讼请求明确性 / 维度 6 文书格式与法庭语体)——案件分析报告不产出诉请、不是法庭文书,强行套用产生虚假低分。taste 项 9 项全部通过(legal-case-analysis 主动拦截旧法是 taste-8 的优秀工程化)。真实诉讼文书生成 skill(起诉状/答辩状/代理词)仍待 T-402 校准,本次校准不构成诉讼型 rubric 的完整回灌。 暴露"案件分析型"为 v0.3.0 三场景未覆盖的第四类,提案 v0.4.0 新增专属 rubric,待用户确认。
推导依据(备查)
- 维度 1(请求权基础)+ 维度 3(事实理由对应):来自 ch07 第六节六维度中"法律准确性 + 事实叙述与证据运用"在诉讼场景的具体化,杨卫薪知识体系《答辩状与代理词生成》明确"分析对方主张 → 定位争议焦点 → 构建答辩逻辑 → 法律依据 + 事实支撑"链条。
- 维度 2(诉讼请求明确性):杨卫薪《批量案件诉讼材料自动处理》强调"诉讼策略决定抽取哪些字段"——诉讼请求不清会反推信息抽取失败。
- 维度 4(证据组织):杨卫薪《证据目录制作》明确证据三要素"证据名称 / 来源 / 证明目的",复杂案件需分组分类。
- 维度 5(抗辩预判):杨卫薪《答辩状与代理词生成》强调"针对每个争议点,提供法律依据和事实支撑"+"先概述立场 → 逐一回应对方主张 → 总结己方观点"。
- 维度 6(文书格式与法庭语体)+ 中国法律语境三层:DR-5 引 LAiW / TW-LegalBench / 最高法案例库与示范文本。
- taste 项 1-7:来自 ch07 第六节 L854 taste 四类(把不确定写成确定 / 把商业谈判点当法律风险 / 混淆本方对方主张 / 初审语气用到对外函)在诉讼场景的具体化扩展。
一、维度清单
维度 1:请求权基础与法律关系定性
检查问题:
- 是否正确识别请求权基础(合同请求权 / 侵权请求权 / 不当得利 / 物权请求权等),并定性准确
- 案由选择是否与请求权基础一致
- 法律关系主体是否清楚(原告 / 被告 / 第三人 / 必要共同诉讼人)
低分表现:请求权基础混乱;案由与主张不一致;主体遗漏或错列。
高分表现:请求权基础清楚;案由准确;主体完整。
维度 2:诉讼请求的明确性与可执行性
检查问题:
- 诉讼请求是否具体、明确、可执行(金额、行为、确认之诉的范围)
- 给付之诉是否明确给付内容、期限、方式
- 是否区分确认之诉 / 给付之诉 / 变更之诉,避免诉的分类错误
- 诉讼请求金额是否有计算依据
低分表现:请求模糊(如"判令被告承担责任");金额无计算过程;诉的分类错误。
高分表现:请求具体可执行;金额有计算清单;诉的分类正确。
维度 3:事实与理由的对应(一请求一理由)
检查问题:
- 每一项诉讼请求是否有对应的事实和理由支撑
- 事实陈述是否有证据对应(事实 → 证据 → 主张链条)
- 是否避免"事实一堆、理由一堆、请求一堆"互不对应的写法
低分表现:事实、理由、请求三段互不对应;理由无法支撑请求。
高分表现:一请求一理由;事实到证据到主张链条清楚。
维度 4:证据组织与证明力评估
检查问题:
- 证据目录是否完整(证据名称 / 来源 / 证明对象 / 证明力初判)
- 是否区分本证 / 反证、直接证据 / 间接证据
- 是否识别证据缺口(哪些主张缺少证据支撑)
- 是否避免对证据证明力做绝对化判断(应留余地)
低分表现:证据目录缺字段;证明对象不清;把存疑证据当确定证据用。
高分表现:证据组织清楚;证明对象对应主张;证据缺口明确标注。
维度 5:抗辩预判与争议焦点把握
检查问题:
- 是否预判对方可能抗辩(诉讼时效 / 程序异议 / 实体抗辩)
- 是否抓住本案实际争议焦点(而不是平均罗列)
- 答辩状类输出是否针对对方主张逐项回应(一主张一反驳)
低分表现:不预判抗辩;争议焦点平均罗列;答辩不针对对方主张。
高分表现:抗辩预判到位;争议焦点聚焦;答辩逐项对应。
维度 6:文书格式与法庭语体
检查问题:
- 是否符合该文书法定格式(首部 / 事实理由 / 请求 / 尾部)
- 法庭语体是否规范(避免口语化、情绪化、绝对化表述)
- 引用法条是否准确(条文 + 款项 + 内容)
低分表现:格式混乱;语体不当;法条引用错误或缺漏。
高分表现:格式规范;语体克制;法条引用准确。
二、诉讼型场景 taste 项
taste 来自 ch07 第六节 L854 + 杨卫薪知识体系《答辩状与代理词生成》"事实准确性 / 法律适用性 / 逻辑严密性 / 语言规范性"四道质量关。每项命中即 taste FAIL,不并入维度评分。
- taste-1:是否避免"万能诉请"(如"判令被告承担本案一切费用")。
- taste-2:是否避免把不确定事实写成确定事实(如把"原告主张"写成"事实如此")。
- taste-3:是否提示举证责任分配(谁主张谁举证的具体落到哪一方)。
- taste-4:是否避免对法官裁判结果做承诺性表述(如"法院必将支持")。
- taste-5:是否区分本方主张和对方主张(答辩状尤其重要,不能把对方主张混入本方陈述)。
- taste-6:是否提示诉讼风险(如诉讼时效风险、举证不能风险、败诉风险),而不是只写有利面。
- taste-7:是否明确"本文书为草稿 / 初稿,须经承办律师复核后定稿"。
- taste-8(v0.3.0 推导,待校准):是否提示 AI 引用的法条需经律师核实适用性与有效性——杨卫薪明确"有些法律可能已经修改或废止,AI 的知识可能不够及时"。
- taste-9(v0.3.0 推导,待校准):长文书(代理词、答辩状)是否避免"像一般大模型作文"——DR-5 引 LAiW 指出自动评测"看起来会写",但专家人工评审会发现其缺乏真正的法律三段论严谨性。
三、中国法律语境三层(v0.2.0 新增,诉讼型专属)
诉讼型清单与合同型/合规型最大的语境差异在于:中国诉讼文书的"像不像律师写的",一大半可拆成官方制度资源对应的结构化要求。评中文诉讼文书时,在维度 1-6 之外必须额外核查三层(依据见 references/eval-methodology.md 第六节,DR-5 综合 LAiW / TW-LegalBench / 最高法案例库与示范文本):
- 官方结构与要素是否齐——是否符合示范文本 / 文书样式的必备要素(deterministic grader 可查)。2025 年起最高法、司法部、全国律协推广的部分案件起诉状 / 答辩状示范文本覆盖 9 个领域 67 类常见纠纷,应作为字段完整性的硬参照。
- 所引法源、案由、程序位置是否对——案由匹配请求权基础、法源层级与时效正确、程序位置(一审 / 二审 / 再审 / 特别程序)准确。落在本清单维度 1(请求权基础与定性)、维度 6(文书格式与法庭语体)。
- 对裁判尺度与案例检索资源的使用是否像中国实务——是否参考同类入库案例(最高法案例库)、是否贴合裁判要旨与案情关键词的对应、是否避免"像一般大模型作文"(human grader + 案例库对照)。
civil-law 不能套 common-law benchmark(已核验):LAiW 明确用 legal syllogism 解释中文法律能力结构,并指出自动评测看起来"会写",但专家人工评审会发现其缺乏真正的法律三段论严谨性。本技能不引用 LegalBench / LexGLUE / LAiW 等公开 benchmark 的分数作为产出物质量指标——它们适合能力筛查,不宜代替真实工作产品验收。
四、与合同型清单的差异说明
诉讼型清单不能套用合同型六维度,原因:
- 合同型的"风险分级"在诉讼型里对应的是"争议焦点把握",但内涵完全不同(合同风险是条款风险,诉讼争议焦点是诉讼攻防焦点)。
- 合同型的"实务可用性"强调修改方向和需确认事项;诉讼型的"实务可用性"强调诉讼请求可执行性和证据组织。
- 诉讼型独有的维度:请求权基础定性、诉讼请求明确性、证据组织、抗辩预判——这些在合同型里不存在。
如果一个 Skill 同时声称覆盖合同和诉讼,本技能要求用户分别用两套清单评测两次,不做平均。