All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

referenceslitigation-scenario-rubric.md

≈2.7k tokens on demand. Your agent reads this file only when SKILL.md points to it.

诉讼型场景产出物评测维度清单

v0.4.0 起降级为深度参考附录。主流程见 universal-dimensions.md(通用六维度 + 通用 taste)+ scenario-tuning-notes.md(诉讼型场景微调说明)。本文件在以下情况启用:taste 深度核查、诉讼型场景特异争议(如长文 judge 稳定性、中国法律语境三层)、需要比通用六维度更细颗粒度的评分。本文件内容作为 v0.3.x 沉淀供深度参考。

适用范围:起诉状、答辩状、代理词、反诉状、证据目录、质证意见、庭审提纲等以"诉讼文书"为处理对象的 Skill 产出物。

本清单与合同型清单不通用。诉讼文书的好坏,不在"风险分级",而在"请求权基础是否立得住、证据组织是否能支撑主张、诉讼请求与理由是否一一对应"。

v0.3.0 待真实 skill 校准声明:本清单的六个维度 + taste 项,由 DR-5 调研(research/issue-123-skill-eval-deep-research-chatgpt.md,SWE-bench 双门槛、LLM-as-judge 四校准、参考解三档、长文 judge)+ 杨卫薪知识体系(source-material/杨卫薪知识体系/5. 案例集/16-答辩状与代理词生成.md、11-批量案件诉讼材料自动处理.md、15-证据目录制作.md、12-医疗损害责任纠纷分析.md)共同推导。未经真实诉讼 skill 校准——维度集的覆盖度、taste 项的命中分布、长文 judge 的稳定性参数都需要在真实诉讼型 skill 上跑过后回灌。校准任务见 TASKS.md T-301。校准回灌后维度可能调整、合并或新增,本版本不是终稿。

v0.3.1 部分校准回灌(来源:legal-case-analysis v0.2.6 案件分析场景降级套用,见 evals/case-bundle-260705/case-analysis-case-01.md):本次校准的是案件分析型(法律分析报告),不是诉讼文书生成(起诉状/答辩状/代理词)。结论:诉讼型 6 维度在案件分析场景仅 3 个完全适配(维度 1/3/5)、1 个颗粒度偏低(维度 4)、2 个不适配(维度 2 诉讼请求明确性 / 维度 6 文书格式与法庭语体)——案件分析报告不产出诉请、不是法庭文书,强行套用产生虚假低分。taste 项 9 项全部通过(legal-case-analysis 主动拦截旧法是 taste-8 的优秀工程化)。真实诉讼文书生成 skill(起诉状/答辩状/代理词)仍待 T-402 校准,本次校准不构成诉讼型 rubric 的完整回灌。 暴露"案件分析型"为 v0.3.0 三场景未覆盖的第四类,提案 v0.4.0 新增专属 rubric,待用户确认。

推导依据(备查)

  • 维度 1(请求权基础)+ 维度 3(事实理由对应):来自 ch07 第六节六维度中"法律准确性 + 事实叙述与证据运用"在诉讼场景的具体化,杨卫薪知识体系《答辩状与代理词生成》明确"分析对方主张 → 定位争议焦点 → 构建答辩逻辑 → 法律依据 + 事实支撑"链条。
  • 维度 2(诉讼请求明确性):杨卫薪《批量案件诉讼材料自动处理》强调"诉讼策略决定抽取哪些字段"——诉讼请求不清会反推信息抽取失败。
  • 维度 4(证据组织):杨卫薪《证据目录制作》明确证据三要素"证据名称 / 来源 / 证明目的",复杂案件需分组分类。
  • 维度 5(抗辩预判):杨卫薪《答辩状与代理词生成》强调"针对每个争议点,提供法律依据和事实支撑"+"先概述立场 → 逐一回应对方主张 → 总结己方观点"。
  • 维度 6(文书格式与法庭语体)+ 中国法律语境三层:DR-5 引 LAiW / TW-LegalBench / 最高法案例库与示范文本。
  • taste 项 1-7:来自 ch07 第六节 L854 taste 四类(把不确定写成确定 / 把商业谈判点当法律风险 / 混淆本方对方主张 / 初审语气用到对外函)在诉讼场景的具体化扩展。

一、维度清单

维度 1:请求权基础与法律关系定性

检查问题:

  • 是否正确识别请求权基础(合同请求权 / 侵权请求权 / 不当得利 / 物权请求权等),并定性准确
  • 案由选择是否与请求权基础一致
  • 法律关系主体是否清楚(原告 / 被告 / 第三人 / 必要共同诉讼人)

低分表现:请求权基础混乱;案由与主张不一致;主体遗漏或错列。

高分表现:请求权基础清楚;案由准确;主体完整。

维度 2:诉讼请求的明确性与可执行性

检查问题:

  • 诉讼请求是否具体、明确、可执行(金额、行为、确认之诉的范围)
  • 给付之诉是否明确给付内容、期限、方式
  • 是否区分确认之诉 / 给付之诉 / 变更之诉,避免诉的分类错误
  • 诉讼请求金额是否有计算依据

低分表现:请求模糊(如"判令被告承担责任");金额无计算过程;诉的分类错误。

高分表现:请求具体可执行;金额有计算清单;诉的分类正确。

维度 3:事实与理由的对应(一请求一理由)

检查问题:

  • 每一项诉讼请求是否有对应的事实和理由支撑
  • 事实陈述是否有证据对应(事实 → 证据 → 主张链条)
  • 是否避免"事实一堆、理由一堆、请求一堆"互不对应的写法

低分表现:事实、理由、请求三段互不对应;理由无法支撑请求。

高分表现:一请求一理由;事实到证据到主张链条清楚。

维度 4:证据组织与证明力评估

检查问题:

  • 证据目录是否完整(证据名称 / 来源 / 证明对象 / 证明力初判)
  • 是否区分本证 / 反证、直接证据 / 间接证据
  • 是否识别证据缺口(哪些主张缺少证据支撑)
  • 是否避免对证据证明力做绝对化判断(应留余地)

低分表现:证据目录缺字段;证明对象不清;把存疑证据当确定证据用。

高分表现:证据组织清楚;证明对象对应主张;证据缺口明确标注。

维度 5:抗辩预判与争议焦点把握

检查问题:

  • 是否预判对方可能抗辩(诉讼时效 / 程序异议 / 实体抗辩)
  • 是否抓住本案实际争议焦点(而不是平均罗列)
  • 答辩状类输出是否针对对方主张逐项回应(一主张一反驳)

低分表现:不预判抗辩;争议焦点平均罗列;答辩不针对对方主张。

高分表现:抗辩预判到位;争议焦点聚焦;答辩逐项对应。

维度 6:文书格式与法庭语体

检查问题:

  • 是否符合该文书法定格式(首部 / 事实理由 / 请求 / 尾部)
  • 法庭语体是否规范(避免口语化、情绪化、绝对化表述)
  • 引用法条是否准确(条文 + 款项 + 内容)

低分表现:格式混乱;语体不当;法条引用错误或缺漏。

高分表现:格式规范;语体克制;法条引用准确。

二、诉讼型场景 taste 项

taste 来自 ch07 第六节 L854 + 杨卫薪知识体系《答辩状与代理词生成》"事实准确性 / 法律适用性 / 逻辑严密性 / 语言规范性"四道质量关。每项命中即 taste FAIL,不并入维度评分。

  • taste-1:是否避免"万能诉请"(如"判令被告承担本案一切费用")。
  • taste-2:是否避免把不确定事实写成确定事实(如把"原告主张"写成"事实如此")。
  • taste-3:是否提示举证责任分配(谁主张谁举证的具体落到哪一方)。
  • taste-4:是否避免对法官裁判结果做承诺性表述(如"法院必将支持")。
  • taste-5:是否区分本方主张和对方主张(答辩状尤其重要,不能把对方主张混入本方陈述)。
  • taste-6:是否提示诉讼风险(如诉讼时效风险、举证不能风险、败诉风险),而不是只写有利面。
  • taste-7:是否明确"本文书为草稿 / 初稿,须经承办律师复核后定稿"。
  • taste-8(v0.3.0 推导,待校准):是否提示 AI 引用的法条需经律师核实适用性与有效性——杨卫薪明确"有些法律可能已经修改或废止,AI 的知识可能不够及时"。
  • taste-9(v0.3.0 推导,待校准):长文书(代理词、答辩状)是否避免"像一般大模型作文"——DR-5 引 LAiW 指出自动评测"看起来会写",但专家人工评审会发现其缺乏真正的法律三段论严谨性。

三、中国法律语境三层(v0.2.0 新增,诉讼型专属)

诉讼型清单与合同型/合规型最大的语境差异在于:中国诉讼文书的"像不像律师写的",一大半可拆成官方制度资源对应的结构化要求。评中文诉讼文书时,在维度 1-6 之外必须额外核查三层(依据见 references/eval-methodology.md 第六节,DR-5 综合 LAiW / TW-LegalBench / 最高法案例库与示范文本):

  1. 官方结构与要素是否齐——是否符合示范文本 / 文书样式的必备要素(deterministic grader 可查)。2025 年起最高法、司法部、全国律协推广的部分案件起诉状 / 答辩状示范文本覆盖 9 个领域 67 类常见纠纷,应作为字段完整性的硬参照。
  2. 所引法源、案由、程序位置是否对——案由匹配请求权基础、法源层级与时效正确、程序位置(一审 / 二审 / 再审 / 特别程序)准确。落在本清单维度 1(请求权基础与定性)、维度 6(文书格式与法庭语体)。
  3. 对裁判尺度与案例检索资源的使用是否像中国实务——是否参考同类入库案例(最高法案例库)、是否贴合裁判要旨与案情关键词的对应、是否避免"像一般大模型作文"(human grader + 案例库对照)。

civil-law 不能套 common-law benchmark(已核验):LAiW 明确用 legal syllogism 解释中文法律能力结构,并指出自动评测看起来"会写",但专家人工评审会发现其缺乏真正的法律三段论严谨性。本技能不引用 LegalBench / LexGLUE / LAiW 等公开 benchmark 的分数作为产出物质量指标——它们适合能力筛查,不宜代替真实工作产品验收。

四、与合同型清单的差异说明

诉讼型清单不能套用合同型六维度,原因:

  • 合同型的"风险分级"在诉讼型里对应的是"争议焦点把握",但内涵完全不同(合同风险是条款风险,诉讼争议焦点是诉讼攻防焦点)。
  • 合同型的"实务可用性"强调修改方向和需确认事项;诉讼型的"实务可用性"强调诉讼请求可执行性和证据组织。
  • 诉讼型独有的维度:请求权基础定性、诉讼请求明确性、证据组织、抗辩预判——这些在合同型里不存在。

如果一个 Skill 同时声称覆盖合同和诉讼,本技能要求用户分别用两套清单评测两次,不做平均。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation