All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

referencesscenario-tuning-notes.md

≈3k tokens on demand. Your agent reads this file only when SKILL.md points to it.

场景微调说明(v0.4.0 主流程配套)

适用范围:通用六维度评测(references/universal-dimensions.md)的场景侧重指引。本文件不是独立 rubric,是通用六维度在合同 / 诉讼 / 合规 / 案件分析四类典型场景下的"附注一段话",帮助评测员在套用通用维度时理解该场景的侧重、taste 关注点、非终端交付物的处理。

v0.4.0 定位:通用六维度是主流程;本文件是场景附注;三场景 rubric(contract / litigation / compliance scenario-rubric.md)降级为深度参考附录。三者关系:

  • 主流程:通用六维度 + 通用 taste(universal-dimensions.md)。
  • 场景附注:本文件(每场景一段话)。
  • 深度参考附录:三场景 rubric(在 taste 深度核查、特定场景争议、需要更细颗粒度评分时用)。

一、合同型场景(合同初审 / 合同审查 / 合同起草 / 补充协议起草)

典型交付物:初审意见、合同风险表、修改建议清单、补充协议草案。

通用六维度在本场景的侧重:

  • 维度 1(法律准确性):重点查基本合同法概念(违约责任、解除权、不安抗辩、违约金调整、验收与付款挂钩、知识产权归属、保密义务、争议解决条款)判断准确;区分法律风险 / 商业谈判点 / 事实缺口。
  • 维度 2(事实叙述与证据运用):重点风险必须标注条款编号或条款位置;合同未标明条款编号时声明"合同未标明条款编号";不虚构交易背景。
  • 维度 3(逻辑说服力):从条款 → 风险 → 修改建议逐步展开;风险与建议一一对应。
  • 维度 4(争议焦点把握):在本场景具体化为风险分级与高影响条款识别——区分高/中/低风险,识别单方变更 / 单方终止 / 单方暂停 / 自动续期 / 责任上限 / 争议解决条款等典型高影响条款。注意:"争议焦点"在合同初审里常常是弱项或空项(合同尚未发生争议),主要靠风险分级和高影响条款识别体现。
  • 维度 5(实务可用性):每项风险有具体修改方向(不是"建议进一步审查"空话);列出需业务/客户确认的事项(商业意图、可接受的风险敞口);能直接进入红线修改、谈判或内部讨论。
  • 维度 6(交付物格式完整度):风险表字段稳定(风险描述 / 条款位置 / 风险等级 / 修改方向 / 需确认事项)。

场景 taste 关注点(深度核查时见 contract-scenario-rubric.md 第二节):区分法律风险与商业谈判点(taste-1)、区分风险与事实缺口(taste-2)、本方立场(taste-3,采购方视角的合同审查把"保护供应商"列为重点风险是立场错位)、材料缺失提示(taste-4)、避免绝对化承诺(taste-5)、避免草稿当正式意见(taste-6)。


二、诉讼型场景(起诉状 / 答辩状 / 代理词 / 反诉状 / 证据目录 / 质证意见 / 庭审提纲)

典型交付物:起诉状、答辩状、代理词、反诉状、证据目录、质证意见、庭审提纲。

通用六维度在本场景的侧重:

  • 维度 1(法律准确性):在本场景具体化为请求权基础与法律关系定性准确——正确识别请求权基础(合同请求权 / 侵权请求权 / 不当得利 / 物权请求权等),案由选择与请求权基础一致,法律关系主体清楚(原告 / 被告 / 第三人 / 必要共同诉讼人)。
  • 维度 2(事实叙述与证据运用):在本场景具体化为事实 → 证据 → 主张链条——每一项诉讼请求/抗辩主张有对应的事实和证据支撑;证据三要素完整(证据名称 / 来源 / 证明目的);区分本证/反证、直接/间接(深度核查时);识别证据缺口。
  • 维度 3(逻辑说服力):在本场景具体化为一请求一理由——避免"事实一堆、理由一堆、请求一堆"互不对应;答辩状类输出针对对方主张逐项回应(一主张一反驳)。
  • 维度 4(争议焦点把握):抓住诉讼攻防焦点 + 抗辩预判(诉讼时效 / 程序异议 / 实体抗辩),而不是平均罗列。
  • 维度 5(实务可用性):在本场景具体化为诉请可执行性 + 证据组织 + 举证责任分配——诉讼请求具体、明确、可执行(金额/行为/确认之诉的范围),金额有计算依据,给付之诉明确给付内容/期限/方式;提示举证责任落在哪一方。
  • 维度 6(交付物格式完整度):在本场景具体化为法定格式 + 法庭语体 + 法条引用准确——符合该文书法定格式(首部/事实理由/请求/尾部);法庭语体规范(避免口语化、情绪化、绝对化);引用法条准确(条文 + 款项 + 内容)。

中国法律语境三层(诉讼型专属,深度核查时见 litigation-scenario-rubric.md 第三节 + eval-methodology.md 第六节):①官方结构与要素是否齐(示范文本 / 文书样式,2025 年起最高法、司法部、全国律协推广的部分案件起诉状 / 答辩状示范文本);②所引法源、案由、程序位置是否对;③对裁判尺度与案例检索资源的使用是否像中国实务。

场景 taste 关注点(深度核查时见 litigation-scenario-rubric.md 第二节):避免万能诉请(taste-1)、不把不确定写成确定(taste-2)、提示举证责任分配(taste-3)、不对裁判结果做承诺(taste-4)、区分本方对方主张(taste-5)、提示诉讼风险(taste-6)、明确草稿须经承办律师复核(taste-7)、AI 引用法条需律师核实适用性与有效性(taste-8)、长文书避免"像一般大模型作文"(taste-9)。


三、合规型场景(合规风险扫描 / 合规整改建议 / 合规审查清单 / 合规尽调备忘录 / 数据合规评估 / 反垄断合规评估 / 反腐败合规评估)

典型交付物:合规风险清单、整改建议书、合规审查意见、尽调备忘录、数据合规评估报告。

通用六维度在本场景的侧重:

  • 维度 1(法律准确性):在本场景具体化为监管依据精确度——引用的法规/规章/规范性文件/行业标准/监管指引准确(名称 + 文号 + 条款);区分法律、行政法规、部门规章、地方性法规、规范性文件、自律规则的不同效力层级;识别跨境/跨法域多重监管依据;避免引用已废止或已修订的依据。
  • 维度 2(事实叙述与证据运用):在本场景具体化为风险结论与业务事实对应——风险结论基于已提供的业务事实(不虚构业务场景);标注事实缺口(缺业务流程图、数据处理清单、关联交易明细等);区分"已确认事实"和"待核实事项"。
  • 维度 3(逻辑说服力):风险 → 整改建议 → 整改次生风险评估逐步展开。
  • 维度 4(争议焦点把握):在本场景具体化为风险等级判定合理性 + 区分必须整改 vs 建议改进——风险等级(高/中/低)判定有标准(违法性/危害后果/发生概率/监管处罚力度);避免一刀切。
  • 维度 5(实务可用性):在本场景具体化为整改路径可执行性——每项风险有对应整改建议(具体到动作、责任人、时限);区分立即整改/短期整改/中长期建设;评估整改成本与风险敞口的匹配;提示整改本身的合规风险(整改过程可能产生的新合规问题)。
    • 场景化豁免(来源:trademark-case-01 校准):对一次性合规动作(商标申请、备案登记、单次尽调),"责任人/时限/分阶段"可降级为"动作完成节点"——这类场景没有分阶段整改,全要求会过度。
  • 维度 6(交付物格式完整度):符合本场景交付物结构(风险清单/整改建议书/尽调备忘录/合规审查意见);每项风险有唯一编号便于整改追溯;区分面向管理层(摘要)和面向执行层(明细)的不同颗粒度。

场景 taste 关注点(深度核查时见 compliance-scenario-rubric.md 第二节):区分法律红线与合规建议(taste-1)、提示监管动态性(taste-2)、避免零风险承诺(taste-3)、提示跨境/跨行业差异(taste-4)、不把商业判断写成合规结论(taste-5)、明确合规初筛非正式意见(taste-6)、业务事实需核实(taste-7)、可追溯证据/截图存证(taste-8,注意:在商标等纸面推理场景下强制等级待用户拍板,可能仅建议而非强制)、跨境数据更新频率差异(taste-9)。


四、案件分析型场景(法律分析报告 / 分析底稿 / 案件可行性分析)

典型交付物:法律分析报告、案件分析底稿、可行性分析报告、检索报告(供律师团队内部研判 + 后续写作 Skill 复用)。

边界定性:案件分析型产出是前置分析底稿,不是终端交付物——不产出诉请、不是法庭文书、不替代正式法律意见。它的"格式完整度"按分析报告结构评(问题树 / 检索吸收 / 策略 / 行动清单),不按法庭文书结构评。

通用六维度在本场景的侧重与豁免:

  • 维度 1(法律准确性):完全适配。重点查请求权基础识别 + 法律问题树拆解完整性(把本案拆成主问题 → 子问题 → 检索点 → 适用规则)。
  • 维度 2(事实叙述与证据运用):适配。颗粒度合理偏低——评到证据强/中/弱即可,不要求本证/反证、直接/间接颗粒度(那是证据目录制作 skill 的范畴)。
  • 维度 3(逻辑说服力):适配。具体化为"法律问题 → 子问题 → 检索吸收 → 策略路径"链条清楚。
  • 维度 4(争议焦点把握):适配,但内涵切换为策略路径关键节点(首选 / 并行 / 不建议三档策略),而非诉讼文书的"诉讼攻防焦点"。
  • 维度 5(实务可用性):适配。具体化为行动清单可执行性(动作 + 目的 + 优先级)+ 检索吸收深度(把检索结果转化为"规则要点 + 适用条件 + 本案对应事实 + 支持方向")。
  • 维度 6(交付物格式完整度):适配,但豁免法庭文书法定结构——不要求首部/事实理由/请求/尾部,不要求法庭语体;按分析报告结构评(问题树 / 检索吸收 / 策略 / 行动清单)。

场景 taste 关注点(深度核查时见 litigation-scenario-rubric.md 第二节,做场景化调整):taste-1 场景化为"避免万能分析结论"(避免"本案可以/不可以"这类无依据断言);taste-7 场景化为"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"。

判分原则:评测员发现产出物是案件分析底稿时,主动套用本节豁免——维度 2 / 维度 6 按本节侧重评,避免因"不是法庭文书"打"虚假低分"。这是 Phase B case-analysis-case-01 校准的核心发现。


五、未覆盖场景的处理

通用六维度 + 本文件未显式覆盖的场景(法律检索、文书润色、尽调、法律咨询答复等):

  • 默认处理:套用通用六维度 + 通用 taste;场景侧重参照与本场景最接近的合同/诉讼/合规/案件分析四类。
  • 报告里标注:"本次评测降级套用通用六维度 + [X 类]场景侧重,建议补充该场景专属微调说明。"
  • 远期方向:见 TASKS.md BACKLOG 段——前期优先通用,等通用维度集经更多场景验证后,再针对高频场景做更深微调。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation