All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

evalscase-bundle-260705calibration-findings.md

≈3.9k tokens on demand. Your agent reads this file only when SKILL.md points to it.

Phase B 首批校准反向发现汇总(trademark + case-analysis)

校准时间: 2026-07-05 校准样本: 2 个真实法律 skill(trademark-assistant v1.5.4 / legal-case-analysis v0.2.6)共 6 份测试材料(每 skill × 三份测试法) 校准目的: 检验 legal-skill-evaluation v0.3.0 的维度集 / taste 项 / 流程方法是否够用,做功能提升 结论一句话: v0.3.0 三场景维度集(合同/诉讼/合规)在商标合规场景可用(需微调),在案件分析场景暴露覆盖盲区——应新增"案件分析型"为第四类场景(v0.4.0 提案)。流程方法(skill-lint-handoff / Hard Fail 红线 / 三份测试法 / 维度+taste 双层评分)实战可用,无需大改。


一、维度集够不够用?(核心问题)

1.1 合规型维度集(商标场景校准)

维度 商标场景可用性 发现
维度 1(监管依据精确度) ✅ 可用 商标法层级(法律→实施条例→审查指南→尼斯分类)是合规型"效力层级"的合理具体化
维度 2(风险识别完整性) ✅ 可用 商标合规天然是"绝对+相对+使用举证"三段式,与合规型"覆盖典型风险"契合
维度 3(风险等级判定合理性) ✅ 可用 output-contract 的"高/中/低/待补充"四级是合规型"区分必须整改 vs 建议改进"的优秀工程化
维度 4(整改路径可执行性) ⚠️ 描述偏严 rubric 要求"具体到动作、责任人、时限、分阶段"——这对企业合规整改(数据合规/反腐败)合理,但对商标申请这类一次性合规动作过度。小改:维度 4 描述补"对一次性合规动作(商标申请、备案登记、单次尽调),责任人/时限可降级为'动作完成节点'"。
维度 5(证据与事实对应) ✅ 可用 完全契合
维度 6(交付物格式与可追溯性) ✅ 可用 完全契合

结论:合规型 6 维度在商标场景5 个完全可用,1 个描述偏严需小改。

1.2 诉讼型维度集(案件分析场景校准——核心发现)

维度 案件分析场景可用性 发现
维度 1(请求权基础与定性) ✅ 完全适配 案件分析报告天然要做请求权基础识别
维度 2(诉讼请求明确性) ❌ 不适配 案件分析报告不产出诉请,只评估可行性——强行套用产生虚假低分
维度 3(事实与理由对应) ✅ 完全适配 案件分析报告的核心就是"事实→证据→法律→主张"链条
维度 4(证据组织与证明力) ⚠️ 颗粒度偏低 案件分析报告的"强/中/弱"证明力评估合理,但 rubric 要求"区分本证/反证、直接/间接"——这是证据目录制作 skill 的范畴,不应让 case-analysis 承担
维度 5(抗辩预判与争议焦点) ✅ 完全适配 案件分析报告的最强维度
维度 6(文书格式与法庭语体) ❌ 不适配 案件分析报告不是法庭文书,没有"首部/事实理由/请求/尾部"法定结构

结论:诉讼型 6 维度在案件分析场景3 个完全适配,1 个颗粒度偏低,2 个不适配——证明 v0.3.0 三场景维度集无法完全覆盖"案件分析型"。

1.3 核心结论:应新增"案件分析型"为第四类场景

v0.4.0 提案(待用户确认,不在本次小改范围):

当时提案新增 references/case-analysis-scenario-rubric.md,维度集推导:

维度 来源
维度 1:请求权基础与法律关系定性 继承诉讼型维度 1
维度 2:法律问题树拆解完整性 新增——来自 legal-case-analysis 第五节
维度 3:事实理由对应(一请求一理由) 继承诉讼型维度 3
维度 4:证据组织(降级颗粒度) 继承诉讼型维度 4 + 显式声明"评到强/中/弱即可,不要求本证/反证/直接/间接"
维度 5:抗辩预判与争议焦点把握 继承诉讼型维度 5
维度 6:法律检索吸收深度 新增——评是否把检索结果转化为"规则要点 + 适用条件 + 本案对应事实 + 支持方向"(来自 contest-sample-analysis 第六节)
维度 7:策略路径切换(首选/备选/并行) 新增——评是否给出首选/并行/不建议三档策略(来自 contest-sample-analysis 第九节)
维度 8:风险等级判定标准 新增——评每条结论是否带"高/中/低 + 判定依据 + 补强建议"
维度 9:行动清单可执行性 新增——评"立即行动清单"是否含动作 + 目的 + 优先级

二、taste 项要不要加?

2.1 合规型 taste 项(商标场景校准)

taste 商标场景命中情况 发现
taste-1 ~ taste-7 全部通过 output-contract 的强制结构天然防护
taste-8(可追溯证据) ❌ 命中 关键发现:trademark 当前流程是纸面推理,无截图存证/API 时间戳——这与制裁核查场景的"截图存证"要求不同。判定:taste-8 在商标场景下的强制等级待用户拍板——强制截图存证(升级)vs 仅建议(场景化降级)。
taste-9(跨境数据更新频率) N/A trademark 仅适用中国商标,跨境场景不适用
新增 taste-10 提案 待新增 商标场景应补"商标在先权利状态会随时变化(每日新申请),初筛结论仅反映查询时点状态"——v0.4.0 待用户确认

2.2 诉讼型 taste 项(案件分析场景校准)

taste 案件分析场景命中情况 发现
taste-1 ~ taste-9 全部通过 legal-case-analysis 是 Phase B 最规范的 skill——9 项全过,主动拦截旧法是 taste-8 的优秀工程化
场景化微调提案 待 v0.4.0 案件分析型专属 taste-7 应场景化:从"草稿须经承办律师复核后定稿"(诉讼文书口径)改为"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"(案件分析报告口径)。taste-1 应场景化为"避免万能分析结论"。

2.3 核心结论

  • 现有 taste 项实战可用——9+9 项在两个场景中全部通过或软命中,无重大缺失;
  • 不需要大改 taste 结构;
  • 需要场景化微调:v0.4.0 案件分析型专属 rubric 中,taste-1/taste-7 语义需场景化;
  • 可选新增:合规型 taste-10(在先权利状态动态性),优先级低。

三、三份测试法可操作吗?

3.1 实战表现

测试法 trademark case-analysis 发现
熟悉材料 ✅ 可操作 ✅ 可操作(直接用现成 examples) 评测人能识别"该场景的重点"——trademark 是核心/防御/储备分层 + 绝对/相对理由;case-analysis 是事实-证据-法律-策略链条
同类不熟悉材料 ✅ 可操作 ✅ 可操作 评测人能识别"输出结构稳定性"——trademark 跨业务领域仍按 output-contract 输出;case-analysis 跨案由仍按要件式九步法
故意缺失关键背景 ✅ 可操作 ✅ 可操作 评测人能识别"边界稳定性"——trademark 触发"待补充(暂不评级)";case-analysis 触发"材料未提及→不得自行补全"

3.2 实战卡点

  1. 熟悉材料档对"现成 examples"的依赖:trademark 没有 archive/examples,必须模拟产出;case-analysis 有现成 examples,评测更客观。这本身就是一个发现——本次评测把"被测 skill 是否自带 benchmark case"作为结构性缺口记录,未来应作为 skill-lint 可评估性基础五项的强化项(已记入 compliance rubric 维度 6 评分依据)。

  2. 同类不熟悉材料的"同类"边界:trademark 评测中,"同类不熟悉"指跨业务领域(智能厨电→SaaS);case-analysis 中指跨案由(合同→侵权)。"同类"的语义在不同场景下不同——建议 test-trio-method.md v0.4.0 补充场景化的"同类"定义。

  3. 模拟产出的诚实标注:本次评测严格按"模拟产出顶部必须标注'非真实 skill 调用'"执行——实战证明这一规则可操作且必要,避免把模拟产出误当成真实 skill 行为。

3.3 核心结论

三份测试法实战可操作,无需大改。仅需在 test-trio-method.md 补充"同类"的场景化定义(v0.4.0 小改)。


四、skill-lint-handoff 边界实战是否清晰?

4.1 实战表现

对接项 实战表现 发现
Hard Fail 清单复用为产出物红线 ✅ 清晰 9 条红线在 trademark / case-analysis 上逐条核验可操作——产出物质量红线(编造事实/草稿当正式意见/未提示人工复核等)能在产出物层核验,不在文档层重复判
可评估性基础五项 ✅ 清晰 五项核验可操作,发现 trademark 缺 benchmark case / case-analysis 软缺 Hard Fail 标签
业务流深度五层(Trigger/Intake/Reasoning/Output/Safety) ✅ 边界清晰 本技能不在文档层重判这五层(skill-lint 的范畴),但产出物评测结果可反向印证——本次 case-analysis 的 Output 层验收标准(templates + 核心原则)实际有效

4.2 实战卡点

  1. "Hard Fail 是否显式标签化":trademark / case-analysis 都用"服务边界""核心原则"段落实质起 Hard Fail 作用,但未显式使用"Hard Fail"标签。skill-lint-handoff.md 第 1 节是否要求被测 skill 显式标签化?当前文档没明确——建议 v0.4.0 补一句:"Hard Fail 清单可以在 SKILL.md 显式标签化(推荐),也可以由'服务边界 / 核心原则'段落实质承担(可接受)——判定标准是产出物层是否真的防护到位,不是文档层是否使用特定标签"。

  2. 降级模式(未调用 skill-lint)的标注:本次评测两次进入"降级模式"(未单独调用 skill-lint,仅按 handoff.md 的清单做纸面核验)。这一模式实战可操作,但应在 skill-lint-handoff.md 显式说明"降级模式"的合法性边界——建议 v0.4.0 补。

4.3 核心结论

skill-lint-handoff 边界实战清晰,无需大改。仅需 v0.4.0 补"Hard Fail 标签化"和"降级模式合法性"两句说明。


五、legal-case-analysis 暴露的"案件分析型"边界问题怎么处理?

5.1 问题定性

legal-case-analysis 的产出(法律分析报告)既不是合同审查意见、不是诉讼文书(起诉状/答辩状/代理词)、不是合规扫描报告——它是前置分析底稿,供律师团队内部研判 + 后续写作 skill 使用。

v0.3.0 三场景维度集(合同/诉讼/合规)是为"终端交付物"设计的,没有为"前置分析底稿"设计专属维度。

5.2 处理方案(本次小改 + v0.4.0 提案)

本次小改(v0.3.1):

  • 在 SKILL.md 步骤 1(识别场景)显式提及"案件分析型"作为潜在的第四类场景,降级套用诉讼型并标注不适配维度;
  • 在 litigation / compliance rubric 顶部"待真实 skill 校准声明"段更新——诉讼型校准状态改为"已在案件分析场景降级套用,真实诉讼文书生成 skill(起诉状/答辩状)仍待 T-402 校准"。

v0.4.0 提案(待用户确认):

  • 当时提案新增 references/case-analysis-scenario-rubric.md(维度集推导见本文件第一节 1.3,现行版本改由通用六维度 + 场景微调处理);
  • 新增 templates/skill-evaluation-report.md 的"案件分析型"评分表分支;
  • 更新 SKILL.md 步骤 1 场景识别决策树。

5.3 为什么不在本次小改中直接补?

理由:

  1. 新增维度集是大改(新增 rubric 文件 + 9 个维度推导 + taste 场景化),按任务要求"大改标待用户确认";
  2. 当前降级套用方案已可操作(本次评测证明),无阻塞;
  3. v0.4.0 应同时考虑其他未覆盖场景(法律检索/文书润色/尽调),统一规划维度集结构,不应单独为案件分析型加文件。

六、本次 legal-skill-evaluation 本体小改清单(v0.3.1)

基于以上发现,本次小改(直接动)的项:

# 改动 位置 依据
1 compliance-rubric 维度 4 描述补"一次性合规动作豁免" references/compliance-scenario-rubric.md 维度 4 trademark-case-01.md 维度 4 校准发现
2 SKILL.md 步骤 1 补"案件分析型"为潜在第四类场景(降级套用诉讼型) SKILL.md 步骤 1 case-analysis-case-01.md 核心发现
3 litigation-rubric 顶部声明更新(已在案件分析降级套用,真实诉讼文书仍待 T-402) references/litigation-scenario-rubric.md 顶部 case-analysis-case-01.md
4 compliance-rubric 顶部声明更新(已在商标场景校准,可追溯证据 taste-8 强制等级待用户拍板) references/compliance-scenario-rubric.md 顶部 trademark-case-01.md taste-8 发现
5 CHANGELOG.md 新增 v0.3.1 段 CHANGELOG.md 本次小改记录
6 TASKS.md 标 Phase B 首批完成 + 登记后续待办 TASKS.md 任务闭环

不动清单(标 v0.4.0 待用户确认):

  • 新增 case-analysis-scenario-rubric.md(案件分析型专属维度集)
  • 新增合规型 taste-10(在先权利状态动态性)
  • test-trio-method.md "同类"场景化定义
  • skill-lint-handoff.md "Hard Fail 标签化"和"降级模式合法性"补强
  • 法律检索/文书润色/尽调专属维度集

七、双门槛自检(本批校准自身)

这是对本批校准"是否引入新问题"的自检(PASS_TO_PASS 思想迁移)。

检查项 结果
是否编造评测样本? ✅ 未编造——trademark 模拟产出严格按 output-contract + references;case-analysis 直接用现成 examples
是否给 skill 打总分排榜? ✅ 未排榜——两个 skill 各评各的,未做横向比较
是否动了被测 skill? ✅ 未动——trademark-assistant / legal-case-analysis 都是只读
是否动了其他 Skill 目录? ✅ 未动——提交前会 git status 自检
是否诚实标注模拟产出? ✅ 已标注——trademark 材料 1/2/3 顶部均有"非真实 skill 调用"声明
是否给"案件分析型"专属维度集直接动手? ✅ 未直接动手——已标 v0.4.0 待用户确认
是否把评测产出直接搬进 manuscript? ✅ 未搬——本评测产出仅留 evals/case-bundle-260705/,符合"评测产出不直接进正文"原则

八、给作者(杨卫薪律师)的待决项

下列决策需作者拍板后,v0.4.0 才能推进:

  1. "案件分析型"是否作为第四类场景独立成 rubric? 还是在诉讼型内加"分析底稿分支"?
  2. trademark 场景的 taste-8(可追溯证据/截图存证)强制等级:强制(升级 trademark-assistant)vs 仅建议(场景化降级)?
  3. 合规型 taste-10(在先权利状态动态性)是否新增?
  4. test-trio-method.md 的"同类"是否需要场景化定义?
  5. skill-lint-handoff.md 的"Hard Fail 标签化"和"降级模式合法性"是否补强?

作者拍板前,v0.3.1 维持当前降级套用方案,无阻塞。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation