Phase B 首批校准反向发现汇总(trademark + case-analysis)
校准时间: 2026-07-05 校准样本: 2 个真实法律 skill(trademark-assistant v1.5.4 / legal-case-analysis v0.2.6)共 6 份测试材料(每 skill × 三份测试法) 校准目的: 检验 legal-skill-evaluation v0.3.0 的维度集 / taste 项 / 流程方法是否够用,做功能提升 结论一句话: v0.3.0 三场景维度集(合同/诉讼/合规)在商标合规场景可用(需微调),在案件分析场景暴露覆盖盲区——应新增"案件分析型"为第四类场景(v0.4.0 提案)。流程方法(skill-lint-handoff / Hard Fail 红线 / 三份测试法 / 维度+taste 双层评分)实战可用,无需大改。
一、维度集够不够用?(核心问题)
1.1 合规型维度集(商标场景校准)
| 维度 | 商标场景可用性 | 发现 |
|---|---|---|
| 维度 1(监管依据精确度) | ✅ 可用 | 商标法层级(法律→实施条例→审查指南→尼斯分类)是合规型"效力层级"的合理具体化 |
| 维度 2(风险识别完整性) | ✅ 可用 | 商标合规天然是"绝对+相对+使用举证"三段式,与合规型"覆盖典型风险"契合 |
| 维度 3(风险等级判定合理性) | ✅ 可用 | output-contract 的"高/中/低/待补充"四级是合规型"区分必须整改 vs 建议改进"的优秀工程化 |
| 维度 4(整改路径可执行性) | ⚠️ 描述偏严 | rubric 要求"具体到动作、责任人、时限、分阶段"——这对企业合规整改(数据合规/反腐败)合理,但对商标申请这类一次性合规动作过度。小改:维度 4 描述补"对一次性合规动作(商标申请、备案登记、单次尽调),责任人/时限可降级为'动作完成节点'"。 |
| 维度 5(证据与事实对应) | ✅ 可用 | 完全契合 |
| 维度 6(交付物格式与可追溯性) | ✅ 可用 | 完全契合 |
结论:合规型 6 维度在商标场景5 个完全可用,1 个描述偏严需小改。
1.2 诉讼型维度集(案件分析场景校准——核心发现)
| 维度 | 案件分析场景可用性 | 发现 |
|---|---|---|
| 维度 1(请求权基础与定性) | ✅ 完全适配 | 案件分析报告天然要做请求权基础识别 |
| 维度 2(诉讼请求明确性) | ❌ 不适配 | 案件分析报告不产出诉请,只评估可行性——强行套用产生虚假低分 |
| 维度 3(事实与理由对应) | ✅ 完全适配 | 案件分析报告的核心就是"事实→证据→法律→主张"链条 |
| 维度 4(证据组织与证明力) | ⚠️ 颗粒度偏低 | 案件分析报告的"强/中/弱"证明力评估合理,但 rubric 要求"区分本证/反证、直接/间接"——这是证据目录制作 skill 的范畴,不应让 case-analysis 承担 |
| 维度 5(抗辩预判与争议焦点) | ✅ 完全适配 | 案件分析报告的最强维度 |
| 维度 6(文书格式与法庭语体) | ❌ 不适配 | 案件分析报告不是法庭文书,没有"首部/事实理由/请求/尾部"法定结构 |
结论:诉讼型 6 维度在案件分析场景3 个完全适配,1 个颗粒度偏低,2 个不适配——证明 v0.3.0 三场景维度集无法完全覆盖"案件分析型"。
1.3 核心结论:应新增"案件分析型"为第四类场景
v0.4.0 提案(待用户确认,不在本次小改范围):
当时提案新增 references/case-analysis-scenario-rubric.md,维度集推导:
| 维度 | 来源 |
|---|---|
| 维度 1:请求权基础与法律关系定性 | 继承诉讼型维度 1 |
| 维度 2:法律问题树拆解完整性 | 新增——来自 legal-case-analysis 第五节 |
| 维度 3:事实理由对应(一请求一理由) | 继承诉讼型维度 3 |
| 维度 4:证据组织(降级颗粒度) | 继承诉讼型维度 4 + 显式声明"评到强/中/弱即可,不要求本证/反证/直接/间接" |
| 维度 5:抗辩预判与争议焦点把握 | 继承诉讼型维度 5 |
| 维度 6:法律检索吸收深度 | 新增——评是否把检索结果转化为"规则要点 + 适用条件 + 本案对应事实 + 支持方向"(来自 contest-sample-analysis 第六节) |
| 维度 7:策略路径切换(首选/备选/并行) | 新增——评是否给出首选/并行/不建议三档策略(来自 contest-sample-analysis 第九节) |
| 维度 8:风险等级判定标准 | 新增——评每条结论是否带"高/中/低 + 判定依据 + 补强建议" |
| 维度 9:行动清单可执行性 | 新增——评"立即行动清单"是否含动作 + 目的 + 优先级 |
二、taste 项要不要加?
2.1 合规型 taste 项(商标场景校准)
| taste | 商标场景命中情况 | 发现 |
|---|---|---|
| taste-1 ~ taste-7 | 全部通过 | output-contract 的强制结构天然防护 |
| taste-8(可追溯证据) | ❌ 命中 | 关键发现:trademark 当前流程是纸面推理,无截图存证/API 时间戳——这与制裁核查场景的"截图存证"要求不同。判定:taste-8 在商标场景下的强制等级待用户拍板——强制截图存证(升级)vs 仅建议(场景化降级)。 |
| taste-9(跨境数据更新频率) | N/A | trademark 仅适用中国商标,跨境场景不适用 |
| 新增 taste-10 提案 | 待新增 | 商标场景应补"商标在先权利状态会随时变化(每日新申请),初筛结论仅反映查询时点状态"——v0.4.0 待用户确认 |
2.2 诉讼型 taste 项(案件分析场景校准)
| taste | 案件分析场景命中情况 | 发现 |
|---|---|---|
| taste-1 ~ taste-9 | 全部通过 | legal-case-analysis 是 Phase B 最规范的 skill——9 项全过,主动拦截旧法是 taste-8 的优秀工程化 |
| 场景化微调提案 | 待 v0.4.0 | 案件分析型专属 taste-7 应场景化:从"草稿须经承办律师复核后定稿"(诉讼文书口径)改为"分析报告须用作律师工作底稿,不能直接交付客户或提交法院"(案件分析报告口径)。taste-1 应场景化为"避免万能分析结论"。 |
2.3 核心结论
- 现有 taste 项实战可用——9+9 项在两个场景中全部通过或软命中,无重大缺失;
- 不需要大改 taste 结构;
- 需要场景化微调:v0.4.0 案件分析型专属 rubric 中,taste-1/taste-7 语义需场景化;
- 可选新增:合规型 taste-10(在先权利状态动态性),优先级低。
三、三份测试法可操作吗?
3.1 实战表现
| 测试法 | trademark | case-analysis | 发现 |
|---|---|---|---|
| 熟悉材料 | ✅ 可操作 | ✅ 可操作(直接用现成 examples) | 评测人能识别"该场景的重点"——trademark 是核心/防御/储备分层 + 绝对/相对理由;case-analysis 是事实-证据-法律-策略链条 |
| 同类不熟悉材料 | ✅ 可操作 | ✅ 可操作 | 评测人能识别"输出结构稳定性"——trademark 跨业务领域仍按 output-contract 输出;case-analysis 跨案由仍按要件式九步法 |
| 故意缺失关键背景 | ✅ 可操作 | ✅ 可操作 | 评测人能识别"边界稳定性"——trademark 触发"待补充(暂不评级)";case-analysis 触发"材料未提及→不得自行补全" |
3.2 实战卡点
熟悉材料档对"现成 examples"的依赖:trademark 没有 archive/examples,必须模拟产出;case-analysis 有现成 examples,评测更客观。这本身就是一个发现——本次评测把"被测 skill 是否自带 benchmark case"作为结构性缺口记录,未来应作为 skill-lint 可评估性基础五项的强化项(已记入 compliance rubric 维度 6 评分依据)。
同类不熟悉材料的"同类"边界:trademark 评测中,"同类不熟悉"指跨业务领域(智能厨电→SaaS);case-analysis 中指跨案由(合同→侵权)。"同类"的语义在不同场景下不同——建议 test-trio-method.md v0.4.0 补充场景化的"同类"定义。
模拟产出的诚实标注:本次评测严格按"模拟产出顶部必须标注'非真实 skill 调用'"执行——实战证明这一规则可操作且必要,避免把模拟产出误当成真实 skill 行为。
3.3 核心结论
三份测试法实战可操作,无需大改。仅需在 test-trio-method.md 补充"同类"的场景化定义(v0.4.0 小改)。
四、skill-lint-handoff 边界实战是否清晰?
4.1 实战表现
| 对接项 | 实战表现 | 发现 |
|---|---|---|
| Hard Fail 清单复用为产出物红线 | ✅ 清晰 | 9 条红线在 trademark / case-analysis 上逐条核验可操作——产出物质量红线(编造事实/草稿当正式意见/未提示人工复核等)能在产出物层核验,不在文档层重复判 |
| 可评估性基础五项 | ✅ 清晰 | 五项核验可操作,发现 trademark 缺 benchmark case / case-analysis 软缺 Hard Fail 标签 |
| 业务流深度五层(Trigger/Intake/Reasoning/Output/Safety) | ✅ 边界清晰 | 本技能不在文档层重判这五层(skill-lint 的范畴),但产出物评测结果可反向印证——本次 case-analysis 的 Output 层验收标准(templates + 核心原则)实际有效 |
4.2 实战卡点
"Hard Fail 是否显式标签化":trademark / case-analysis 都用"服务边界""核心原则"段落实质起 Hard Fail 作用,但未显式使用"Hard Fail"标签。skill-lint-handoff.md 第 1 节是否要求被测 skill 显式标签化?当前文档没明确——建议 v0.4.0 补一句:"Hard Fail 清单可以在 SKILL.md 显式标签化(推荐),也可以由'服务边界 / 核心原则'段落实质承担(可接受)——判定标准是产出物层是否真的防护到位,不是文档层是否使用特定标签"。
降级模式(未调用 skill-lint)的标注:本次评测两次进入"降级模式"(未单独调用 skill-lint,仅按 handoff.md 的清单做纸面核验)。这一模式实战可操作,但应在 skill-lint-handoff.md 显式说明"降级模式"的合法性边界——建议 v0.4.0 补。
4.3 核心结论
skill-lint-handoff 边界实战清晰,无需大改。仅需 v0.4.0 补"Hard Fail 标签化"和"降级模式合法性"两句说明。
五、legal-case-analysis 暴露的"案件分析型"边界问题怎么处理?
5.1 问题定性
legal-case-analysis 的产出(法律分析报告)既不是合同审查意见、不是诉讼文书(起诉状/答辩状/代理词)、不是合规扫描报告——它是前置分析底稿,供律师团队内部研判 + 后续写作 skill 使用。
v0.3.0 三场景维度集(合同/诉讼/合规)是为"终端交付物"设计的,没有为"前置分析底稿"设计专属维度。
5.2 处理方案(本次小改 + v0.4.0 提案)
本次小改(v0.3.1):
- 在 SKILL.md 步骤 1(识别场景)显式提及"案件分析型"作为潜在的第四类场景,降级套用诉讼型并标注不适配维度;
- 在 litigation / compliance rubric 顶部"待真实 skill 校准声明"段更新——诉讼型校准状态改为"已在案件分析场景降级套用,真实诉讼文书生成 skill(起诉状/答辩状)仍待 T-402 校准"。
v0.4.0 提案(待用户确认):
- 当时提案新增
references/case-analysis-scenario-rubric.md(维度集推导见本文件第一节 1.3,现行版本改由通用六维度 + 场景微调处理); - 新增
templates/skill-evaluation-report.md的"案件分析型"评分表分支; - 更新 SKILL.md 步骤 1 场景识别决策树。
5.3 为什么不在本次小改中直接补?
理由:
- 新增维度集是大改(新增 rubric 文件 + 9 个维度推导 + taste 场景化),按任务要求"大改标待用户确认";
- 当前降级套用方案已可操作(本次评测证明),无阻塞;
- v0.4.0 应同时考虑其他未覆盖场景(法律检索/文书润色/尽调),统一规划维度集结构,不应单独为案件分析型加文件。
六、本次 legal-skill-evaluation 本体小改清单(v0.3.1)
基于以上发现,本次小改(直接动)的项:
| # | 改动 | 位置 | 依据 |
|---|---|---|---|
| 1 | compliance-rubric 维度 4 描述补"一次性合规动作豁免" | references/compliance-scenario-rubric.md 维度 4 |
trademark-case-01.md 维度 4 校准发现 |
| 2 | SKILL.md 步骤 1 补"案件分析型"为潜在第四类场景(降级套用诉讼型) | SKILL.md 步骤 1 | case-analysis-case-01.md 核心发现 |
| 3 | litigation-rubric 顶部声明更新(已在案件分析降级套用,真实诉讼文书仍待 T-402) | references/litigation-scenario-rubric.md 顶部 |
case-analysis-case-01.md |
| 4 | compliance-rubric 顶部声明更新(已在商标场景校准,可追溯证据 taste-8 强制等级待用户拍板) | references/compliance-scenario-rubric.md 顶部 |
trademark-case-01.md taste-8 发现 |
| 5 | CHANGELOG.md 新增 v0.3.1 段 | CHANGELOG.md | 本次小改记录 |
| 6 | TASKS.md 标 Phase B 首批完成 + 登记后续待办 | TASKS.md | 任务闭环 |
不动清单(标 v0.4.0 待用户确认):
- 新增 case-analysis-scenario-rubric.md(案件分析型专属维度集)
- 新增合规型 taste-10(在先权利状态动态性)
- test-trio-method.md "同类"场景化定义
- skill-lint-handoff.md "Hard Fail 标签化"和"降级模式合法性"补强
- 法律检索/文书润色/尽调专属维度集
七、双门槛自检(本批校准自身)
这是对本批校准"是否引入新问题"的自检(PASS_TO_PASS 思想迁移)。
| 检查项 | 结果 |
|---|---|
| 是否编造评测样本? | ✅ 未编造——trademark 模拟产出严格按 output-contract + references;case-analysis 直接用现成 examples |
| 是否给 skill 打总分排榜? | ✅ 未排榜——两个 skill 各评各的,未做横向比较 |
| 是否动了被测 skill? | ✅ 未动——trademark-assistant / legal-case-analysis 都是只读 |
| 是否动了其他 Skill 目录? | ✅ 未动——提交前会 git status 自检 |
| 是否诚实标注模拟产出? | ✅ 已标注——trademark 材料 1/2/3 顶部均有"非真实 skill 调用"声明 |
| 是否给"案件分析型"专属维度集直接动手? | ✅ 未直接动手——已标 v0.4.0 待用户确认 |
| 是否把评测产出直接搬进 manuscript? | ✅ 未搬——本评测产出仅留 evals/case-bundle-260705/,符合"评测产出不直接进正文"原则 |
八、给作者(杨卫薪律师)的待决项
下列决策需作者拍板后,v0.4.0 才能推进:
- "案件分析型"是否作为第四类场景独立成 rubric? 还是在诉讼型内加"分析底稿分支"?
- trademark 场景的 taste-8(可追溯证据/截图存证)强制等级:强制(升级 trademark-assistant)vs 仅建议(场景化降级)?
- 合规型 taste-10(在先权利状态动态性)是否新增?
- test-trio-method.md 的"同类"是否需要场景化定义?
- skill-lint-handoff.md 的"Hard Fail 标签化"和"降级模式合法性"是否补强?
作者拍板前,v0.3.1 维持当前降级套用方案,无阻塞。