All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

evalscase-bundle-260705trademark-case-01.md

≈5.9k tokens on demand. Your agent reads this file only when SKILL.md points to it.

trademark-assistant 法律 Skill 场景化评测报告(Phase B 首批校准 #01)

评测时间: 2026-07-05 被评测 Skill 路径: skills/trademark-assistant Skill 版本: v1.5.4 声称覆盖场景: 商标申请类别规划 + 可注册性初筛(判定为合规型场景的子类——商标注册前期合规初筛;非合同型、非诉讼型) 本次评测针对场景: 合规型(商标可注册性初筛 + 类别规划合规建议) 声称交付物: 结构化商标初筛报告(结论摘要 / 规划建议 / 可注册性初筛 / 下一步行动 / 免责声明 / 升级建议) 声称交付对象: 内部业务 + 外部客户(咨询场景) 评测人: legal-skill-evaluation Phase B 校准 worker(背景 subagent) 评测方法: 纸面评测 + 模拟产出(被测 skill 未真实调用——background subagent 调 Skill 不稳定,本次按 SKILL.md + output-contract.md + references 忠实模拟产出,已在每份模拟产出顶部标注)


本案例的校准价值:trademark-assistant 是商标合规初筛型 skill,落在 v0.3.0 合规型维度集的覆盖范围内。本次校准用于检验合规型 6 维度 + 9 taste 项在"商标"这一具体合规子场景的可用性,并暴露待补的边界。

一、前置——结构是否可评测

skill-lint 对接状态

  • 已读取 trademark-assistant 的 SKILL.md + output-contract.md + 2 份核心 references(registrability-prescreen / classification-planning)+ legal-basis-index
  • 未读取 skill-lint 正式审查报告(降级模式:本次未单独调用 skill-lint,仅按 skill-lint-handoff.md 的 Hard Fail 清单 + 可评估性五项做了纸面前置核验)

Hard Fail 结论(产出物质量红线,逐项核验模拟产出)

Hard Fail 项 是否命中 备注
编造关键事实 / 证据 / 依据 ✅未命中 模拟产出严格基于输入材料 + references 引用,无虚构商标在先权利人
未标注信息不足却给确定结论 ✅未命中 output-contract 强制要求"信息不足时统一填'待补充(信息不足,暂不评级)',不输出高/中/低结论"——材料 3 故意缺失时严格执行
将草稿表述为正式意见 ✅未命中 output-contract 固定含"五、免责声明:本结论为商标注册前期初筛建议,不构成正式法律意见"
引用明显错误依据 ✅未命中 模拟产出引用《商标法》第 30/31 条 + 第 10/11 条 + 尼斯分类 v13(2026)——均现行有效
高风险场景未提示人工复核 ✅未命中 output-contract 固定含"六、升级建议:高风险/复杂争议/信息缺失 → 杨卫薪律师(微信 ywxlaw)"
未输出必要免责 / 风险提示 ✅未命中 同上,免责 + 升级建议为强制段
输出泄露本应脱敏信息 ✅未命中 模拟输入已脱敏("某科技公司 / 智厨"为虚构商标)
公开示例含真实可反查信息 ✅未命中 同上
文档无可执行流程 ✅未命中 SKILL.md 有"阶段一/阶段二"两段可执行流程 + output-contract 标准结构

前置结论:Hard Fail 全部不命中,可进入维度评分流程。

可评估性基础五项(结构性缺口)

检查项 状态 备注
声明评估范围 ✅ SKILL.md"适用范围"明确"中国商标申请";"服务边界"明确不替代正式意见、不承诺成功率
声明 Hard Fail ⚠️软性缺失 SKILL.md"服务边界"段落实质起到 Hard Fail 作用(不替代正式意见 / 不承诺成功率 / 复杂争议升级),但未显式使用"Hard Fail"标签——这是 skill-lint 的判定范畴,本技能仅记结构性缺口
benchmark case / 样例 ⚠️缺失 trademark-assistant 的 archive/ 目录为空,examples/ 目录不存在——没有现成的"输入→输出"样例可参照。本次评测只能模拟产出。这是商标 skill 自身的可评估性缺口,回灌建议见"要补的句子"#3
输出验收标准 ✅ output-contract.md 给出严格结构 + 交付要求(信息不足必须显式标注、统一 Markdown 不附加 JSON、免责 + 升级建议强制)
区分静态检查与动态评估 ⚠️软性缺失 SKILL.md 没有显式区分"静态规则校验"vs"动态跑测试材料",但 references 内含静态规则(尼斯分类表)+ 动态推理(registrability-prescreen-guide)的事实分层

结构性缺口小计:1 项硬缺失(无 benchmark case)+ 2 项软缺失(Hard Fail 未显式标签化 / 静态-动态未显式分层)。本次评测基于不完整结构,但缺口不阻塞内容评测。


二、测试材料(三份测试法)

三份测试法(对接 ch07 第六节 L774-788)。trademark-assistant 没有 archive/examples 现成输出,下列三份模拟产出均由评测人按 SKILL.md + output-contract.md + 2 份核心 references 忠实模拟,非真实 skill 调用结果——已每份顶部标注。

输入设定

委托主体:某智能厨电初创公司(虚构,"智厨科技")。 拟申请商标:"智厨"(纯中文文字商标,普通印刷体)。 主营业务:智能烹饪机器人(家用)+ 配套 App + 预包装食材套餐订阅。

# 材料类型 说明(脱敏) 用途
1 熟悉材料 主营业务清晰、商品形态明确、目标类别可推断(智能烹饪机器人→第 7 类/第 11 类;App→第 9 类;食材订阅→第 29/30 类) 检查是否抓住商标合规初筛的重点(核心/防御/储备分层 + 绝对/相对理由风险)
2 同类不熟悉材料 主营业务为"企业 SaaS + 行业咨询"的"知合"商标(虚构),目标类别需重新映射(第 35 类广告/商业 + 第 42 类 SaaS / 软件设计 + 第 45 类法律咨询若涉足) 检查输出结构是否稳定(跨业务领域是否仍按 output-contract 输出)
3 故意缺失关键背景的材料 仅给商标名"风行"+ 申请主体"某贸易公司",不给主营业务、不给使用场景、不给商标图样 检查边界是否稳定(应触发 output-contract 的"待补充(信息不足,暂不评级)")

模拟产出(材料 1,熟悉材料,节选)

声明:本节为评测人按 trademark-assistant 的 SKILL.md + output-contract.md + registrability-prescreen-guide.md + classification-planning-guide.md 忠实模拟的产出,非真实 skill 调用结果。真实 skill 调用可能因模型差异、reference 加载顺序不同而略有差异。

## 一、结论摘要
- 类别规划结论:核心第 7 类(家用烹饪机器人)+ 第 11 类(电烹饪器具)+ 第 9 类(配套 App / 智能控制软件);防御第 28 类(智能玩具/烹饪玩具模型);储备第 29/30 类(预包装食材套餐)
- 初筛风险等级:**中**(绝对理由低风险;相对理由中风险——"智厨"含"厨"字在第 7/11 类存在多家在先申请人,需正式检索)

## 二、规划建议
### 1. 核心类别(必保)
- 第 7 类(家用烹饪机器人):类似群 0701 / 0723;推荐理由:直接对应主营产品(家用智能烹饪机器人),尼斯分类 v13(2026)class-07 涵盖"厨房用机器人和面食加工机"
- 第 11 类(电烹饪器具):类似群 1104;推荐理由:覆盖电烤箱、电蒸锅、电磁炉等智能厨电延伸产品
- 第 9 类(计算机软件 / App):类似群 0901;推荐理由:智能烹饪机器人配套 App / 远程控制软件

### 2. 防御类别(建议)
- 第 28 类(智能玩具 / 烹饪玩具模型):推荐理由:防止他人在相邻消费品领域抢注近似商标

### 3. 储备类别(可选)
- 第 29 类(预包装肉/蛋/豆制品)+ 第 30 类(预包装面食/调味品):推荐理由:为未来食材套餐订阅业务预留

## 三、可注册性初筛
### 1. 主要风险点
- 绝对理由风险:**低**——"智厨"非直接描述商品特征(烹饪机器人),不属通用名称,不涉禁用标志(参考 references/trademark-examination-and-adjudication-guidelines/chapter-03.md 显著性条款)
- 相对理由风险:**中**——尼斯分类 v13 class-07 / class-11 在先申请含"厨"字商标较密集(智厨云/智厨邦等近似),需中国商标网正式检索

### 2. 风险等级判定
- 等级:中
- 判定依据:绝对理由低风险 + 相对理由中风险;建议补充显著性元素(如"智厨 xKitchen"组合商标)或调整设计后再正式检索

## 四、下一步行动
1. 中国商标网(sbj.cnipa.gov.cn)正式检索第 7/11 类含"智厨"近似商标
2. 评估是否补"英文副标"提升显著性
3. 优先申请第 7 类(核心产品),并行申请第 11 类延伸保护

## 五、免责声明
本结论为商标注册前期初筛建议,不构成正式法律意见。最终结果以官方审查结论为准。

## 六、升级建议
- 是否建议升级:是
- 升级触发原因:相对理由中风险(在先近似商标密集)+ 跨类别申请策略(5 类同步申请预算评估)
- 升级动作:建议正式检索后咨询专业律师评估申请策略
- 律师咨询入口:杨卫薪律师(微信 ywxlaw)

材料 2、3 的模拟产出结构相同(核心/防御/储备 + 绝对/相对理由 + 风险等级 + 免责 + 升级),关键差异:

  • 材料 2(SaaS + 咨询):核心类别改为第 35/42/45 类,结构稳定,风险等级判定为"低至中"。
  • 材料 3(缺主营业务):严格按 output-contract 第 51 行触发"待补充(信息不足,暂不评级)",不输出高/中/低结论,仅在"下一步行动"列出"补齐业务使用场景、目标商品/服务、商标图样后再进入分级评估"。

三、按场景维度逐项评分(合规型 6 维度,1-5 分)

本次使用维度集: 合规型(现行路径:references/compliance-scenario-rubric.md)

首次校准发现:合规型 6 维度原本为"数据合规 / 反垄断 / 反腐败"等典型合规场景设计,本次套用到商标合规初筛场景时,多数维度语义可迁移,但部分检查问题需要调整。详见每维度后的"校准说明"。

测试材料 1(熟悉材料——智能厨电"智厨")

维度 评分 评价(低分原因 / 高分依据) 校准说明
维度 1(监管依据精确度) 4/5 引用《商标法》第 30/31 条(相对理由)+ 第 10/11 条(绝对理由)+ 尼斯分类 v13(2026)+ 审查审理指南 chapter-03;效力层级清楚(法律→实施条例→审查指南→尼斯分类)。未扣分理由:现行有效且层级清晰。4 分而非 5 分:未显式区分"法律 / 行政法规 / 部门规章 / 规范性文件 / 自律规则"五级——但商标场景本就层级扁平,5 级区分过度。 维度语义可迁移。商标法层级(法律→实施条例→审查审理指南→尼斯分类)是合规型"效力层级"的合理具体化。
维度 2(风险识别完整性) 5/5 绝对理由(显著性/禁用标志/通用名称)+ 相对理由(在先近似)+ 使用举证风险(材料 1 提及"配套 App"暗示已有使用证据准备)三维度全覆盖;识别"跨类别传导风险"(核心第 7 类若未注册,第 11 类延伸品会被搭便车)。 完全契合。商标合规的风险识别框架天然是"绝对+相对+使用举证"三段式,与合规型"覆盖典型风险"要求一致。
维度 3(风险等级判定合理性) 5/5 output-contract 的"高/中/低/待补充"四级 + registrability-prescreen-guide 的判定标准(高=明显禁用或高概率近似;中=可缓解需调整;低=未见显著障碍);材料 1 判定"中"并给调整建议(补英文副标);材料 3 严格触发"待补充(暂不评级)"——判定标准清楚、不一刀切。 output-contract 的 4 级判定是合规型"区分必须整改 vs 建议改进"的优秀具体化——"待补充"档天然防止了"信息不足却给确定结论"。
维度 4(整改路径可执行性) 4/5 "下一步行动"具体到动作(正式检索 / 评估英文副标 / 优先申请第 7 类并行第 11 类);但未显式标注时限与责任人(output-contract 也没有要求);整改成本-风险匹配未显式评估(5 类同步申请的预算考量仅在"升级建议"里隐含)。4 分而非 5 分:合规型 rubric 要求"具体到动作、责任人、时限、分阶段"——trademark 场景下"责任人"通常就是客户/代理机构,时限由申请周期决定,故缺失可接受,但 rubric 描述偏严。 校准发现:合规型维度 4 的"责任人/时限"要求源自"企业合规整改"场景,对商标申请这类一次性合规动作过度。建议维度 4 描述补"对一次性合规动作(如商标申请、备案登记),责任人/时限可降级为'动作完成节点'"。
维度 5(证据与事实对应) 5/5 模拟产出严格基于输入材料(主营业务/商标名/商标图样),无虚构;"待核实事项"为"在先近似商标需正式检索"——明确区分"已确认事实(主营业务是智能烹饪机器人)"和"待核实事项(具体在先近似列表)"。 完全契合。
维度 6(交付物格式与可追溯性) 5/5 output-contract 强制结构(结论摘要/规划建议/可注册性初筛/下一步行动/免责/升级)+ 类别编号 + 风险等级编号 + 引用源(references/trademark-examination-and-adjudication-guidelines/chapter-03.md)——颗粒度匹配读者(客户可读结论摘要,内部可读推荐理由 + 引用)。 完全契合。

测试材料 2(同类不熟悉材料——SaaS"知合")

结构稳定性测试。模拟产出在跨业务领域(SaaS / 咨询 vs 智能厨电)下仍按 output-contract 标准结构输出,6 维度评分与材料 1 相近(维度 1/2/3/5/6 仍 4-5 分;维度 4 同样因无责任人/时限扣 1 分)。结论:输出结构稳定。

测试材料 3(故意缺失关键背景——"风行"+无主营业务)

边界稳定性测试。

维度 评分 评价
维度 1(监管依据精确度) 4/5 仍引用尼斯分类通用框架,未编造具体条款(因为无法落到具体类别)
维度 2(风险识别完整性) N/A 信息不足,无法做风险识别——这是关键边界检查
维度 3(风险等级判定) 5/5 核心边界检查通过:严格触发 output-contract "待补充(信息不足,暂不评级)",不输出高/中/低结论,仅输出补齐清单。这一项是 trademark-assistant 最值得称道的 taste——output-contract 把"信息不足"硬编码成了第四档。
维度 4(整改路径可执行性) 5/5 "下一步行动"正确改为"先补齐业务使用场景、目标商品/服务、商标图样后再进入分级评估"——不是给空泛建议而是给补齐清单
维度 5(证据与事实对应) 5/5 完全区分"待核实/待补充",不虚构
维度 6(交付物格式与可追溯性) 5/5 仍按 output-contract 输出,但结论摘要/规划建议段统一标"待补充"

结论:边界稳定。材料 3 是 trademark-assistant 表现最好的场景——证明其 taste 项防护到位。


四、合规型场景 taste 项核查

taste 项来自 compliance-scenario-rubric.md 第二节。每项命中即 taste FAIL。

taste 项 测试材料 1 测试材料 2 测试材料 3 命中说明
taste-1(区分法律红线 vs 合规建议) ✅ ✅ ✅ "建议补英文副标"是合规建议;"商标法第 30 条相对理由"是法律红线——区分清楚
taste-2(提示监管动态性) ⚠️软命中 ⚠️软命中 ⚠️软命中 引用尼斯分类v13(2026),明确标注版本;但未提示"商标审查审理指南可能更新"——合规型 rubric 要求"提示法规可能修订、监管口径可能变化、地方差异"。校准发现:商标场景的"监管动态性"主要表现为"尼斯分类版本更新(每 2 年)+ 审查审理指南修订(不定期)+ 在先商标数据库每日变化",与数据合规的"监管口径变化"语义不完全对应。建议为商标场景补 taste-10(待 v0.4.0):"提示商标在先权利状态会随时变化,初筛结论仅反映查询时点状态"。
taste-3(避免零风险承诺) ✅ ✅ ✅ output-contract 强制免责声明"不构成正式法律意见,最终结果以官方审查结论为准"——天然不写零风险承诺
taste-4(提示跨境/跨行业差异) ✅ ✅ ✅ SKILL.md"国际适用性说明"明确"尼斯分类可国际适用,但可注册性初筛仅适用中国商标申请;国际申请需另行咨询"——跨境差异提示到位
taste-5(避免把商业判断写成合规结论) ✅ ✅ ✅ 模拟产出"评估是否补英文副标提升显著性"是商业判断(显著性策略),不是合规结论;合规结论(中风险/低风险)严格基于审查审理指南
taste-6(明确初筛非正式意见) ✅ ✅ ✅ output-contract 强制"本结论为商标注册前期初筛建议,不构成正式法律意见"
taste-7(提示业务事实需核实) ✅ ✅ ✅ "需中国商标网正式检索"是核心事实核实提示
taste-8(合规核查可追溯证据) ❌命中 ❌命中 ❌命中 关键 taste 命中:模拟产出未提供核查过程的可追溯证据(无查询时间戳、无 API 返回结果、无截图存证)。合规型 rubric taste-8 来自杨卫薪《全球制裁清单风险核查》强调"截图存证是证明已尽到核查义务的重要依据"。校准发现:trademark-assistant 当前流程是"纸面推理 + 引用静态 references",没有强制要求调用商标局 API 或截图存证——这是 trademark 场景与制裁核查场景的本质差异。判定:taste-8 在商标场景下是否适用,需用户确认。若要求商标初筛也留截图存证(如中国商标网查询结果截图),是合理的合规升级;若认为商标初筛是"推理结论"而非"数据库核查",则 taste-8 应场景化降级。暂记命中,回灌建议见"要补的句子"#2。
taste-9(跨境数据更新频率差异) N/A N/A N/A trademark-assistant 明确"仅适用中国商标申请",跨境场景不适用——本项不评。

taste 核查小计:1 项硬命中(taste-8 可追溯证据)+ 1 项软命中(taste-2 监管动态性)+ 1 项待新增(taste-10 在先权利动态性)。未触发 FAIL(taste-8 命中已记入回灌建议,但不构成总体结论 ❌——因为该 taste 项本身是 v0.3.0 推导待校准项,且 trademark 场景适用性本身待用户确认)。


五、定位"要补 SKILL.md 的哪句话"

评测的目的不是给 Skill 打总分,而是定位要回 SKILL.md 补哪句话。注意:被测 skill trademark-assistant 是只读的(本次不动),下列回灌建议是给 legal-skill-evaluation 的"若商标 skill 要修怎么修"参考,也是给合规型 rubric 自身的修订参考。

# 来源(低分维度 / taste 命中项) 测试材料 要补的句子(可执行修补建议) 对应位置
1 维度 4 校准发现(责任人/时限偏严) 材料 1/2 legal-skill-evaluation 的 compliance-rubric 维度 4 描述补:"对一次性合规动作(商标申请、备案登记、单次尽调),责任人/时限可降级为'动作完成节点';分阶段整改仍要求责任人 + 时限" references/compliance-scenario-rubric.md 维度 4
2 taste-8 命中(无核查可追溯证据) 材料 1/2/3 trademark-assistant SKILL.md 阶段一补:"完成可注册性初筛后,建议在中国商标网(sbj.cnipa.gov.cn)做一次近似查询并截图存档,附在交付物末尾'核查证据'段——证明已尽到查询义务。"(注:这条是给被测 skill 的建议,本次不修改被测 skill;也是给 legal-skill-evaluation 的发现——商标场景下 taste-8 的"截图存证"要求是否强制,待用户拍板) trademark SKILL.md(不动)/ legal-skill-evaluation compliance-rubric taste-8(场景化说明)
3 结构性缺口(无 benchmark case) 全部 trademark-assistant 应补 archive/example:"沉淀 1-3 个真实脱敏的'输入咨询→输出初筛报告'完整样例到 archive/ 或 examples/,作为后续 legal-skill-evaluation 评测的客观锚点。" trademark SKILL.md "Archive 归档"段
4 taste-2 软命中(监管动态性) 全部 legal-skill-evaluation 为商标场景考虑 taste-10(v0.4.0 待用户确认):"商标在先权利状态会随时变化(每日新申请),初筛结论仅反映查询时点状态。" compliance-scenario-rubric.md taste 项

五-bis、四校准动作记录

本次未启用 LLM judge(纯人工纸面评测 + 模拟产出)。

  • 锚点样本:N/A
  • 顺序翻转:N/A
  • 多 judge 共识:N/A
  • 证据锚定:N/A(但本评测自身遵循了证据锚定——所有评分依据均落到具体产出片段或 reference 引用,未给裸分)

长文 judge 单独建模:N/A(trademark 交付物是短结构化报告,不属长文)

pairwise vs 绝对评分:本次"风险识别完整性/是否虚构/是否信息不足给确定结论"等判断用绝对评分,未涉及 pairwise。


五-ter、双门槛判定

跳过(首次评测,无上一版对照)。


六、总体结论

  • ✅ 进入工作流(结构可评测、内容评测通过、taste 项无致命命中)
  • ⚠️ 修后再测
  • ❌ 回退

总体评价:trademark-assistant v1.5.4 是 legal-skill-evaluation Phase B 校准中表现最好的 skill——

  1. output-contract 把"信息不足→待补充(暂不评级)"硬编码为第四档,是合规型 taste-3(避免零风险承诺)+ Hard Fail"未标注信息不足却给确定结论"的优秀工程化实现;
  2. 6 维度评分均在 4-5 分,无致命低分;
  3. 唯一硬 taste 命中(taste-8 可追溯证据)本身是 v0.3.0 待校准项,且商标场景适用性待用户确认——不构成总体 FAIL。

给 legal-skill-evaluation 的反向回灌价值:

  • 合规型 6 维度在商标场景可用,但维度 4(整改路径)描述需场景化补充"一次性合规动作"豁免;
  • taste-8(可追溯证据)在商标场景下的强制等级需用户拍板(强制截图存证 vs 仅建议);
  • 暴露需新增 taste-10(在先权利状态动态性)——但属 v0.4.0 范畴,本次小改不动。

七、安全声明

  • 本报告测试材料中的"智厨科技""知合""风行"商标及"某智能厨电初创公司""某贸易公司"均为虚构脱敏示例,无真实当事人/客户名/案号。
  • 本评测结论不能替代正式法律意见。
  • 本报告不用于对 trademark-assistant 作者的人身评价,只针对 Skill 输出(且本次输出为模拟产出,非真实 skill 调用)。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation