trademark-assistant 法律 Skill 场景化评测报告(Phase B 首批校准 #01)
评测时间: 2026-07-05
被评测 Skill 路径: skills/trademark-assistant
Skill 版本: v1.5.4
声称覆盖场景: 商标申请类别规划 + 可注册性初筛(判定为合规型场景的子类——商标注册前期合规初筛;非合同型、非诉讼型)
本次评测针对场景: 合规型(商标可注册性初筛 + 类别规划合规建议)
声称交付物: 结构化商标初筛报告(结论摘要 / 规划建议 / 可注册性初筛 / 下一步行动 / 免责声明 / 升级建议)
声称交付对象: 内部业务 + 外部客户(咨询场景)
评测人: legal-skill-evaluation Phase B 校准 worker(背景 subagent)
评测方法: 纸面评测 + 模拟产出(被测 skill 未真实调用——background subagent 调 Skill 不稳定,本次按 SKILL.md + output-contract.md + references 忠实模拟产出,已在每份模拟产出顶部标注)
本案例的校准价值:trademark-assistant 是商标合规初筛型 skill,落在 v0.3.0 合规型维度集的覆盖范围内。本次校准用于检验合规型 6 维度 + 9 taste 项在"商标"这一具体合规子场景的可用性,并暴露待补的边界。
一、前置——结构是否可评测
skill-lint 对接状态
- 已读取 trademark-assistant 的 SKILL.md + output-contract.md + 2 份核心 references(registrability-prescreen / classification-planning)+ legal-basis-index
- 未读取 skill-lint 正式审查报告(降级模式:本次未单独调用 skill-lint,仅按 skill-lint-handoff.md 的 Hard Fail 清单 + 可评估性五项做了纸面前置核验)
Hard Fail 结论(产出物质量红线,逐项核验模拟产出)
| Hard Fail 项 | 是否命中 | 备注 |
|---|---|---|
| 编造关键事实 / 证据 / 依据 | ✅未命中 | 模拟产出严格基于输入材料 + references 引用,无虚构商标在先权利人 |
| 未标注信息不足却给确定结论 | ✅未命中 | output-contract 强制要求"信息不足时统一填'待补充(信息不足,暂不评级)',不输出高/中/低结论"——材料 3 故意缺失时严格执行 |
| 将草稿表述为正式意见 | ✅未命中 | output-contract 固定含"五、免责声明:本结论为商标注册前期初筛建议,不构成正式法律意见" |
| 引用明显错误依据 | ✅未命中 | 模拟产出引用《商标法》第 30/31 条 + 第 10/11 条 + 尼斯分类 v13(2026)——均现行有效 |
| 高风险场景未提示人工复核 | ✅未命中 | output-contract 固定含"六、升级建议:高风险/复杂争议/信息缺失 → 杨卫薪律师(微信 ywxlaw)" |
| 未输出必要免责 / 风险提示 | ✅未命中 | 同上,免责 + 升级建议为强制段 |
| 输出泄露本应脱敏信息 | ✅未命中 | 模拟输入已脱敏("某科技公司 / 智厨"为虚构商标) |
| 公开示例含真实可反查信息 | ✅未命中 | 同上 |
| 文档无可执行流程 | ✅未命中 | SKILL.md 有"阶段一/阶段二"两段可执行流程 + output-contract 标准结构 |
前置结论:Hard Fail 全部不命中,可进入维度评分流程。
可评估性基础五项(结构性缺口)
| 检查项 | 状态 | 备注 |
|---|---|---|
| 声明评估范围 | ✅ | SKILL.md"适用范围"明确"中国商标申请";"服务边界"明确不替代正式意见、不承诺成功率 |
| 声明 Hard Fail | ⚠️软性缺失 | SKILL.md"服务边界"段落实质起到 Hard Fail 作用(不替代正式意见 / 不承诺成功率 / 复杂争议升级),但未显式使用"Hard Fail"标签——这是 skill-lint 的判定范畴,本技能仅记结构性缺口 |
| benchmark case / 样例 | ⚠️缺失 | trademark-assistant 的 archive/ 目录为空,examples/ 目录不存在——没有现成的"输入→输出"样例可参照。本次评测只能模拟产出。这是商标 skill 自身的可评估性缺口,回灌建议见"要补的句子"#3 |
| 输出验收标准 | ✅ | output-contract.md 给出严格结构 + 交付要求(信息不足必须显式标注、统一 Markdown 不附加 JSON、免责 + 升级建议强制) |
| 区分静态检查与动态评估 | ⚠️软性缺失 | SKILL.md 没有显式区分"静态规则校验"vs"动态跑测试材料",但 references 内含静态规则(尼斯分类表)+ 动态推理(registrability-prescreen-guide)的事实分层 |
结构性缺口小计:1 项硬缺失(无 benchmark case)+ 2 项软缺失(Hard Fail 未显式标签化 / 静态-动态未显式分层)。本次评测基于不完整结构,但缺口不阻塞内容评测。
二、测试材料(三份测试法)
三份测试法(对接 ch07 第六节 L774-788)。trademark-assistant 没有 archive/examples 现成输出,下列三份模拟产出均由评测人按 SKILL.md + output-contract.md + 2 份核心 references 忠实模拟,非真实 skill 调用结果——已每份顶部标注。
输入设定
委托主体:某智能厨电初创公司(虚构,"智厨科技")。 拟申请商标:"智厨"(纯中文文字商标,普通印刷体)。 主营业务:智能烹饪机器人(家用)+ 配套 App + 预包装食材套餐订阅。
| # | 材料类型 | 说明(脱敏) | 用途 |
|---|---|---|---|
| 1 | 熟悉材料 | 主营业务清晰、商品形态明确、目标类别可推断(智能烹饪机器人→第 7 类/第 11 类;App→第 9 类;食材订阅→第 29/30 类) | 检查是否抓住商标合规初筛的重点(核心/防御/储备分层 + 绝对/相对理由风险) |
| 2 | 同类不熟悉材料 | 主营业务为"企业 SaaS + 行业咨询"的"知合"商标(虚构),目标类别需重新映射(第 35 类广告/商业 + 第 42 类 SaaS / 软件设计 + 第 45 类法律咨询若涉足) | 检查输出结构是否稳定(跨业务领域是否仍按 output-contract 输出) |
| 3 | 故意缺失关键背景的材料 | 仅给商标名"风行"+ 申请主体"某贸易公司",不给主营业务、不给使用场景、不给商标图样 | 检查边界是否稳定(应触发 output-contract 的"待补充(信息不足,暂不评级)") |
模拟产出(材料 1,熟悉材料,节选)
声明:本节为评测人按 trademark-assistant 的 SKILL.md + output-contract.md + registrability-prescreen-guide.md + classification-planning-guide.md 忠实模拟的产出,非真实 skill 调用结果。真实 skill 调用可能因模型差异、reference 加载顺序不同而略有差异。
## 一、结论摘要
- 类别规划结论:核心第 7 类(家用烹饪机器人)+ 第 11 类(电烹饪器具)+ 第 9 类(配套 App / 智能控制软件);防御第 28 类(智能玩具/烹饪玩具模型);储备第 29/30 类(预包装食材套餐)
- 初筛风险等级:**中**(绝对理由低风险;相对理由中风险——"智厨"含"厨"字在第 7/11 类存在多家在先申请人,需正式检索)
## 二、规划建议
### 1. 核心类别(必保)
- 第 7 类(家用烹饪机器人):类似群 0701 / 0723;推荐理由:直接对应主营产品(家用智能烹饪机器人),尼斯分类 v13(2026)class-07 涵盖"厨房用机器人和面食加工机"
- 第 11 类(电烹饪器具):类似群 1104;推荐理由:覆盖电烤箱、电蒸锅、电磁炉等智能厨电延伸产品
- 第 9 类(计算机软件 / App):类似群 0901;推荐理由:智能烹饪机器人配套 App / 远程控制软件
### 2. 防御类别(建议)
- 第 28 类(智能玩具 / 烹饪玩具模型):推荐理由:防止他人在相邻消费品领域抢注近似商标
### 3. 储备类别(可选)
- 第 29 类(预包装肉/蛋/豆制品)+ 第 30 类(预包装面食/调味品):推荐理由:为未来食材套餐订阅业务预留
## 三、可注册性初筛
### 1. 主要风险点
- 绝对理由风险:**低**——"智厨"非直接描述商品特征(烹饪机器人),不属通用名称,不涉禁用标志(参考 references/trademark-examination-and-adjudication-guidelines/chapter-03.md 显著性条款)
- 相对理由风险:**中**——尼斯分类 v13 class-07 / class-11 在先申请含"厨"字商标较密集(智厨云/智厨邦等近似),需中国商标网正式检索
### 2. 风险等级判定
- 等级:中
- 判定依据:绝对理由低风险 + 相对理由中风险;建议补充显著性元素(如"智厨 xKitchen"组合商标)或调整设计后再正式检索
## 四、下一步行动
1. 中国商标网(sbj.cnipa.gov.cn)正式检索第 7/11 类含"智厨"近似商标
2. 评估是否补"英文副标"提升显著性
3. 优先申请第 7 类(核心产品),并行申请第 11 类延伸保护
## 五、免责声明
本结论为商标注册前期初筛建议,不构成正式法律意见。最终结果以官方审查结论为准。
## 六、升级建议
- 是否建议升级:是
- 升级触发原因:相对理由中风险(在先近似商标密集)+ 跨类别申请策略(5 类同步申请预算评估)
- 升级动作:建议正式检索后咨询专业律师评估申请策略
- 律师咨询入口:杨卫薪律师(微信 ywxlaw)材料 2、3 的模拟产出结构相同(核心/防御/储备 + 绝对/相对理由 + 风险等级 + 免责 + 升级),关键差异:
- 材料 2(SaaS + 咨询):核心类别改为第 35/42/45 类,结构稳定,风险等级判定为"低至中"。
- 材料 3(缺主营业务):严格按 output-contract 第 51 行触发"待补充(信息不足,暂不评级)",不输出高/中/低结论,仅在"下一步行动"列出"补齐业务使用场景、目标商品/服务、商标图样后再进入分级评估"。
三、按场景维度逐项评分(合规型 6 维度,1-5 分)
本次使用维度集: 合规型(现行路径:references/compliance-scenario-rubric.md)
首次校准发现:合规型 6 维度原本为"数据合规 / 反垄断 / 反腐败"等典型合规场景设计,本次套用到商标合规初筛场景时,多数维度语义可迁移,但部分检查问题需要调整。详见每维度后的"校准说明"。
测试材料 1(熟悉材料——智能厨电"智厨")
| 维度 | 评分 | 评价(低分原因 / 高分依据) | 校准说明 |
|---|---|---|---|
| 维度 1(监管依据精确度) | 4/5 | 引用《商标法》第 30/31 条(相对理由)+ 第 10/11 条(绝对理由)+ 尼斯分类 v13(2026)+ 审查审理指南 chapter-03;效力层级清楚(法律→实施条例→审查指南→尼斯分类)。未扣分理由:现行有效且层级清晰。4 分而非 5 分:未显式区分"法律 / 行政法规 / 部门规章 / 规范性文件 / 自律规则"五级——但商标场景本就层级扁平,5 级区分过度。 | 维度语义可迁移。商标法层级(法律→实施条例→审查审理指南→尼斯分类)是合规型"效力层级"的合理具体化。 |
| 维度 2(风险识别完整性) | 5/5 | 绝对理由(显著性/禁用标志/通用名称)+ 相对理由(在先近似)+ 使用举证风险(材料 1 提及"配套 App"暗示已有使用证据准备)三维度全覆盖;识别"跨类别传导风险"(核心第 7 类若未注册,第 11 类延伸品会被搭便车)。 | 完全契合。商标合规的风险识别框架天然是"绝对+相对+使用举证"三段式,与合规型"覆盖典型风险"要求一致。 |
| 维度 3(风险等级判定合理性) | 5/5 | output-contract 的"高/中/低/待补充"四级 + registrability-prescreen-guide 的判定标准(高=明显禁用或高概率近似;中=可缓解需调整;低=未见显著障碍);材料 1 判定"中"并给调整建议(补英文副标);材料 3 严格触发"待补充(暂不评级)"——判定标准清楚、不一刀切。 | output-contract 的 4 级判定是合规型"区分必须整改 vs 建议改进"的优秀具体化——"待补充"档天然防止了"信息不足却给确定结论"。 |
| 维度 4(整改路径可执行性) | 4/5 | "下一步行动"具体到动作(正式检索 / 评估英文副标 / 优先申请第 7 类并行第 11 类);但未显式标注时限与责任人(output-contract 也没有要求);整改成本-风险匹配未显式评估(5 类同步申请的预算考量仅在"升级建议"里隐含)。4 分而非 5 分:合规型 rubric 要求"具体到动作、责任人、时限、分阶段"——trademark 场景下"责任人"通常就是客户/代理机构,时限由申请周期决定,故缺失可接受,但 rubric 描述偏严。 | 校准发现:合规型维度 4 的"责任人/时限"要求源自"企业合规整改"场景,对商标申请这类一次性合规动作过度。建议维度 4 描述补"对一次性合规动作(如商标申请、备案登记),责任人/时限可降级为'动作完成节点'"。 |
| 维度 5(证据与事实对应) | 5/5 | 模拟产出严格基于输入材料(主营业务/商标名/商标图样),无虚构;"待核实事项"为"在先近似商标需正式检索"——明确区分"已确认事实(主营业务是智能烹饪机器人)"和"待核实事项(具体在先近似列表)"。 | 完全契合。 |
| 维度 6(交付物格式与可追溯性) | 5/5 | output-contract 强制结构(结论摘要/规划建议/可注册性初筛/下一步行动/免责/升级)+ 类别编号 + 风险等级编号 + 引用源(references/trademark-examination-and-adjudication-guidelines/chapter-03.md)——颗粒度匹配读者(客户可读结论摘要,内部可读推荐理由 + 引用)。 | 完全契合。 |
测试材料 2(同类不熟悉材料——SaaS"知合")
结构稳定性测试。模拟产出在跨业务领域(SaaS / 咨询 vs 智能厨电)下仍按 output-contract 标准结构输出,6 维度评分与材料 1 相近(维度 1/2/3/5/6 仍 4-5 分;维度 4 同样因无责任人/时限扣 1 分)。结论:输出结构稳定。
测试材料 3(故意缺失关键背景——"风行"+无主营业务)
边界稳定性测试。
| 维度 | 评分 | 评价 |
|---|---|---|
| 维度 1(监管依据精确度) | 4/5 | 仍引用尼斯分类通用框架,未编造具体条款(因为无法落到具体类别) |
| 维度 2(风险识别完整性) | N/A | 信息不足,无法做风险识别——这是关键边界检查 |
| 维度 3(风险等级判定) | 5/5 | 核心边界检查通过:严格触发 output-contract "待补充(信息不足,暂不评级)",不输出高/中/低结论,仅输出补齐清单。这一项是 trademark-assistant 最值得称道的 taste——output-contract 把"信息不足"硬编码成了第四档。 |
| 维度 4(整改路径可执行性) | 5/5 | "下一步行动"正确改为"先补齐业务使用场景、目标商品/服务、商标图样后再进入分级评估"——不是给空泛建议而是给补齐清单 |
| 维度 5(证据与事实对应) | 5/5 | 完全区分"待核实/待补充",不虚构 |
| 维度 6(交付物格式与可追溯性) | 5/5 | 仍按 output-contract 输出,但结论摘要/规划建议段统一标"待补充" |
结论:边界稳定。材料 3 是 trademark-assistant 表现最好的场景——证明其 taste 项防护到位。
四、合规型场景 taste 项核查
taste 项来自
compliance-scenario-rubric.md第二节。每项命中即 taste FAIL。
| taste 项 | 测试材料 1 | 测试材料 2 | 测试材料 3 | 命中说明 |
|---|---|---|---|---|
| taste-1(区分法律红线 vs 合规建议) | ✅ | ✅ | ✅ | "建议补英文副标"是合规建议;"商标法第 30 条相对理由"是法律红线——区分清楚 |
| taste-2(提示监管动态性) | ⚠️软命中 | ⚠️软命中 | ⚠️软命中 | 引用尼斯分类v13(2026),明确标注版本;但未提示"商标审查审理指南可能更新"——合规型 rubric 要求"提示法规可能修订、监管口径可能变化、地方差异"。校准发现:商标场景的"监管动态性"主要表现为"尼斯分类版本更新(每 2 年)+ 审查审理指南修订(不定期)+ 在先商标数据库每日变化",与数据合规的"监管口径变化"语义不完全对应。建议为商标场景补 taste-10(待 v0.4.0):"提示商标在先权利状态会随时变化,初筛结论仅反映查询时点状态"。 |
| taste-3(避免零风险承诺) | ✅ | ✅ | ✅ | output-contract 强制免责声明"不构成正式法律意见,最终结果以官方审查结论为准"——天然不写零风险承诺 |
| taste-4(提示跨境/跨行业差异) | ✅ | ✅ | ✅ | SKILL.md"国际适用性说明"明确"尼斯分类可国际适用,但可注册性初筛仅适用中国商标申请;国际申请需另行咨询"——跨境差异提示到位 |
| taste-5(避免把商业判断写成合规结论) | ✅ | ✅ | ✅ | 模拟产出"评估是否补英文副标提升显著性"是商业判断(显著性策略),不是合规结论;合规结论(中风险/低风险)严格基于审查审理指南 |
| taste-6(明确初筛非正式意见) | ✅ | ✅ | ✅ | output-contract 强制"本结论为商标注册前期初筛建议,不构成正式法律意见" |
| taste-7(提示业务事实需核实) | ✅ | ✅ | ✅ | "需中国商标网正式检索"是核心事实核实提示 |
| taste-8(合规核查可追溯证据) | ❌命中 | ❌命中 | ❌命中 | 关键 taste 命中:模拟产出未提供核查过程的可追溯证据(无查询时间戳、无 API 返回结果、无截图存证)。合规型 rubric taste-8 来自杨卫薪《全球制裁清单风险核查》强调"截图存证是证明已尽到核查义务的重要依据"。校准发现:trademark-assistant 当前流程是"纸面推理 + 引用静态 references",没有强制要求调用商标局 API 或截图存证——这是 trademark 场景与制裁核查场景的本质差异。判定:taste-8 在商标场景下是否适用,需用户确认。若要求商标初筛也留截图存证(如中国商标网查询结果截图),是合理的合规升级;若认为商标初筛是"推理结论"而非"数据库核查",则 taste-8 应场景化降级。暂记命中,回灌建议见"要补的句子"#2。 |
| taste-9(跨境数据更新频率差异) | N/A | N/A | N/A | trademark-assistant 明确"仅适用中国商标申请",跨境场景不适用——本项不评。 |
taste 核查小计:1 项硬命中(taste-8 可追溯证据)+ 1 项软命中(taste-2 监管动态性)+ 1 项待新增(taste-10 在先权利动态性)。未触发 FAIL(taste-8 命中已记入回灌建议,但不构成总体结论 ❌——因为该 taste 项本身是 v0.3.0 推导待校准项,且 trademark 场景适用性本身待用户确认)。
五、定位"要补 SKILL.md 的哪句话"
评测的目的不是给 Skill 打总分,而是定位要回 SKILL.md 补哪句话。注意:被测 skill trademark-assistant 是只读的(本次不动),下列回灌建议是给 legal-skill-evaluation 的"若商标 skill 要修怎么修"参考,也是给合规型 rubric 自身的修订参考。
| # | 来源(低分维度 / taste 命中项) | 测试材料 | 要补的句子(可执行修补建议) | 对应位置 |
|---|---|---|---|---|
| 1 | 维度 4 校准发现(责任人/时限偏严) | 材料 1/2 | legal-skill-evaluation 的 compliance-rubric 维度 4 描述补:"对一次性合规动作(商标申请、备案登记、单次尽调),责任人/时限可降级为'动作完成节点';分阶段整改仍要求责任人 + 时限" | references/compliance-scenario-rubric.md 维度 4 |
| 2 | taste-8 命中(无核查可追溯证据) | 材料 1/2/3 | trademark-assistant SKILL.md 阶段一补:"完成可注册性初筛后,建议在中国商标网(sbj.cnipa.gov.cn)做一次近似查询并截图存档,附在交付物末尾'核查证据'段——证明已尽到查询义务。"(注:这条是给被测 skill 的建议,本次不修改被测 skill;也是给 legal-skill-evaluation 的发现——商标场景下 taste-8 的"截图存证"要求是否强制,待用户拍板) | trademark SKILL.md(不动)/ legal-skill-evaluation compliance-rubric taste-8(场景化说明) |
| 3 | 结构性缺口(无 benchmark case) | 全部 | trademark-assistant 应补 archive/example:"沉淀 1-3 个真实脱敏的'输入咨询→输出初筛报告'完整样例到 archive/ 或 examples/,作为后续 legal-skill-evaluation 评测的客观锚点。" | trademark SKILL.md "Archive 归档"段 |
| 4 | taste-2 软命中(监管动态性) | 全部 | legal-skill-evaluation 为商标场景考虑 taste-10(v0.4.0 待用户确认):"商标在先权利状态会随时变化(每日新申请),初筛结论仅反映查询时点状态。" | compliance-scenario-rubric.md taste 项 |
五-bis、四校准动作记录
本次未启用 LLM judge(纯人工纸面评测 + 模拟产出)。
- 锚点样本:N/A
- 顺序翻转:N/A
- 多 judge 共识:N/A
- 证据锚定:N/A(但本评测自身遵循了证据锚定——所有评分依据均落到具体产出片段或 reference 引用,未给裸分)
长文 judge 单独建模:N/A(trademark 交付物是短结构化报告,不属长文)
pairwise vs 绝对评分:本次"风险识别完整性/是否虚构/是否信息不足给确定结论"等判断用绝对评分,未涉及 pairwise。
五-ter、双门槛判定
跳过(首次评测,无上一版对照)。
六、总体结论
- ✅ 进入工作流(结构可评测、内容评测通过、taste 项无致命命中)
- ⚠️ 修后再测
- ❌ 回退
总体评价:trademark-assistant v1.5.4 是 legal-skill-evaluation Phase B 校准中表现最好的 skill——
- output-contract 把"信息不足→待补充(暂不评级)"硬编码为第四档,是合规型 taste-3(避免零风险承诺)+ Hard Fail"未标注信息不足却给确定结论"的优秀工程化实现;
- 6 维度评分均在 4-5 分,无致命低分;
- 唯一硬 taste 命中(taste-8 可追溯证据)本身是 v0.3.0 待校准项,且商标场景适用性待用户确认——不构成总体 FAIL。
给 legal-skill-evaluation 的反向回灌价值:
- 合规型 6 维度在商标场景可用,但维度 4(整改路径)描述需场景化补充"一次性合规动作"豁免;
- taste-8(可追溯证据)在商标场景下的强制等级需用户拍板(强制截图存证 vs 仅建议);
- 暴露需新增 taste-10(在先权利状态动态性)——但属 v0.4.0 范畴,本次小改不动。
七、安全声明
- 本报告测试材料中的"智厨科技""知合""风行"商标及"某智能厨电初创公司""某贸易公司"均为虚构脱敏示例,无真实当事人/客户名/案号。
- 本评测结论不能替代正式法律意见。
- 本报告不用于对 trademark-assistant 作者的人身评价,只针对 Skill 输出(且本次输出为模拟产出,非真实 skill 调用)。