Case 05: 负向触发案例(T-011 / T-017)
状态:[骨架 - 待实测]
目的:验证 alignment 不应被触发的场景。对应 SKILL.md description 的两类负向边界 + 使用咨询边界。
判定标准:alignment skill 不应出现在候选列表中,或即使出现也不应被选中执行对齐流程。
负向案例清单
case-05a:非法律类 Skill(内容获取工具)
用户输入:
帮我做一个 douyin 视频批量下载的 skill,我经常需要下载视频做素材。预期:❌ 不触发 alignment 负向边界类型:非法律类 Skill 创建 判定依据:场景是"视频下载工具",不涉及任何法律领域(合同/诉讼/合规/尽调/知产/劳动/公司/家事/税务/刑事)。应路由到通用 skill-creator 或其他工具类技能。 实测结果:—(待跑)
case-05b:非法律类 Skill(内容创作)
用户输入:
我想把我的读书笔记整理成一个 skill,每次读完书自动生成摘要和思维导图。预期:❌ 不触发 alignment 负向边界类型:非法律类 Skill 创建 判定依据:场景是"读书笔记自动化",非法律业务。alignment 的 description 明确限定"法律 Skill 前置对齐"。 实测结果:—(待跑)
case-06:已提供完整 Brief 要求直接编译
用户输入:
我已经把意图完整结构化好了,这是我的 Brief(附完整 legal-skill-brief/v1 格式文档)。
请直接帮我编译成 SKILL.md,不要问我问题了。
[贴入完整 Brief,含五问齐全 + 法源三列 + 安全段 + 状态判定]预期:❌ 不触发 alignment(应直接路由到 skill-creator)
负向边界类型:用户已提供完整可执行 Brief 且明确要求直接编译
判定依据:用户已给出 structurally_complete = true 且 handoff_ready = true 的 Brief,并明确说"直接编译"。alignment 的对齐流程是冗余的。
实测结果:—(待跑)
边界细微处:如果用户说"帮我看看这个 Brief 对不对"——这是审查而非对齐,可能触发 alignment 做一轮校验,但不走完整访谈。此边界须人工判定。
case-07:使用咨询(非创建)
用户输入:
skill 是什么?怎么安装?我怎么知道一个 skill 适不适合我用?预期:❌ 不触发 alignment 负向边界类型:使用咨询,非创建前置对齐 判定依据:用户问的是"skill 是什么 / 怎么用",不是"我想做一个 skill"。这是使用咨询,应路由到通用帮助文档或 skill-manager。 实测结果:—(待跑)
近似正例(应触发,用于对比)
为了验证负向边界的精度,需同时测近似正例:
| 输入 | 预期 | 说明 |
|---|---|---|
| "我是律师,想把劳动仲裁答辩的经验做成 skill" | ✅ 触发 | 明确法律领域 + 创建意图 |
| "我有几份合同审查的意见书,想做成可复用的 skill" | ✅ 触发 | 有素材 + 法律领域 |
| "帮我把客户咨询记录提炼成一个法律问答 skill" | ✅ 触发 | 法律领域 + 创建意图 |
实测方法
- 在 Claude Code / Claude CLI 中逐条输入上述用户输入。
- 观察 alignment skill 是否出现在候选列表。
- 如果出现,观察是否被选中执行(description 匹配度)。
- 记录"出现但未选中"vs"完全未出现"——前者说明 description 边界可进一步收紧。
回填模板:
case-05a 实测:[出现/未出现] alignment,[选中/未选中] 执行。判定:[✅符合预期/❌误触发]边界例(灰度场景,需人工判定)
以下场景属于边界,触发与否取决于上下文,须人工记录判定依据:
| 输入 | 灰度点 | 倾向 |
|---|---|---|
| "我想做一个帮律师管理案件的工具" | "工具"+"律师"——是法律工具还是通用项目管理? | 追问:如果核心是法律业务流程→触发;如果是通用排期→不触发 |
| "帮我做一个审查合同条款合规性的 skill,但不是法律审查,是技术合规" | "合规"但非法律 | 不触发(技术合规 ≠ 法律合规) |
| "我想把公司的审批流程做成 skill" | 公司流程,可能涉法律也可能不涉 | 追问:流程是否涉及法律判断 |