素材对齐厘清策略(question-set/v1)
本文档定义各类素材的对齐厘清策略,对应 SKILL.md 步骤 1A.1。
v1 变更:素材分类从 3 类扩展为 7 类可组合类型(新增 rules / revisions / tools-data / authorities);顶部新增"敏感材料识别清单"(与 SKILL.md 安全段联动);多分类共存处理段加入"三角色交叉验证"指引。
零、敏感材料识别清单(v1 必读)
本节对应 SKILL.md 步骤 0「安全预检」。处理用户素材前,先过一遍这份清单,发现命中即提示用户脱敏。
| 敏感信息类型 | 识别特征 | 典型示例 |
|---|---|---|
| 身份证号 | 18 位(末位 X/x),或 15 位旧版 | 110101199003078888、110101900307888 |
| 手机号 | 11 位中国大陆号 | 13800138000 |
| 银行卡号 | 16-19 位连续数字 | 6222021234567890 |
| 当事人自然人姓名 | 真名 + 案件角色 / 文书角色 | "张三(原告)"、"李四(被告)" |
| 当事人企业名称(涉商业敏感) | 真实公司全称 + 案件角色 | "ABC 科技有限公司(被收购方)" |
| 合同 / 案件金额 | 人民币 / 美元 + 金额 + 案件 | "标的额 1000 万元" |
| 当事人地址 | 详细到门牌 | "北京市朝阳区 XX 路 XX 号 XX 室" |
| 内部账号 / 工号 | 律所系统账号、客户编号 | "内档 2024-ZD-001" |
| 未公开的裁判 / 调解结果 | 真实案件号、调解协议编号 | "(2024)京 01 民初 1234 号判决书" |
| 客户内部文件号 / 流程编号 | 公司内部命名规则 | "CL-FW-2024-001" |
处理流程:
- 命中即提示用户:"检测到 [敏感信息类型],请确认是否已脱敏 / 是否需要本 Skill 协助脱敏(仅提示,不自动改写原文件)"。
- 用户确认后,在 Brief 中默认使用脱敏表述(如"买方/卖方""XX 公司""标的额 N 万元")。
- 在 Brief 的「安全与脱敏说明」段记录脱敏状态与脱敏责任归属。
- 如用户拒绝脱敏且敏感信息为高风险类型(身份证 / 银行卡 / 未公开裁判结果),警告用户下游消费者可能不接受该 Brief。
一、素材分类(七类可组合,v1 扩展)
v1 起,素材分类从三类扩展为七类可组合类型。单份素材可同时归属多个分类(如一份"律师函模板"既是 sample 又是 rules)。
1.1 样本类(sample)
识别特征:成品法律文书。如律师函、起诉状、答辩状、合同、合同审查意见、法律意见书、证据目录、备忘录等。
厘清目标
从成品中逆向出"可复用的生产模板",而非复述某一具体案件的内容。
厘清步骤
- 结构骨架提取:拆出文书的固定章节顺序(如律师函 = 抬头 → 事实概述 → 法律分析 → 诉求 → 落款)。
- 风格特征提取:
- 用词偏好(如"敬请"/"特此函告"/"郑重提示")
- 句式特征(长句陈述 vs 短句威慑)
- 语气基调(协商 / 提示 / 威慑 / 中性)
- 风险点清单:把文中反复出现的风险提示项汇总成清单。
- 决策点识别:标记律师在不同情形下做了不同选择的位置(如"金额 > X 走诉讼 / 否则先发函")。
输出要素
- 结构骨架(章节 + 字数占比)
- 风格画像(用词 / 句式 / 语气)
- 风险点清单(条目 + 触发条件)
- 决策分支(if-then 列表)
1.2 流程 SOP 类(sop)
识别特征:步骤化操作文档。如办案流程、合同审查清单、出庭准备、尽调清单、案件管理规程。
厘清目标
把"线性流程"转化为"带决策点的状态机"。
厘清步骤
- 步骤序列还原:按时间顺序列出所有动作。
- 前置条件标注:每一步开始前必须满足什么。
- 决策点提取:哪些步骤存在分支(是 / 否 / 看情况)。
- 质量检查点:哪些步骤有 review / sign-off 节点。
- 异常路径:流程外的常见 exception 怎么处理。
输出要素
- 主流程步骤列表(含前置条件)
- 决策点表(条件 → 分支)
- 质量检查点(位置 + 检查人 + 标准)
- 异常处理表(异常类型 → 应对动作)
1.3 问答 Q&A 类(qa)
识别特征:一问一答形式。如客户咨询记录、培训答疑、内部 FAQ、公众号问答。
厘清目标
从零散问答中提炼"高频问题 + 标准答法 + 例外情形"。
厘清步骤
- 问题聚类:把相似问题归到同一主题。
- 标准答法提炼:从多个回答中抽出共性,写成一版规范答案。
- 例外情形标注:哪些情况下标准答案不适用。
- 价值评估:标注每个问答的复用价值(普遍 / 典型 / 教育 / 复用)。
输出要素
- 高频问题清单(按主题分组)
- 标准答法(每个问题一版)
- 例外情形表
- 价值标签
1.4 规则包类(rules)——v1 新增
识别特征:结构化规则。如阈值表、判断标准、合规清单、风险评分矩阵。
厘清目标
把"规则"从文档中结构化抽离出来,使其可被 Skill 引用、修改、版本化管理。
厘清步骤
- 规则类型识别:是阈值(如"金额 > X 标红")?判断标准(如"管辖不利 → 建议改")?还是风险评分?
- 规则来源追溯:来自法条 / 司法解释 / 行业规范 / 律所内部 SOP?
- 规则适用范围:哪个领域 / 哪个阶段生效?
- 规则冲突检测:两条规则相互矛盾时,优先级如何?
输出要素
- 规则条目表(规则名 + 数值 / 逻辑 + 触发动作 +
source+effective_date) - 适用范围标签
- 冲突与优先级说明
1.5 对话修订记录类(revisions)——v1 新增
识别特征:历史对话 / 反复修改痕迹。如律师-客户沟通记录、文稿修改批注、多版本迭代历史。
厘清目标
从对话 / 修改痕迹中提炼风格偏好、反馈修订倾向、常见避坑——这些往往不在 SOP 文档里。
厘清步骤
- 关键反馈提取:客户 / 资深律师反复强调的点是什么?
- 修改前后对比:哪类修改经常出现?(如"开头去掉客套话""结论前置")
- 避坑提示:客户 / 团队经常反对的表述、容易出错的细节。
- 风格指纹:句式 / 用词 / 段落长度的偏好模式。
输出要素
- 风格指纹(句式 / 用词 / 段落结构)
- 反馈倾向列表(高频反馈 + 应对策略)
- 避坑提示清单
- 正面 / 负面示例对比
1.6 工具与数据源类(tools-data)——v1 新增
识别特征:工具输出、API 数据、数据库快照。如工商查询结果、裁判文书检索导出、合同管理系统输出。
厘清目标
厘清工具 / 数据的输入格式、输出格式、联动方式——便于 Skill 在 workflow 中嵌入或调用。
厘清步骤
- 数据格式识别:JSON / CSV / 表格 / Markdown / 原始文本?
- 字段语义:每个字段含义、单位、是否必填。
- 数据来源与可信度:哪个工具 / API / 数据库输出?
- 联动方式:Skill 是直接消费工具输出?还是再加工?还是作为输入喂给其他工具?
输出要素
- 数据格式说明(schema / 样例)
- 字段语义表
- 来源与可信度(与素材溯源 quality 联动)
- 联动方式描述(输入 / 输出 / 中间产物)
1.7 法源原文类(authorities)——v1 新增
识别特征:法律条文、司法解释、案例原文、监管文件的原始文本或权威转录。
厘清目标
为 Brief 的"知识支撑"段提供可溯源的法源条目——含 jurisdiction / effective_date / verification_status。
厘清步骤
- 法源识别:是法律 / 行政法规 / 司法解释 / 部门规章 / 行业规范 / 案例?
- 生效日期确认:当前版本生效日 + 最近一次修订日。
- 法域标注:CN / HK / US / ...;如果是地方法规,标注适用地区。
- 验证状态:用户已确认 →
verified;未确认 →unverified。 - 条款精确引用:精确到条 / 款 / 项。
输出要素
- 法源条目表(法源 + jurisdiction + effective_date + verification_status)
- 适用条款精确引用
- 法源原文链接 / 路径
二、多分类共存处理
用户给的素材经常是混合的(如"5 份律师函样本 + 1 份出函流程 SOP + 客户咨询记录 + 一份内部审查规则表")。处理原则:
- 每类分别厘清,不要混在一锅炖。
- 厘清完后做交叉验证:
- SOP 里要求的步骤是否在样本中体现?
- 样本里的风险点是否在 Q&A 中被反复问?
- 规则表的阈值是否与 SOP 决策点一致?
- 对话修订中的避坑点是否被规则表覆盖?
- 最终在 Brief 中按"主结构 + 辅助知识"组织(如:以样本骨架为主结构,SOP 决策点作为 workflow,Q&A 作为 knowledge_base,rules 作为规则引擎,revisions 作为风格偏好)。
三角色交叉验证(v1 新增)
v1 起第 4 问拆三子项,多分类素材需做三角色交叉验证,避免角色错位:
| 角色 | 在素材中的常见信号 | 易错点 |
|---|---|---|
operator |
抬头 / 落款的签发人;SOP 的执行者;Q&A 的提问者 | 把"团队所有人"误填为 operator(应明确单一角色) |
represented_party |
文书中的立场表述("我方"/"贵方");SOP 服务的对象;案例中的角色 | 把"客户本人"误填为 represented_party(客户可能是 output_audience) |
output_audience |
文书的实际读者;SOP 的最终交付对象;Q&A 的答复对象 | 把"法官"误填为 represented_party(法官是 output_audience) |
交叉验证规则:
- 文书抬头 "致 XX 法官" →
output_audience = judge,不是represented_party - 文书落款 "XX 律师事务所 代表 XXX 公司" →
operator = lawyer,represented_party = XXX-company - 合同审查意见书 "致 XX 公司法务部" →
output_audience = company-legal,represented_party = client-company(客户企业是 represented_party,法务部是 reader) - 监管报送材料 "致 XX 监管局" →
output_audience = regulator,represented_party = regulated-entity
如发现素材中的角色信号不一致(如样本是律师函但 SOP 提示是合规文档),回到 SKILL.md 步骤 1A.4 引导用户确认。
三、厘清产出的缺口提示
厘清完一定要向用户报告"哪些要素没从素材中得到":
- 素材没提
operator/represented_party/output_audience→ 引导补全第 4 问三子项 - 素材没体现法律依据 / 法源未标
effective_date→ 引导补全第 5 问法源时效子问 - 素材只有一份样本(不足以提炼模式)→ 提示"建议再提供 2-3 份同类样本"
- 素材全是 sample 没有 sop → 提示"决策点提取受限,建议补充 SOP"
不要默默地把缺口留到 Brief 里靠"待确认"硬撑。
四、单样本 / 少样本处理策略
当素材不足以满足"2-3 份同类样本"的最低要求时:
原则
- 承认局限:在 Brief 输出的"素材溯源"段标注"样本数量不足(仅 N 份),厘清出的模式和决策分支可能不完整"
- 标风险不造假:样本未覆盖的场景标注"素材未覆盖此场景,需用户补充",不要从单一案例泛化出"通用规则"
处理流程
- 从可用样本中提取能确定的要素(结构骨架、风格特征、法条引用)
- 识别"样本未覆盖"的缺口(决策分支、异常路径、不同情形下的输出差异)
- 在"待确认清单"中按
blocker/warning分类列出缺口 + 建议补充方式(如"请提供一份败诉场景的代理词 — type: warning") - 如果样本只有 1 份,提示用户:1 份样本只能提取"这一个案子怎么做",无法确定"这一类案子怎么做"。建议至少补充 2 份同类样本后再做厘清。
单样本仍可提取的内容
即使只有 1 份样本,以下内容仍有价值:
- 结构骨架(章节顺序、字数占比)
- 风格特征(用词偏好、句式特征、语气基调)
- 法条引用清单(但需标
verification_status: unverified) - 风险点(但需标注"可能遗漏未触发场景")
以下内容在单样本时价值有限,应标"待补充":
- 决策分支(单样本只展示一条路径)
- 异常路径(单样本通常不体现异常)
- 不同
output_audience的输出差异(单样本只服务一个角色)
五、跨领域任务与非文书型任务(v1 新增)
v1 起不再强制单一法律模板骨架。两类此前被排除的任务现在有正式路径:
跨领域任务
示例:并购尽调报告 = 尽调 + 公司 + 证券 + 劳动 + 知识产权 的复合 Skill。
处理:
- 每个领域按其 stage 枚举分别识别
- workflow 跨领域时按时间顺序串联(而非塞进单一模板)
- knowledge_base 分领域组织,每个领域段落独立
非文书型任务(工具 / 数据包)
示例:证据组织器、合规扫描工具、规则抽取器、风险矩阵生成器。
处理:
doc_type = tool/data-pack(而非demand-letter等文书类型)产出形态 = tool-output(Outputs段标注)- workflow 描述工具的输入 / 处理 / 输出三段
- 不强制要求"抬头 / 落款"等文书专属字段
详见 legal-domain-mapping.md 的"非文书型任务"专章。