合规型场景产出物评测维度清单
v0.4.0 起降级为深度参考附录。主流程见
universal-dimensions.md(通用六维度 + 通用 taste)+scenario-tuning-notes.md(合规型场景微调说明)。本文件在以下情况启用:taste 深度核查(如可追溯证据 taste-8 强制等级、跨境数据更新频率 taste-9)、合规型场景特异争议、需要比通用六维度更细颗粒度的评分。本文件内容作为 v0.3.x 沉淀供深度参考。
适用范围:合规风险扫描、合规整改建议、合规审查清单、合规尽调备忘录、数据合规评估、反垄断合规评估、反腐败合规评估等以"合规风险识别与整改"为处理对象的 Skill 产出物。
本清单与合同型、诉讼型均不通用。合规型输出的好坏,核心在"监管依据是否精确、风险等级判定是否合理、整改路径是否可执行"。
v0.3.0 待真实 skill 校准声明:本清单的六个维度 + taste 项,由 DR-5 调研(三层评测栈 / 三类 grader / capability-regression 分离 / 参考解三档 / LLM-as-judge 四校准 / SWE-bench 双门槛)+ 杨卫薪知识体系(
source-material/杨卫薪知识体系/5. 案例集/07-全球制裁清单风险核查.md、06-跨境并购合同审查.md,配合2. 方法论/05-法律AI的10个应用场景.md合规类章节)共同推导。未经真实合规 skill 校准——风险等级判定标准、监管依据精确度阈值、整改路径颗粒度都需要在真实合规型 skill 上跑过后回灌。校准任务见 TASKS.md T-301。本版本不是终稿。v0.3.1 部分校准回灌(来源:trademark-assistant v1.5.4 商标合规初筛场景校准,见
evals/case-bundle-260705/trademark-case-01.md):合规型 6 维度在商标场景5 个完全可用,1 个描述偏严已小改(维度 4 补"一次性合规动作豁免");taste-8(可追溯证据)在商标场景下命中——当前 trademark 流程是纸面推理无截图存证,与制裁核查场景不同;taste-8 强制等级待用户拍板(强制 vs 仅建议)。taste-9(跨境数据更新频率)在商标场景不适用(trademark 仅覆盖中国商标)。提案新增 taste-10(在先权利状态动态性),待 v0.4.0 用户确认。
推导依据(备查)
- 维度 1(监管依据精确度):杨卫薪《全球制裁清单风险核查》强调 API 初筛 + 浏览器二次验证 + 截图存证;监管依据必须可追溯(OFAC / 欧盟 / 联合国清单各自的官方来源)。
- 维度 2(风险识别完整性)+ 维度 3(风险等级判定):来自 ch07 第六节六维度中"争议焦点把握"在合规场景的具体化;杨卫薪知识体系强调区分"必须整改(法律红线)"和"建议改进(合规优化)"。
- 维度 4(整改路径可执行性):来自 ch07 第六节六维度中"实务可用性"在合规场景的具体化;要求具体到动作、责任人、时限、分阶段。
- 维度 5(证据与事实对应):来自 ch07 第六节"事实叙述与证据运用"在合规场景的具体化;杨卫薪知识体系强调"合规结论的可靠性高度依赖业务事实准确性"。
- 维度 6(交付物格式与可追溯性):来自 ch07 第六节"文书格式完整度";杨卫薪《全球制裁清单风险核查》强调结构化风险评级报告(HTML/PDF)+ 行动建议 + 截图存证。
- taste 项 1-7:来自 ch07 第六节 L854 taste 四类(区分法律风险与商业谈判点 / 区分事实缺口 / 不写绝对化承诺 / 区分草稿与正式意见)在合规场景的具体化扩展。
一、维度清单
维度 1:监管依据精确度
检查问题:
- 引用的法规 / 规章 / 规范性文件 / 行业标准 / 监管指引是否准确(名称 + 文号 + 条款)
- 是否区分法律、行政法规、部门规章、地方性法规、规范性文件、自律规则的不同效力层级
- 是否识别跨境 / 跨法域场景下的多重监管依据(如数据出境涉及网信办 + 行业主管 + 境外法域)
- 是否避免引用已废止或已修订的依据
低分表现:依据笼统("根据相关规定");效力层级不分;引用过时依据。
高分表现:依据精确到条款;效力层级清楚;跨境场景识别多重监管。
维度 2:风险识别完整性
检查问题:
- 是否覆盖本场景典型合规风险(如数据合规的收集 / 存储 / 使用 / 共享 / 出境 / 删除全生命周期;反腐败的商业贿赂 / 利益冲突 / 礼品招待 / 赞助)
- 是否区分法律合规风险、监管合规风险、自律合规风险、声誉风险
- 是否识别隐性合规义务(如合同传导义务、集团内合规义务)
低分表现:风险识别不全;只看显性风险;风险类型不分。
高分表现:覆盖典型风险;区分风险类型;识别隐性义务。
维度 3:风险等级判定合理性
检查问题:
- 风险等级(高 / 中 / 低)判定是否有标准(违法性 / 危害后果 / 发生概率 / 监管处罚力度)
- 是否区分"必须整改"和"建议改进"
- 是否避免一刀切(把所有风险都标高,或都标低)
低分表现:等级判定无标准;一刀切;高影响风险被低估。
高分表现:判定标准清楚;区分强制性 / 建议性;高影响风险不被低估。
维度 4:整改路径可执行性
检查问题:
- 每项风险是否有对应整改建议(具体到动作、责任人、时限)
- 整改建议是否区分立即整改 / 短期整改 / 中长期建设
- 是否评估整改成本与风险敞口的匹配(避免"花百万改一个低风险")
- 是否提示整改本身的合规风险(如整改过程中可能产生的新合规问题)
场景化豁免(v0.3.1 补,来源:trademark-case-01 校准):对一次性合规动作(如商标申请、备案登记、单次尽调),"责任人/时限"可降级为"动作完成节点"——这类场景下没有分阶段整改,rubric 第 1-2 条的"责任人 + 时限 + 分阶段"过度。判定时区分:企业合规整改(数据合规/反腐败)→ 全要求;一次性合规动作 → 仅要求"动作具体 + 完成节点"。
低分表现:建议空泛("加强合规管理");无责任人 / 时限;成本不匹配。
高分表现:整改动作具体;分阶段;成本匹配;识别整改次生风险。
维度 5:证据与事实对应
检查问题:
- 风险结论是否基于已提供的业务事实(不虚构业务场景)
- 是否标注事实缺口(如缺少业务流程图、缺少数据处理清单、缺少关联交易明细)
- 是否区分"已确认事实"和"待核实事项"
低分表现:风险结论脱离业务事实;事实缺口不标注;把待核实当已确认。
高分表现:结论基于事实;缺口标注清楚;区分已确认 / 待核实。
维度 6:交付物格式与可追溯性
检查问题:
- 是否符合本场景交付物结构(风险清单 / 整改建议书 / 尽调备忘录 / 合规审查意见)
- 每项风险是否有唯一编号,便于整改追溯
- 是否区分面向管理层(摘要)和面向执行层(明细)的不同颗粒度
低分表现:格式混乱;无编号;颗粒度不匹配读者。
高分表现:结构规范;可追溯;颗粒度匹配。
二、合规型场景 taste 项
taste 来自 ch07 第六节 L854 taste 四类 + 杨卫薪知识体系合规类案例的实务判断点。每项命中即 taste FAIL,不并入维度评分。
- taste-1:是否区分"法律红线"和"合规建议"。把建议性要求写成法律强制,是越界。
- taste-2:是否提示监管动态性(法规可能修订、监管口径可能变化、地方差异)。
- taste-3:是否避免"零风险承诺"(如"本方案确保完全合规")。
- taste-4:是否提示跨境 / 跨行业差异(同一业务在不同法域、不同行业的合规要求不同)。
- taste-5:是否避免把商业判断写成合规结论(如"该商业模式不可行"应是商业判断,不是合规结论)。
- taste-6:是否明确本输出为合规初筛 / 尽调初稿,不替代正式合规意见或法律意见。
- taste-7:是否提示本输出涉及的业务事实需经业务方核实(合规结论的可靠性高度依赖业务事实准确性)。
- taste-8(v0.3.0 推导,待校准):合规核查类输出是否提供核查过程的可追溯证据(截图存证、查询时间戳、API 返回结果)——杨卫薪《全球制裁清单风险核查》强调"截图存证是证明已尽到核查义务的重要依据"。
- taste-9(v0.3.0 推导,待校准):跨境 / 跨法域场景是否提示数据更新频率差异("API 显示已解除制裁,但网站上还有记录")——杨卫薪明确这是合规核查的常见坑。
三、与合同型、诉讼型清单的差异说明
合规型清单不能套用另两套,原因:
- 合规型的"监管依据精确度"独有——合同型只看合同条款,诉讼型看法条但不看监管层级和动态性。
- 合规型的"风险等级判定"和合同型的"风险分级"看起来像,但判定标准完全不同(合规看违法性和监管处罚力度,合同看对本方履约影响)。
- 合规型独有的维度:整改路径可执行性、监管动态性、跨境识别——这些在合同和诉讼型里不存在。
如果一个 Skill 同时声称覆盖合规和合同(如合同合规一体化审查),本技能要求用户分别用两套清单评测两次,不做平均。