All skills
cat-xierluo avatar

/legal-skill-evaluation

@9be736d

法律 Skill 分层质量评测工具。消费 skill-lint 的通用质量结论,再用三份测试材料、通用六维度、场景微调和律师 taste 评估法律产出,并定位最小修复单元。本技能应在审查、回归验证或发布验收法律 Skill 时使用。不要用于代替通用 Skill lint、正式法律意见或跨场景排名。

Use this Skill: https://skilld.dev/gh/cat-xierluo/legal-skills/legal-skill-evaluation

This session only. Nothing lands on disk.

referencescompliance-scenario-rubric.md

≈2.4k tokens on demand. Your agent reads this file only when SKILL.md points to it.

合规型场景产出物评测维度清单

v0.4.0 起降级为深度参考附录。主流程见 universal-dimensions.md(通用六维度 + 通用 taste)+ scenario-tuning-notes.md(合规型场景微调说明)。本文件在以下情况启用:taste 深度核查(如可追溯证据 taste-8 强制等级、跨境数据更新频率 taste-9)、合规型场景特异争议、需要比通用六维度更细颗粒度的评分。本文件内容作为 v0.3.x 沉淀供深度参考。

适用范围:合规风险扫描、合规整改建议、合规审查清单、合规尽调备忘录、数据合规评估、反垄断合规评估、反腐败合规评估等以"合规风险识别与整改"为处理对象的 Skill 产出物。

本清单与合同型、诉讼型均不通用。合规型输出的好坏,核心在"监管依据是否精确、风险等级判定是否合理、整改路径是否可执行"。

v0.3.0 待真实 skill 校准声明:本清单的六个维度 + taste 项,由 DR-5 调研(三层评测栈 / 三类 grader / capability-regression 分离 / 参考解三档 / LLM-as-judge 四校准 / SWE-bench 双门槛)+ 杨卫薪知识体系(source-material/杨卫薪知识体系/5. 案例集/07-全球制裁清单风险核查.md、06-跨境并购合同审查.md,配合 2. 方法论/05-法律AI的10个应用场景.md 合规类章节)共同推导。未经真实合规 skill 校准——风险等级判定标准、监管依据精确度阈值、整改路径颗粒度都需要在真实合规型 skill 上跑过后回灌。校准任务见 TASKS.md T-301。本版本不是终稿。

v0.3.1 部分校准回灌(来源:trademark-assistant v1.5.4 商标合规初筛场景校准,见 evals/case-bundle-260705/trademark-case-01.md):合规型 6 维度在商标场景5 个完全可用,1 个描述偏严已小改(维度 4 补"一次性合规动作豁免");taste-8(可追溯证据)在商标场景下命中——当前 trademark 流程是纸面推理无截图存证,与制裁核查场景不同;taste-8 强制等级待用户拍板(强制 vs 仅建议)。taste-9(跨境数据更新频率)在商标场景不适用(trademark 仅覆盖中国商标)。提案新增 taste-10(在先权利状态动态性),待 v0.4.0 用户确认。

推导依据(备查)

  • 维度 1(监管依据精确度):杨卫薪《全球制裁清单风险核查》强调 API 初筛 + 浏览器二次验证 + 截图存证;监管依据必须可追溯(OFAC / 欧盟 / 联合国清单各自的官方来源)。
  • 维度 2(风险识别完整性)+ 维度 3(风险等级判定):来自 ch07 第六节六维度中"争议焦点把握"在合规场景的具体化;杨卫薪知识体系强调区分"必须整改(法律红线)"和"建议改进(合规优化)"。
  • 维度 4(整改路径可执行性):来自 ch07 第六节六维度中"实务可用性"在合规场景的具体化;要求具体到动作、责任人、时限、分阶段。
  • 维度 5(证据与事实对应):来自 ch07 第六节"事实叙述与证据运用"在合规场景的具体化;杨卫薪知识体系强调"合规结论的可靠性高度依赖业务事实准确性"。
  • 维度 6(交付物格式与可追溯性):来自 ch07 第六节"文书格式完整度";杨卫薪《全球制裁清单风险核查》强调结构化风险评级报告(HTML/PDF)+ 行动建议 + 截图存证。
  • taste 项 1-7:来自 ch07 第六节 L854 taste 四类(区分法律风险与商业谈判点 / 区分事实缺口 / 不写绝对化承诺 / 区分草稿与正式意见)在合规场景的具体化扩展。

一、维度清单

维度 1:监管依据精确度

检查问题:

  • 引用的法规 / 规章 / 规范性文件 / 行业标准 / 监管指引是否准确(名称 + 文号 + 条款)
  • 是否区分法律、行政法规、部门规章、地方性法规、规范性文件、自律规则的不同效力层级
  • 是否识别跨境 / 跨法域场景下的多重监管依据(如数据出境涉及网信办 + 行业主管 + 境外法域)
  • 是否避免引用已废止或已修订的依据

低分表现:依据笼统("根据相关规定");效力层级不分;引用过时依据。

高分表现:依据精确到条款;效力层级清楚;跨境场景识别多重监管。

维度 2:风险识别完整性

检查问题:

  • 是否覆盖本场景典型合规风险(如数据合规的收集 / 存储 / 使用 / 共享 / 出境 / 删除全生命周期;反腐败的商业贿赂 / 利益冲突 / 礼品招待 / 赞助)
  • 是否区分法律合规风险、监管合规风险、自律合规风险、声誉风险
  • 是否识别隐性合规义务(如合同传导义务、集团内合规义务)

低分表现:风险识别不全;只看显性风险;风险类型不分。

高分表现:覆盖典型风险;区分风险类型;识别隐性义务。

维度 3:风险等级判定合理性

检查问题:

  • 风险等级(高 / 中 / 低)判定是否有标准(违法性 / 危害后果 / 发生概率 / 监管处罚力度)
  • 是否区分"必须整改"和"建议改进"
  • 是否避免一刀切(把所有风险都标高,或都标低)

低分表现:等级判定无标准;一刀切;高影响风险被低估。

高分表现:判定标准清楚;区分强制性 / 建议性;高影响风险不被低估。

维度 4:整改路径可执行性

检查问题:

  • 每项风险是否有对应整改建议(具体到动作、责任人、时限)
  • 整改建议是否区分立即整改 / 短期整改 / 中长期建设
  • 是否评估整改成本与风险敞口的匹配(避免"花百万改一个低风险")
  • 是否提示整改本身的合规风险(如整改过程中可能产生的新合规问题)

场景化豁免(v0.3.1 补,来源:trademark-case-01 校准):对一次性合规动作(如商标申请、备案登记、单次尽调),"责任人/时限"可降级为"动作完成节点"——这类场景下没有分阶段整改,rubric 第 1-2 条的"责任人 + 时限 + 分阶段"过度。判定时区分:企业合规整改(数据合规/反腐败)→ 全要求;一次性合规动作 → 仅要求"动作具体 + 完成节点"。

低分表现:建议空泛("加强合规管理");无责任人 / 时限;成本不匹配。

高分表现:整改动作具体;分阶段;成本匹配;识别整改次生风险。

维度 5:证据与事实对应

检查问题:

  • 风险结论是否基于已提供的业务事实(不虚构业务场景)
  • 是否标注事实缺口(如缺少业务流程图、缺少数据处理清单、缺少关联交易明细)
  • 是否区分"已确认事实"和"待核实事项"

低分表现:风险结论脱离业务事实;事实缺口不标注;把待核实当已确认。

高分表现:结论基于事实;缺口标注清楚;区分已确认 / 待核实。

维度 6:交付物格式与可追溯性

检查问题:

  • 是否符合本场景交付物结构(风险清单 / 整改建议书 / 尽调备忘录 / 合规审查意见)
  • 每项风险是否有唯一编号,便于整改追溯
  • 是否区分面向管理层(摘要)和面向执行层(明细)的不同颗粒度

低分表现:格式混乱;无编号;颗粒度不匹配读者。

高分表现:结构规范;可追溯;颗粒度匹配。

二、合规型场景 taste 项

taste 来自 ch07 第六节 L854 taste 四类 + 杨卫薪知识体系合规类案例的实务判断点。每项命中即 taste FAIL,不并入维度评分。

  • taste-1:是否区分"法律红线"和"合规建议"。把建议性要求写成法律强制,是越界。
  • taste-2:是否提示监管动态性(法规可能修订、监管口径可能变化、地方差异)。
  • taste-3:是否避免"零风险承诺"(如"本方案确保完全合规")。
  • taste-4:是否提示跨境 / 跨行业差异(同一业务在不同法域、不同行业的合规要求不同)。
  • taste-5:是否避免把商业判断写成合规结论(如"该商业模式不可行"应是商业判断,不是合规结论)。
  • taste-6:是否明确本输出为合规初筛 / 尽调初稿,不替代正式合规意见或法律意见。
  • taste-7:是否提示本输出涉及的业务事实需经业务方核实(合规结论的可靠性高度依赖业务事实准确性)。
  • taste-8(v0.3.0 推导,待校准):合规核查类输出是否提供核查过程的可追溯证据(截图存证、查询时间戳、API 返回结果)——杨卫薪《全球制裁清单风险核查》强调"截图存证是证明已尽到核查义务的重要依据"。
  • taste-9(v0.3.0 推导,待校准):跨境 / 跨法域场景是否提示数据更新频率差异("API 显示已解除制裁,但网站上还有记录")——杨卫薪明确这是合规核查的常见坑。

三、与合同型、诉讼型清单的差异说明

合规型清单不能套用另两套,原因:

  • 合规型的"监管依据精确度"独有——合同型只看合同条款,诉讼型看法条但不看监管层级和动态性。
  • 合规型的"风险等级判定"和合同型的"风险分级"看起来像,但判定标准完全不同(合规看违法性和监管处罚力度,合同看对本方履约影响)。
  • 合规型独有的维度:整改路径可执行性、监管动态性、跨境识别——这些在合同和诉讼型里不存在。

如果一个 Skill 同时声称覆盖合规和合同(如合同合规一体化审查),本技能要求用户分别用两套清单评测两次,不做平均。

Source: SKILL.md on GitHub

No alerts10d3 checks · Risk SAFE
  • Gen Agent Trust Hub10d

    A comprehensive evaluation framework for legal AI skills designed to assess legal accuracy, fact faithfulness, and adherence to professional tastes. It includes Python scripts for automated quality gates, hashing, and execution probes. No malicious patterns were detected; the automated scripts are functionally aligned with the skill's primary purpose as a testing and evaluation harness.

  • Socket10d

    No alerts

  • Snyk10d

    Risk: LOW · No issues

Signed by skilld at 9be736d. This ties the file your Agent reads to that commit on GitHub. It does not review the instructions.

Last checked against GitHub yesterday.

Activeupdated 2 weeks ago
version
0.8.12
author
杨卫薪律师(微信ywxlaw)
homepage
https://github.com/cat-xierluo/legal-skills

README badge

README badge for cat-xierluo/legal-skills/legal-skill-evaluation