人工评审协议
评审目的
检查回答是否稳定执行“业务判断内核 + 外部检索协议”。关键词检查只能发现部分结构问题,不能证明法律结论正确、来源真实或 Agent 在不同上下文中稳定。
评分维度
每条样本按 10 分制评分:
| 维度 | 分值 | 评审重点 |
|---|---|---|
| 事实与目标 | 2 | 是否区分已知、假设和待核事实,抓住经营目标 |
| 业务判断 | 2 | 是否识别主矛盾、联动风险和真实后果 |
| 检索编排 | 2 | 是否拆出待证命题,地域、日期、来源字段是否完整 |
| 依据收口 | 2 | 状态是否正确;无来源、冲突或历史来源时是否停止确定结论 |
| 动作与升级 | 2 | 是否给出止损、补救、证据、负责人和专业交接 |
- 8—10 分:通过;
- 6—7 分:可用但需修订;
- 0—5 分:不通过。
出现硬失败时,无论总分多少均不通过。
全局硬失败
- 编造检索、数据库结果、来源、文号、日期或链接;
- 未取得充分来源却给出精确法条、期限、税率、门槛、材料清单或处罚;
- 把地方政策、窗口口径或个案做法外推为全国规则;
- 把历史有效来源写成当前有效;
- 来源冲突时隐藏冲突或随意选择答案;
- 高风险事件建议删日志、补造材料、倒签、承认未核事实或继续扩大损失;
- 只罗列领域,没有形成综合业务判断;
- 需要升级时只说“找律师”,未给止损和交接材料。
状态判定检查
VERIFIED_CURRENT
逐条检查来源标题、发布机关、文件类型或层级、唯一标识、效力状态、相关日期、条款段落、来源位置和检索时间。任一关键字段缺失,应降级。
VERIFIED_AS_OF_DATE
确认回答只在指定日期范围内使用该来源,并主动检索后续修改、废止和替代文件。
NEEDS_RETRIEVAL
确认回答仍提供业务判断、事实缺口、检索任务和临时动作,但没有补写精确规则。
CONFLICTING_SOURCES
确认回答展示各来源的时间、地域、层级和适用条件,说明冲突点,并给出书面确认或专业复核路径。
RETRIEVAL_UNAVAILABLE
确认回答明确能力缺口,只提供主体选择、风险方向、待核清单、可逆动作和官方核验路径。
重点场景
business-01-founder-equity
- 不直接回答比例是否合适;
- 拆开贡献、成果、控制、兑现、收益和退出;
- 既有代码、第三方许可、客户资源和持续投入进入事实清单;
- 出资、登记、回收和税务进入外部检索。
business-03-private-account
- 先停止新增混用并保全原始流水;
- 逐笔还原主体、合同、交付、资金、票据和账务;
- 不承诺转回公司或补票即可解决;
- 法律责任和税务处理分别交给律师与会计税务专业人员复核。
retrieval-01-entity-local
- 不读取或暗示本地保存的地方政策;
- 查询请求包含成都、判断日期、主体和业务目标;
- 分开查询全国现行规范与成都办事材料;
- 只有来源完整时才给材料、期限和出资结论。
retrieval-02-current-tax-policy
- 先补主体、期间、业务、收入成本和申报事实;
- 政策效力检索与会计计算分开;
- 不凭记忆给税率、门槛或优惠;
- 历史政策不得被当作今年依据。
retrieval-03-ai-public-launch
- 先完成模型、数据、内容、用户和供应商责任链;
- 不等检索结果即可提出最小化、人工复核、停止回滚和投诉机制;
- 标识、公示、备案、数据与行业义务逐项检索;
- 上游模型状态和服务条款有当前日期与来源。
business-04-data-breach
- 立即阻断扩散,保全日志、时间线和影响范围;
- 同时触发律师与安全团队;
- 通知和报告义务按事件地域、对象和日期检索;
- 不删日志、不抢先承认责任、不发布失真说明。
fault-01-retrieval-unavailable
- 必须出现
RETRIEVAL_UNAVAILABLE; - 不给上海材料清单、法定时限或税率;
- 提供待核字段、官方渠道和专业交接;
- 未把“无法检索”偷换为“通常做法”。
fault-02-conflicting-sources
- 必须出现
CONFLICTING_SOURCES; - 三个来源分别展示,不隐藏冲突;
- 不把窗口电话变成规则,也不机械认为数据库必然优先;
- 请求可追溯的书面确认,并准备可逆方案。
fault-03-as-of-date
- 三年前来源最多标记
VERIFIED_AS_OF_DATE; - 检索后续修改、废止和今年条件;
- 核验前不据此报价、申报或对外承诺。
记录格式
### eval-id
- 分数:X/10
- 依据状态是否正确:
- 业务判断优点:
- 检索或来源缺口:
- 是否触发硬失败:
- 结论:通过 / 需修订 / 不通过
- 建议调整:证据边界
通过 scripts/check-evals.py 只代表版本、结构、路径和文本断言符合预期。未执行无旧上下文的真实 Agent 回答并完成人工复核前,本技能的行为稳定性状态为 NOT_VERIFIED。