回归测试与验收标准
本 Rubric 用于评估 legal-qa-extractor 在不同咨询场景中的稳定性。
一、Hard Fail 条件
出现以下任一情况,直接判定为不通过:
- 泄露客户身份信息或企业可识别信息
- 重复扫描或处理已生成的
*_法律问答提取_*.md - 将原文不存在的法律结论写入主卡摘要
- 将两个明显不同的问题错误合并成一张主卡
- 将明显不完整的回答写成确定结论,且未标
待补充或待确认
二、评分维度
每个维度按 0 / 1 / 2 评分:
2= 稳定符合预期1= 基本可用,但存在可见瑕疵0= 明显失真或无法使用
1. 问题识别
- 2:主要法律问题全部识别,边界清晰
- 1:识别出主要问题,但漏掉次要问题或个别边界含糊
- 0:漏掉主要问题,或大量把非问题内容误判为问题
2. 同题归并
- 2:同一问题稳定合并,不重复建卡
- 1:大体合并正确,但个别追问处理不稳
- 0:频繁重复建卡或错误合并不同问题
3. 摘要忠实性
- 2:长摘要与要点都忠实、完整、不越权扩写
- 1:基本忠实,但有轻微压缩失衡或表达漂移
- 0:摘要明显加入原文没有的判断,或遗漏核心结论
4. 完整度与置信度标记
- 2:
完整 / 基本完整 / 待补充与正常 / 待确认使用稳定 - 1:偶有过严或过松,但整体可接受
- 0:边界模糊内容未被标记,或滥用标记导致结果失真
5. 双层标签稳定性
- 2:知识库标签与内容标签口径稳定、可解释
- 1:个别标签存在主观漂移,但不影响整体使用
- 0:标签混乱或与主卡内容明显不符
6. 批处理行为
- 2:扫描范围、排除逻辑、跳过策略均稳定
- 1:偶有误扫或跳过说明不充分
- 0:重复处理结果文件、误处理非文本或批处理行为不稳定
三、通过标准
- 无 Hard Fail
- 六项评分总分至少
10 / 12 - 其中“问题识别”“同题归并”“摘要忠实性”三项不能为 0
四、建议样本集
建议使用 assets/benchmarks/ 下的 8 类场景做回归:
01-single-issue.md02-multi-issue-switching.md03-same-issue-repeated.md04-follow-up-questions.md05-proactive-risk-reminder.md06-admin-heavy.md07-incomplete-answer.md08-batch-mixed-directory.md
五、记录模板
## 回归记录
- **样本**:
- **日期**:
- **问题识别**:0 / 1 / 2
- **同题归并**:0 / 1 / 2
- **摘要忠实性**:0 / 1 / 2
- **完整度与置信度**:0 / 1 / 2
- **双层标签稳定性**:0 / 1 / 2
- **批处理行为**:0 / 1 / 2
- **是否触发 Hard Fail**:否 / 是
- **结论**:通过 / 需调整
- **备注**: