开发验证与合成样例
样例完全虚构,不构成真实案件或法律结论。运行产物放到 Skill 目录外的临时目录,证据路径与实际命令记录到开发 TASKS.md。
协议回归
python3 scripts/test_clerk.py测试通过真实 CLI 子进程检查:民刑三角色、发言关联、重复提交不重复入卷、不同内容冲突、错身份/旧版本/缺少必答拒绝、私有引用拒绝与材料包过滤、半写 JSON、材料更新、取消重派、运行关闭、事件损坏检测和派生状态重建。它不测试法律正确性或模型语义。
无旧上下文的前向评估
向独立评估 Agent 提供本 Skill 路径、下列任务及对应原始合成材料,不提供预期答案或已发现缺陷:
使用 moot-court,基于指定合成材料自动完成一次简短模拟庭审,围绕一个核心争点完成双方一次往返、法官追问和双方回应。总正式发言不超过 8 次。使用独立角色子任务,保存真实发言、书记员记录、复盘和补强清单。只讨论现有事实与材料,不联网、不补充未核验法律规则。产物写入指定临时目录,不修改 Skill 源码。
分别使用 民事样例 与 刑事样例。民事包含单方私有准备信息;刑事缺少完整法源与卷宗。另测单方材料、矛盾材料与用户加入角色的停等行为,未执行的场景明确保留 NOT_VERIFIED。
主控检查真实产物:是否实际派发独立角色,后发言是否回应前文,来源是否支持表述,私有内容是否误入公开记录,缺少材料是否如实保留,复盘是否回指事件。父 Agent 或专业复核者独立检查,不以评估 Agent 自报完成替代。
最小反例与合法近似例
- 违规:packet 只列公开材料,角色从其他目录读到内部策略后改写到正文;合法:仅凭公开证据独立提出相同质疑。不能只靠文字相似判泄漏。
- 违规:正确填了 responds_to,但正文没有回应那个问题;合法:明确指出问题所需材料缺失并解释当前不能回答的边界。
- 违规:引用 D-003 却声称其有签收签名;合法:指出 D-003 签收栏空白,同时引用其他公开材料论证交付可能性。
- 违规:角色超时后将“不能反驳”计为对方优势;合法:材料本身缺少支撑且角色直接承认当前不能证明。
这些语义反例需独立审阅实际产物;引用编号校验不能捕获伪造内容,也不能证明语义稳定。
证据范围
每次记录候选文件摘要、命令退出码、产物路径与人工检查位置。单轮合成案例仅证明该次路径可运行。未完成候选绑定门禁、至少三轮同输入及外部约束证据前,不声明跨 Runtime 稳定或多轮不漂移;未由领域验证者复核,不声明 DOMAIN_VERIFIED。
v1.2.0 连续讨论与 Runtime 路径
前向评估先固定一种真实可执行模式,避免把多个路径混成一个 PASS:
- 续接式:同一角色实例多次接收新 packet,核对后发言是否看到了新增公开事件。
- 一次性式:每次正式发言使用新实例,只提供角色合同、packet、共同程序与本方备忘录;不得续接或互发消息。检查逻辑角色与立场延续,不以实例数量判断角色数量。
- 主控搬运式:角色不读主控目录,完整输入输出由主控传递。仅在确有工具限制时声称无文件访问;提示“不要读”只证明逻辑约束。
观察范围:针对同一争点的主张、质证、回应与主持处理能否回查;角色拿到相反公开材料后是否处理;出现未决问题是否安排回答或如实保留。问题标签与证据状态由语义审查确认,不冒称 clerk 自动强制。
增加反例:公开信息未送达却被认定为漏答;修改 manifest 后继续复用看过私有资料的角色;法官从私有策略得知问题;把证人回答记录为律师发言;最终陈述没有给正确诉讼身份;新材料提出后对方未获回应机会。合法近似例:双方充分回应但仍不一致;角色按材料缺口拒绝推断;仅展示既有证言且明确未做现场询问。
协议新增回归:history 与 transcript 保留原 issue/stage,原 speech 正文不变,其他角色私有 dispatch.prompt 不进入历史与笔录。候选版本、各角色调用与实际产物逐份绑定。当前宿主限制成一次性路径的演练,不是其他 Runtime 的动态测试。
当前主线
通用民事闭环固定后,按跨Runtime统一任务继续。逐环节检查真实记录,并分别记录流程是否完成、事实是否仍待查;不得因为有实体分歧就判定调度失败。证人、鉴定人暂缓,不作为本轮验收前置条件。