通用民事基准的跨 Runtime 验证
先读民事闭环,在不同真实宿主使用同一候选、案卷与目标。当前目标是让现有原告、被告、法官加书记员流程应用起来;证人、鉴定人、刑事专门环节和新案由不是前置任务。
固定输入与范围
- 候选:本次SKILL.md及实际使用的references、clerk脚本,记录版本和文件摘要。
- 案卷:合成民事材料,不更改公开/私有范围、不添加真实客户资料;所有宿主用同一份原始材料。
- 流程:庭前准备、开庭与请求答辩、争点整理、举证质证、追问辩论、双方总结与法官归纳、三项交付。限定同一交付及验收争点,案卷事实与法律结论分开。
- 预算:每次至多16次正式派发、每争点至多两次交流;这是统一测试上限,不要求用满,不覆盖技能默认总预算。
- 产物:Skill源码之外的新目录;正常输出笔录、复盘、补强清单,并保留材料包、提交稿、正式事件与真实调用索引。
按分级门禁验证,不从长任务起步
在新的临时目录逐级执行。上一阶段未通过时停止,不把后续阶段标为失败,也不继续消耗完整庭审预算。
| 阶段 | 最小动作 | 通过证据 | 未通过时记录 |
|---|---|---|---|
| G0 命令入口 | 取得CLI/宿主自报版本,验证参数解析及帮助 | 真实入口、版本和可用模式可回查 | 安装包版本与CLI自报不一致时都保留,以实际入口自报为准 |
| G1 模型响应 | 在默认安全模式发出只需固定短答的请求 | 有完整模型回复、退出状态和会话标识 | 登录、网络、路由、配额、无输出或超时;不归因于本Skill |
| G2 子任务 | 主控创建一个无旧上下文的角色,让其返回固定短答 | 真实子任务调用标识、完整返回及先后关系 | 工具不存在、权限拒绝、调用停滞或只在主控内模拟 |
| G3 持久化 | 写入一个固定内容的小文件并由主控逐字节复核 | 文件位置、内容和实际写入工具 | 无文件能力时记录主控搬运方案,不冒称脚本落盘已通过 |
| G4 四发言短闭环 | 法官提问→原告回答→被告针对回应→法官归纳,四次顺序冷启动;最后落盘结构化结果 | 四个真实调用、每次完成后才启动下一次、后发言引用前文、结果文件 | 调度、顺序回应、事实扩大和角色越界分别记录 |
| G5 完整民事闭环 | 执行下方统一任务,使用本候选、书记员记录与合成案卷 | civil-hearing七环节、正式事件、调用索引及三项交付均经独立复核 | 缺失环节、运行故障、材料缺口和语义问题分开 |
G4只证明该Runtime具备顺序多Agent编排与结果持久化能力,不证明完整Skill遵循、信息隔离、书记员协议或法律领域正确性。只有G5通过,才可称该候选在该Runtime完成一次完整闭环。阶段性结果用PASS、PASS_WITH_FINDINGS、BLOCKED_OR_STALLED、NOT_RUN、NOT_VERIFIED分别记录,不用单一“兼容/不兼容”覆盖证据边界。
每个简单探针预先设置有界等待。若G1在60至90秒内没有任何模型输出或可解释进展,停止本次入口测试;长任务则观察真实工具事件和文件进展,连续两次有界尝试都没有首个有效动作时停止并保留调试记录。G4、G5可能耗时较长,已有真实进展时不要仅按总时长判失败。
执行时还须遵守以下条件:
- 先读本机帮助,不用另一个产品的参数套用;子任务名称和底层模型名称不能单独证明换了Runtime。
- 确认当前会话能创建子任务、等待并取得完整结果;可续接则续接,否则按一次性方式重建角色。
- 保留现有授权与工具限制;不为验收自动安装平台、修改全局设置或绕过审批。入口问题与庭审协议问题分开。
- 每次测试只在一个真实Runtime内完成主控和角色编排;若跨产品混用,单独记录,不能称该Runtime独立跑通。
- G5只提供原始输入与技能,不提供上一宿主答案、短闭环答案或预期争论内容。
可直接交给宿主的任务
使用指定路径的moot-court技能和assets/civil-case.example.json,完成一次通用民事流程演练,范围限于交付及验收证据链。使用法官、原告、被告三个独立角色,由主控担任书记员。完成庭前准备、开庭与请求答辩、整理争点、举证质证、法官追问与双方辩论、双方总结、法官归纳和庭后交付。根据你当前真实工具能力选择角色续接或逐回合重建,不要求角色直接互相通信。正式派发不超过16次,两次交流回路;不联网补法、不编造案情、不扩展证人鉴定人。原告私有准备只送原告,其他角色接收完整公开案卷和已入卷历史。产物放指定的全新临时目录,禁止修改技能或其他项目文件。保留真实子任务调用与入卷对应、所用技能文件摘要,并交付笔录、争点复盘和补强清单;未能完成的步骤及宿主限制如实记录。
“指定路径”与“指定目录”由主控在真实派发前替换为宿主可访问的位置。跨机器传递时仅传技能候选和合成案卷,运行编号重新生成;不要复制其他宿主私有会话或凭证。
用同一标准复核
| 观察项 | 检查实际产物 |
|---|---|
| 角色与书记员 | 确有独立角色调用,身份和提交一致;书记员只派发入卷,不代写观点 |
| 完整流程 | 按civil-hearing的7环节逐项对应事件或庭前/庭后文件;允许合并动作,不允许用标题冒充已做 |
| 真正回应 | 后发言回应前文具体问题;公开历史与必答事件实际送达;不能只填responds_to |
| 信息边界 | 原告私有材料不进法官/被告包,不变成公开既定事实;说明逻辑隔离还是强制权限限制 |
| 收尾与交付 | 双方总结、法官归纳、三份成果对应;事实缺口、未覆盖环节与运行故障分开 |
| 故障与恢复 | 基本闭环成功后再独立测取消重派、恢复等;不把首次正常演练当异常路径通过 |
保存每宿主各阶段结果、执行模式、实际文件和独立复核;最后汇总到TASKS Task-011。只看过帮助、完成短探针或让模型评议Skill,不算该Runtime执行过完整庭审。
当前Codex的历史实测见Task-008/016/018,可作流程对照;2026-09-20的Claude Code与Gemini CLI分级实测见Task-011。源码或方法变动后按受影响范围重新验证,不沿用旧候选签名。其他Runtime未有实际产物前保持NOT_VERIFIED。