任务与后续升级
本文件是 moot-court 开发任务的权威入口,与源码一并版本化。DEFERRED 表示用户明确暂缓;DRAFT 表示升级方向,输入与范围确认后转为 READY;执行时标记 IN_PROGRESS,以实际验收证据闭环。用户当前明确指令优先于队列。
当前迭代
Task-018 · 固定通用民事闭环,转入 Runtime 验证
- 状态:DONE;日期:2026-09-19。
- 来源:用户明确先跑通原告、被告、法官与书记员的普通民事流程,暂不展开证人、鉴定人等角色,再验证不同Runtime。
- 目标:以固定的民事流程作为跨Runtime共同基准,书记员继续由主控承担;不把新增参与人或专门案件规则作为前置条件。
- 范围:默认入口、民事流程、结束标准、已有实际记录的环节覆盖复核、Runtime复现任务与后续队列;不修改CLI协议或重跑无关回归。
- 验收:默认流程具有明确的输入、角色、过程和三项交付;已有证据逐环节对应并注明缺项;其他Runtime使用同一输入与检查标准,能力预检和真实庭审运行分开记录。
- 固定通用民事主线与书记员职责。
- 核对已有10次真实发言的流程覆盖与剩余验证范围。
- 准备跨Runtime统一任务,调整后续顺序并记录本机入口能力。
覆盖复核与交接(2026-09-19)
本轮是流程规范、关闭语义及任务顺序调整;复核Task-016实际运行,未新做一次庭审或声称最终候选已重新前向验收。证据沿用其本机archive目录,不修改旧笔录与历史状态。
| 通用环节 | 已有实际证据 | 范围 |
|---|---|---|
| 庭前准备 | materials、preparation及双方真实调用 | 合成案卷,原告私有准备独立分包 |
| 开庭、请求与答辩 | seq3开庭;seq5原告提出10万元请求;seq7被告回应 | 请求答辩与首次举证质证合并,非缺少双方发言 |
| 争点整理 | seq3提出I-001,seq11依据双方回应继续整理 | 庭前已有单争点,未测试多请求排序 |
| 举证质证 | seq5提出材料,seq7质疑,seq9直接回应 | 相同材料与具体异议可回查 |
| 法官追问与辩论 | seq11追问,seq13被告解释,seq15原告回应并收窄观点 | 证据推理与问答合并,未核验法源,不冒称完成法律适用辩论 |
| 总结与归纳 | seq17原告、seq19被告、seq21法官 | 均有独立正式发言 |
| 庭后交付 | transcript、争点攻防复盘、庭前补强清单;父Agent复核 | 三项成果存在并已亲读,缺口与执行问题分开 |
- 结论:已有实际记录支持单争点通用民事训练闭环,不证明整案全部请求、法定环节或多Runtime运行。可用同一材料进入Task-011;无需先扩展参与人。
- 关闭澄清:旧记录依旧规则使用incomplete,历史不改写;当前文档明确按约定环节是否完成选择close,不能仅因证据缺口或恰好用满预算判流程没跑通。脚本与字段未改。
- Runtime入口预检:Claude Code 2.1.237的
--version及--help正常返回,确认有非交互入口和子任务相关选项;未执行该宿主庭审。Gemini CLI安装包版本0.29.0(package.json),本机--version长时间未返回,已中止(退出130),后续帮助未取得;原因未确认,未把包版本当可运行证明。没有修改平台配置或安装软件。 - 下一执行项:Task-011,优先Claude Code,再定位Gemini入口问题;成功标准是实际子任务与庭审产物,不是模型读完Skill后自报可用。见references/runtime-validation.md的同一输入、预算及复核标准。
- 验证:复核10个speech事件和庭前/庭后产物存在;相对引用、末尾换行、git diff --check通过。本轮未改CLI,未重复17项协议回归;Task-016的候选签名不覆盖本轮新文档,跨Runtime实测和稳定性仍NOT_VERIFIED。
- 本地Git归档:用户随后明确要求先本地提交。范围为Task-016/018的v1.2.0技能文件与README对应索引,提交标识由Git历史提供;本机archive及其他技能工作区改动不纳入,不执行远端推送或发布。提交前重新检查差异、引用、格式及敏感关键词,未发现凭证。
Task-016 · 中外模拟法庭研究与跨 Runtime 庭审方法
- 状态:DONE;日期:2026-09-19。
- 来源:用户要求全面研究国内外模拟法庭,围绕真实控辩、轮次衔接、差异化信息和不同 Runtime 完善技能。
- 目标:区分竞赛论辩、证据审理与真实案件预演;把有来源的方法落实为程序选择、发言闭环、角色认知边界及能力适配规范。
- 范围:官方规则与宿主文档研究、技能主流程与 references、任务/决策/变更及 README 必要索引;根据已验证缺口决定是否调整工具。
- 非目标:声称复现所有法域程序、混用各赛事证据规则、虚构跨 Runtime 动态测试、自动安装运行平台或发布。
- 验收:来源与适用范围可回查;有限会话也能形成顺序回应;已公开材料与私有策略分开;有现实请求的独立前向测试并检查产物;未支持的角色及未实测 Runtime 明示。
- 完成中外方法与 Runtime 能力研究,定位当前缺口。
- 沉淀流程、通信与信息规则,更新角色模板与复核标准。
- 完成静态检查与有界前向测试,记录剩余验证范围。
验收记录(2026-09-19)
- 方法来源:研究报告保留13项官方规则、诉讼程序、宿主文档及研究论文来源和适用范围;国内完整流程以可读取的高校规则原文为历史方法参照,不用验证码附件摘要或失效链接补推规则。
- 协议回归:
python3 -B skills/moot-court/scripts/test_clerk.py,17/17通过;新增历史争点/阶段、恢复等值、笔录展示及私有调度提示不传播的真实CLI检查。没有变更原speech字段或事件版本。 - 前向执行:当前Codex宿主、macOS、合成民事案卷;独立主控无旧上下文读取技能,双方准备后,每次正式发言新建角色实例。10次正式发言、10个不同实例,两轮交流;speech为seq3至21的奇数,关闭seq22、active=null。按预算和材料范围使用
close --incomplete:专项演练完成,未声称完整庭审或交付验收事实已证明。 - 父Agent独立检查:逐份核对全部packet、submission、正式事件和调用索引;公开历史及必答事件完整,角色材料范围正确,历史context对应原派发,提交正文未被主控改写。亲读笔录、复盘、补强清单,未见私有拟取证线索变成公开证言或法官问题。共享磁盘仅逻辑隔离,未据此证明工具权限封锁。
- 连续讨论证据:seq7被告提出“相容不等于对应”,seq9原告回答,seq11法官处理并追问,seq13被告认可有限线索价值,seq15原告自行收窄对象联系措辞;双方总结后seq21归纳未决材料问题。没有把收到问题后的承认缺口误作角色超时或漏答。
- 观察与修订:首次init把已存输入的根目录作为运行目录,退出2拒绝覆盖;改用全新hearing子目录后正常执行。测试结束后在clerk-protocol补充空目录及前置材料位置说明,属于入口文档澄清。角色输入包含整份公开职责模板,已披露;本次未证明按角色裁剪到最小上下文。
- 候选边界:实际正文读取/执行文件在前向开始和结束时摘要相同;研究报告和evaluation只做摘要覆盖、未读正文,其间有编辑。上述init说明与本任务验收记录在前向结束后更新,不把该次演练描述成最终全部文件的多轮验收。最终协议候选另由harness快照及verify输出绑定。
- 静态检查:Python/JSON解析、相对链接、单换行、许可证联系信息、版本与README索引、差异检查通过。安全扫描0 critical/high;测试subprocess及临时文件清理提示已审查。harness静态审查零finding。官方quick_validate仍不接受项目要求的author/homepage/version,保留原字段;临时去三字段投影通过,不称原文件直接通过。
- 稳定性assess退出2,
NOT_VERIFIED:缺机器约束合同及至少三轮绑定证据(ISG-001/003/004/005);ISG-002把“render/正文”等触发成视觉约束,不能据此断言法律技能有图面错误。真实案卷、刑事多Agent、其他Runtime/系统、异常恢复的本轮动态路径、完整参与人、强隔离与多轮稳定性仍待分别验证。 - 本机完整证据保存在技能忽略目录
archive/2026-09-19-v1.2.0-validation/:forward含原始输入输出及起终摘要,review含父Agent核对与门禁实际输出;仅合成材料,不随公开Skill分发。归档保留原运行绝对路径,复查时按归档forward目录映射。后续任务见Task-017、011、010、005等,不将方向性文档当实测完成。
Task-009 · 开发文档整理与本地提交
- 状态:DONE;日期:2026-09-18。
- 来源:用户要求提交本次迭代,保留技能内部决策、任务、变更记录及未来升级方向。
- 范围:本技能源码、开发文档、README 对应索引与
.gitignore精确例外;其他技能改动保留在工作区。 - 非目标:远端推送、发布渠道同步、执行下方升级队列。
- 将任务与决策文档纳入版本管理;本机验证流水保留在本地忽略目录。
- 明确历史决策替代关系和未来任务依赖、验收、优先级。
- 检查差异、公开文件与回归结果;以本次聚焦的本地提交归档(提交标识见 Git 历史)。
- 验收:提交前重新运行 16 项 CLI 回归全部通过;暂存范围、三份文档纳入、相对引用、解析、换行、README 最近 8 条及敏感内容检查通过。仅包含本技能与必要索引/忽略例外;无远端推送或渠道发布。
Task-008 · v1.1.0 自动模拟庭审与书记员协议
- 状态:DONE;日期:2026-09-18。
- 主结果:默认自动分派法官与双方角色,以书记员文件协议交换发言,不依赖 Subagent 直接通信。
- 范围:主文档、角色与民刑流程、标准库记录工具、合成案卷、CLI 回归和交付模板。
- 非目标:常驻服务、宿主 Agent 启动器、跨机器自动同步、裁判预测或未经验证的跨平台兼容承诺。
- 定义角色职责与公开/私有材料范围,撤销故意弱化角色。
- 实现单写者事件、版本化派发、提交校验、去重、取消重派、派生状态恢复及笔录生成。
- 完成协议回归和一次无旧上下文的民事多 Agent 前向演练,亲自核对产物。
- 更新技能文档、版本与 README;后续提交按 Task-009 的新授权处理。
验收记录(2026-09-18)
- 环境:macOS、Python 3.14.6。复现命令(仓库根目录):
python3 -B skills/moot-court/scripts/test_clerk.py,16/16 通过。覆盖民刑角色、身份及版本、同稿重试、冲突稿、私有材料过滤与引用拒绝、半写稿、取消重派、并发互斥、事件损坏、状态重建和关闭预算。 - 独立协议审查:真实 CLI 探针覆盖锁竞争、持锁进程退出恢复、材料更新/新回合/关闭后重试旧稿、布尔版本拒绝及缓存重建;主控读取并亲自重跑通过。确认 hash 链不能独立发现完整尾部丢失或目录回滚,文档已限制恢复承诺。
- 前向演练:合成民事案卷,三个无旧上下文的独立角色 Agent,另设独立复核;8 次正式发言,关闭事件 seq18。主控检查 closed、active=null,逐份核对 packet—submission—event,并阅读笔录、复盘和补强清单。私有材料仅进入指定角色包,未见拟取证事项升级为既成事实。
- 观察到的失败及修订:法官 citations 首次返回对象数组而被拒收,原角色改为字符串数组后入卷;角色模板明确格式并补回归。未将技术失败计作律师补证事项。
- 静态检查:Python/JSON 解析、相对引用、文件末尾换行、版本/许可证和主文长度通过;安全扫描无 critical/high,本地测试 subprocess 与临时文件清理提示已人工复核;harness 静态检查零 finding。
- 官方 quick_validate 不接受项目扩展字段 author/homepage/version;保留项目规定字段。去掉三字段的临时投影通过,不等同原始文件直接通过。
- 实现候选的协议绑定门禁已通过,覆盖 16 项 CLI 回归、源码树运行目录拒绝及零预算拒绝。该证据绑定当时文件内容;后续文档整理不能沿用该签名声称最终候选全部验收。
- 验证边界:前向演练期间按观察修订了角色模板和协议说明,未对最终全部文档重做多轮前向测试。真实案卷、刑事多 Agent、其他 Runtime/操作系统、用户停等与多轮稳定性均为
NOT_VERIFIED。不声称DOMAIN_VERIFIED或INSTRUCTION_STABILITY_VERIFIED。 - 稳定性 assess 退出码 2:缺少机器约束合同与多轮签名证据(ISG-001/003/004/005);ISG-002 将正文等措辞触发为视觉规则,需按适用范围处理,不通过改写业务表述规避。
后续升级队列
当前主线:Task-018 固定通用民事基准 → Task-011 在不同真实Runtime复现。真实案卷、刑事、证人/鉴定人和其他专门扩展不是跨Runtime验证的前置条件;除READY项外,均须按完整任务卡确定输入后再执行。
| 优先级 | 任务 | 方向 | 状态 |
|---|---|---|---|
| P1 | Task-011 | 同一通用民事基准的跨 Runtime 实测 | IN_PROGRESS |
| P1 | Task-005 | 基准流程的多轮稳定性与约束追踪 | DRAFT |
| P2 | Task-001 | 真实脱敏案卷全流程验证 | DRAFT |
| P2 | Task-003 | 应诉方向与单方材料验证 | DRAFT |
| P2 | Task-010 | 刑事多角色前向验证 | DRAFT |
| P2 | Task-002 | 用户亲自参与与停等恢复 | DRAFT |
| P2 | Task-012 | 长案卷与增量材料包 | DRAFT |
| P2 | Task-019 | WorkBuddy、千问办公等办公类 Agent Runtime 实测 | DRAFT |
| P2 | Task-004 | 二审流程适配 | DRAFT |
| P2 | Task-013 | 多方当事人、反诉与角色扩展 | DRAFT |
| P2 | Task-014 | 角色权限与私有信息保护 | DRAFT |
| P2 | Task-015 | 数据丢失检测与可信恢复 | DRAFT |
| 暂缓 | Task-017 | 证人、鉴定人与刑事被告人角色协议 | DEFERRED |
Task-001 · 真实脱敏案卷全流程验证
- 目标:验证材料整理、自动攻防、庭后复盘能否形成可执行的庭前准备。
- 输入/依赖:获准用于测试的脱敏案卷、明确请求与我方身份、可回查材料及专业复核人;不把案卷提交到源码库。
- 验收:主要争点覆盖有据,发言和补强动作回指真实材料与事件;逐项复核事实/主张/假设区分、依据适用和行动可执行性,记录遗漏与修订后的重跑。
- 非目标:用一案推断普遍法律正确性或真实胜诉概率。
Task-003 · 应诉方向与单方材料验证
- 目标:检验仅有被告材料时,对方主张假设、反向要件审查与质证是否保持边界。
- 输入/依赖:脱敏应诉材料及已知起诉请求;优先复用 Task-001 的验证框架。
- 验收:未知对方事实明确标记;质证落到具体材料,未提供反证不自动判失败;新增对方材料后重开受影响争点并保留旧版本。
- 非目标:为缺失的对方卷宗编造证据。
Task-010 · 刑事多角色前向验证
- 目标:让法官、控方和辩方真实完成有界攻防,补足本版仅有刑事配置回归的缺口。
- 输入/依赖:先用合成案卷,标明演练阶段、指控、证据范围;涉及法律判断时核验依据并安排专业复核。
- 验收:独立角色完成举证质证、争点辩论和归纳,区分事实、程序与量刑问题;检查公开/私有边界、必答问题、关闭状态及三份交付物。
- 非目标:由民事演练结果推断刑事流程已验收。
Task-011 · 跨 Runtime 适配实测
- 状态:IN_PROGRESS;优先级:P1。执行入口:统一验证任务。
- 前置:Task-018的通用民事流程;复用assets/civil-case.example.json,当前Codex记录作为对照。当前优先完成Claude Code验证;Gemini CLI保留已有入口结果,不继续投入。办公类Agent Runtime另见Task-019。
- 目标:在至少两个实际 Runtime 上验证可续接角色、一次性子任务、主控搬运材料等可用路径。
- 输入/依赖:可用宿主、能力清单、同一合成案卷与检查脚本;缺少的能力如实列出。
- 验收:记录宿主/版本/模式、实际调用和产物;角色重建后能回应指定事件,取消与重派不收过期稿;无 Subagent 或无 Python 时正确披露降级。
- 非目标:把文件协议描述当作平台兼容证据,或依赖某平台内部 mailbox 格式。
分级实测记录(2026-09-20)
- 候选与范围:以v1.2.0已提交候选和
assets/civil-case.example.json为完整任务输入;另用固定短答、单Agent、单文件和四发言缩减合同逐级定位Runtime能力。全部为合成材料,产物保存在忽略目录archive/2026-09-20-runtime-validation/,未修改平台全局设置。 - Claude Code 2.1.237:模型入口、Agent工具与Write探针通过。四发言短闭环由4个不同冷启动Agent顺序完成,真实调用与会话标识保存在本机忽略目录,结果文件由主控落盘;调试记录证明前一Agent完成后才启动下一次。
- Claude语义复核:原告曾把主体不明的“东西先放仓库”扩大为设备实际入库,被告把无验收记录扩大为验收从未发生;法官未据此裁判并区分已回应与已证明。该短闭环只证明顺序编排和落盘能力,不能证明完整角色合同、书记员协议或领域正确性。
- Claude完整任务:两次实际读取候选后停滞,分别约159秒、232秒后中止;无正式庭审产物、无权限拒绝。另一次10轮缩减任务在约142秒内未产生工具调用。结果为
full_skill=NOT_VERIFIED,不能据此认定Skill不兼容。 - Gemini CLI:实际CLI自报0.25.2,顶层包文件为0.29.0,保留版本来源差异。参数解析和帮助可用;最小模型请求在默认模式持续90秒无输出,调试重试超过60秒仍无输出,均主动中止。结果为
argument_parser=PASS、model_entry=BLOCKED_OR_STALLED、agent=NOT_RUN、full_skill=NOT_RUN;未创建项目代理配置。 - 状态:Task保持
IN_PROGRESS。当前只有Codex宿主完成既有完整民事记录;Claude Code停在短闭环,Gemini已有结果停在模型入口,尚未满足“至少两个实际Runtime完整闭环”、异常恢复与三项交付验收。下一次优先按分级门禁续测Claude Code,不再推进Gemini。
Task-019 · 办公类 Agent Runtime 实测
- 状态:DRAFT;优先级:P2。候选包括WorkBuddy、千问办公等带文档/任务能力的办公类Agent,具体产品名称与版本在执行前确认。
- 目标:验证缺少通用终端、Python或原生Subagent工具的办公型宿主,能否依靠其实际任务、会话、文档和文件能力组织通用民事闭环,并如实披露单Agent分角色或主控搬运等降级路径。
- 输入/依赖:先完成Task-011的Claude Code主路径;取得可用测试账号或本机入口、当前能力说明和用户授权的合成材料空间。统一使用
assets/civil-case.example.json,不导入真实客户材料。 - 验收:至少在WorkBuddy与一个千问办公类产品上分别记录G0—G5结果;核对角色是否真正独立、后发言是否收到前文、公开/私有材料如何传递、产物能否导出。没有Subagent时明确标为单Agent演练,不计入独立多Agent闭环。
- 非目标:为测试自动安装产品、修改账号或组织级设置、上传真实案卷,或因界面存在多个角色名称就声称多个Agent已相互讨论。
Task-005 · 多轮稳定性与约束追踪
- 目标:建立机器可追踪约束与独立多轮证据,复查 instruction_stability_gate。
- 输入/依赖:确定候选版本、约束合同和评估标准;民事、刑事等范围先经对应前向任务验证。
- 验收:至少三轮无旧上下文演练,各自保留实际产物、候选对应关系和独立复核;消除适用的门禁缺项,对不适用规则给出依据;失败修订后重跑受影响范围。
- 非目标:补字段或复用一次日志便宣称稳定通过;领域正确性仍单独复核。
Task-002 · 用户亲自参与与停等恢复
- 目标:用户接管指定角色时,系统正确等待、续接并区分真实应答问题与 Agent 失误。
- 输入/依赖:用户明确选择参与角色与范围、可控演练材料。
- 验收:用户发言前不代答,不推进依赖该回答的回合;暂停后从原派发恢复,原话入卷;用户退出后按明确指令切换模式并记录。
- 非目标:以等待超时推断用户承认事实或无法反驳。
Task-012 · 长案卷与增量材料包
- 目标:减少重复传输,保留争点所需原文和来源,支持较长演练。
- 输入/依赖:先测当前材料包大小、上下文成本和遗漏,再选压缩/增量策略;保留完整权威事件。
- 验收:冷启动与续接均能读取所需版本和必答发言;摘要回指原文,私有内容不过界;以相同案卷比较成本、遗漏与回应质量。
- 非目标:用摘要覆盖原始证据或以更小材料包牺牲关键反方材料。
Task-004 · 二审流程适配
- 目标:围绕一审认定、法律适用、上诉范围与新材料组织演练。
- 输入/依赖:一审裁判、上诉请求与材料、适用程序规则及专业复核。
- 验收:逐争点对应上诉理由和一审处理,角色/阶段/输出均有明确合同,完成独立前向演练后再声明支持。
- 非目标:仅改角色名称即当作二审适配。
Task-013 · 多方当事人、反诉与角色扩展
- 目标:突破固定三角色配置,明确多方请求、利益冲突、发言顺序与可见范围。
- 输入/依赖:选择一个具体场景,先设计角色注册与程序范围;与 Task-004 分开验收。
- 验收:至少一个多方合成案件完成真实演练;角色身份、材料可见性、必答集合、关闭条件和笔录归属都有回归与语义复核。
- 非目标:一次覆盖所有诉讼参与人类型或开发通用 Agent 平台。
Task-014 · 角色权限与私有信息保护
- 目标:在支持权限限制的宿主上验证真正的文件/工具访问隔离,补充私有内容语义泄漏检查。
- 输入/依赖:宿主权限能力、明确需保护的材料类别及合成测试信息。
- 验收:角色直接访问其他角色目录/内部事件被拒绝;改写泄漏探针由独立复核检查;不支持的宿主仍明确标记逻辑隔离。
- 非目标:把目录划分或模型自报当作安全沙箱证明。
Task-015 · 数据丢失检测与可信恢复
- 目标:识别完整事件尾部丢失和目录回滚,建立与风险相称的恢复机制。
- 输入/依赖:复现现有边界,明确故障模型及可信外部检查点/备份存放条件。
- 验收:尾部删除、整目录回滚和提交中断分别测试;发现不一致时停止自动续跑;恢复后无重复入卷,并保留失败证据。
- 非目标:仅靠同目录 hash 链承诺防回滚,或直接扩展成分布式数据库。
Task-017 · 完整庭审参与人及询问协议
- 状态:DEFERRED;来源:Task-016 方法研究;2026-09-19用户明确暂不展开。本任务不阻塞通用民事闭环或Runtime验证,待用户重新要求扩展时恢复。
- 目标:区分代理人/辩护人、当事人/被告人、证人、鉴定人,支持有限知识下的逐问逐答、异议处理与适用的最后陈述。
- 输入/依赖:先选一个具体法域与程序、准备有来源的角色事实卡和公开/私有范围;不能预设所有法域都采用美式主询问/交叉询问。
- 范围:可扩展角色注册、派发身份校验、各角色阅读范围、发言许可及阶段转换;与 Task-013 多方诉讼利益关系分别设计。
- 验收:正例验证证人只按其知识卡回答、律师与被告人身份分离、异议后恢复正确提问位置、最后陈述属于正确角色;反例覆盖替他人回答、看过全案后伪装失忆、案卷外答案与超范围追问。真实前向测试后才声明支持完整目标程序。
- 非目标:通过编造证言提高真实感,或把角色数量增加当程序已经完备。
规划历史
- Task-006(DONE,2026-09-18):完成定位与撰写规划;用户确认基于现有材料自动分派法官、原被告或控辩。实现随后由 Task-008 承接。
- Task-007(DONE,2026-09-18):完成书记员中转规划,区分记录持久化和宿主唤醒;通过限定材料包、提交稿及单写者事件衔接角色。架构取舍见 DEC-005,实现由 Task-008 承接。