任务清单
当前任务:建立弱模型课程生成评测资产
- 在 Skill 内建立独立语义质量合同,固定硬失败、70 分任务质量和版本晋级条件。
- 决定真实课程和历轮产物进入私有评测仓库,不复制到公开 Skill。
- 建立
course-generator-weak-model-260904评测资产目录和旧轮次哈希索引。 - 建立
course-generator-course-fidelityDataset 登记入口,未满足发布条件前保持无正式 release。 - 由用户校准三门真实课程的“必须保留、允许压缩、不得加强”要求卡。
- 新增至少一门未参与修改的课程作为隐藏测试样本,并确定数据授权与保留策略。
- 对现有候选补录统一评分;不能从旧报告确认的字段保持
NOT_VERIFIED。 - 完成校准后,以串行 canary 启动下一轮弱模型验证;硬失败立即停止,不并行消耗额度。
涌现任务:降低强弱模型的执行成本与过门禁写作
背景:2026-09-11 使用冻结的 v2.10.13 候选,从华商律所 4 份转录稿和云南省检 1 份转录稿各完成一套全量课程。两轮最终均达到机械门禁 15/15,但强模型执行期间仍需在 Skill 外编写 build_ledger_batch.py,并多次人工修补覆盖词、来源锚点、章节深度和正文证据。现状证明门禁已经能约束结果,却还没有把执行器稳定带到结果;弱模型更容易在这些机械环节漂移或浪费额度。
证据位置:
- 运行输入与中间资产:知识整理目录的
.course-generator-work/huashang/、.course-generator-work/yunnan/、failed-ledger-v1/、failed-ledger-v2/。 - 成功回执:
.course-generator-work/huashang/run-result-v3.json、.course-generator-work/yunnan/run-result-v3.json。 - 成功课程:
260627 华商律所(乌鲁木齐)- 从三大基建到 Skill 护城河(新版候选)/、260716 法律人必备 AI 核心技能 - 云南省检(新版候选)/。
P0:先修确定性缺口
- 为来源分片、相邻块预览、重复识别、素材 ID 分配和 ledger 初稿提供 Skill 内置命令;生成器应给出可审阅草稿,不替代 Agent 的语义取舍。
- 改进覆盖词和来源锚点候选器:拒绝代词、数字、残句、口语起手式及与对应块不匹配的跨块词;候选必须附原文上下文和命中位置。
- 修复图片选择理由在
image-selection.json中存在、进入chapter-packet.json后变为null的字段传递问题,并增加回归测试。 - 增加状态驱动的
next/driver 入口,每次输出当前状态、唯一下一步、所需输入、预期产物和失败恢复方式;不自动代写语义正文。
P1:降低门禁诱导的内容失真
- 重新评估
CG-READER-DEPTH的单一字符硬阈值:保留反薄写能力,同时避免章节只差 2—13 字时诱导无信息补写;候选方案需以信息覆盖、段落展开或有界容差作对照实验。 - 重新设计
CG-READER-EVIDENCE的唯一段落绑定:评估句子/字符区间级证据,或有界多素材共享段落,避免为满足唯一性重复铺陈。 - 让
CG-CLAIM-FIDELITY区分“转述来源事实”和“作者给出的操作建议”;对孤立的“常见”“标准做法”等泛化词优先给上下文警告,只有实质性来源外加强才硬失败。 - 提供结构化章节填充/渲染命令,原子写入已声明的 H2、正文和图片,防止执行器重复脚手架标题、漏标题或错置图片。
- 在最终回执中生成独立的语义复核清单,至少覆盖跨章连贯性、独有洞察保留、事实强度、图片视觉价值和个人表达风格;机械通过不得自动等同于可正式发布。
验收边界
- 新实现通过全量自测、
skill-lint、安全检查和既有失败夹具重放,不削弱当前 15 项机械约束。 - 强模型在一门长课与一门短课上完成前向运行,不编写 Skill 外临时辅助脚本,不手改 manifest、收据或验证结果,且确定性结构修复不超过 1 次。
- 冻结候选后,再用弱模型对未参与本轮设计的长、短课程各完成至少 1 个有效运行;记录工具调用数、人工干预数、失败类型、机械结果和语义评分,不以配额中断轮次计质量。
- 图片理由完整传入全部章节包;低质量锚点/覆盖词夹具前置失败;深度与证据规则不得通过无信息扩写获得合格。