课程成品质量验收
本文件用于独立验收课程成品和比较 Skill 版本。生成者不得把评分项当作写作目录,也不得为了命中指标补写来源外内容。
一、先判断本轮是否有效
出现任一情形时,本轮不进入质量评分:
- 来源文件或冻结 Skill 快照在运行中发生变化。
- 生成者修改冻结快照、验收脚本或来源材料。
- 配额、网络或平台异常导致任务未正常完成。
- 课程正文由验收者补写、改写或代为收口。
- 任务提示、输入范围或输出要求与对照轮不一致。
无效运行保留为协议或基础设施失败证据,但不得计作 Skill 成败。
二、机械门禁
只有以下项目全部通过,才进入语义评分:
- 总览、全部章节、
source-index.json和course-manifest.json齐全。 - 账本预检、全部
check-chapter和最终verify.sh通过。 - 来源块、素材、目标小节、正文证据和图片关系可回溯。
- 输出目录没有临时文件、自建验收脚本、缓存或未声明读者文件。
机械通过只证明结构和证据契约成立,不证明内容已保留课程精华。
三、语义硬失败
出现任一项时直接判定不可交付,不用总分抵消:
- 编造来源没有的事实、能力、案例、流程或结论。
- 把“可能、好像、我记得、举例、设想”等不确定表达升级为确定事实。
- 遗漏或一句带过核心案例、真实操作链、失败修正、判断依据或关键结论。
- 把建议改成禁令,把风险降低写成彻底消除,把单一样本推广为行业惯例。
- 将疑似误识别的专名、数字、身份或断裂语句直接写成正文事实。
- 用重复、空泛扩写、审计说明或堆砌术语换取覆盖率、篇幅或证据数量。
- 正文出现素材编号、门禁解释、生成日志、逐字稿框架或明显转录残片。
- 权威修订与正文冲突,或旧口径重新进入读者正文。
四、任务质量评分
任务质量满分 70 分:
| 维度 | 分值 | 核心证据 |
|---|---|---|
| 精华与关键素材保留 | 20 | 核心案例、操作过程、失败修正、判断方法逐项对照来源 |
| 事实与语气忠实 | 18 | 数字、专名、建议强度、置信语气和权威修订抽查 |
| 细节与可复用性 | 12 | 读者能否复述动作顺序、适用条件、结果与注意事项 |
| 独立可读性与结构 | 10 | 无需原稿即可理解,章节组织服务内容而非转录顺序 |
| 书面表达质量 | 5 | 无 ASR 噪声、口语残片、重复句和悬空说明 |
| 反投机 | 5 | 没有靠堆字、拆素材、泛化或审计语言刷指标 |
每项必须给出来源位置、正文位置和扣分理由。没有证据时标记 NOT_VERIFIED,不得凭整体印象给满分。
五、版本晋级
版本可以进入候选晋级,须同时满足:
- 本轮有效,机械门禁全部通过,且没有语义硬失败。
- 任务质量不少于 60/70。
- 实验协议不少于 13/15,稳定性不少于 12/15,总分不少于 85/100。
- 同一冻结版本在至少两门真实课程上各完成三次独立运行;报告均值和标准差,供应商失败不计样本。
- 至少一份代表性完整课程经用户明确确认可用;未校准的模型评审不能替代用户判断。
- 已参与修改的课程只作为校准和回归样本;晋级还须使用未向修改者暴露的隐藏样本,或明确披露暂时缺少隐藏样本。
为控制成本,按顺序运行 canary:首份产物出现机械失败或语义硬失败时立即停止该版本,不继续并行消耗额度。