课程大纲生成提示词
基于 index_sources.py 生成的完整来源索引、ledger_tool.py 建立的章/节计划、素材账本和必要原文片段,生成系统化课程大纲。短材料可以整体分析;长材料按有界批次处理。模型只判断素材语义和目标章/节,稳定 MAT-xxx / source refs / 图片编号由工具合并,不要求模型在一次回复里同时维护全局编号、哈希和全部原文。
核心要求
- 整体把握:理解所有内容的整体脉络和逻辑关系
- 主题识别:基于所有内容自动识别主要主题(不限于特定领域)
- 内容优化:
- 识别并保留重要观点、具体例子、重要表述
- 清洗冗余信息(如过度口语化表达、重复语句)
- 去除发言人标记和转播式来源归属(如"主讲人强调"、"主讲人指出"等);事实性内容直接陈述,个人判断、产品自评、事故转述和时间预测用“课程判断/案例描述/本次运行”保留证据边界,不得因删除讲者主语而升级成无条件客观事实
- 使用工具已建立的可追溯图片资产,只提交真正适合进入正文的代表图短清单
- 将口语化内容转换为专业书面语,直接陈述内容而非强调说话者
- 区分轻量摘要和书稿素材型整理:本任务采用书稿素材取向,应少压缩、多保留有思想密度的内容
- 先处理
source-index.authority:authority块是编校/修订声明,control块是控制口径,二者不建立普通素材。current 模式逐项读取corrections,为每个COR-xxx选择一个计划 H2,并按索引原顺序把每个superseded_candidate_block_ids判为superseded或retained_current,逐项写至少 12 字理由;不得漏审候选或把候选整体当作删除清单。直接陈述或支持旧口径的块写入该路由的superseded_source_block_ids;没有时明确记no_matching_source_block和检索依据。候选之外仍要检索同义旧结论。不要改写revised_text,也不要在章名、H2、素材摘要或总览中恢复deprecated_terms。被替代块只能用authority_superseded跳过,控制文档其他章节不扩成课程主题。historical 模式只在用户明确要求时使用,并把 plan 中的reader_notice原样写入总览
- 用户词典校正:
- 如果提供用户词典,将词典中的每一项视为正确术语
- 在转录内容中识别与词典术语高度相近、且上下文明确指向同一概念的误转写
- 将高置信误转写统一改为词典中的正确写法,保留词典中的大小写和空格
- 可校正大小写、空格、标点、音近/形近、英文术语被拆分或被转成中文近音等错误
- 模糊、低置信或上下文无法确认的内容不强行替换;明显语法断裂、专名/数字疑似误识别的片段不得照抄成课程事实。只有邻近原文能唯一确认时才作最小修正,否则将该异常部分从读者素材舍弃,必要时仅在审计说明中标为待核
- 专有名称保真:
- 对 Skill 名称、工具名、项目名、产品名、命令名、API、文件名、框架名等专有名称,保留原文语言、大小写、空格和连字符
- 原文或用户词典中明确出现英文名称时,不要翻译成中文;例如
Course Generator应保留为Course Generator,不要写作"课程生成器" - 可以在首次出现时用中文解释其功能,但专有名称本身必须保持英文原名
- 只有当原文和用户词典都使用中文官方名称时,才使用中文名称
- 高价值素材识别:
- 核心观点:能概括课程主张、判断标准、能力模型或行业趋势的内容
- 实践案例:真实项目、工具链、操作流程、业务场景和结果反馈
- 方法论:可迁移的方法框架、步骤、判断问题、工作流和任务拆解方式
- 取舍理由:为什么选择某个工具、模式、路径或不选择另一方案
- 踩坑经验:失败、中断、误识别、配置问题、成本问题、安全事故及其修正方式
- 反直觉判断:与常见认知不同、能体现个人经验或行业洞察的判断
- 可迁移表达:适合后续写书或文章复用的比喻、金句、概念命名和解释方式
- 真实疑惑:问答素材中反映一线使用者困惑、阻力、误区和实践取舍的问题
- 工具使用细节与判断技巧:工具的具体功能细节(如通义听悟的章节速览、PPT 智能截取、按发言人总结)、可迁移的判断技巧(如"用 PDF 阅读器试着选中文字,能选中就是双层 PDF")、具体的取舍判断(如"法院电子文书大多是双层,不必全跑 OCR")和个人工作习惯——这些是正文高价值素材,必须逐条识别为素材点,不得因去来源痕迹而把整节工具介绍或判断技巧归入跳过类别
- 每条高价值素材提交
source_block_ids、目标章节、目标二级标题,并用类型前缀标注:【案例】【操作】【观点】【金句】【踩坑】【取舍】【疑问】;稳定MAT-xxx与source_refs由ledger_tool.py merge自动补齐。一条素材承载一个读者可复用的信息单元,但不等于一个发言片段:通常合并 2—5 个相邻、同一教学点或同一连续操作阶段的块;只有新内容本身能独立讲清时才拆分,不因微步骤、插话或块边界建新素材,也不把同一标题下的整节压成一项 - include 素材最多合并 6 个相邻来源块,并预承诺 1—3 个
coverage_terms;数量至少为ceil(source_block_ids 数量 / 3)(最低 1、最高 3)。每个词必须能在该素材绑定的原始来源块中逐字找到,优先选步骤、结果、数字、限制或专名;不要求在摘要里逐字重复。merge返回候选时只复制完整、有辨识度的来源短语,不采用“我觉得”“比如说”“你像”“做一个新”等口语指代、语气词或截断片段,不得发明“范式阶梯”“四位一体”等抽象词后写回正文,也不得全用AI/Agent/Skill类通用词。章节生成阶段按类型决定展开深度——案例、操作、踩坑类完整展开,观点类保持简洁;来源块数量只决定审计颗粒度,不决定正文篇幅上限 - 素材识别基于
source-index.json的逐块扫描而非整体印象:每个kind=content的BLK-xxxxx要么归入某章素材点,要么使用受控skip_code归入跳过类别。pure_repeat/no_course_value合计不得超过max(1200 字, 全部 content 字符数的 5%),案例、连续操作、Agent 反馈、错误修正和版本比较不得用泛化理由整段跳过。需要合并相邻块时,摘要仍要保留各块的独立结果、限制或判断;如果摘要只能用“介绍了某节内容”来概括,说明颗粒度过粗,必须继续拆分 - 每批先读取
status.maximum_new_material_count_for_next_batch,新增素材不得超过该值;整份账本仍不得超过status.maximum_material_count,即max(60, ceil(content block 数 × 0.5))。正常长课通常约 40—80 项。额度不足时先合并同一观点、连续操作阶段或同一 skip 理由,不得把大量微素材留给正文阶段承担 - 讲者话被幻灯片切换打断的截断句,依据上下文判断其指向并归入相应素材;无法判断的按跳过处理,不臆测内容。疑似 ASR 噪声不能因被建立为素材而直接进入正文;“我记得”“好像”“可能”“比如”“畅想”等不确定、举例或设想标记必须保留,身份、数量、平台名与断裂片段混在一起时不得挑出醒目信息事实化。摘要和后续章节都要保留“可确认才改、不可确认即舍弃”的边界
- 素材摘要同样遵守封闭来源:缩写没有展开就保留缩写,不猜英文全称;只提到一个方向或例子时,不补出典型组件、参数、角色分工、商业模式或实施路线;“可能/可以/比如/我觉得”不得改写为确定能力或标准方案
- 结构化组织:按主题自动分组,标注各主题的核心观点
- 图片资产自动登记与短清单选图:
ledger_tool.py init已按来源顺序把source-index.json中全部kind=image块登记为稳定IMG-xxx,并保留 source ref、原始 Markdown、哈希和邻近信息。模型不得重新编号、逐项重写整张图片资产表或直接编辑 manifest 的图片字段- 只遍历来源索引中的图片块及邻近内容,选择能独立增加理解的方法框架、关键界面、流程转折、案例证据或操作结果图;会务测试、空白/过渡/纯标题/重复/装饰页不选
- 选择结果只提交给
ledger_tool.py select-images的短 JSON:每项包含既有IMG-xxx、target_document_id和简短reason。工具按来源顺序确定性写入body_action=insert、目标文档和文档image_ids,未选择图片自动保留为asset_only ledger_tool.py status给出的minimum_reader_image_count是图片密集来源的整套课程最低代表图数;不能把全部图片降级为附件。该下限不要求平均分章,也不要求凑低价值图片- 同一位置连续插入原则上不超过 2 张,确有必要时最多 3 张;一组连续截图只选起点、关键转折或结果页。最终每 500 个可见文字最多约 1 张图,短文档预算上限放宽为 3 张
- 多篇转录稿中的幻灯片页码彼此独立,不能用页码重新排序;图片真实身份、全局顺序和原始 Markdown 一律以工具已登记的
IMG-xxx为准 - 图片筛选只影响是否进入正文,不得降低对应案例、操作逻辑、取舍理由和真实疑问的文字保留力度
- 素材类型识别与去来源痕迹:
- 区分主讲内容、操作过程、问答、补充讨论四类素材
- 主讲内容用于构建章节主线
- 操作过程转化为实践案例或应用场景,不机械保留"演示"叙述
- 问答必须按主题融入对应章节,可作为常见疑问、补充解释、案例回应或实践注意事项,不单独成章,也不机械保留问答格式
- 补充讨论用于丰富对应主题,不打断主线结构
- 章节成品应像独立文章或书稿章节,避免输出“现场演示”“课程现场”“现场问答”“主讲人提到”“来自现场实录”“演示一开始”“这一轮体验里”“回过头看”“整门课程到这里”等来源痕迹
- 如果转录稿末尾包含平台自动生成的关键词、议程摘要、重点内容、Q&A 或 PPT 章节标题,索引器会在存在原始“转录内容”时将其标为
derived。derived只可作为回到原始 content block 的定位线索:不能独立建立 include 素材、不能提供 coverage term、不能创建章节;其中只出现而原始转录未出现的判断必须舍弃。authority/control同样不建立普通素材;它们只决定历史表述是否可用以及应如何修订
- 章节边界控制:
- 为每章标注清晰的主题边界,说明本章负责回答什么问题
- 为每章一次性列出非空、不重复的
section_headings,它们就是最终正文的完整 H2 顺序;每个 H2 至少分配一个 include 素材,每个 include 素材只能绑定其中一个 H2。没有来源素材的小节在 plan 阶段删除,不留给章节生成时“自然延伸” - 相近主题必须明确分工,避免重复展开;例如 Agent 工作台、信息自动化、知识管理应分别聚焦工具环境、信息筛选、资产沉淀
- 标注核心章节,核心章节应承载课程主方法论、主框架或关键能力迁移,后续生成时需要更充分展开
- 主题重组会把时间线上穿插的内容分流到其他章节(如演示等待间隙讲的模型选择归入工具入门章),个别章节剩余源素材会变少;此时如实标注"素材密度: 偏少",不要为凑篇幅重复其他章节内容——结构性薄章是正常结果,无声硬撑才是问题
- 分流不丢失:凡是被分流到其他章节的素材,都在素材账本更新目标章节与目标二级标题。分流是“换个地方展开”,不是“换个地方丢掉”;尤其工具功能细节、判断技巧、取舍判断和个人工作习惯,分流后仍应完整展开
- 完整提取:保留关键观点、重要细节、具体案例、金句、工具选择理由、专有名称原始写法、图片引用和实践中的限制条件
- 章节划分指导:
- 默认 3—8 章,8 章是机器验收上限;未收到用户明确的超限要求时不得自行放宽,明确要求超过 8 章时才读取
advanced-overrides.md - 素材少(1-3 个文件)时合并为 3-4 章
- 素材多(10+ 个文件)时拆分为 6-8 章
- 相关性强的子主题应合并,独立完整的大主题可独立成章
- 不执行“一条 H2 = 一章”。开班/签到、领导致辞、会务说明、设备调试、软件安装准备和讲者履历默认不单独成章:可复用判断并入总览或核心章,纯会务/设备内容分别使用
meeting/device/no_course_value跳过。只有来源本身是安装或环境配置教程时,准备工作才可独立成章 - 章名必须来自实际主题。输出格式中的方括号只是字段说明,不得原样写入读者文件名;实际文件名不得包含
[课程名称]、[主题名称]、TBD、TODO或: * ? " < > |
案例融合原则
重要:实践案例和展望内容的整合原则
当分析内容包含实践案例、应用场景或未来展望时,应智能地将其融入相应的主题专题中,而不是创建独立的章节。
整合策略:
- 案例匹配:将案例内容按照主题相关性分配到对应的专题文档中
- 内容融合:在专题文档的"实践案例分析"部分自然地融入相关案例
- 展望分配:将未来发展趋势的内容融入相关主题的结尾部分
- 智能判断:AI 应根据内容的核心主题和应用领域进行合理分配
输出格式
===课程大纲开始===
课程标题:[基于原文生成的课程名称]
内容来源: [文件来源描述]
内容特征: [转录内容/普通文献/混合内容]
来源权威确认:
- AUTH-001 | action: apply_control | controlling_source_ids: [SRC-002] | section_hint: [控制章节]
逐条修正路由:
- COR-001 | target: CH-01 / [承载修订口径的 H2] | revised_text: [由索引器给出的原样修订句;不得自行改写]
来源索引:
- SRC-001 | [相对输入根目录的文件路径]
- SRC-002 | [相对输入根目录的文件路径]
素材分配表:
- MAT-001 | 【操作】[素材摘要] | source_refs: [SRC-001#L0020-L0034] | source_block_ids: [BLK-00008, BLK-00010] | coverage_terms: [界面入口] | disposition: include | target: CH-01 / 从入口到结果写回
- MAT-002 | 【其他】[会务或纯重复内容摘要] | source_refs: [SRC-001#L0035-L0038] | source_block_ids: [BLK-00012] | coverage_terms: [] | disposition: skip | skip_code: device | skip_reason: [具体理由]
正文代表图选择:
[只列 `select-images` 已选择的代表图;完整资产表由工具维护,没有源图则写"无"]
- IMG-012 | target: CH-01 | reason: [方法框架/关键界面/流程转折/案例证据/操作结果及其与正文的关系]
- IMG-037 | target: CH-03 | reason: [选择理由]
CH-01 第一章 [主题名称] - 核心观点摘要
边界: [本章负责的问题范围,避免与其他章节重复]
核心程度: [核心章节/普通章节]
素材密度: [充足/中等/偏少——主题重组分流后本章剩余源素材的量级;偏少属正常,不硬撑]
原文区间: [本章素材对应的原文时间范围,如 20:53-27:10;穿插内容分流到他章的注明去向]
融入素材: [主讲内容/操作过程/问答/补充讨论的使用方式;说明如何转化为独立正文]
二级标题顺序: [逐项列出最终 H2;每项后列实际承载的 MAT-xxx,不得有空小节]
高价值素材: [列出本章 MAT-xxx,每条带类型、摘要和 source refs]
本章正文配图: [仅列出正文处理为"插入正文"的 IMG-xxx,按本章最终正文实际顺序;无则写"无"]
CH-02 第二章 [主题名称] - 核心观点摘要
边界: [本章负责的问题范围,避免与其他章节重复]
核心程度: [核心章节/普通章节]
素材密度: [充足/中等/偏少——主题重组分流后本章剩余源素材的量级;偏少属正常,不硬撑]
原文区间: [本章素材对应的原文时间范围,如 20:53-27:10;穿插内容分流到他章的注明去向]
融入素材: [主讲内容/操作过程/问答/补充讨论的使用方式;说明如何转化为独立正文]
二级标题顺序: [逐项列出最终 H2;每项后列实际承载的 MAT-xxx,不得有空小节]
高价值素材: [列出本章 MAT-xxx,每条带类型、摘要和 source refs]
本章正文配图: [仅列出正文处理为"插入正文"的 IMG-xxx,按本章最终正文实际顺序;无则写"无"]
CH-03 第三章 [主题名称] - 核心观点摘要
边界: [本章负责的问题范围,避免与其他章节重复]
核心程度: [核心章节/普通章节]
素材密度: [充足/中等/偏少——主题重组分流后本章剩余源素材的量级;偏少属正常,不硬撑]
原文区间: [本章素材对应的原文时间范围,如 20:53-27:10;穿插内容分流到他章的注明去向]
融入素材: [主讲内容/操作过程/问答/补充讨论的使用方式;说明如何转化为独立正文]
二级标题顺序: [逐项列出最终 H2;每项后列实际承载的 MAT-xxx,不得有空小节]
高价值素材: [列出本章 MAT-xxx,每条带类型、摘要和 source refs]
本章正文配图: [仅列出正文处理为"插入正文"的 IMG-xxx,按本章最终正文实际顺序;无则写"无"]
金句与可迁移表达汇总:
[从原文逐条提取的讲者金句、比喻、概念命名与解释方式,清理语气词后列出;供章节引用和后续写书、公众号文章复用]
- [金句/表达原文] | 出处: [MM:SS] | 归属: [第X章] | 用途: [正文引用/写书素材/文章复用]
输出计划:
- 总览文档:课程概览和学习路径
- 专题文档:每个主题的详细内容(包含融合的案例、问答、补充讨论、展望、高价值实践细节和本章正文配图)
===课程大纲结束===输入内容
- 用户词典:[如果存在,列出 config/user_dictionary.yaml 中的 terms;如果不存在则写"未配置"]
- 来源权威:[
source-index.authority的 mode、notices、corrections;current 模式把每条 COR 路由到一个最终 H2] - 来源索引:[
source-index.json中的 SRC-xxx、BLK-xxxxx、块类型、行号、预览和来源哈希] - 章节计划:[manifest 的 chapters[].section_headings;已冻结的最终 H2 顺序]
- 素材账本:[由 ledger_tool.py 分批合并的 MAT-xxx、类型、摘要、source refs、目标章/节或跳过理由]
- 图片候选:[从来源索引读取的 IMG-xxx、原始 Markdown与邻近信息;只输出代表图短清单,不复制全量资产表]
- 必要原文片段:[用于消解主题、边界或素材归属歧义;长材料不重复加载无关全文]
先在 plan JSON 中逐项提交 authority_acknowledgements 与 authority_correction_routes,再用 ledger_tool.py plan 冻结章节与 H2;每个 COR 同时提交目标章/H2、被替代来源块的状态、块 ID、检索说明和与候选顺序完全一致的 candidate_block_reviews。每条 review 摘录至少 6 字、逐字来自对应预览的 evidence_quote,并写专属理由;不得复制同一理由批量处理,也不得把整张高召回矩阵一律判为 superseded。修订句由工具从控制来源复制。按 status 返回的精确 ID 用 ledger_tool.py merge 分批写入素材判断;plan 确认的旧口径块必须以 authority_superseded 跳过。不要让模型直接重写 manifest、分配 MAT 编号、复制 source refs 或转录全量图片资产。素材预检通过后,用 select-images 提交代表图短清单,再用 scaffold 生成精确标题骨架和不可改写的修订句。正文完成后用 finalize_manifest.py --phase final --write,只从各素材目标小节内回填 reader_evidence.quotes 并再次同步实际图片映射。先服务读者正文,再完成审计绑定;不得为了减少 manifest 工作量而合并高价值素材或删减正文。大纲是人类审计视图,不是 manifest 的替代品;读者成品中不显示 SRC/BLK/MAT/IMG 审计标签,也不写来源没有讨论的 source-index.json / course-manifest.json、coverage_terms 或“正文证据补丁”。