Extract Workflow
把一份信息抽成 Q-A 链。
Voice Notification
curl -s -X POST http://localhost:31337/notify \
-H "Content-Type: application/json" \
-d '{"message": "Running Extract in ljg-qa"}' \
> /dev/null 2>&1 &输出文本:Running **Extract** in **ljg-qa**...
Step 1: 获取内容
按输入类型走:
| 输入 | 工具 | 注意 |
|---|---|---|
| URL(普通网页) | WebFetch | 需要登录的页面用 markdown-proxy |
| arxiv 链接 | WebFetch(HTML 版) | 拿 abstract + 方法 + 实验段 |
| PDF / 本地文件 | Read | 大 PDF 用 pages 参数分段读 |
| 直接文本 | 跳过 | 直接进入 Step 2 |
| 论文/书名 | WebSearch | 拿到 URL 再走 WebFetch |
确保拿到:核心论点 / 论证链 / 关键例子 / 边界讨论。
Step 2: 找观点骨架
读完后沉默 30 秒,回答这一个问题:
这篇东西的核心论点是什么?它怎么把这个论点撑起来?哪几步是关键转折?
写下:
- 核心论点:一句话
- 3-5 个关键转折:每个转折一句话
这是 Q 链的脊柱。脊柱立不起来,下面的 Q 都是浮的——回去重读。
Step 3: 设计 Q 链
每个关键转折长出一个或一组 Q。Q 必须满足:
- 一句定义答不出来——切要害
- 答案能在原材料里找到根据
- 跟前一个 Q 有继承关系(Q2 是 Q1 答完后自然冒出来的)
Q 类型四类(动 / 对 / 因 / 界)和模式见 ../References/QuestionDesign.md。一篇好 Q 链至少混合三类。
排序规则:按论证依赖关系,不按章节顺序。原文先写背景再写方法是叙事需要,但 Q 链应该按「先问根问题,再问解法,再问代价」走。
数量:5-10 个 Q。少则不够覆盖,多则读者疲劳。
Step 4: 写 A
每个 A 严格四段,不可省,不可乱:
*结论*:(一句话——能脱离上下文被抄走)
*形式化*:(用文字 + 简单符号把思想压成一行可视关系——见下方"形式化的写法")
*怎么想到的*:
- 步骤 1(短句,只走一步推理)
- 步骤 2
- 步骤 3
*边界*:(这个结论在什么条件下不成立 / 论证还没覆盖什么)硬要求:
- 结论:脱离上下文还能被抄走。读者把这句话发给朋友,朋友能 get
- 形式化:用文字 + 简单符号(→ = ≠ + × ⊃ ⊥ 等)把思想压成一行可视的关系——是"思想的几何",不是"数学的公式"。让读者一眼看出对应关系。详见
../References/QuestionDesign.md的"形式化的写法" - 论证步:每条只走一步推理,前一步打开后一步的口子
- 边界:写「不成立的条件」,不写「未来工作」——前者是诚实度,后者是公关辞令
形式化的写法(要点)
四种常见模式:
- 等式:
通才 = 协调员;专才 = 干活的 - 对比:
旧: 大模型 = 全栈;新: 大模型 = 协调员 - 流向:
数据 → token → 答案 = 损失 + 浪费 - 递进:
调用 → 接口 → 双语热线
只用 ASCII + 中文。禁 LaTeX、禁复杂数学符号。一行内放完。
Step 5: 检查 Q 链方向感
通读 Q 顺序:
- 继承:Q1 答完,Q2 是不是自然冒出来?
- 依赖:把 Q3 删了,Q4 还成立吗?
如果 Q 之间是平行的(删一个不影响其他),重排或合并。Q 链是路径,不是清单。
可以画一张草图(不入 org,只是自己的脚手架):
Q1 ─┬─→ Q2
└─→ Q3
Q2 ──→ Q4
Q4 ──→ Q5(收口反问)Step 6: 过红线
逐条扫:
- 每个 Q 不能用一句定义打发
- 每个 A 四段齐(结论 / 形式化 / 步骤 / 边界)
- 形式化句一眼能看出关系——不是数学公式,不是堆术语
- Q 链有方向(不是并列罗列)
- 没有「什么是 X」型 Q
- Q 句 ≤ 20 字(一眼能扫完)
- 没有学术腔(「值得注意的是」「综上所述」「在……背景下」)
- A 没有靠堆术语保平安——所有术语翻译成具体动作或物件
- 5-10 个 Q
任何一条不过,回去改。
Step 7: 写文件
获取时间戳:
date +%Y%m%dT%H%M%S # → identifier
date "+%Y-%m-%d %a %H:%M" # → date 字段denote schema 文件名:{YYYYMMDDTHHMMSS}--qa-{主题}__qa.org
qa-前缀:标记 Q-A 类型(与 ljg-paper 的paper-同构)- 主题:核心论点的 5-10 字提炼,去标点。优先用方法名/概念名/灵魂句关键字
__qa后缀:keyword tag,便于 denote 搜索
输出路径:~/Documents/notes/
写入后报告路径给用户。
文件结构
#+title: {一句精炼的核心观点——10-25 字}
#+subtitle: {原文标题}
#+date: [{YYYY-MM-DD Day HH:MM}]
#+filetags: :qa:
#+identifier: {YYYYMMDDTHHMMSS}
#+source: {URL 或来源}
* 引子
(一段话,3-5 句:这篇东西在讲什么,为什么值得拿出来问。带读者落地,不是综述)
* Q1: {一句尖锐的问句,≤ 20 字}
*结论*:...
*形式化*:...(如 `A = B + C` / `旧: X → 新: Y`)
*怎么想到的*:
- ...
- ...
- ...
*边界*:...
* Q2: ...
...
* 收口
(一句话压住整串 Q-A:作者真正贡献的那个东西是什么。不是总结,是命名)注意:
- 加粗用
*bold*(org-mode),不用**bold**(markdown) - 列表用
- item,不用* item(*在 org 是标题) - 分隔用空行或层级,不用
--- - 代码用
~code~或=code=,不用反引号
验收
- Q 切要害:每个 Q 不能用一句定义打发
- A 有形式化收口:每个 A 四段齐——结论句能被抄走,形式化一眼看出关系
- Q 链有方向:删一个 Q 后续会塌
- 不复述原文:是骨架重建,不是段落改写
- 中文母语:每句默念听是否像中文人说话——动词驱动、不堆术语、不学术腔