Annotation Method
一条原则
注解负责把原文中的局部阻力拿掉;章节解读负责说明整章为什么这样安排。两层不能互相代替。
切分单位
按最小有意义单位切,不机械逐字拆:
- 固定词、成语、官名、地名保留为一个 token。
- 古今义变化明显的单字可独立成 token。
之、其、以、而、于、者、也等虚词按本句功能注,不能复制同一释义。- 通假字以原字留在
text,在note说明所通之字;不能先改原文再注。 - 标点单独作为
{ "text": ",", "punctuation": true },不写伪注解。
“逐字注解”通过覆盖率兑现:所有非标点 token 都有 note。切分的目标是让每一注都能落到一个明确语言动作上。
三类夹注
| tone | 颜色语义 | 回答的问题 | 典型内容 |
|---|---|---|---|
word |
青色 | 这个字词在此处是什么意思 | 古今义、虚词功能、语法、读音 |
clause |
朱色 | 这一小句在做什么 | 谁对谁做什么、动作结果、局部因果 |
variant |
赭色 | 这里为什么不能装作只有一种读法 | 通假、异文、版本差异、解释分歧 |
每条 note 优先 2–14 个汉字。超过 22 个字,通常已经越过局部注解边界,应改写或移入章节解读。
拼音
只给会改变理解的生僻读音、多音字和古音提示。格式不带声调数字时用带调拼音;无法确认时不猜,改用 variant 说明。
章节解读
章节解读只保留一个主关系。它至少让人看见:
- 章内哪些词是同一台机器的不同零件。
- 条件怎样触发动作,动作怎样产生结果。
- 为什么只按现代常识直译会漏掉关键一步。
- 这条关系还能迁移到哪里,或在什么条件下失效。
先直白,再准确;术语只在大白话已经落地后出现。不要把逐句译文重新拼成一段,也不要用“人生智慧、值得深思、发人深省”填空。
事实边界
- 原文事实来自底本;解释是解释,不能伪装成作者自述。
- 章旨存在学术分歧时,写清“本图采用哪一种读法”。
- 现代案例只检验结构,不证明古人原意。