法律术语后处理说明
legal-ocr 的法律术语优化是保守型后处理,用于修正常见 OCR 断字和高置信误识别。它不是法律语义改写,也不会补充原文没有的信息。
默认模式是 auto:非法律材料只做通用 OCR 清理;只有检测到法律文书信号时,才启用本页所述法律术语优化。
默认处理范围
- 合并常见法律术语断字/断行:如
人 民 法 院、委 托 诉 讼 代 理 人、本 院 认 为、本院认\n为。 - 修正常见 OCR 异体字或混淆词:如
民亊、刑亊、入民法院。 - 统一文书标签冒号:如
原告;、被告:、案号:。 - 合并明显属于同一中文段落的 OCR 硬换行,但保留标题、当事人标签、编号、表格和 Markdown 结构。
默认词表覆盖:
- 文书名称:民事判决书、民事裁定书、民事调解书、刑事判决书、行政判决书、执行裁定书、民事起诉状、民事上诉状。
- 主体标签:原告、被告、第三人、上诉人、被上诉人、申请人、被申请人、再审申请人、申请执行人、被执行人。
- 程序与证据词:诉讼请求、事实和理由、管辖权异议、举证期限、证据目录、庭审笔录、开庭传票、执行依据。
- 文书结构词:本院查明、本院认为、判决如下、裁定如下、审判长、审判员、人民陪审员、书记员。
配置
.env 中默认使用自动检测:
LEGAL_OCR_LEGAL_TERMS=auto
LEGAL_OCR_LINE_MERGE=true
LEGAL_OCR_CUSTOM_TERMS_PATH=可选值:
auto:默认值,检测到法律材料才启用法律术语优化。true/always:强制启用,适合用户确认输入就是法律材料。false/never:关闭,适合不希望做任何法律词替换的非法律材料。
如需关闭法律术语优化:
LEGAL_OCR_LEGAL_TERMS=false单次命令关闭:
uv run scripts/convert.py "/path/to/file.pdf" --no-legal-terms如需强制启用法律术语优化:
uv run scripts/convert.py "/path/to/file.pdf" --legal-terms always如需单次关闭硬换行整理:
uv run scripts/convert.py "/path/to/file.pdf" --no-line-merge--no-post-process 会关闭全部后处理,包括法律术语优化、硬换行整理和标题整理。
换行整理边界
默认只合并这类硬换行:
被告提交的证据能够证明
其已经履行付款义务,
但不能证明原告同意解除合同。处理后:
被告提交的证据能够证明其已经履行付款义务,但不能证明原告同意解除合同。以下内容不会主动合并:
原告:、被告:、案号:等主体或文书信息标签。一、、(一)、1.、第十条等编号。- Markdown 标题、引用、表格、图片和代码块。
- 已经以明显句末标点结束的两行。
自定义术语
可通过 LEGAL_OCR_CUSTOM_TERMS_PATH 指向 JSON 文件。支持对象映射:
{
"某OCR误词": "正确法律词",
"某公司常见误识别": "某公司标准名称"
}也支持列表格式:
{
"replacements": [
{
"source": "某OCR误词",
"replacement": "正确法律词",
"description": "客户名称常见误识别"
},
{
"pattern": "管[辖輖]权",
"replacement": "管辖权",
"description": "正则修正"
}
]
}建议只加入高置信替换。涉及人名、公司名、金额、案号等事实信息时,应保留 result_raw.md 并人工复核。