Backlog
Отложенные механики, которые стоит делать отдельными задачами.
OCR
Добавить отдельный поток для сканированных PDF:
- детектировать почти пустой текст после извлечения;
- предлагать OCR только после подтверждения пользователя;
- сохранять качество распознавания в
metadata.json; - не обходить DRM или технические ограничения файла.
Улучшенный EPUB-разбор
Если стандартного разбора EPUB станет мало, добавить отдельный extract_epub_ebooklib.py с зависимостями через uv run --script. Не класть ebooklib/lxml в основной путь, чтобы обычные запуски не тянули тяжёлые пакеты.
Go-ускоритель
Имеет смысл, если появятся частые многократные операции над большими корпусами:
- разметка заголовков и сегментов;
- скользящие n-граммы;
- поиск подпоследовательностей;
- построение source map по большим файлам.
Пока Python через uv run --script достаточно: прогрев один раз на источник дешевле сложности поставки бинарников.
Оценка переработки
Возможные уровни:
- быстрый лексический контроль: n-граммы, уже есть;
- поиск подпоследовательностей с rolling hash;
- MinHash/SimHash по абзацам;
- семантическая близость через вложения, если появится стабильный локальный или внешний поставщик.
Публикационный профиль
Отдельный режим для материалов, которые планируется выкладывать публично:
- явный источник прав;
- запрет пересказов по главам;
- отдельная проверка таблиц, кода и цитат;
- license manifest;
- человеческий чеклист перед публикацией.
Несколько источников
Будущая версия может собирать не один источник, а малую библиотеку:
- общий словарь;
- конфликтующие позиции авторов;
- карта, какой источник сильнее для какой задачи;
- дедупликация понятий.
Агентная разведка оглавления
Базовый outline_scout.py уже готовит малый слепок структуры. Следующий шаг — отдельный встроенный сценарий для субагента, который возвращает только model_decision в JSON и не видит полный источник.