356b9ddb22
Невидимый слой tesseract набран GlyphLessFont с выставленным моно-битом, и is_mono() опознавала книгу как один сплошной листинг: измерено на Ansible после OCR — pre 10498, p 0. Кегль в таком слое подгоняется под рамку слова и гуляет внутри абзаца (9.0, 9.2, 9.4), из-за чего гистограмма размазывалась и основной кегль книги определялся неверно; в OCR-слое он округляется до целого. Каждая строка кода приходит отдельным блоком — соседние pre склеиваются переводом строки, иначе листинг рассыпается на десяток однострочных. Признак OCR-слоя считается по выборке страниц, обычные PDF идут прежним путём. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>