SP-DocReader: самопроверка, покрывающая различия для точного документа
arXiv: 2610.11148v1 Тип уведомления: новое резюме: точная транскрипция страниц по-прежнему сопряжена с трудностями для моделей языка зрения при ограниченных бюджетах ресурсов и учебных программ. Мы представляем SP-DocReader, самопроигрывающий механизм оптического распознавания персонажей (ОКР), который нацелен на остаточные ошибки после контролируемой доработки. Чтение дискрементов Маскинг сравнивает ссылки и генерирует символы моделей через самую длительную общую подпоследовательность, затем забивает несопоставимые позиции с их полными префиксами кондиционирования. В "Целенаправленной Фидельти" добавляется прямой отрицательный контроль за уклоном в несопоставимых позициях. Подготовка ведется только по модулю OCR, в то время как позвоночник остается замороженным. Мы вычисляем совокупный градиент, чтобы отличить оптимизацию относительных баллов от прямого контроля. По сравнению со SFT-2, SP-DR-3 снижает частоту ошибок в символах Vary-600K на обоих позвоночниках. На Qwen3-VL-4B она снижает частоту ошибок персонажей примерно на 54% и улучшает средненормализованное сходство Levenshtein (ANLS) на 3