23 модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе — пять суток (120+ часов) чистого инференса на одной RTX 5070 Ti. В марте я рекомендовал Whisper Large v3, а потом случайно нашёл модель не хуже — и понял, что выбор держался на инерции. Пересобрал всё по-научному, и мартовская рекомендация устарела. Кто её сместил — дальше.
В марте я написал статью про voice-to-text и пришёл к рекомендации: Whisper Large v3 + кастомный промпт на пунктуацию через свой форк Handy на Vulkan-ускорении (которое, к моему удивлению, оказалось быстрее CUDA — про это я тоже писал).
В Handy в списке поддерживаемых моделей я заметил странную опцию — breeze-asr с пометкой «Optimized for Taiwanese Mandarin. Code-switching support». Зачем нишевый мандарин-английский fine-tune вообще положили в набор моделей по умолчанию — непонятно. Из любопытства переключился. Поработал день в обычном режиме (я диктую LLM больше часа в день для общения и заметок). И обнаружил: качество не хуже Whisper Large v3. Может, даже лучше.
Странная находка — надо разбираться. И я начал разбираться. Несколько недель и один Frankenstein-fork в три уровня глубиной. Дальше — что я нашёл и почему мартовская рекомендация теперь устарела.