Если вы когда-нибудь смотрели на HF и не понимали, что такое DFlash, квантизация и почему одна и та же модель лежит в десяти репозиториях от десяти разных людей — или давно собирались поднять LLM у себя, но всё не находили повода — выход Muse Glimmer 30B буквально лучший момент начать.
Есть особый сорт растерянности, который накрывает вас при первой попытке запустить модель локально.
Вы находите модель на Hugging Face. Там пять репозиториев с одинаковым названием. Один весит 59 ГБ, другой 39 ГБ, третий называется GGUF, четвёртый MLX, пятый принадлежит организации, о которой вы никогда не слышали. Внутри GGUF-репозитория четырнадцать файлов. Они называются что-то вроде UD-IQ3_XXS и Q5_K_M. Никто не объясняет, какой качать. В README написано «18 ГБ RAM», у вас 32 — значит, подойдёт любой?
Не подойдёт. И самое забавное, что ничего сложного здесь нет. Это история про пропускную способность памяти, арифметическую интенсивность и горстку инженерных компромиссов, которые никто не удосуживается объяснить, потому что все считают, что вы и так в курсе. Вам не хватает буквально четырёх вопросов, чтобы понять происходящее целиком. Но, как обычно, совершенно непонятно, с какого конца заходить.