Использование моделей Token-Trained в моделях byte
arXiv: 2602.01007v2 Annuales Type: заменить резюме: Bayte Language Models (BLM) стали многообещающим направлением для масштабирования языковых моделей помимо символизации. Однако существующие БМР обычно требуют подготовки с нуля на триллионах байтов, что делает их непомерно дорогостоящими. В настоящем документе мы предлагаем эффективный рецепт перегонки, который преобразует существующие МРМ, обученные символическими знаками, в БМР при сохранении сопоставимых возможностей. Наш рецепт построен по двухэтапной программе: 1) прогрессивная дистилляция знаний, которая увязывает представления на байт-уровне с встроенной моделью, подготовленной для подготовки учителей; и 2) подконтрольная на уровне байт модель, позволяющая полностью производить конечное поколение в промежутке между концами. Мы подтверждаем наш подход к многочисленным моделям семейств, включая Ламу, Квен и ОЛМ, и показываем, что дистиллированные BLM сохраняют большую часть эффективности моделей учителей с использованием только примерно 125B байт.