Реклама

MINCE: Стирание наборов данных для оценки LLM с помощью маломощной модели калибровки Монте Карло

#MINCE #Стирание #Монте #Карло #Annuales

arXiv:2606.22826v2 Annuales Type: заменить резюме: Оценка МЛМ во многих вариантах моделей - количественное, усовершенствованное или конкретное развертывание - требует многократного достижения крупных контрольных показателей, процесс, который может занять десятки часов на одну модель по кадрам, таким как НПУ. Существующие методы отбора подмножеств сокращают эти затраты, но зависят от крупных калибровочных пулов или усвоенных слоев прогнозирования. Мы введем MINCE (Monte Carlo Sensive N-system for Compact Assessment), которая использует моделирование Монте Карло по каждому пункту logs из небольшого набора калибровочных моделей для определения минимального размера поднабора, который ограничивает точность дрейфа и затем восстанавливает произвольно отобранный подмножество на этом уровне без необходимости прогнозирования слоя. MINCE сокращает ИФЕВАЛ на 54%, ММЛУ - на 89%, GSM8K - на 70% и MMLU-Pro - на 88% с максимальным дрейфом $\leq$2,62\,pp по калибровочным моделям BF16. Замороженные подмножества обобщают задерживаемые модели GPU со средним дрейфом в 1,40 долл. США,pp и INT4 модели NPU с средним смещением 0,77-3,59\,pp при доставке