Компьютерная наука > Расчет и язык [представлен 16 сентября 2026 года] Название: A Calibrated Indext for Measuring Who inference Optimizations Effecutive View Quality PDF Резюме: Оптимизация больших языковых моделей является активной областью исследований, охватывающей квантизацию весов модели, методы раннего выхода для пропусков слоев и спекулятивное декодирование. Каждый трек использует свои собственные показатели качества, как правило, идиосинкратический базовый показатель. Лишь немногие подходят к точности измерений, требуемой другими научными дисциплинами. Мы предлагаем строгую методологию измерения качества выпуска, подходящую для межсистемного и межсекторального сопоставления. Мы получаем результаты с ОЖЛ в качестве судьи, но официально калибруем судью: мы сравниваем его оценки по двум обычным прогонам модели при тех же значениях, проверяя отсутствие систематической предпочтения между статистически эквивалентными результатами и измерением шума на выборке. Каждая конструкция также включает состояние "null", которое очевидно идентично по распределению немодифицированной модели, измеренная разница которой должна быть нулевой. С помощью этого одного инструмента мы измеряем несколько методов ускорения на одних и тех же сигналах, так что можно сопоставить их качественные издержки. Приобретенное качество в значительной степени зависит от сферы обсуждения. 4-битная модель была неотличима от ее 16-разрядного оригинала вплоть до нашего дизайнерского разрешения в +/-0,3 пункта…
Калибровочный инструмент для измерения того, как оптимизация воздействия влияет на качество выпуска
arXiv:2609.18005v1 Annualce Type: New Humber Brieflow: Major Language Model Reduction — это активная область исследований, включающая квантизацию весов моделей, методы раннего выхода для пропусков слоев и спекулятивное декодирование. Каждый трек использует свои собственные показатели качества, как правило, идиосинкратический базовый показатель. Лишь немногие подходят к точности измерений, требуемой другими научными дисциплинами. Мы предлагаем строгую методологию измерения качества выпуска, подходящую для межсистемного и межсекторального сопоставления. Мы получаем результаты с ОЖЛ в качестве судьи, но официально калибруем судью: мы сравниваем его оценки по двум обычным прогонам модели при тех же значениях, проверяя отсутствие систематической предпочтения между статистически эквивалентными результатами и измерением шума на выборке. Каждая конструкция также включает состояние "null", которое очевидно идентично по распределению немодифицированной модели, измеренная разница которой должна быть нулевой. С помощью этого одного прибора мы измеряем несколько методов ускорения