Помимо глубинной передачи: контролируемая оценка использования глубины в рекурсивных языковых моделях

#Помимо #Annuate #Type #Humber #Brieflook

arXiv: 2609.19934v1 Annuate Type: New Humber Brieflook: Deft-Sonters Language Models Итеративно применяют небольшой стоп, отделяя от отдельного числа параметров одноразовый расчет. Для определения того, действительно ли такая модель использует свою глубину, в литературе по рекурсии и стиранию слоев используется общая оценка: уплотнение глубины во время вывода, наброски качества с учетом остаточной доли глубины и прочтение склона. Несмотря на то, что этот показатель является дешевым и бесплатным для обучения, он страдает от неизученного недостатка: в нем выводится один скаляр из вмешательства, которое одновременно меняет свойства нескольких моделей. Глубина одновременно сокращает количество блоковых приложений, уменьшает объем выполненных отдельных вычислений и переталкивает считывающую голову на остаточный поток вне распределения. Наблюдаемый уклон сравняет все три фактора, однако обычно он толкуется как отражающий только второй. Мы предлагаем Протокол по контролю за глубиной (DCP) - диагностический блок, в котором не работают