Компьютерная наука > Вычисление и язык [представлено 15 сентября 2026 года] Заголовок: Постоянная периодическая память между Трансформаторными слоями - Улучшает языковую модель Генетализации Вид PDF HTML (экспериментальный) Резюме: Мы введем простую архитектурную модификацию для трансформаторов только декодера — постоянное регулярное состояние, которое наблюдает скрытые представления через перекрестное нахождение, обновляет себя через GRU и модифицирует последующую обработку через входное добавление. Этот модуль, включенный между нижней и верхней половинками шестислойного трансформатора, добавляет лишь 3,7% дополнительных параметров при одновременном сокращении потерь в результате оценки с 2,438 долл. США x 0,04 долл. Это улучшение статистически значимо для пяти случайных семян ($p < 0,01 долл. США) и соответствует сокращению перенасыщенности (общий разрыв 0,12 по сравнению с 0,26). С помощью контролируемых абляции мы показываем, что улучшение происходит только благодаря стойкой топологии памяти, а не в результате вспомогательных целей самопредукции. Модель с идентичной топологией, но без вспомогательных потерь выполняет эквивалентные функции, в то время как случайные вспомогательные потери не дают никакой выгоды. Анализ представленности показывает, что постоянное состояние кодирует описательную позицию (52% по сравнению с 33% по шансу) - информация о том, что стандартное внимание остается менее эффективным. Наши результаты свидетельствуют о том, что объединение слоев…
Постоянная периодическая память между трансформированными слоями - Улучшает языковую модель
arXiv:2609.17251v1 Annualce Type: New Hume Abstract: Мы введём простое архитектурное изменение только декодерных трансформаторов: постоянное регулярное состояние, которое наблюдает скрытые представления через перекрестное внимание, обновляется через GRU и модуляторирует последующую обработку через входное добавление. Этот модуль, включенный между нижней и верхней половинками шестислойного трансформатора, добавляет лишь 3,7% дополнительных параметров при одновременном сокращении потерь в результате оценки с 2,438 долл. США x 0,04 долл. Это улучшение статистически значимо для пяти случайных семян ($p < 0,01 долл. США) и соответствует сокращению перенасыщенности (общий разрыв 0,12 по сравнению с 0,26). С помощью контролируемых абляции мы показываем, что улучшение происходит только благодаря стойкой топологии памяти, а не в результате вспомогательных целей самопредукции. Модель с идентичной топологией, но без вспомогательных потерь выполняет эквивалентные функции, в то время как случайные вспомогательные потери являются провидными