Кодирование местоположения с помощью Token-Aware
arXiv: 25009.12635v4 Annuate Type: заменить Резюме: Мы доказываем с практической точки зрения, что Rootal Plaintal Embedding (ROPE) вводит неизбежную погрешность в оценках внимания на расстоянии, которая ограничивает способность ROPЕ моделировать длинный контекст. Методы расширения ROPE могут облегчить этот вопрос, но обычно после предварительной подготовки они требуют постспециальных корректировок, таких как перерасчет или реконструирование гиперпараметров. Настоящий документ представляет собой новый метод позиционного кодирования, который включает в механизм внимания функцию изучаемой фазы. ТАПА сохраняет символическое взаимодействие на большом расстоянии, распространяется на более длинные контексты с прямой и световой постоянной предварительной подготовкой, экстраполирует до невидимой длины и достигает значительно меньшей степени запутанности и большей эффективности поиска в режиме длинного контекста по сравнению с исходными данными ROPE.