Трансформаторы в качестве проб внутриконтекста: от закрытого диффузия до свободного от оценки отбора проб
arXiv: 2609.08981v1 Annualce Type: cross Brieft: Растущий объем работы устанавливает, что крупные языковые модели являются не просто статистическими запоминающими устройствами, но способны учиться в тексте: делать выводы во время испытания с использованием только примеров, приведенных в оперативной работе без каких-либо изменений параметров. Как показывает предыдущая теоретическая работа, этот потенциал распространяется на контролируемые учебные задачи, такие как линейная регрессия. Мы доказываем, что обучение в контексте распространяется на процесс получения данных: замороженные трансформаторы могут имитировать итеративные системы отбора проб в контокс. Сначала мы показываем, что трансформаторы могут использовать закрытые и гладкие дисперсионные пробоотборники закрытой формы. Строительство определяет конкретную стимулирующую роль для мягких максимальных затрат внимания: оно вычисляет веса ответственности и взвешенные эмпирические средние значения, в то время как движущиеся слои внедряют обновления Эйлера. Чтобы эмпирически увязать эти конструкции с заранее подготовленными языковыми моделями, мы изучаем mephh {семантическая тема выборки}: импульсы