Компьютерные науки > Машинное обучение [представлено 15 сентября 2026 года] Заголовок: Большие языковые модели развивают государственную геометрию в рамках проекта PDF Резюме: Мощно-лингвистические модели (LMS), подготовленные по следующим вопросам прогнозирования, демонстрируют замечательные способности к изучению текстов (ICL), однако представления, которые поддерживают МЦЛ, остаются плохо понятными. Мы рассматриваем такие представления в контролируемой среде: побуждение МЛМ с данными, излучаемыми на основе скрытой модели Маркова (HMM), и поиск соответствующего состояния веры -- заднего распределения по тайным штатам HMM с учетом наблюдаемого символического прошлого. В шести открытых МРМ, порожденных данными из 40 HMM, отобранными для нетривиальной структуры веры, мы находим, что веские состояния линейно декодируемы при активации остаточного потока с пиковыми значениями зонда $R>2 долл. США от 0,83-0,99 во всех комбинациях HmM и LLM, диапазон между ранними слоями и поздними уровнями. Чтобы установить функциональную значимость, мы непосредственно вмешиваемся в подпроверку зонда посредством запятой и рулевого управления, что приводит к качеству прогнозирования вниз по течению от модели без штампов при одновременном существенном снижении эффективности. В совокупности эти результаты дают представление о том, что ICL в открытых МПМ приблизительно соответствует оптимальному байесианскому прогнозированию по контексту предполагаемой модели регенерации. В более широком плане наши…
Крупные языковые модели развивают в вере геометрию государства
arXiv: 2609.17376v1 Annuate Type: New Humber Abstract: Major Language Models (LMS), тренированная по следующим предсказаниям, демонстрирует замечательные способности к изучению текстов (ICL), однако представления в поддержку ICL остаются плохо понятными. Мы рассматриваем такие представления в контролируемой среде: побуждение МЛМ с данными, излучаемыми на основе скрытой модели Маркова (HMM), и поиск соответствующего состояния веры -- заднего распределения по тайным штатам HMM с учетом наблюдаемого символического прошлого. В шести открытых МРМ, порожденных данными из 40 HMM, отобранными для нетривиальной структуры веры, мы находим, что веские состояния линейно декодируемы при активации остаточного потока с пиковыми значениями зонда $R>2 долл. США от 0,83-0,99 во всех комбинациях HmM и LLM, диапазон между ранними слоями и поздними уровнями. Чтобы установить функциональную значимость, мы непосредственно вмешаемся в подпроверку зонда посредством патрубков и рулевого управления, что приведет к качеству прогноза вниз по течению в порядке нетамперированной модели, тогда как