WordPolo: Оценка языковых моделей с помощью интеративной семантической обратной связи

#WordPolo #Оценка #Большие #MARM #Игроки

arXiv: 2609.19006v1 Вид уведомления: новое резюме: крупные языковые модели (LMS) и Большие расчетные модели (MARM), как правило, оцениваются на основе сложных контрольных показателей только путем обеспечения точности набора данных, что не позволяет получить представление о качестве или верности их процессов рассуждения. Мы представляем WordPolo, задачу поиска слов, в которой участники должны найти неизвестное целевое слово с использованием семантичной обратной связи. Игроки начинают с нуля знаний, делают догадки и получают оценки расстояния (1 = правильно, выше = дальше). Успех требует интерпретации результатов для использования семантического пространства и систематической сужения поиска. Этот проект позволяет итеративно мыслить и адаптивных стратегий поиска, которые непосредственно отслеживаются и необходимы для успеха. Мы оцениваем недавние МЛМ (GPT-4.1, Llama 4, Clod 3.5 Haiku, Qwen 3), ЛRM (o4-mini, Deepsek-R1), человека и новую эвристику на 1 500 головоломок. Помимо коэффициентов решения (которые колеблются от 4% до 62%), мы внедряем метрики, основанные на прогрессии и раскрывающие модель

Компьютерные науки > Вычисления и язык [представлены 18 июля 2026 года] Название: WordPolo: Оценка языковых моделей с помощью итеративного семантического взгляда на HTML (экспериментальный) резюме: модели большого языка (МЖЛ) и модели крупных рассознаний (МРП), как правило, оцениваются по трудновыполнимым контрольным параметрам только путем обеспечения точности набора данных, что не позволяет получить представление о качестве или верности их логических процессов. Мы представляем WordPolo, задачу поиска слов, в которой участники должны найти неизвестное целевое слово с использованием семантичной обратной связи. Игроки начинают с нуля знаний, делают догадки и получают оценки расстояния (1 = правильно, выше = дальше). Успех требует интерпретации результатов для использования семантического пространства и систематической сужения поиска. Этот проект позволяет итеративно мыслить и адаптивных стратегий поиска, которые непосредственно отслеживаются и необходимы для успеха. Мы оцениваем недавние МЛМ (GPT-4.1, Llama 4, Clod 3.5 Haiku, Qwen 3), ЛRM (o4-mini, Deepsek-R1), человека и новую эвристику на 1 500 головоломок. Помимо показателей решения (которые колеблются от 4% до 62%), мы внедряем метрики, основанные на прогрессии, которые раскрывают модели, часто дают значимый прогресс. Наш анализ показывает, как модели рассуждений могут быть сорваны из-за чрезмерного мышления и недоосмысления, в то время как успешные модели демонстрируют человеческие стратегии. "WordPolo" демонстрирует…