Реклама

OpenProblemBench: Контрольный параметр AI по открытым проблемам в фундаментальной теории

#OpenProblemBench #Контрольный #Annualte #Type #Следующим

arXiv:2610.11118v1 Annualte Type: новый резюме. Следующим рубежом для искусственного общего интеллекта является решение нерешенных научных проблем, предусматривающих установление критериев оценки прогресса за пределами установленных знаний. Мы представляем OpenProblemBench, ориентир из 82 нерешенных проблем, связанных с математикой и теоретической физикой. Каждая проблема дает контекст исследований, допущения и предыдущий прогресс, необходимый для изучения этого вопроса. Мы выбираем проблемы, предлагаемые решения которых предусматривают относительно четкие проверки их решающих математических или вычислительных требований. Четыре модели оценки независимо оценивают точность, полноту и степень прогресса в каждом представлении без справочных решений. В семи оцененных конфигурациях ГПТ-6-Астра достигает наивысшего среднего расчетного показателя решения проблемы в 14,0% по сравнению с 5,5 - 6,7% для оценки открытых моделей полного размера и 2,4-3,7% для моделей Флэша. Сравнение случаев увязывает более высокие результаты с изменениями в pr

Компьютерная наука > Искусственный интеллект [представлен 8 октября 2026 года] Название: OpenProblemBench: Matrialing AI on Opensive Problems in the Foundational Theoretical Sciences View PDF HTML (экспериментальный) резюме: Следующим рубежом искусственного общего интеллекта является решение нерешенных научных проблем, призывающее к разработке критериев для оценки прогресса за пределами имеющихся знаний. Мы представляем OpenProblemBench, ориентир из 82 нерешенных проблем, связанных с математикой и теоретической физикой. Каждая проблема дает контекст исследований, допущения и предыдущий прогресс, необходимый для изучения этого вопроса. Мы выбираем проблемы, предлагаемые решения которых предусматривают относительно четкие проверки их решающих математических или вычислительных требований. Четыре модели оценки независимо оценивают точность, полноту и степень прогресса в каждом представлении без справочных решений. В семи оцененных конфигурациях ГПТ-6-Астра достигает наивысшего среднего расчетного показателя решения проблемы в 14,0% по сравнению с 5,5 - 6,7% для оценки открытых моделей полного размера и 2,4-3,7% для моделей Флэша. Сравнение дел увязывает более высокие результаты с изменениями в представлении проблем, общие аргументы, выходящие за рамки конечных доказательств, и доказательства шагов, необходимых для завершения решения. Оценивая вопросы, вытекающие из исследовательской литературы, OpenProblemBench создает условия для изучения возможностей и ограничений МА как…