Реклама

StoreBench: Жизненная среда для оценки и подготовки независимых операторов

#StoreBench #Жизненная #Annuaire #Type #Abstract

arXiv:2610/942v1 Annuaire Type: New Abstract: Supretainment Education Cities теперь является главным рычагом для совершенствования возможностей большой языковой модели (LLM) в период после прохождения подготовки, однако большинство агенских контрольных показателей остаются статичными: мир движется только тогда, когда агент действует, вознаграждение - это окончательный вердикт и бар пропусков устанавливается произвольно. Мы представляем StoreBench, среду для торговли живым товаром, в которой агент управляет средним онлайн-магазином одежды на производственном уровне, проверяя долгое планирование и экономические суждения при неопределённости. Клиенты заказывают круглосуточно, поставщики переценивают цены и сводят концы с концами, а рыночные потрясения происходят частично или без предупреждения. Агент действует с помощью тех же 29 торговых инструментов, которые использует оператор человека в рамках " окнах > операционного бюджета, который делает имитируемое время функцией принимаемых мер, так что запоздание модели не может повлиять на имитационное время. Пороговые значения для пропусков откалиброваны по сценариям якорной политики, вознаграждение ужесточается по каталогу ре.

Компьютерные науки > Искусственный интеллект [представлен 7 октября 2026 года] Название: StoreBench: Жизненная среда для оценки и подготовки независимых операторов Ви (экспериментальный) обзор PDF HTML. Мы представляем StoreBench, среду для торговли живым товаром, в которой агент управляет средним онлайн-магазином одежды на производственном уровне, проверяя долгое планирование и экономические суждения при неопределённости. Клиенты заказывают круглосуточно, поставщики переценивают цены и сводят концы с концами, а рыночные потрясения происходят частично или без предупреждения. Агент действует с помощью тех же 29 торговых инструментов, которые использует оператор человека в рамках " окнах > операционного бюджета, который делает имитируемое время функцией принимаемых мер, так что запоздание модели не может повлиять на имитационное время. Пороговые значения откалиброваны по сценариям якорной политики, вознаграждение закрепляется по каталогу взломов награды и каждый эпизод повторяется идентично при условии последовательности действий. Мы оцениваем семь пограничных МЛМ по 11 сценариям продолжительностью от 30 до 45 дней и полностью моделируем год, более чем три мировых семян при параллельной логике. Ни одна модель не соответствует сценарийной политике в среднем: лучший, DeepSeek-V4-Pro, проходит 49% целевых клеток против 97% эвристики. Человеческие эксперты, работающие с использованием одних и тех же инструментов и бюджетов, превосходят каждую модель (средний состав 0,708…