Ненадежный прогресс бар: могут ли агенты LLM регулярно сообщать о прогрессе в выполнении задач на протяжении всего срока исполнения?
arXiv: 2609.085889v1 Annualection Type: Cross Brieft: Последние модели крупных языков могут давать сигналы о ходе выполнения задач, которые используются в рамках агентов для решения вопроса о том, следует ли продолжать или прекратить выполнение той или иной задачи, однако вопрос о том: может ли модель достоверно сообщать о достигнутом прогрессе на каждом этапе работы и где и каким образом ее доклады оказываются неуспешными, систематически изучается. Мы оцениваем эту способность на государственном контрольном уровне в размере $tau2 долл. США и на этапе IFP - контролируемом тесте, где пропускные пункты для представления отчетности размещаются на протяжении всего жизненного цикла задачи. Оба параметра требуют представления докладов на нескольких этапах выполнения задач. Мы считаем, что надежность отчетности зависит от стадии выполнения той или иной задачи и что почти каждая применяемая нами модель на одних этапах является надежной и ненадежной на других. В тех случаях, когда отчетность ломается, не везде одно и то же. Большинство развернутых моделей теряют точность после начала работ и восстановления после выполнения задачи. Новое поколение закрывает это среднее задание и вместо этого становится консервативным на финишной линии. Наш жеребец