FLARE: Тонкая диагностика для уточнения кода LLM

#FLARE #Тонкая #Annuales #Type #Большие

arXiv: 2606.03852v2 Annuales Type: заменить кросс-бюллетень: Большие языковые модели часто генерируют коды с ошибками. Существующие методы основаны на таких сигналах обратной связи, как несрабатывание в ходе испытаний и самокритики для итеративной доработки генерируемого кода. Такие сигналы либо слишком тяжёлые, либо слишком высокие, что недостаточно для информирования модели о том, где можно исправить ошибку. В этой работе мы представляем Flare, итеративную систему с легкой диагностической моделью, которая предсказывает сигналы подозрительности на линейном уровне для локализации ошибок и уточнения кода. С учетом присущей диагностике неопределенности, «проблемы» ищут в районах сверху-k и выбирают наилучших кандидатов по результатам исполнения. Эксперименты на LiveCodeBench и Big Codelbench с пятью базовыми МЛМ показывают, что даже без поиска кандидатов (k=1) Flare превосходит самые сильные исходные показатели с абсолютным улучшением с 1,72% до 7,42%. Кроме того, поиск более 10 кандидатов дает в среднем 8,50 улучшения.