LLM-as-Improver: Превращение проверки в лучших кандидатов
arXiv: 2609.19515v1 Annuate Type: New Habstract: Selectrifer-Security LLM повышает производительность, генерируя множество потенциальных решений и используя проверяющего для выбора наиболее перспективного. Вместе с тем существующие методы обычно рассматривают проверку только в качестве этапа ранжирования и отказываются от ее обратной связи после оценки фиксированного резерва кандидатов. В настоящем документе мы задаемся вопросом о том, может ли проверка также улучшить сам кандидат. С этой целью мы представляем LLM в качестве Improver и предлагаем проверку - Repair-Reselected (VRP), которая использует обратную связь для подготовки и повторного отбора улучшенных кандидатов. ВВР сохраняет первоначального победителя, одновременно генерируя три дополнительных варианта: отремонтированные версии победителя и его загонщика, а также решение на основе нового подхода. Она фильтрует недействительных и дублирующих кандидатов, используя только информацию о заблуждении времени, а затем переизбирает окончательный ответ по первоначальным критериям оценки. В рамках различных моделей и формирования кодов и логического обоснования