Тренер Qwen3 Coder 30B, чтобы думать как агент CodClash Arena

#Тренер #Coder #CodClash #Arena #Annualce

arXiv:2609.16096v1 Annualce Type: кросс-бюллетени. Этот пробел особенно заметен в дальнего горзона, где агент должен неоднократно проверять результаты предыдущих исследований, диагностировать ошибки и выбирать следующий редактор кода под ограничениями взаимодействия. Это мотивирует естественный вопрос: что мы можем сделать для улучшения процесса мышления слабого агента кода? Мы изучаем этот вопрос в CodeClash, ориентире код-арены, где изначальная работа оценивает 8 коммерческих агентов кодирования на 6 ареалах с помощью многоразовых турниров. Поскольку Qwen3 Coder Plus занимает последнее место среди них, мы берем открытый вес Qwent3-Coder-30B в качестве тематического исследования и изучаем вопрос о том, как улучшить его с помощью дистиллированных знаний от более сильных агентов. Наш анализ показывает, что Qwen3-Coder-30B недостаточно оптимизирован для взаимодействия в стиле арен: он Fre

Компьютерная наука > Программное инжиниринг [Представлено 14 сентября 2026 года] Название: Тренирование Qwen3 Coder 30B для мышления как кодClash Arena View PDF HTML (экспериментальный) Резюме. Этот пробел особенно заметен в дальнего горзона, где агент должен неоднократно проверять результаты предыдущих исследований, диагностировать ошибки и выбирать следующий редактор кода под ограничениями взаимодействия. Это мотивирует естественный вопрос: что мы можем сделать для улучшения процесса мышления слабого агента кода? Мы изучаем этот вопрос в CodeClash, ориентире код-арены, где изначальная работа оценивает 8 коммерческих агентов кодирования на 6 ареалах с помощью многоразовых турниров. Поскольку Qwen3 Coder Plus занимает последнее место среди них, мы берем открытый вес Qwent3-Coder-30B в качестве тематического исследования и изучаем вопрос о том, как улучшить его с помощью дистиллированных знаний от более сильных агентов. Наш анализ показывает, что Qwen3-Coder-30B недостаточно оптимизирован для взаимодействия в стиле арен: он часто вызывает ошибки в синтаксисах и протоколах и демонстрирует недостаточную стратегическую адаптацию на протяжении всего цикла. Эти недостатки трудно исправить только путем установки ванильной инструкции, поскольку офлайновый SFT не может непосредственно проверить действительность или полезность совершенного действия. Для решения этой проблемы мы предлагаем перезаписать траектории учителя в четкие [очки][обыки] [действующие] цепи и индексируемое…