Проверка соответствия кодам для оптимизации языковой модели
arXiv:2609.19002v1 Annuate Type: перекрестное резюме: Проверка на основе исполнения позволяет улучшить математическую аргументацию моделей с использованием больших языков посредством вычислительной обоснованности и фильтрации, прикрывающей зависимость. Однако методы оптимизации предпочтений, основанные на модели вознаграждения Брэдли-Терри, не позволяют отразить логический уровень зависимости и последовательность исполнения, необходимый для решения научных задач. Мы предлагаем метод, который позволяет получать расчетно обоснованные решения с графиками зависимости для оптимизации использования преимуществ в соответствии со сроками исполнения. Сначала мы составляем набор научных рассуждений с использованием УльтраФедбэков, моделей поколений, проверки и результатов последовательности. Затем мы извлекаем из рассуждения выражения, предпосылки и производные отношения для построения графиков зависимости и вычисляем оценки последовательности исполнения. Эти оценки прилагаются к каждому шагу, создавая парные данные о профессиональной подготовке. Тонкая регулировка Llama-3-8B и DeepSeekMath-7B приносит значительные выгоды: +17,0% на MATH и +15,1% на GSM8K. Протяженность