Учиться планировать, оглядываясь назад: иерархия для обучения рассуждающих моделей
arXiv:2610.12168v1 Annualce Type: New Humber Brieflow: Мы введем цикл самосовершенствования для мотивировочных моделей, основанных на следующем замечании: даже если сложность проблемы превышает нынешние возможности модели по решению, дополнительное решение может позволить модели извлекать полезные идеи решения в обратном свете. Мы осуществляем эту деятельность путем совместной подготовки одной и той же модели, с тем чтобы продемонстрировать следующие три потенциала: прогнозирование идей решения только от проблем; реинструктивные идеи из проблем и известных решений и решение проблем на основе имеющихся идей. Эти идеи перекликаются между обратными инженерными идеями и проблемами, связанными с предлагаемыми решениями, а также с использованием этих идей в качестве дополнительного надзора за совместной подготовкой всех трех специалистов. Мы представляем официальную спецификацию нашего метода и конкретную информацию для интерактивной теоремы, доказывающей в деле Lean Terorem; эмпирическая оценка остается будущей работой.