Оригинальное название: Open Inside: Where RLVR Narrows the Solution Space
arXiv:2608.29188v1 Анонс Тип: новый Аннотация: Усиление обучения с проверяемыми наградами (RLVR) существенно повышает точность одного образца (pass@1), но приводит к сокращению пространства решения политики, уменьшая отдачу от масштабирования тестового времени. В этой работе мы исследуем, где…