Модели, которые знают, каким образом разрабатываются оценки

#Модели #arXiv NLP #arXiv

arXiv: 2605.28591v4 Тип уведомления: заменить резюме: достоверность оценок безопасности АИ зависит от моделей, которые последовательно действуют в контролируемых и развернутых конфигурациях. В ходе предыдущей работы были определены контекстуальные параметры тест-времени, такие как гипотетические сценарии, в качестве источника словесной осведомленности об оценке и последующего изменения поведения. В настоящем документе мы изучаем потенциальное объяснение этого явления: мета-знания оценки, определяемые как параметрические знания о структурных особенностях, характерных для оценок. По аналогии с загрязнением набора данных, когда базовый уровень воздействия приводит к повышению эффективности посредством запоминания, мы предполагаем, что модели, подготовленные по текстам о практике оценки, могут имплицитно научиться распознавать и реагировать на условия, похожие на оценку, например путем ознакомления с научными статьями или постами в социальных сетях относительно контрольных параметров АИ. Чтобы проверить это, мы отладим модели на синтетических документах с описанием таких характеристик оценки как поддающаяся проверке структ

Компьютерные науки > Расчеты и язык [представлен 27 мая 2026 (v1), последний пересмотренный вариант 7 сентября 2026 года (эта версия, v4)] Название: Models Whouse Know Houth Evaluations Are Designed Score View PDF HTML (экспериментальное) Резюме: Достоверность оценок безопасности АИ зависит от того, будут ли модели последовательно вести себя в контролируемых и развернутых условиях. В ходе предыдущей работы были определены контекстуальные параметры тест-времени, такие как гипотетические сценарии, в качестве источника словесной осведомленности об оценке и последующего изменения поведения. В настоящем документе мы изучаем потенциальное объяснение этого явления: мета-знания оценки, определяемые как параметрические знания о структурных особенностях, характерных для оценок. По аналогии с загрязнением набора данных, когда базовый уровень воздействия приводит к повышению эффективности посредством запоминания, мы предполагаем, что модели, подготовленные по текстам о практике оценки, могут имплицитно научиться распознавать и реагировать на условия, похожие на оценку, например путем ознакомления с научными статьями или постами в социальных сетях относительно контрольных параметров АИ. Чтобы проверить это, мы совершенствуем модели на синтетических документах с описанием таких характеристик оценки, как поддающиеся проверке структуры или вредные запросы. Оценивая эту усовершенствованную модель на основе пяти контрольных показателей безопасности, мы считаем ее значительно более безопасной…