Компьютерные науки > Расчеты и язык [представлен 27 мая 2026 (v1), последний пересмотренный вариант 7 сентября 2026 года (эта версия, v4)] Название: Models Whouse Know Houth Evaluations Are Designed Score View PDF HTML (экспериментальное) Резюме: Достоверность оценок безопасности АИ зависит от того, будут ли модели последовательно вести себя в контролируемых и развернутых условиях. В ходе предыдущей работы были определены контекстуальные параметры тест-времени, такие как гипотетические сценарии, в качестве источника словесной осведомленности об оценке и последующего изменения поведения. В настоящем документе мы изучаем потенциальное объяснение этого явления: мета-знания оценки, определяемые как параметрические знания о структурных особенностях, характерных для оценок. По аналогии с загрязнением набора данных, когда базовый уровень воздействия приводит к повышению эффективности посредством запоминания, мы предполагаем, что модели, подготовленные по текстам о практике оценки, могут имплицитно научиться распознавать и реагировать на условия, похожие на оценку, например путем ознакомления с научными статьями или постами в социальных сетях относительно контрольных параметров АИ. Чтобы проверить это, мы совершенствуем модели на синтетических документах с описанием таких характеристик оценки, как поддающиеся проверке структуры или вредные запросы. Оценивая эту усовершенствованную модель на основе пяти контрольных показателей безопасности, мы считаем ее значительно более безопасной…
Модели, которые знают, каким образом разрабатываются оценки
arXiv: 2605.28591v4 Тип уведомления: заменить резюме: достоверность оценок безопасности АИ зависит от моделей, которые последовательно действуют в контролируемых и развернутых конфигурациях. В ходе предыдущей работы были определены контекстуальные параметры тест-времени, такие как гипотетические сценарии, в качестве источника словесной осведомленности об оценке и последующего изменения поведения. В настоящем документе мы изучаем потенциальное объяснение этого явления: мета-знания оценки, определяемые как параметрические знания о структурных особенностях, характерных для оценок. По аналогии с загрязнением набора данных, когда базовый уровень воздействия приводит к повышению эффективности посредством запоминания, мы предполагаем, что модели, подготовленные по текстам о практике оценки, могут имплицитно научиться распознавать и реагировать на условия, похожие на оценку, например путем ознакомления с научными статьями или постами в социальных сетях относительно контрольных параметров АИ. Чтобы проверить это, мы отладим модели на синтетических документах с описанием таких характеристик оценки как поддающаяся проверке структ