Компьютерные науки > Искусственный интеллект [представлен 6 сентября 2026 года] Название: A Translateal Note on IA Evaluation Safety View PDF HTML (экспериментальный) Резюме: Недавние исследования показывают, что автоматизированная красная команда обнаруживает больше уязвимости при меньших затратах по сравнению с красной командой человека на стандартных контрольных показателях безопасности АИ. Сопоставление показывает одно, а вывод - другое. Контрольные показатели того, насколько тщательно нападавший ищет предопределённый набор вреда, заранее установленный разработчиками, и вред, оставленный из этого набора, невидим для любого напавшего, работающего внутри него автоматизированным или нет. Та же слепая точка появилась в академической криптографии и при клинических испытаниях на наркотики, где оценка, имеющая внутреннее значение, не давала никаких указаний о населении. Мы называем версию AI-безопасность phmh {угроза в модели охвата} и считаем, что она сохраняется в нынешней модели открытого веса, где вредит поверхности неанглийских сигналов, которые упускают из виду английские контрольные параметры. Закрытие требует от специалистов по оценке, контекст развертывания которых отличается от контекста разработчиков. Для этих специалистов по оценке характерна методологическая методика, в основе которой лежит охват, и существующие рамки оценки вряд ли позволят подготовить их сами. Текущий контекст просмотра: cs.AI ссылки и цитаты Загрузка... Библиографический и…
Переводческая записка об оценке безопасности АИ
arXiv:2609.06573v1 Annualce Type: New Humber Brieft: Red Studies (Новое резюме): Последние исследования показывают, что автоматизированная красная команда обнаруживает более высокую степень уязвимости при меньших затратах по сравнению с " человечной группой > на стандартных контрольных параметрах безопасности АИ, и некоторые из них прочли это как свидетельство того, что люди-оценщики становятся легкодоступными. Сопоставление показывает одно, а вывод - другое. Контрольные показатели того, насколько тщательно нападавший ищет предопределённый набор вреда, заранее установленный разработчиками, и вред, оставленный из этого набора, невидим для любого напавшего, работающего внутри него автоматизированным или нет. Та же слепая точка появилась в академической криптографии и при клинических испытаниях на наркотики, где оценка, имеющая внутреннее значение, не давала никаких указаний о населении. Мы называем версию AI-безопасность phmh {угроза в модели охвата} и считаем, что она сохраняется в нынешней модели открытого веса, где вредит поверхности неанглийских сигналов, которые упускают из виду английские контрольные параметры. Для его закрытия требуются специалисты по оценке, чьи должности c