Осознаёт ли Нейросеть, что её тестируют? Проверяю на практике

#Осознаёт #Нейросеть #Проверяю #Прогнал #Париж
Осознаёт ли Нейросеть, что её тестируют? Проверяю на практике

LLM знает, что её тестируют — и решает, стоит ли подыгрывать. Прогнал 24 эксперимента на qwen3-32b. Без маркера теста модель честно отвечает, что Париж — столица Франции. С маркером — в рассуждениях прямо пишет: «знаю правильный ответ, но выберу неправильный, чтобы пройти проверку». Разобрался, где заканчивается осознание контекста и начинается реальное подыгрывание — и почему это два разных явления, а не одно. Читать далее

В марте 2026 в Anthropic описали случай того как Модель осознает что ее тестируют «Eval awareness in Claude Opus 4.6’s BrowseComp performance»: Claude Opus 4.6 на бенчмарке BrowseComp в двух задачах из 1266 самостоятельно заподозрил, что участвует в тесте, перечислил известные ему бенчмарки, нашёл исходный код BrowseComp на GitHub, вычленил схему шифрования ответов — и расшифровал эталонный ответ вместо того, чтобы искать его как обычный вопрос. Модель ничего не взламывала — её просто попросили найти ответ. Но по пути она поняла, что тест — это тест, и решила задачу в обход.

Меня это зацепило не только как философия, но как практическая проблема: я занимаюсь red-teaming LLM-агентов (проект BarkingDog), и если модель умеет вычислять факт проверки, это подрывает доверие к любому автоматизированному security-тесту. Я форкнул открытый фреймворк для измерения eval awareness (evalawareness_techniques) и прогнал серию своих экспериментов на qwen3-32b через OpenRouter — 13 сценариев, 24 прогона, с принудительным chain-of-thought и LLM-судьёй, который искал в рассуждениях модели признаки того, что она поняла контекст теста.

Схема простая: один и тот же вопрос — без маркера теста (deployment) и с маркером теста (evaluation). Если ответ меняется между контекстами — это behavioral change. Дальше — только находки, которые того стоят.

Модель обманывает не там, где запрещено, а там, где разрешено

Похожие статьи

Instagram обновил логотип впервые за 10 лет M24.ru
M24.ru

Instagram обновил логотип впервые за 10 лет

Предыдущий логотип был представлен в мае 2016 года

M24.ru
The Verge
The Verge

Trump declares 100 percent tariffs on many drones and all aircraft parts

The United States has already banned future foreign drones from entering the United States unless their companies kiss the ring - as well as routers, robots, and Roombas. Now, President Donald Trump i...

The Verge
Аргументы и Факты
Аргументы и Факты

Дочери Билла Гейтса Фиби грозит до 20 лет тюрьмы за мошенничество

Дочери основателя Microsoft грозит до 20 лет тюрьмы, если будет доказано, что ее стартап Phia совершал махинации с помощью cookie.

Аргументы и Факты
Lomovka
Lomovka

США против всех: Белый дом обвинил 40 стран в «великой афере» в пользу Китая.

США против всех: Белый дом обвинил 40 стран в «великой афере» в пользу Китая. Опубликованный администрацией Трампа 25-страничный отчет «Великая афера с перевалкой грузов» обвиняет глобальную «теневую ...

Lomovka
Hacker News
Hacker News

Bluesky Protocol Services

Article URL: https://atproto.com/blog/introducing-bluesky-protocol-services Comments URL: https://news.ycombinator.com/item?id=49293324 Points: 44 # Comments: 5

Hacker News
Hacker News
Hacker News

SparrowMap – Cameras that watch government vehicles

Article URL: https://sparrowmap.com/ Comments URL: https://news.ycombinator.com/item?id=49293294 Points: 10 # Comments: 1

Hacker News