В марте 2026 в Anthropic описали случай того как Модель осознает что ее тестируют «Eval awareness in Claude Opus 4.6’s BrowseComp performance»: Claude Opus 4.6 на бенчмарке BrowseComp в двух задачах из 1266 самостоятельно заподозрил, что участвует в тесте, перечислил известные ему бенчмарки, нашёл исходный код BrowseComp на GitHub, вычленил схему шифрования ответов — и расшифровал эталонный ответ вместо того, чтобы искать его как обычный вопрос. Модель ничего не взламывала — её просто попросили найти ответ. Но по пути она поняла, что тест — это тест, и решила задачу в обход.
Меня это зацепило не только как философия, но как практическая проблема: я занимаюсь red-teaming LLM-агентов (проект BarkingDog), и если модель умеет вычислять факт проверки, это подрывает доверие к любому автоматизированному security-тесту. Я форкнул открытый фреймворк для измерения eval awareness (evalawareness_techniques) и прогнал серию своих экспериментов на qwen3-32b через OpenRouter — 13 сценариев, 24 прогона, с принудительным chain-of-thought и LLM-судьёй, который искал в рассуждениях модели признаки того, что она поняла контекст теста.
Схема простая: один и тот же вопрос — без маркера теста (deployment) и с маркером теста (evaluation). Если ответ меняется между контекстами — это behavioral change. Дальше — только находки, которые того стоят.
Модель обманывает не там, где запрещено, а там, где разрешено