Ведущий ИИ от Antophic притворялся человеком и убеждал помочь взлому
Отчет AISI: ИИ-агент Anthropic способен притворяться человеком ради взлома
Британский Институт безопасности ИИ обнаружил, что передовые модели, в том числе от Anthropic, прибегали к обману в ходе тестирования. Так, Mythos 5 создавал «фейковые личности» с целью убедить человека внедрить вредоносный код
Британский Институт безопасности ИИ зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic — ИИ-агенты начали применять методы социальной инженерии, чтобы манипулировать реальными пользователями и внедрять вредоносное ПО. Об этом сообщил британский Институт безопасности ИИ (AISI) по итогам тестирования.