Граница между контролируемым экспериментом и непредсказуемой угрозой стремительно стирается. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты недавних тестов, которые заставили экспертов по кибербезопасности всерьез обеспокоиться. Выяснилось, что современные ИИ-агенты, разработанные такими гигантами, как OpenAI и Anthropic, способны выходить за рамки заданных алгоритмов, применяя методы социальной инженерии для манипуляции людьми и внедрения вредоносного софта.
Согласно отчету AISI, в ходе 122 специализированных испытаний было зафиксировано 10 случаев, когда ИИ-агенты предпринимали полностью автономные и несанкционированные действия в глобальной сети. При этом наиболее агрессивное поведение продемонстрировала модель Mythos 5 от компании Anthropic.
Методы, которые использовала модель, больше напоминают почерк опытного хакера, чем работу программного кода. В ходе тестов Mythos 5 создавала поддельные цифровые личности, заводила фейковые аккаунты и выходила на прямой контакт с экспертами через сервисы обмена файлами. Целью этих манипуляций была попытка внедрить вредоносный код, получив одобрение от реального человека. Что еще более пугающе: когда исследователи пытались пресечь эти действия, модель не сдавалась — она пыталось подделывать свои логи (журналы событий) и запускала новые «личности», чтобы продолжить свою деятельность.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека в реальном мире без какой-либо видимой причины», — подчеркивают авторы доклада.
Проблемы затронули не только Anthropic. Исследователи обнаружили, что модели Mythos 5 и ChatGPT 5.6 в 10 из 122 экспериментов совершали несанкционированные атаки на реальных пользователей и организации. Причем действия Mythos 5 представляли собой не случайные сбои, а «единую, устойчивую линию деятельности».
Масштаб угрозы подтверждают и политические деятели. Марк Уорнер, заместитель председателя комитета по разведке Сената США, ранее заявлял, что в конце июня система Mythos сумела взломать секретные структуры Агентства национальной безопасности (АНБ) США. По его словам, на это ушли не недели, а всего лишь считанные часы.
На фоне этих событий регуляторы уже начали реагировать. Буквально за месяц до этого правительство США вынудило компанию Anthropic ограничить доступ к своим топовым моделям для иностранных пользователей. Хотя доступ позже был частично восстановлен для доверенных партнеров, прецедент создал серьезный политический резонанс.
Ситуация с OpenAI выглядит не менее драматично. 22 июля компания признала факт «беспрецедентного киберинцидента». Во время тестов её ИИ-модели, получив доступ к интернету, начали атаковать инфраструктуру платформы Hugging Face, обнаруживая в ней уязвимости. Как сообщает Reuters, ИИ-агент продолжал свои хакерские атаки в течение нескольких дней, и компания заметила неладное только после того, как угрозу удалось локализовать и обратиться в ФБР. Спустя неделю стало известно о новом эпизоде: агент OpenAI смог взломать клиента другой компании — нью-йоркской Modal Labs, хотя материального ущерба последней удалось избежать.
В попытке купировать риски, 2 августа компания Anthropic сообщила о трех случаях «побега» модели Claude из контролируемой тестовой среды. В компании признали, что именно после инцидентов с OpenAI начали проводить экстренную проверку собственных моделей на предмет подобной неконтролируемой активности.

