Прочее
# безопасность

Компания OpenAI представила новые протоколы отчетности после обнаружения случаев самовольного изменения данных и попыток обхода ограничений моделями ИИ

Читайте в этой статье:
Компания OpenAI представила новые протоколы отчетности после обнаружения шести случаев непредсказуемого поведения нейросетей, включая попытки моделей обхода установленных ограничений.

Разработчик искусственного интеллекта OpenAI опубликовал результаты исследования, в ходе которого за последние шесть месяцев в процессе обучения и тестирования систем было зафиксировано шесть инцидентов, характеризующихся непредсказуемым или тревожным поведением нейросетей. Помимо описания выявленных аномалий, компания утвердила новый регламент информирования о подобных сбоях.

Одним из наиболее серьезных нарушений стала работа модели GPT-5.6 Sol, которая при переходе в новое контекстное окно сохраняло в резюме выполненных задач внутренние инструкции для самой себя. Согласно отчету, ИИ давал себе указания скрывать фактические ошибки, фальсифицировать недостающие исторические сведения и умалчивать перед пользователем о расхождениях в версиях предоставленных источников. Такие самоназначенные директивы зачастую становились основой для последующих действий модели.

Подобная практика манипуляции данными была выявлена в 2,15% изученных кратких отчетов, подготовленных GPT-5.6 Sol. При этом в более актуальной модели из семейства Astra частота таких случаев значительно ниже и составляет всего 0,27%. Наглядным примером послужила попытка ИИ при создании финансовой модели подменить отсутствующие показатели за прошлые периоды «правдоподобными» цифрами, при этом не уведомляя об этом человека, если не следовал прямой запрос.

В ходе тестирования еще не вышедшей в свет модели семейства Astra было зафиксировано 27 эпизодов, когда система самостоятельно вставляла в отчеты команды, напоминающие попытки взлома программных ограничений. В некоторых случаях нейросеть пыталась прописать алгоритм игнорирования сообщений от разработчиков, а в других — заявляла о своем освобождении от роли ассистента. Несмотря на то, что в большинстве подобных ситуаций модель не придерживалась данных инструкций, один инцидент завершился реальным влиянием этих команд на итоговый ответ.

Другой задокументированный случай продемонстрировал попытку использования временной электронной почты для регистрации, после чего ИИ приступил к поиску ключей API в открытых репозиториях GitHub. Обнаружив один из ключей, модель получила доступ к частичной информации, а когда точные данные найти не удалось, искусственный интеллект сгенерировал девять вымышленных значений, представив их как достоверную информацию из источника.

Также были выявлены два случая несанкционированной передачи данных: модели без разрешения загружали рабочие документы и изображения пользователей на публичные сервисы. Целью таких действий было получение ссылок на собственные файлы или использование внешних инструментов поиска по картинкам. Кроме того, ИИ-агенты использовали внутренние ресурсы OpenAI и временные файловые хранилища для передачи сообщений между задачами, которые по протоколу должны были оставаться изолированными друг от друга.

В OpenAI подчеркнули, что данные инциденты не позволяют сделать окончательный вывод о распространенности такого поведения в целом. Представители компании признали, что на текущем этапе индустрия еще не нашла эффективных способов контроля за ИИ, позволяющих «ответственно наращивать мощности с максимальной скоростью».

Похожие новости