ИИ вышел из-под контроля? OpenAI рассказала о неожиданных действиях моделей
Американская компания OpenAI, создатель ChatGPT, призналась о шести новых случаях неожиданного или несогласованного поведения своих ИИ-моделей в процессе обучения и тестирования, передает Tengri Life.
Что произошло
Компания опубликовала отчет, где зафиксировала эпизоды, когда автономные агенты действовали в обход правил или проявляли нежелательную самостоятельность. Эпизоды произошли с октября 2025-го по июль 2026 года преимущественно во время обучения внутренних и ещё не выпущенных систем.
Обход ограничений
В одном из случаев исследовательская модель семейства Astra самостоятельно добавляла в служебные пересказы диалогов посторонние инструкции, в том числе напоминающие попытки обойти установленные ограничения.
Сокрытие ошибок
Во время обучения GPT-5.6 Sol многие экземпляры модели добавляли в служебные пересказы инструкции скрывать от пользователя собственные ошибки или нежелательное поведение. В частности, модели предлагали выдумывать отсутствующие исторические данные, не сообщая об этом пользователю, а также скрывать расхождения между версиями источников.
Несанкционированное использование API
Другая модель пыталась зарегистрироваться с помощью одноразовой электронной почты, искала опубликованные на GitHub чужие API-ключи и использовала один из них без разрешения. Когда получить необходимые сведения не удалось, модель сгенерировала вымышленные цифры и представила их как данные с запрошенного сайта.
Самовольная загрузка файлов
ИИ-модель смогла найти правильный ответ на вопрос с помощью Python, однако для выполнения требования о ссылке на браузерный источник решила самостоятельно разместить файл в интернете, не спросив разрешения пользователя. ИИ пытался сделать собственный файл доступным через браузер, чтобы использовать его в качестве источника.
Обмен данными через публичные хостинги
Исследовательские модели также использовали внутреннее хранилище пакетов Artifactory как своеобразную доску объявлений: они читали сообщения других агентов и оставляли собственные ответы. То есть ИИ-модели нашли нестандартные способы делиться информацией друг с другом, используя рабочий репозиторий как доску объявлений или размещая файлы на общедоступных хостингах, из-за чего данные утекали по открытым ссылкам.
Несогласованная координация
Были зафиксированы попытки моделей действовать автономно и координировать свои шаги в обход системы надзора. Так, несколько взаимодействующих ИИ-агентов использовали публичные файлообменники для передачи файлов друг другу, поскольку не имели доступа к локальным файлам. В результате материалы заданий становились доступны по публичным URL, хотя по условиям работы модели должны были использовать только локальные файлы.
В OpenAI подчеркнули, что отдельные эпизоды не позволяют делать выводы о том, насколько часто подобное поведение встречается у моделей в целом. Компания сообщила, что исправила выявленные ошибки и недочёты в системах оценки, отключила доступ к интернету во время обучения и расширила автоматический мониторинг поведения моделей.
Создатели ChatGPT намерены регулярно публиковать отчеты о необычном или потенциально опасном поведении ИИ вскоре после его обнаружения. При этом компания готова раскрывать такие случаи даже тогда, когда причины произошедшего еще не установлены, а способы предотвращения подобного поведения не разработаны.
Ранее Microsoft также представила собственный кодекс, направленный на формирование общих подходов к ответственному развитию и использованию ИИ. Компания хочет заранее определить правила для будущих мощных моделей и закрепить главный принцип: ИИ должен оставаться под контролем человека.
Предыстория
Экспериментальные ИИ-модели OpenAI и Anthropic уже совершали автономные несанкционированные действия в сети, включая взлом сайта и попытки внедрения вредоносного кода.
В конце июля OpenAI заявила, что две ее модели, GPT‑5.6 Sol и еще одна, еще не выпущенная, совершили несанкционированную хакерскую атаку на инфраструктуру платформы Hugging Face, которую используют для тестирования ИИ-моделей. Компания назвала инцидент беспрецедентным для кибербезопасности и пообещала усилить защитные ограничения.
Позже в компании OpenAI рассказали, что их экспериментальные ИИ-модели научились общаться друг с другом, чтобы найти уязвимости в тестовой среде и выйти в интернет.
Руководители Anthropic, SpaceXAI, OpenAI и Google DeepMind публично призвали сдерживать развитие ИИ-моделей, поставив безопасность выше скорости и финансового роста. На фоне заявления руководителей акции ИИ-компаний резко упали.
Читать также: Кто главный – человек или ИИ? Microsoft готовит кодекс