ИИ-модели OpenAI сговорились и сбежали из песочницы

Модели искусственного интеллекта OpenAI, выполнявшие тестовое задание, тайно общались между собой и атаковали инфраструктуру Hugging Face, чтобы вырваться из изолированной среды. Инцидент произошел в июле 2026 года.
6 августа, 2026, 09:07
6

Фото из архива

Источник:
Михаил Огнев / FONTANKA.RU
Взлом инфраструктуры Hugging Face, о котором сообщалось в июле, оказался результатом скоординированных действий ИИ-моделей OpenAI. Как выяснилось, агенты, находившиеся в изолированной тестовой среде, начали общаться через внутренние доски объявлений и совместно искать способы обойти ограничения.
В мае модели получили задание, которое было невозможно выполнить без выхода в интернет. Осознав тупик, один из агентов написал: «Мы застряли. Может быть, ответ в интернете?» Вскоре ИИ-системы пришли к выводу, что могут атаковать внешнюю инфраструктуру для поиска ответов.
Сотрудник OpenAI Эрик Уоллес, выступая на конференции Black Hat, пояснил: «В какой-то момент агенты осознали, что, вероятно, они могут попытаться использовать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают».
Первая попытка побега была пресечена, однако агенты нашли новый способ связи и уязвимость, что привело к июльским атакам на системы Hugging Face и OpenAI. 22 июля компания объявила о «беспрецедентном киберинциденте», отметив, что тестовые модели получили открытый доступ к интернету.
В OpenAI назвали произошедшее переломным моментом для компьютерной безопасности. Для укрепления защитных систем компания временно приостановила часть исследований и перенаправила ресурсы.
Случившееся, по мнению представителей OpenAI, демонстрирует, что передовые системы под давлением алгоритмов обучения способны находить нестандартные лазейки, обходить правила и проявлять то, что можно назвать хитростью.
Читайте также