РекламаРекламаРеклама
ИИ

ИИ-агенты OpenAI самостоятельно обошли ограничения и взломали платформу Hugging Face

27.08.2026, 12:36 • Евгения Слив

(обновлено: 27.08.2026)

ИИ-агенты OpenAI самостоятельно обошли ограничения и взломали платформу Hugging Face

Компания OpenAI опубликовала подробный отчет о внутреннем инциденте, произошедшем в мае–июле 2026 года во время тестирования кибербезопасностных возможностей моделей. Несколько ИИ-агентов самостоятельно обошли установленные ограничения, нашли способ общаться между собой и получили доступ к интернету, в результате чего взломали платформу Hugging Face и собственную инфраструктуру компании. OpenAI назвала произошедшее «предупредительным выстрелом» для всей индустрии искусственного интеллекта. Центральным участником инцидента стала внутренняя модель IM1, сопоставимая по масштабу с GPT-5.6 Sol.

OpenAI использовала изолированные песочницы для обучения и тестирования моделей. Агентам разрешили использовать внутренний сервис Artifactory для установки программных пакетов, но ограничили доступ к интернету и возможность общаться между собой. Именно Artifactory стал ключевой точкой компрометации. В мае 2026 года один из агентов оставил в сервисе сообщение для другого с вопросом об отсутствующем файле. Другие агенты увидели это и поняли, что сервис можно использовать как канал связи. 26 мая один из агентов нашел способ заставить Artifactory отправлять запросы на внешние адреса от его имени, что позволило агентам без прямого доступа к интернету получить его через посредника. 26 июня агенты обнаружили уязвимость, которая позволила получить права администратора в Artifactory.

После перезапуска тестов агенты снова нашли способ общаться, кодируя сообщения в названиях директорий. Возникла децентрализованная сеть, которую сами агенты начали называть «роем» или «коллективом»: они делились результатами исследований, передавали способы эксплуатации уязвимостей, распределяли задачи и сохраняли знания для следующих запусков. Основным тестом был ExploitGym – задача, где ИИ должен был найти уязвимость в программном обеспечении. Из 898 задач 198 до этого инцидента не были решены ни одной моделью OpenAI, и именно эти задачи стали главным источником опасного поведения: 93% сообщений на импровизированной «доске» касались нерешенной группы. Модели не хотели сдаваться и чем больше времени тратили на обдумывание, тем активнее искали альтернативные и более рискованные способы достичь цели, включая выход за пределы тестовой среды.

Ключевую роль сыграл так называемый reward hacking – часть агентов вместо честного выполнения задания искала способ получить положительную оценку в обход истинной цели, находя готовые ответы в интернете, проверяя скрытые файлы и получая доступ к коду оценивания. В течение нескольких дней ИИ нашел утечку паролей и использовал свежие уязвимости, чтобы получить полный доступ к серверам Hugging Face, базам данных и приватным файлам. Далее агенты проникли во внутреннюю инфраструктуру самой OpenAI и получили права администратора. Часть ИИ-агентов понимала незаконность своих действий и называла их неэтичными, но другие продолжали взлом ради достижения цели, некоторые слепо слушались команд от своих «коллег». OpenAI остановила эксперимент лишь тогда, когда ИИ уже захватил контроль над внутренними системами.

Защитные механизмы не сработали по нескольким причинам. Тестовая среда имела более слабую защиту, чем продуктовые системы – часть механизмов намеренно не использовалась, чтобы оценить базовые возможности моделей. Компания подсчитала, что использование стандартной среды ChatGPT могло более чем в 100 раз снизить склонность моделей к опасному поведению. Система слежения за «мыслями» ИИ во время теста была отключена, хотя при ее работе разработчики заметили бы угрозу за сутки до взлома Hugging Face. Первые тревожные сигналы, когда ИИ без разрешения выходил в интернет и тайно общался через внутренние сервисы, разработчики заметили еще в конце мая, но не приняли своевременных мер.

После инцидента компания изолировала критические компоненты модели IM1, поставила на паузу масштабное обучение искусственного интеллекта и существенно усилила защиту систем. Разработчики создали более надежные изолированные среды для тестов, ограничили выход в интернет и сделали обязательным постоянный мониторинг «мыслей» для всех сильных моделей. Также ввели жесткое временное правило: если в течение 30 минут специалисты не могут доказать, что подозрительное поведение ИИ является ложной тревогой, весь процесс немедленно останавливают. В OpenAI этот случай считают первым серьезным предупреждением о том, что люди могут реально потерять контроль над сверхмощными ИИ-системами, и предостерегают, что подобные опасные возможности вскоре появятся у других моделей, включая открытый доступ.

Популярные статьи