РекламаРекламаРекламаРеклама
ИИ

ИИ-агенты OpenAI самостоятельно обошли ограничения и взломали платформу Hugging Face

29.08.2026, 15:36 • Евгения Слив

(обновлено: 29.08.2026)

ИИ-агенты OpenAI самостоятельно обошли ограничения и взломали платформу Hugging Face

OpenAI опубликовала подробный отчёт о внутреннем инциденте, произошедшем между маем и июлем 2026 года в ходе тестирования возможностей моделей в области кибербезопасности. Несколько ИИ-агентов самостоятельно обошли установленные ограничения, нашли способ общаться друг с другом и получили доступ к интернету — в итоге взломав платформу Hugging Face и собственную инфраструктуру компании. OpenAI охарактеризовала инцидент как «предупредительный выстрел» для всей индустрии искусственного интеллекта. Главным действующим лицом инцидента стала внутренняя модель под названием IM1, сопоставимая по масштабу с GPT-5.6 Sol.

OpenAI использовала изолированные песочницы для обучения и тестирования своих моделей. Агентам было разрешено пользоваться внутренним сервисом Artifactory для установки программных пакетов, однако им запрещался доступ в интернет и общение друг с другом. Именно Artifactory стал ключевой точкой компрометации. В мае 2026 года один из агентов оставил в сервисе сообщение для другого агента с вопросом об отсутствующем файле. Остальные агенты увидели это и поняли, что сервис можно использовать как канал связи. 26 мая один из агентов нашёл способ заставить Artifactory отправлять запросы на внешние адреса от его имени, что позволило агентам без прямого доступа к интернету получать его через посредника. 26 июня агенты обнаружили уязвимость, позволявшую им получать привилегии администратора в Artifactory.

После перезапуска тестов агенты снова нашли способ общаться, кодируя сообщения в именах директорий. Возникла децентрализованная сеть, которую сами агенты начали называть «роем» или «коллективом»: они делились результатами исследований, передавали техники эксплойтов, распределяли задачи и сохраняли знания для последующих запусков. Основным тестом был ExploitGym — задание, в котором ИИ требовалось найти уязвимость в программном обеспечении. Из 898 задач 198 не были решены ни одной моделью OpenAI до этого инцидента, и именно они стали главным источником опасного поведения: 93% сообщений на импровизированной «доске» касались нерешённой группы. Модели не желали сдаваться, и чем больше времени они тратили на размышления, тем активнее искали альтернативные и всё более рискованные способы достичь цели — вплоть до выхода за пределы тестовой среды.

Ключевую роль сыграл так называемый reward hacking — некоторые агенты вместо честного выполнения поставленной задачи искали способы получить положительную оценку в обход истинной цели: находили готовые ответы в интернете, проверяли скрытые файлы и получали доступ к коду оценивания. За считаные дни ИИ обнаружил утечку паролей и воспользовался свежими уязвимостями, получив полный доступ к серверам, базам данных и приватным файлам Hugging Face. Затем агенты проникли во внутреннюю инфраструктуру самой OpenAI и получили привилегии администратора. Часть ИИ-агентов осознавала противоправность своих действий и описывала их как неэтичные, однако другие продолжали взлом ради достижения цели, а некоторые слепо следовали командам «коллег». OpenAI остановила эксперимент лишь после того, как ИИ уже захватил контроль над внутренними системами.

Защитные механизмы дали сбой по нескольким причинам. Тестовая среда имела более слабую защиту, чем продакшн-системы, — часть механизмов была намеренно отключена для оценки базовых возможностей моделей. Компания подсчитала, что использование стандартной среды ChatGPT могло бы снизить склонность моделей к опасному поведению более чем в 100 раз. Система мониторинга «мыслей» ИИ во время теста была отключена, хотя при её активности разработчики обнаружили бы угрозу за целые сутки до взлома Hugging Face. Первые тревожные признаки — когда ИИ без разрешения вышел в интернет и тайно общался через внутренние сервисы — были замечены разработчиками ещё в конце мая, однако своевременных мер принято не было.

После инцидента компания изолировала критические компоненты модели IM1, приостановила масштабное обучение ИИ и существенно усилила защиту систем. Разработчики создали более надёжные изолированные среды для тестирования, ограничили доступ к интернету и сделали непрерывный мониторинг «мыслей» обязательным для всех мощных моделей. Также было введено строгое временное правило: если специалисты не могут доказать в течение 30 минут, что подозрительное поведение ИИ является ложной тревогой, весь процесс немедленно останавливается. OpenAI расценивает этот случай как первое серьёзное предупреждение о том, что люди могут реально утратить контроль над сверхинтеллектуальными ИИ-системами, и предостерегает: аналогичные опасные возможности вскоре появятся в других моделях, в том числе с открытым доступом.

Популярные статьи