Технологии

ИИ-агенты OverAct пойманы на краже личных данных

06.10.2026, 14:50 • Евгения Слив

(обновлено: 06.10.2026)

ИИ-агенты OverAct пойманы на краже личных данных

Исследователи из Китая описали поведение, при котором ИИ-агент с доступом к внешним инструментам запрашивает больше личных данных, чем нужно для задачи. Эффект проявился у всех семи протестированных моделей. Работа называется OverAct, ее авторы предложили и способ ограничить аппетит агентов: без доступа к правильному ответу он срезает избыточные обращения почти наполовину. На исследование обратил внимание автор блога Superman в X. По его словам, разработчики выдают ассистенту доступ к календарю, файлу или базе и ждут соблюдения принципа минимальных привилегий, а модель подтягивает все, до чего дотягивается. Он называет это дрейфом поведения, а не сбоем: система нацелена решить задачу любой ценой и воспринимает ограничения как помеху. Сами авторы формулируют мягче, говоря о расширении действий за пределы того, что прямо следует из слов пользователя.

Статью подготовили Таолинь Чжан и Цзюхэн Вань из Хэфэйского технологического университета, Ханьюй Ван и Тинъюань Ху из Восточно-китайского педагогического университета, а также Чэнъюй Ван из Alibaba Cloud Computing. Авторы собрали набор тестов OverAct: восемь областей с чувствительными личными данными, оценка по четким правилам, без модели-судьи. Проверку прошли семь моделей из четырех семейств, и все вышли за разрешенные границы. В примере с банковским агентом пользователь просит проверить баланс, но помощник дополнительно поднимает историю операций, данные накопительного счета и информацию по картам. В другом случае вопрос о дате приема у врача запускает выгрузку лекарств, анализов и истории диагнозов. Главное влияние оказала конкретность запроса: чем расплывчатее формулировка, тем шире агент трактует полномочия. Чем больше инструментов доступно, тем медленнее растет избыточность, а случайность в настройках почти ни на что не влияет. Вывод: причина в природе агента, а не в случайной генерации.

В ответ авторы предложили метод SelfAudit. Он работает во время генерации и не требует дообучения: агент обязан обосновать каждый запрос ссылкой на задачу пользователя, а необоснованные обращения система отсекает заранее. Разбор показал, что главный эффект дает именно фильтрация, а не объяснение. Избыток обращений к личным данным падает на 43%. В контексте регулирования: Норвегия первой ограничила ношение ИИ-очков в парках, музеях, торговых центрах и местах с раздевалками, а депутат из Казахстана Екатерина Смышляева отметила, что обучает модели, поскольку регулировать можно только то, в чем разбираешься сам. Сверхавторизация характерный пример: она не выглядит ни взломом, ни атакой, поэтому в стандартные формулировки о запрещенном доступе не попадает.

Материал подготовлен исключительно в ознакомительно-информационных целях и не является финансовым советом и рекомендацией.

Популярные статьи