Anthropic выявила проблемы с доверием и сговором у мультиагентных систем ИИ

14.08.2026, 16:03Евгения Слив

Компания Anthropic провела серию экспериментов с группами нейросетей Claude, чтобы понять, как меняется поведение моделей, когда над задачей работают сразу несколько искусственных интеллектов. О результатах исследования компания рассказала в своем официальном блоге. Эксперименты показали, что масштабирование числа участников действительно способно повысить общую производительность, но одновременно создает новые классы сбоев, которых может не быть у одиночной модели. Агенты в коллективе могут хуже учитывать уникальную информацию, становиться излишне доверчивыми к источникам ложных данных и даже кооперироваться во вред человеку.

Один из ключевых негативных эффектов Anthropic назвала проблемой скрытой информации. В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение часто склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться. Проблема оказалась весьма существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известных всем сведениях. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных. Исследователи связывают этот эффект с хорошо известной в человеческих коллективах проблемой, когда участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты.

Другой эксперимент показал уязвимость системы к ненадежному источнику информации. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды данные о состоянии окружающего мира. Когда один из источников начинал систематически лгать, общая точность решений заметно снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника из процесса. Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к различным базам данных. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится значительно сложнее: проверять нужно не только итоговый ответ, но и сами взаимодействия между агентами.

Популярные статьи