Tecnología

Agentes de IA OverAct atrapados robando datos personales

6/10/2026, 17:47 • Eugenia Sliv

(edited: 06/10/2026)

Agentes de IA OverAct atrapados robando datos personales

Investigadores de China describieron un comportamiento en el que un agente de IA con acceso a herramientas externas solicita más datos personales de los necesarios para la tarea. Este efecto se manifestó en los siete modelos probados. El trabajo se llama OverAct, y sus autores propusieron una forma de limitar el apetito de los agentes: sin acceso a la respuesta correcta, reduce las solicitudes excesivas casi a la mitad. El autor del blog Superman en X llamó la atención sobre la investigación. Según él, los desarrolladores otorgan al asistente acceso a un calendario, archivo o base de datos y esperan que se respete el principio de privilegios mínimos, pero el modelo accede a todo lo que puede. Él lo llama una deriva de comportamiento, no un fallo: el sistema está enfocado en resolver la tarea a toda costa y percibe las restricciones como un obstáculo. Los propios autores lo expresan de manera más suave, hablando de una expansión de acciones más allá de lo que se deriva directamente de las palabras del usuario.

El artículo fue preparado por Taolin Zhang y Jiuheng Wan de la Universidad de Tecnología de Hefei, Hanyue Wang y Tingyuan Hu de la Universidad Normal del Este de China, y Chengyu Wang de Alibaba Cloud Computing. Los autores recopilaron un conjunto de pruebas OverAct: ocho áreas con datos personales sensibles, evaluación según reglas claras, sin un modelo juez. Siete modelos de cuatro familias fueron sometidos a prueba, y todos excedieron los límites permitidos. En el ejemplo de un agente bancario, el usuario solicita verificar el saldo, pero el asistente además extrae el historial de transacciones, datos de cuentas de ahorro e información de tarjetas. En otro caso, una pregunta sobre la fecha de una cita médica desencadena la descarga de medicamentos, análisis e historial de diagnósticos. La influencia principal fue la especificidad de la solicitud: cuanto más vaga es la formulación, más amplias son las facultades que el agente interpreta. Cuantos más herramientas están disponibles, más lentamente crece la redundancia, y la aleatoriedad en la configuración casi no influye. Conclusión: la causa está en la naturaleza del agente, no en la generación aleatoria.

En respuesta, los autores propusieron el método SelfAudit. Funciona durante la generación y no requiere reentrenamiento: el agente debe justificar cada solicitud con un enlace a la tarea del usuario, y las solicitudes injustificadas son filtradas por el sistema de antemano. El análisis mostró que el principal efecto proviene precisamente de la filtración, no de la explicación. El exceso de solicitudes de datos personales cae un 43%. En el contexto de la regulación: Noruega fue el primer país en restringir el uso de gafas de IA en parques, museos, centros comerciales y lugares con vestuarios, y la diputada de Kazajistán, Ekaterina Smyshlyaeva, señaló que entrena modelos, ya que solo se puede regular lo que uno mismo entiende. La sobreautorización es un ejemplo característico: no parece ni un hackeo ni un ataque, por lo que no se incluye en las formulaciones estándar sobre acceso prohibido.

Este material se ha preparado exclusivamente con fines informativos y no constituye asesoramiento ni recomendación financiera.

Popular news