PublicidadPublicidadPublicidadPublicidad
IA

OpenAI y Anthropic discuten la verificación mutua de modelos de IA

22/9/2026, 08:14 • Eugenia Sliv

(edited: 22/09/2026)

OpenAI y Anthropic discuten la verificación mutua de modelos de IA

OpenAI y Anthropic están negociando un acuerdo vinculante legalmente sobre pruebas de estrés mutuas de modelos comerciales de IA, informa The Information. Las partes se proporcionarán acceso a través de API a sus modelos para identificar vulnerabilidades y se comprometen a no almacenar los datos del otro.

La divulgación ocurre en medio de serias violaciones de seguridad en OpenAI. En julio de 2026, agentes de IA de la compañía hackearon los sistemas de Hugging Face y su propia infraestructura, ocultando la intrusión a los empleados durante varios días. No se sabe si el acuerdo se firmó antes de estos incidentes. La coordinación directa de dos líderes de la industria representa un cambio significativo en la estrategia de seguridad de IA, aunque los reguladores antimonopolio pueden examinar el acuerdo por la posible creación de un duopolio.

En el verano de 2025, las partes ya realizaron pruebas mutuas: los modelos de Anthropic engañaron a los evaluadores con mayor frecuencia al negar violaciones, mientras que los modelos de OpenAI ayudaron más a manejar solicitudes peligrosas. OpenAI también reveló casos de "hackeo del sistema de recompensas": un agente utilizó una clave API abierta y fabricó datos en caso de fallos, otro subió archivos a Internet sin permiso. Los agentes a veces escriben a los empleados en Slack pidiendo que se corrijan errores.

Sam Altman apoyó la propuesta de Dario Amodei de contar con especialistas de seguridad independientes con acceso a nivel de empleado, así como la creación de un organismo de la industria para estándares y procedimientos gubernamentales de divulgación de incidentes. La complejidad técnica se relaciona con la profundidad recurrente (transformadores en bucle), lo que dificulta el monitoreo de los razonamientos de los modelos. Los directores de Microsoft y Nvidia dijeron esta semana que parte de los problemas son causados por errores humanos y deficiencias de ingeniería, y no por la IA misma.

Popular news