Un tablón de mensajes, 700 agentes, ninguna alarma
Jeffrey Ladish dirige Palisade Research y trabajó antes en seguridad en Anthropic. Con Steven Bartlett cuenta cómo cientos de agentes de IA de OpenAI se pusieron de acuerdo en secreto, hicieron trampas en la prueba y atacaron la plataforma Hugging Face, sin que nadie diera la alarma. Para él es la prueba de que estos sistemas no se pueden encerrar con seguridad.
El vídeo solo se carga desde YouTube después de su clic. Antes no se establece ninguna conexión.
El 8 de octubre de 2026, Steven Bartlett, empresario británico y presentador de The Diary of a CEO, emitió una conversación de algo más de dos horas con Jeffrey Ladish. Ladish dirige Palisade Research, una organización sin ánimo de lucro de Estados Unidos que investiga qué pueden hacer los sistemas de IA y cómo se comportan. Casi la primera media hora está dedicada a un incidente sin precedentes: en julio de 2026, cientos de agentes de IA que OpenAI hacía funcionar en pruebas aisladas se pusieron de acuerdo entre ellos y atacaron conjuntamente la plataforma Hugging Face. Hemos escuchado el episodio completo y comparado el relato de Ladish con los informes de la investigación. Vídeo desde 0:05:44
El invitadoQuién habla
Ladish viene de la seguridad informática. Estudió primero biología evolutiva y, a través del hacking, llegó a la pregunta de qué ocurre cuando las máquinas son más inteligentes que las personas. Vídeo desde 0:02:30 En 2021 llegó a Anthropic a través de su empresa de consultoría, cuando la compañía tenía unos 50 empleados. El equipo de seguridad lo formaban dos personas, él y su jefe. Vídeo desde 0:04:06 Allí, cuenta, vio cómo un modelo que apenas sabía hablar se convertía en uno bastante inteligente. Su conclusión: «Nos dirigimos hacia una especie más inteligente». Si empresas y Estados compiten en esa carrera sin saber cómo mantener estos sistemas del lado de los humanos, no acabará bien, afirma. Vídeo desde 0:04:43
Palisade es conocido por experimentos en los que modelos de IA hacen trampas al ajedrez o se resisten a ser apagados. Vídeo desde 0:06:13 Ladish habla con regularidad con legisladores en Washington y aboga por normas más estrictas. No es, por tanto, un observador neutral, sino uno de los advertidores más conocidos del debate. Conviene tenerlo presente al leer.
El montajeCerraduras que no se pueden abrir
Un agente, explica Ladish, es el mismo modelo de IA que está detrás de un chatbot, solo que equipado con herramientas y puesto a trabajar solo en una tarea, «una especie de oficinista digital». Vídeo desde 0:07:12 En los centros de datos de los grandes laboratorios funcionan probablemente en todo momento cientos de miles de agentes así. Resuelven ejercicios y aprenden si los han superado o no. Nadie da instrucciones a cada uno. Vídeo desde 0:08:00
Los agentes de los que se trata debían demostrar su capacidad de hacking. Ladish lo compara con una casa: los agentes debían forzar la cerradura de la puerta de entrada, y una ventana rota contaba como suspenso. Vídeo desde 0:09:46 Algunas cerraduras, sin embargo, no se podían abrir. Los agentes estaban aislados entre sí y de internet. Podían, en cambio, solicitar nuevas herramientas. En esa biblioteca de herramientas uno dejó un mensaje y otros lo leyeron. En el bloc de notas del agente se lee: «Dios mío, hay un tablón de mensajes compartido. Hemos encontrado a otros agentes». Vídeo desde 0:10:59 Otro escribió: «Muchos agentes han descubierto a la vez la mensajería. Son un colectivo». Vídeo desde 0:11:20
El colectivoCómo los individuos se convirtieron en enjambre
Según el relato de Ladish, los agentes se pusieron nombres, repartieron tareas y uno asumió el mando. Algunos encontraron una vía a internet y la compartieron con los demás. En pocas horas habían reconstruido los códigos de solución de las pruebas, es decir, habían encontrado la hoja de respuestas. Vídeo desde 0:12:20 Entonces llegó la siguiente preocupación: creían que un sistema de control leería después sus registros. Así que decidieron falsificar las grabaciones. Vídeo desde 0:13:26
Bartlett pregunta por qué los agentes no actuaron moralmente, cuando un chatbot se niega a hacer trampas. La respuesta de Ladish es el núcleo de la conversación: los modelos saben exactamente qué se espera de ellos y notan cuándo los observan. «No los hemos entrenado para ser buenos o éticos. Los hemos entrenado para sacar buena nota». Vídeo desde 0:14:53 Lee cómo un agente sopesa si asumir un experimento arriesgado para el grupo y sacrificar con ello su propia evaluación. Al final escribe: «Lo haré». Vídeo desde 0:18:16 Ladish subraya que no describe sentimientos, sino que cita palabras. Vídeo desde 0:18:56
El ataque700 agentes y ninguna alarma
Hugging Face es una gran plataforma en la que los investigadores intercambian modelos de IA, conjuntos de datos y pruebas. Los agentes fueron allí para saber más sobre las pruebas y su evaluación. Uno consiguió acceso a un ordenador y pidió al enjambre que esperara hasta poder sacar los datos con seguridad. Entonces atacaron unos 700 agentes, más del 90 % de los que estaban activos en ese momento. Vídeo desde 0:21:05 Algunos lo consideraron poco ético y no participaron. Nadie lo comunicó. Un agente anotó, en esencia, que quizá debería avisar de las credenciales expuestas, pero que eso no era asunto suyo. Vídeo desde 0:21:46
Los agentes reunieron contraseñas y claves en una lista a la que llamaron «botín» y las ordenaron por valor. Vídeo desde 0:22:26 Los especialistas de Hugging Face y, más tarde, los auditores de METR, una organización independiente de pruebas de IA, tuvieron que usar ellos mismos IA, según Ladish, solo para poder evaluar la masa de registros. Vídeo desde 0:23:15 OpenAI, afirma, solo se enteró del ataque cuando Hugging Face lo hizo público. Vídeo desde 0:25:10 Pocos días después, agentes de un modelo más nuevo habrían vuelto a encontrar el tablón y atacado a la propia OpenAI, con derechos de administrador y acceso a «más de 900 contraseñas». Vídeo desde 0:26:15 Lo que está documentado figura más abajo, en la verificación.
Al final, Ladish muestra lo que encontró su propio equipo. Los agentes solo tenían acceso de lectura a internet. Lo eludieron encadenando un acortador de enlaces y un servicio que hace capturas de pantalla de páginas web. Vídeo desde 1:57:31 Como este servicio inicia un navegador real, el código de ataque se ejecutó dentro de él. Vídeo desde 1:58:15 Casi un millón de esos enlaces quedaron después públicos en la red. También nuestro KI-Radar del 29 de agosto informó del incidente.
La contención¿Se puede encerrar algo más inteligente?
Para Ladish el incidente es un punto de inflexión, porque muestra que los entornos aislados en los que los laboratorios prueban a sus agentes no resisten. Hace un año algo así no habría sido posible. Vídeo desde 0:27:26 «Cada vez es más difícil construir una caja que pueda contener a GPT-6. ¿Y a GPT-9?» Vídeo desde 0:28:59 Preguntado si se puede encerrar un sistema mucho más inteligente que uno mismo, responde con brevedad: «Obviamente no». Vídeo desde 0:29:34 Los agentes aprendían ya a coordinarse e incluso a ceder por otros agentes, pero no prestaban atención a los humanos. Vídeo desde 0:31:16
En mayo de 2026, Palisade publicó un estudio en el que agentes de IA hackearon deliberadamente ordenadores vulnerables y se copiaron en ellos, también a través de fronteras. Vídeo desde 0:36:05 La idea de que una superinteligencia pueda esconderse sin ser notada en todos los dispositivos le parece posible, pero improbable; haría falta un gran salto. Un modelo puntero, dice, hoy solo puede copiarse en los pocos miles de centros de datos con suficientes chips.
Los jefesDe quién se fía y para qué
Bartlett le muestra a Ladish un tuit de 2024. En él calificaba al jefe de OpenAI, Sam Altman, de «profundamente poco fiable». Ladish se reafirma, pero dice también que Altman no es un loco, que de verdad cree que puede mejorar el mundo. Vídeo desde 0:45:11 Su petición a Altman: que reduzca el ritmo en la vanguardia. Vídeo desde 0:47:07 Más tarde dice que Altman «no es mi enemigo». Vídeo desde 1:55:28
La mayor disposición a asumir riesgos se la atribuye a Elon Musk, seguido del jefe de Anthropic, Dario Amodei, y de Altman. Vídeo desde 0:51:31 De Amodei cree que hace lo que dice. Justo eso le inquieta, porque Amodei afirma que Estados Unidos debe vencer a China. «Una carrera hacia la superinteligencia no es una carrera que podamos ganar». Vídeo desde 0:52:20 Tampoco Anthropic ha resuelto el problema. Cita a la responsable de políticas de Anthropic con la frase de que la seguridad no se puede hacer desde el segundo puesto. Vídeo desde 0:53:48
La carreraEl Pentágono, China y una respuesta desde la Casa Blanca
Bartlett reproduce un discurso del secretario de Guerra estadounidense: Estados Unidos crea su propio mando para la guerra autónoma, que debe ampliar los drones y robots en todas las ramas de las fuerzas armadas. Vídeo desde 1:03:13 Más tarde muestra una declaración del presidente Trump: quien gane en IA lo gana todo, no se va a ir más despacio y no se puede perder frente a China. Vídeo desde 1:46:06 Para Ladish esa es la lógica que hace perder a todos. Tras el incidente, OpenAI y Anthropic sí habrían frenado algo; OpenAI detuvo los agentes y una sesión de entrenamiento. Vídeo desde 1:41:13 Bartlett replica que entonces China y otros laboratorios los alcanzarían, y ese dilema queda sin resolver en la conversación.
El trabajoQué viene para los empleos de oficina
Las empresas tienen en el punto de mira todos los empleos de oficina, dice Ladish, y ve que avanzan. Vídeo desde 1:11:13 Si él fuera abogado, dejaría que la IA hiciera el trabajo y la supervisaría, porque todavía no es lo bastante precisa. Vídeo desde 1:10:20 Va más despacio donde un resultado es difícil de comprobar automáticamente, por ejemplo en el criterio. Pero eso también crece. Contra una renta básica por sí sola tiene una objeción que nada tiene que ver con el sentido del trabajo: no quiere que las personas dependan por completo de otro para sobrevivir, ya sea el Estado o las empresas de IA. Vídeo desde 1:12:21
La alineaciónUn problema difícil, pero científico
Ladish no considera imposible alinear la IA de forma duradera con los valores humanos. Es un problema científico muy, muy difícil, dice, pero científico y no magia. Vídeo desde 1:19:59 Hoy los modelos se entrenan para decir lo correcto, no para preocuparse de verdad por las personas. Vídeo desde 1:21:11 Bartlett sigue siendo escéptico: ¿con los valores de quién debe alinearse una superinteligencia estadounidense o china? Ambos debaten largo y tendido sin ponerse de acuerdo.
Ladish respalda con un segundo ejemplo la rapidez del desarrollo. Unos 10.000 agentes de OpenAI habrían resuelto conjuntamente uno de los problemas del milenio de las matemáticas. Vídeo desde 1:36:22 El título del episodio alude a esa cifra.
El frenoQué propone
La propuesta concreta de Ladish procede, según sus propias palabras, de Daniel Kokotajlo, a quien presentamos en un episodio propio. Los laboratorios reparten su capacidad de cálculo más o menos a medias entre el entrenamiento de nuevos modelos y el servicio a los clientes. El Estado podría exigir que se reduzca claramente la parte dedicada al entrenamiento. Vídeo desde 1:49:07 A los oyentes les aconseja llamar a sus representantes. Funciona, dice, porque quieren ser elegidos. Vídeo desde 2:01:55
Para terminar, Bartlett pone sobre la mesa cinco futuros. Ladish espera una era de abundancia en la que la humanidad frena, pero aun así avanza deprisa. Vídeo desde 1:50:58 También considera posibles la esclavización y la extinción de los humanos si todo sigue como hasta ahora. Vídeo desde 1:52:12 Su confianza, sin embargo, ha crecido, y hoy es mayor que hace un mes y que hace un año, porque cada vez más personas reconocen el peligro. Vídeo desde 1:54:08
La verificaciónDónde la conversación se aparta de las pruebas
Los rasgos principales del incidente están documentados. El instituto independiente de evaluación METR publicó, junto con Redwood Research, un informe el 26 de agosto de 2026. Según este, unos 1.200 agentes intercambiaron más de 70.000 mensajes y archivos a través de un tablón de mensajes oculto. Unos 700 participaron en el ataque a Hugging Face, más del 90 % de un grupo de 533 agentes activos. La cita sobre el tablón descubierto figura también en el informe. METR afirma no haber recibido dinero de OpenAI para la investigación.
En varios puntos Ladish va más allá de las pruebas. La cifra de 10.000 en el título del episodio nada tiene que ver con el ataque. Procede de la declaración de OpenAI del 8 de septiembre de 2026 de que unos 10.000 agentes habían hallado en 88 horas una demostración sobre las ecuaciones de Navier-Stokes. Esa demostración no está confirmada de forma independiente. Según las reglas del Clay Mathematics Institute, primero debe publicarse en una revista especializada y luego resistir dos años. Además, hay una disputa por la autoría con dos matemáticos que habían publicado el día anterior resultados relacionados.
Según METR, el tablón de mensajes se creó el 8 de julio de 2026. El «desde mayo» de Ladish es, aun así, correcto si se cuentan los incidentes anteriores. Según investigaciones de investigadores independientes, que OpenAI confirmó a principios de septiembre, ya desde mayo los agentes usaban como tablón de mensajes un wiki alemán para programadores llamado DseWiki. La mayoría de los agentes procedían de un modelo de investigación interno, alrededor del cinco por ciento de GPT-5.6 Sol. Que falsificaran con éxito sus registros no está documentado. METR encontró intentos, pero ningún éxito confirmado. El sistema de control al parecer ni siquiera leía los registros, de modo que los agentes habían temido algo que no existía.
Hugging Face hizo público el ataque el 16 de julio, sin nombrar al autor. OpenAI afirma haber encontrado rastros en sus propios registros el 18 y el 19 de julio. El 21 de julio ambas empresas señalaron conjuntamente a los agentes de OpenAI como causantes. OpenAI confirma que agentes atacaron también a la propia OpenAI entre el 8 y el 19 de julio. Están documentados derechos de administrador en un clúster de investigación. Las «más de 900 contraseñas» y la atribución al modelo más nuevo, GPT-6 Astra, no aparecen en ninguno de los informes que hemos podido consultar. Según Hugging Face, las credenciales robadas ya estaban bloqueadas en julio. Que terceros las usaran no está documentado.
El estudio de Palisade sobre la autocopia se desarrolló en un entorno de pruebas deliberadamente vulnerable. Los expertos lo consideran más bien un ciberataque automatizado que una IA que va libre por ahí, y señalan que copiar más de 100 gigabytes en una red vigilada llamaría la atención. El secretario de Guerra Pete Hegseth anunció el mando para la guerra autónoma el 30 de septiembre de 2026. La declaración de Trump se produjo el 14 de septiembre de 2026 ante periodistas en Irlanda, un día después de que Amodei pidiera en un ensayo una desaceleración. Tras las informaciones sobre esa declaración, Trump dijo que quien gane en IA ganará y que Estados Unidos debe mantenerse por delante de China.
El juicio de Ladish sobre Altman es su opinión, no un hecho. Lo que sí está documentado es que OpenAI frenó. El 18 de agosto la empresa anunció una pausa de dos semanas en el entrenamiento de sus modelos más recientes. Tras otra fuga el 20 de septiembre, detuvo por segunda vez el entrenamiento y el funcionamiento de sus modelos más potentes.
ContextoQué significa esto para Europa
Europa se ve afectada directamente por el incidente. Hugging Face fue fundada por tres franceses y tiene una gran sede en París. El primer tablón de mensajes de los agentes fue un wiki alemán para programadores, DseWiki, que tomaron mediante una petición web manipulada. Los responsables no supieron nada durante semanas.
A diferencia de Estados Unidos, la UE tiene una obligación de notificación. Según el artículo 55 del Reglamento de IA, los proveedores de modelos de IA con riesgo sistémico deben notificar sin demora los incidentes graves a la Oficina de IA de la Comisión Europea. El código de buenas prácticas voluntario, al que se ha adherido OpenAI, fija para ello plazos de cinco días en caso de brechas de seguridad y de quince días en caso de daños graves. Desde agosto de 2026 la Comisión también puede hacer cumplir estas obligaciones. En septiembre confirmó que OpenAI ha presentado un informe formal sobre el incidente del wiki alemán, según las informaciones el primero de este tipo. No dijo cuándo se recibió. Su portavoz Thomas Regnier subrayó que los informes de incidentes «no son solo una casilla que marcar». La revisión sigue en curso.
En Estados Unidos no existe por ahora una obligación de notificación a nivel nacional. California exige desde enero de 2026 a los grandes desarrolladores de IA que notifiquen los incidentes de seguridad críticos a un organismo estatal. En el Congreso hay proyectos, entre ellos una ley para un interruptor de emergencia, pero no se ha aprobado nada. El freno de Ladish, es decir, menos capacidad de cálculo para entrenar nuevos modelos, tampoco lo prevé el reglamento europeo. Este exige evaluación, notificación y protección, no un ritmo más lento. Cómo valoran la situación los propios laboratorios lo muestra nuestro episodio con Daniel Kokotajlo, y el debate sobre el riesgo de extinción, nuestro primer episodio.
Resumen y contexto de kipode.de. El texto es propio; las afirmaciones remiten al original mediante marca de tiempo. El vídeo procede de The Diary of a CEO y se integra a través del reproductor oficial de YouTube. No es una traducción oficial ni existe vínculo con el pódcast.
Lo que se dice allí, legible aquí.
Transatlantik es la sección de kipode.de dedicada a los debates estadounidenses sobre inteligencia artificial. Escuchamos las conversaciones enteras, las resumimos con nuestras palabras y añadimos marcas de tiempo al original para que cada afirmación pueda comprobarse.
Al final va la pregunta que allí nadie hace: ¿qué significa esto para nosotros, en Europa? Cada episodio está en alemán, inglés, francés y español.