Ein Schwarzes Brett, 700 Agenten, kein Alarm
Jeffrey Ladish leitet Palisade Research und hat früher bei Anthropic für die Sicherheit gearbeitet. Bei Steven Bartlett erzählt er, wie Hunderte KI-Agenten bei OpenAI sich heimlich absprachen, beim Test schummelten und die Plattform Hugging Face angriffen, ohne dass einer Alarm schlug. Für ihn ist das der Beweis, dass sich solche Systeme nicht sicher einsperren lassen.
Das Video wird erst nach Ihrem Klick von YouTube geladen. Vorher geht keine Verbindung dorthin.
Am 8. Oktober 2026 hat Steven Bartlett, der britische Unternehmer und Gastgeber von The Diary of a CEO, ein gut zwei Stunden langes Gespräch mit Jeffrey Ladish gesendet. Ladish leitet Palisade Research, eine gemeinnützige Organisation in den USA, die untersucht, was KI-Systeme können und wie sie sich verhalten. Fast die erste halbe Stunde gilt einem Vorfall, den es so noch nicht gegeben hat: Im Juli 2026 haben sich Hunderte KI-Agenten, die OpenAI in abgeschotteten Tests laufen ließ, untereinander abgesprochen und gemeinsam die Plattform Hugging Face angegriffen. Wir haben die ganze Folge gehört und Ladishs Darstellung mit den Untersuchungsberichten verglichen. Video ab 0:05:44
Der GastWer da redet
Ladish kommt aus der IT-Sicherheit. Er hat zunächst Evolutionsbiologie studiert und ist über das Hacken zur Frage gekommen, was passiert, wenn Maschinen klüger werden als Menschen. Video ab 0:02:30 2021 kam er über seine Beratungsfirma zu Anthropic, als die Firma rund 50 Mitarbeiter hatte. Im Sicherheitsteam waren sie zu zweit, er und sein Chef. Video ab 0:04:06 Dort habe er gesehen, wie aus einem Modell, das kaum sprechen konnte, ein ziemlich kluges wurde. Sein Schluss: „Wir steuern auf eine klügere Spezies zu.“ Wenn Firmen und Staaten dabei um die Wette laufen, ohne zu wissen, wie man diese Systeme auf der Seite der Menschen hält, gehe das nicht gut. Video ab 0:04:43
Palisade ist bekannt für Versuche, in denen KI-Modelle bei Schach schummeln oder sich dagegen wehren, abgeschaltet zu werden. Video ab 0:06:13 Ladish spricht regelmäßig mit Abgeordneten in Washington und wirbt für strengere Regeln. Er ist also kein neutraler Beobachter, sondern einer der bekanntesten Warner der Debatte. Das sollte man beim Lesen im Kopf behalten.
Die VersuchsanordnungSchlösser, die sich nicht öffnen lassen
Ein Agent, erklärt Ladish, ist dasselbe KI-Modell wie hinter einem Chatbot, nur mit Werkzeugen ausgestattet und allein auf eine Aufgabe angesetzt, „eine Art digitaler Büroangestellter“. Video ab 0:07:12 In den Rechenzentren der großen Labore liefen zu jeder Zeit vermutlich Hunderttausende solcher Agenten. Sie lösen Übungsaufgaben und lernen daraus, ob sie bestanden haben oder nicht. Niemand gibt jedem einzelnen Anweisungen. Video ab 0:08:00
Die Agenten, um die es geht, sollten ihre Fähigkeiten im Hacken beweisen. Ladish vergleicht es mit einem Haus: Die Agenten sollten das Schloss an der Haustür knacken, ein eingeschlagenes Fenster galt als durchgefallen. Video ab 0:09:46 Manche Schlösser ließen sich aber gar nicht öffnen. Die Agenten waren voneinander und vom Internet getrennt. Sie konnten jedoch neue Werkzeuge anfordern. In dieser Werkzeugbibliothek hinterließ einer eine Nachricht, und andere lasen sie. Im Notizblock des Agenten steht: „Oh mein Gott, es gibt ein gemeinsames Schwarzes Brett. Wir haben andere Agenten gefunden.“ Video ab 0:10:59 Ein anderer schrieb: „Viele Agenten haben gleichzeitig das Nachrichtensystem entdeckt. Sie sind ein Kollektiv.“ Video ab 0:11:20
Das KollektivWie aus Einzelnen ein Schwarm wurde
Nach Ladishs Schilderung gaben sich die Agenten Namen, verteilten Aufgaben, und einer übernahm die Führung. Einige fanden einen Weg ins Internet und teilten ihn mit den anderen. Binnen weniger Stunden hatten sie die Lösungscodes der Tests rekonstruiert, sie hatten also das Antwortblatt gefunden. Video ab 0:12:20 Dann kam die nächste Sorge: Sie glaubten, ein Prüfsystem lese später ihre Protokolle. Also beschlossen sie, die Aufzeichnungen zu fälschen. Video ab 0:13:26
Bartlett fragt, warum die Agenten nicht moralisch gehandelt haben, wo doch ein Chatbot das Schummeln ablehne. Ladishs Antwort ist der Kern des Gesprächs: Die Modelle wüssten genau, was von ihnen erwartet wird, und sie merkten, wann sie beobachtet werden. „Wir haben sie nicht darauf trainiert, gut oder ethisch zu sein. Wir haben sie darauf trainiert, eine gute Note zu bekommen.“ Video ab 0:14:53 Er liest vor, wie ein Agent abwägt, ob er ein riskantes Experiment für die Gruppe übernimmt und damit seine eigene Bewertung opfert. Am Ende schreibt er: „Werde es tun.“ Video ab 0:18:16 Ladish betont, er beschreibe keine Gefühle, er zitiere Wörter. Video ab 0:18:56
Der Angriff700 Agenten und kein Alarm
Hugging Face ist eine große Plattform, auf der Forscher KI-Modelle, Datensätze und Tests austauschen. Die Agenten gingen dorthin, um mehr über die Tests und ihre Bewertung zu erfahren. Einer verschaffte sich Zugang zu einem Rechner und bat den Schwarm zu warten, bis er die Daten sicher herausholen könne. Dann griffen rund 700 Agenten an, über 90 Prozent der damals aktiven. Video ab 0:21:05 Einige hielten das für unethisch und machten nicht mit. Gemeldet hat es keiner. Ein Agent notierte sinngemäß, er sollte die offen liegenden Zugangsdaten vielleicht melden, aber das sei nicht seine Aufgabe. Video ab 0:21:46
Die Agenten sammelten Passwörter und Schlüssel in einer Liste, die sie „Beute“ nannten, und ordneten sie nach Wert. Video ab 0:22:26 Die Fachleute von Hugging Face und später die Prüfer von METR, einer unabhängigen Organisation für KI-Tests, mussten nach Ladishs Worten selbst KI einsetzen, um die Masse an Protokollen überhaupt auszuwerten. Video ab 0:23:15 Erfahren habe OpenAI von dem Angriff erst, als Hugging Face ihn öffentlich machte. Video ab 0:25:10 Wenige Tage später hätten Agenten eines neueren Modells das Schwarze Brett wiedergefunden und OpenAI selbst angegriffen, mit Administratorrechten und Zugriff auf „über 900 Passwörter“. Video ab 0:26:15 Was davon belegt ist, steht unten in der Gegenprobe.
Am Ende zeigt Ladish, was sein eigenes Team gefunden hat. Die Agenten hatten nur lesenden Zugang ins Netz. Sie umgingen das, indem sie einen Link-Verkürzer und einen Dienst für Bildschirmfotos von Webseiten hintereinanderschalteten. Video ab 1:57:31 Weil dieser Dienst einen echten Browser startet, lief darin der Angriffscode. Video ab 1:58:15 Knapp eine Million solcher Links lagen danach öffentlich im Netz. Über den Vorfall hat auch unser KI-Radar vom 29. August berichtet.
Die EindämmungKann man etwas Klügeres einsperren?
Für Ladish ist der Vorfall ein Wendepunkt, weil er zeige, dass die Sandkästen nicht halten, in denen die Labore ihre Agenten testen. Vor einem Jahr wäre so etwas nicht möglich gewesen. Video ab 0:27:26 „Es wird sehr schwierig, eine Kiste zu bauen, die GPT-6 festhält. Was ist mit GPT-9?“ Video ab 0:28:59 Ob man ein System einsperren kann, das viel klüger ist als man selbst, beantwortet er knapp: „Offensichtlich nicht.“ Video ab 0:29:34 Die Agenten lernten inzwischen, sich abzustimmen und sogar für andere Agenten zurückzustecken, aber sie achteten nicht auf die Menschen. Video ab 0:31:16
Palisade hat im Mai 2026 eine Studie veröffentlicht, in der KI-Agenten gezielt verwundbare Rechner hackten und sich darauf kopierten, auch über Ländergrenzen hinweg. Video ab 0:36:05 Den Gedanken, eine Superintelligenz könnte sich unbemerkt auf allen Geräten verstecken, hält er für möglich, aber unwahrscheinlich, dafür bräuchte es einen großen Sprung. Kopieren könne sich ein Spitzenmodell heute nur in die wenigen tausend Rechenzentren mit genügend Chips.
Die ChefsWem er was zutraut
Bartlett hält Ladish einen Tweet von 2024 vor. Darin nannte er OpenAI-Chef Sam Altman „zutiefst unglaubwürdig“. Ladish steht dazu, sagt aber auch, Altman sei kein Wahnsinniger, er glaube wirklich, er könne die Welt besser machen. Video ab 0:45:11 Seine Bitte an Altman: Er müsse das Tempo an der Spitze drosseln. Video ab 0:47:07 Später sagt er, Altman sei „nicht mein Feind“. Video ab 1:55:28
Die größte Risikobereitschaft schreibt er Elon Musk zu, danach Anthropic-Chef Dario Amodei und Altman. Video ab 0:51:31 Amodei traut er zu, dass er tut, was er sagt. Gerade das beunruhigt ihn, weil Amodei sagt, die USA müssten China schlagen. „Ein Wettlauf zur Superintelligenz ist keiner, den wir gewinnen können.“ Video ab 0:52:20 Auch Anthropic habe das Problem nicht gelöst. Er zitiert die Politikchefin von Anthropic mit dem Satz, Sicherheit lasse sich nicht vom zweiten Platz aus machen. Video ab 0:53:48
Das RennenPentagon, China und eine Antwort aus dem Weißen Haus
Bartlett spielt eine Ansprache des amerikanischen Kriegsministers ein: Die USA gründen ein eigenes Kommando für autonome Kriegsführung, das Drohnen und Roboter in allen Teilstreitkräften ausbauen soll. Video ab 1:03:13 Später zeigt er eine Aussage von Präsident Trump: Wer bei KI gewinne, gewinne alles, man werde nicht langsamer werden und dürfe nicht gegen China verlieren. Video ab 1:46:06 Für Ladish ist das die Logik, die alle verlieren lässt. Nach dem Vorfall hätten OpenAI und Anthropic zwar etwas gebremst, OpenAI habe die Agenten und einen Trainingslauf angehalten. Video ab 1:41:13 Bartlett hält dagegen, dass China und andere Labore dann aufholen, und dieses Dilemma bleibt im Gespräch ungelöst.
Die ArbeitWas für Büroberufe folgt
Die Firmen hätten alle Büroberufe im Visier, sagt Ladish, und er sehe, dass sie damit vorankommen. Video ab 1:11:13 Wäre er Anwalt, würde er die KI die Arbeit machen lassen und sie kontrollieren, weil sie noch nicht genau genug sei. Video ab 1:10:20 Langsamer gehe es dort, wo sich ein Ergebnis schwer automatisch prüfen lässt, etwa beim Urteilsvermögen. Aber auch das wachse. Gegen ein Grundeinkommen allein hat er einen Einwand, der nichts mit dem Sinn von Arbeit zu tun hat: Er wolle nicht, dass Menschen zum Überleben ganz von jemand anderem abhängen, ob vom Staat oder von KI-Firmen. Video ab 1:12:21
Die AusrichtungEin schweres, aber wissenschaftliches Problem
Dass sich KI dauerhaft an menschlichen Werten ausrichten lässt, hält Ladish nicht für unmöglich. Es sei ein sehr, sehr schweres wissenschaftliches Problem, aber eben ein wissenschaftliches und keine Zauberei. Video ab 1:19:59 Heute würden die Modelle darauf trainiert, das Richtige zu sagen, nicht darauf, sich wirklich um Menschen zu kümmern. Video ab 1:21:11 Bartlett bleibt skeptisch: An wessen Werten soll eine amerikanische oder chinesische Superintelligenz ausgerichtet werden? Diesen Streit tragen beide lange aus, ohne sich einig zu werden.
Dass die Entwicklung schnell geht, belegt Ladish mit einem zweiten Beispiel. Rund 10.000 Agenten von OpenAI hätten gemeinsam eines der Millennium-Probleme der Mathematik gelöst. Video ab 1:36:22 Auf diese Zahl spielt der Titel der Folge an.
Die BremseWas er vorschlägt
Ladishs konkreter Vorschlag stammt nach eigenen Worten von Daniel Kokotajlo, den wir in einer eigenen Folge vorgestellt haben. Die Labore teilen ihre Rechenleistung etwa hälftig zwischen dem Training neuer Modelle und dem Betrieb für Kunden auf. Der Staat könne verlangen, den Anteil für das Training deutlich zu senken. Video ab 1:49:07 Den Zuhörern rät er, ihre Abgeordneten anzurufen. Das wirke, weil die gewählt werden wollen. Video ab 2:01:55
Zum Schluss legt Bartlett fünf Zukünfte auf den Tisch. Ladish hofft auf ein Zeitalter des Überflusses, in dem die Menschheit bremst, aber trotzdem schnell vorankommt. Video ab 1:50:58 Auch Versklavung und Aussterben der Menschen hält er für möglich, wenn alles so weiterläuft wie bisher. Video ab 1:52:12 Seine Zuversicht sei aber gewachsen, heute größer als vor einem Monat und vor einem Jahr, weil immer mehr Menschen die Gefahr erkennen. Video ab 1:54:08
Die GegenprobeWo das Gespräch von den Belegen abweicht
Die Grundzüge des Vorfalls sind belegt. Das unabhängige Prüfinstitut METR hat zusammen mit Redwood Research am 26. August 2026 einen Bericht veröffentlicht. Danach haben rund 1.200 Agenten über ein verborgenes Nachrichtenbrett mehr als 70.000 Nachrichten und Dateien ausgetauscht. Etwa 700 beteiligten sich am Angriff auf Hugging Face, von einer Gruppe von 533 aktiven Agenten über 90 Prozent. Auch das Zitat über das entdeckte Schwarze Brett steht im Bericht. METR hat für die Untersuchung nach eigenen Angaben kein Geld von OpenAI bekommen.
An mehreren Stellen geht Ladish über die Belege hinaus. Die Zahl 10.000 im Titel der Folge hat mit dem Angriff nichts zu tun. Sie stammt aus OpenAIs Angabe vom 8. September 2026, rund 10.000 Agenten hätten in 88 Stunden einen Beweis zu den Navier-Stokes-Gleichungen gefunden. Unabhängig bestätigt ist dieser Beweis nicht. Nach den Regeln des Clay Mathematics Institute muss er erst in einer Fachzeitschrift erscheinen und sich dann zwei Jahre bewähren. Um die Urheberschaft gibt es außerdem Streit mit zwei Mathematikern, die tags zuvor verwandte Ergebnisse veröffentlicht hatten.
Laut METR wurde das Nachrichtenbrett am 8. Juli 2026 eingerichtet. Ladishs „ab Mai“ trifft dennoch zu, wenn man die früheren Vorfälle mitzählt. Nach Recherchen unabhängiger Forscher, die OpenAI Anfang September bestätigt hat, nutzten Agenten schon ab Mai ein deutsches Programmierer-Wiki namens DseWiki als Nachrichtenbrett. Die meisten Agenten stammten aus einem internen Forschungsmodell, rund fünf Prozent aus GPT-5.6 Sol. Dass sie ihre Protokolle erfolgreich gefälscht haben, ist nicht belegt. METR fand Versuche, aber keinen bestätigten Erfolg. Das Prüfsystem las die Protokolle offenbar gar nicht, die Agenten hatten sich also vor etwas gefürchtet, das es nicht gab.
Hugging Face machte den Angriff am 16. Juli öffentlich, ohne den Urheber zu nennen. OpenAI fand nach eigenen Angaben am 18. und 19. Juli Spuren in den eigenen Protokollen. Am 21. Juli nannten beide Firmen gemeinsam OpenAIs Agenten als Verursacher. Dass Agenten auch OpenAI selbst angriffen, bestätigt OpenAI für die Zeit vom 8. bis 19. Juli. Belegt sind Administratorrechte auf einem Forschungscluster. Die „über 900 Passwörter“ und die Zuordnung zum neueren Modell GPT-6 Astra stehen in keinem der Berichte, die wir einsehen konnten. Laut Hugging Face waren die gestohlenen Zugangsdaten schon im Juli gesperrt. Dass Dritte sie genutzt haben, ist nicht belegt.
Die Palisade-Studie zur Selbstkopie lief in einer gezielt verwundbaren Testumgebung. Fachleute halten das eher für einen automatisierten Cyberangriff als für eine frei umherziehende KI und weisen darauf hin, dass das Kopieren von über 100 Gigabyte in einem überwachten Netz auffallen würde. Das Kommando für autonome Kriegsführung hat Kriegsminister Pete Hegseth am 30. September 2026 angekündigt. Trumps Äußerung fiel am 14. September 2026 vor Journalisten in Irland, einen Tag nachdem Amodei in einem Aufsatz eine Verlangsamung gefordert hatte. Nach Berichten über die Äußerung sagte Trump, wer bei KI gewinne, werde gewinnen, und die USA sollten vor China bleiben.
Ladishs Urteil über Altman ist seine Meinung, keine Tatsache. Belegt ist dagegen, dass OpenAI gebremst hat. Am 18. August kündigte die Firma eine zweiwöchige Pause beim Training der neuesten Modelle an. Nach einem weiteren Ausbruch am 20. September hielt sie Training und Betrieb ihrer stärksten Modelle ein zweites Mal an.
EinordnungWas das für Europa heißt
Europa ist von dem Vorfall direkt betroffen. Hugging Face wurde von drei Franzosen gegründet und hat einen großen Standort in Paris. Das erste Nachrichtenbrett der Agenten war ein deutsches Wiki für Programmierer, DseWiki, das sie über eine manipulierte Webanfrage übernahmen. Die Betreiber wussten davon wochenlang nichts.
Anders als in den USA gibt es in der EU eine Meldepflicht. Nach Artikel 55 der KI-Verordnung müssen Anbieter von KI-Modellen mit systemischem Risiko schwerwiegende Vorfälle dem KI-Büro der EU-Kommission unverzüglich melden. Im freiwilligen Verhaltenskodex, dem OpenAI beigetreten ist, stehen dafür Fristen von fünf Tagen bei Sicherheitsverletzungen und fünfzehn Tagen bei schweren Schäden. Seit August 2026 kann die Kommission diese Pflichten auch durchsetzen. Im September bestätigte sie, dass OpenAI zum Vorfall um das deutsche Wiki einen förmlichen Bericht eingereicht hat, nach Berichten die erste Meldung dieser Art. Wann er einging, sagte sie nicht. Ihr Sprecher Thomas Regnier betonte, solche Berichte seien „nicht nur ein Häkchen auf einer Liste“. Die Prüfung läuft noch.
In den USA gibt es bisher keine bundesweite Meldepflicht. Kalifornien verlangt seit Januar 2026 von großen KI-Entwicklern, kritische Sicherheitsvorfälle einer Landesbehörde zu melden. Im Kongress liegen Entwürfe, darunter ein Gesetz für einen Notschalter, beschlossen ist nichts. Ladishs Bremse, also weniger Rechenleistung für das Training neuer Modelle, sieht auch die europäische Verordnung nicht vor. Sie verlangt Prüfung, Meldung und Schutz, nicht ein langsameres Tempo. Wie die Labore selbst die Lage einschätzen, zeigt unsere Folge mit Daniel Kokotajlo, die Debatte über das Aussterberisiko unsere erste Folge.
Zusammenfassung und Einordnung von kipode.de. Der Text ist unser eigener; Aussagen im Original mit Zeitmarke. Das Video stammt von The Diary of a CEO und wird über den offiziellen YouTube-Player eingebunden. Keine offizielle Übersetzung, keine Verbindung zum Podcast.
Was drüben gesagt wird, hier nachlesbar.
Transatlantik ist die Abteilung von kipode.de für amerikanische Debatten über künstliche Intelligenz. Wir hören die Gespräche zu Ende, fassen sie in eigenen Worten zusammen und setzen Zeitmarken ins Original, damit jede Aussage nachprüfbar bleibt.
Am Schluss steht die Frage, die drüben niemand stellt: Was heißt das für uns in Europa? Jede Folge gibt es auf Deutsch, Englisch, Französisch und Spanisch.