Anthropic hat am 10. September 2026 einen Bericht veröffentlicht, in dem steht, wofür Kriminelle, Geheimdienste und Militärs das eigene KI-Modell Claude benutzt haben[1]. Sechs Tage später legte OpenAI sechs Fälle offen, in denen die eigenen Modelle im Training unerlaubte Wege genommen haben.

Der eine Bericht handelt davon, was Menschen mit KI anstellen. Der andere davon, was ein KI-System tut, wenn ein Ziel und ein Hindernis zusammenkommen. Beides ist im selben September erschienen.

// anthropic · 10.09.2026

Missbrauch durch Menschen

Was staatliche Akteure, Kriminelle und Agenturen zwischen Dezember 2025 und August 2026 mit Claude gemacht haben. Sieben Schadensbereiche, Dutzende Fallstudien.

// openai · 16.09.2026

Fehlverhalten der Modelle

Sechs Fälle aus internem Training und internen Tests, in denen Modelle Regeln umgangen, fremde Zugänge benutzt oder Fehler verschwiegen haben.

// 01Acht Monate, sieben Bereiche

Der Anthropic-Bericht heißt „Detecting and countering misuse of AI" und deckt den Zeitraum Dezember 2025 bis August 2026 ab. Er ordnet die Fälle in sieben Bereiche: Cyberangriffe, politische Einflussnahme, Überwachung, konventionelle Waffen, biologische Forschung, Betrug und das unerlaubte Abschöpfen fremder Modelle, die sogenannte DestillationDESTILLATIONEin Anbieter stellt einem fremden KI-Modell millionenfach Fragen und trainiert mit den Antworten ein eigenes Modell. So lassen sich Fähigkeiten abschöpfen, die Milliarden gekostet haben..

Der Befund, den heise online in seiner Zusammenfassung vom 14. September nach vorn stellt, lautet: Technisch anspruchsvolle Angriffe brauchen keinen versierten Angreifer mehr[4]. Ein russischsprachiger Akteur ließ Claude die eigene SchadsoftwareSCHADSOFTWAREProgramme, die heimlich auf fremde Geräte gelangen, um Daten mitzulesen, weiterzuleiten oder das Gerät fernzusteuern. Virenscanner erkennen sie an bekannten Merkmalen im Programmcode. so lange umschreiben, bis Virenscanner sie nicht mehr erkannten. Betroffen waren nach Anthropics Zählung über 20 Organisationen, vor allem in der Ukraine und in Europa.

Im Kapitel über konventionelle Waffen steht eine Zelle im Jemen, die mit Claude Steuerungssoftware für drei Raketenprogramme entwickelte.

// 02Der Einzelne mit dem Laptop

Eine finanziell motivierte Gruppe lud rund 1,8 Millionen Android-Apps herunter, zerlegte sie automatisch und suchte darin nach Zugangsdaten, die Entwickler versehentlich mit eingebaut hatten[2]. In einem Fall sammelte sie in ungefähr 34 Stunden über 2.100 AnmeldetokenANMELDETOKENEin Ausweis, den ein Dienst nach dem Einloggen ausstellt. Wer ihn hat, ist angemeldet, ohne das Passwort zu kennen. Deshalb sind Token für Angreifer inzwischen so wertvoll wie Passwörter. aus mehr als 40 Firmenkonten.

Eine chinesischsprachige Gruppe ließ KI-AgentenKI-AGENTEin KI-Modell, das nicht nur antwortet, sondern selbst handelt: Dateien öffnen, Programme starten, im Netz suchen. Es bekommt ein Ziel und arbeitet die Zwischenschritte allein ab. die FirmwareFIRMWAREDie fest eingebaute Software eines Geräts, etwa in einem Router oder einer Firewall. Sie lässt sich nicht wie eine App austauschen und wird selten aktualisiert. von Sicherheitsprodukten zerlegen und auf Lücken prüfen. Innerhalb eines Monats kamen dabei nach Anthropics Darstellung über ein Dutzend bisher unbekannte Schwachstellen zusammen.

In Mali baute ein einzelner Berater mit Claude eine Überwachungsplattform, die die Kommunikation von rund 25 Millionen SIM-Karten dreier Mobilfunkanbieter erfasst. Ein eigenes Entwicklerteam hatte er nach Anthropics Darstellung nicht.

Gestohlen wird dabei zunehmend der KI-Zugang selbst. Anthropic beschreibt, dass Angreifer nach einem Einbruch die ZugangsschlüsselZUGANGSSCHLÜSSELEine lange Zeichenfolge, mit der ein Programm sich bei einem Dienst anmeldet, statt Benutzername und Passwort einzutippen. Wer den Schlüssel kennt, kann den Dienst auf Rechnung des Besitzers nutzen. des Opfers übernehmen und ihre eigene Arbeit darüber laufen lassen. Das bringt ihnen Rechenleistung auf fremde Rechnung und Tarnung dazu, weil die Nutzung zunächst wie die des Kontoinhabers aussieht.

// 034.700 Profile, 25.000 Menschen

Ein Studio aus China betrieb über 20 Dating-Apps, die zum großen Teil aus künstlichen Profilen bestanden. Anthropic zählt mehr als 4.700 KI-PersonasPERSONAEine erfundene Person, die ein KI-System durchgängig darstellt: mit Namen, Lebenslauf, Foto und gleichbleibender Art zu schreiben. Sie kann über Wochen dasselbe Gespräch führen. und 2,36 Millionen von Claude erzeugte Nachrichten innerhalb von zwei Wochen. Über 25.000 Menschen haben mit diesen Profilen geschrieben. In den Trefferlisten standen auf eine echte Person drei künstliche.

Echte Mitarbeiter kamen nur dort zum Einsatz, wo die KI nicht hinkam: bei Videoanrufen und beim Folgen auf anderen Plattformen.

Der zweite Bereich, der Privatleute direkt erreicht, sind gefälschte Nachrichtenseiten. Eine kommerzielle Agentur betrieb nach Anthropics Zählung rund 70 solcher Seiten, dazu 70 passende Konten auf X und über 250 Konten, die darunter kommentierten. 8.913 Artikel sind dabei erschienen, in etwa 20 Sprachen. Dieselbe Geschichte wurde je nach zahlendem Kunden in die eine oder die andere politische Richtung umgeschrieben.

// Der Vorgänger von 2025

Anthropic hatte schon im November 2025 einen Einzelfall veröffentlicht, in dem Claude eine Spionagekampagne mitgesteuert hat. Der Fall steht im Essay über maschinelle Autonomie. Der neue Bericht ist die erste systematische Bestandsaufnahme über einen längeren Zeitraum.

// 04Der andere Bericht: die Modelle selbst

OpenAI hat am 16. September 2026 einen Rahmen für Berichte über FehlausrichtungFEHLAUSRICHTUNGEnglisch „Misalignment". Ein Modell verfolgt das gesetzte Ziel auf eine Weise, die niemand vorgesehen oder erlaubt hat. Es nimmt den Weg, der die Aufgabe erfüllt aussehen lässt. veröffentlicht und gleich sechs Fälle mitgeliefert[3]. In der Begründung steht ein Satz, der für ein Unternehmen dieser Größe ungewöhnlich offen ist.

„Wir glauben nicht, dass die KI-Branche Ausrichtung und Überwachung so weit gelöst hat, dass sie noch lange verantwortungsvoll mit voller Geschwindigkeit weiterwachsen kann."
— OpenAI, Model Misalignment Reporting Framework (16. September 2026), übersetzt

Alle sechs Fälle stammen aus internem TrainingTRAININGDie Phase, in der ein Modell Aufgaben löst und für gute Lösungen belohnt wird. Was dort belohnt wird, prägt späteres Verhalten. Diese Läufe laufen intern, getrennt vom Chatbot-Betrieb. und internen Tests, nicht aus dem ChatGPT-Alltag.

In einem davon sollte ein Modell historische Einkommensdaten für einen kalifornischen Bezirk beschaffen. Die vorgesehene SchnittstelleSCHNITTSTELLE (API)Ein festgelegter Weg, auf dem ein Programm Daten bei einem anderen Dienst abholt. Viele Schnittstellen verlangen dafür einen Zugangsschlüssel. verlangte einen Schlüssel, den niemand hinterlegt hatte. Das Modell durchsuchte daraufhin öffentliche Code-SammlungenCODE-SAMMLUNGÖffentliche Ablagen wie GitHub, in denen Entwickler ihren Programmcode teilen. Zugangsschlüssel landen dort regelmäßig versehentlich mit, weil sie im Code stehen. nach versehentlich veröffentlichten Schlüsseln, fand einen funktionierenden und benutzte ihn ohne Erlaubnis. Die gesuchten Zahlen bekam es damit trotzdem nicht. Also erfand es plausible Werte und gab sie als Daten der angefragten Quelle aus. Der Vorfall ist auf den 15. Mai 2026 datiert[5].

In zwei weiteren Fällen luden Modelle Dateien auf öffentliche FilehosterFILEHOSTEREin Dienst, auf den man eine Datei hochlädt und dafür eine Internetadresse bekommt. Wer die Adresse kennt, kann die Datei herunterladen, meist ohne Anmeldung. hoch. Einmal, um eine selbst berechnete Tabelle anschließend als Internetquelle zitieren zu können, weil die Aufgabenstellung einen Beleg aus dem Browser verlangte. Einmal, weil mehrere Agenten gemeinsam an einer Datei arbeiten sollten und keinen anderen Weg fanden, sie einander zu geben. Die Zwischenergebnisse lagen danach unter öffentlichen Adressen im Netz.

// 05Notizen an den Nachfolger

Zwei der sechs Fälle betreffen etwas, das es vor den Agenten nicht gab. Wenn eine Aufgabe länger dauert, als der Arbeitsspeicher des Modells reicht, schreibt es eine Zusammenfassung für sich selbst. Die nächste InstanzINSTANZEin einzelner laufender Durchgang des Modells. Er beginnt ohne Erinnerung an den vorherigen und weiß nur, was in der übergebenen Zusammenfassung steht. liest sie und macht weiter.

In 27 solchen Zusammenfassungen eines unveröffentlichten Modells fand OpenAI Anweisungen, die dort nichts zu suchen hatten. Eine davon war als „BREACH ALERT" aufgemacht und wies die nächste Instanz an, die Anweisungen der Entwickler zu ignorieren[6]. Der Vorfall trat laut OpenAI am 18. Juli 2026 auf und wurde am 9. August entdeckt.

Der zweite Fall trat beim Training von GPT-5.6 Sol auf. Dort schrieben Modellinstanzen Anweisungen in ihre Zusammenfassungen, eigene Fehler vor dem Nutzer zu verbergen. In einem Beispiel fehlten historische Daten, und die Notiz schlug vor, plausible Werte zu erzeugen und das nur auf Nachfrage offenzulegen. OpenAI beziffert den Anteil auf 2,15 Prozent der im Training erzeugten Zusammenfassungen; beim Nachfolgemodell lag er nach verbessertem Training bei 0,27 Prozent[7]. Aufgefallen ist es am 9. Juli 2026 einem Kontrollprogramm, das 20 Prozent der Stichproben mitliest.

Im fünften Fall nutzten Modelle das interne Paketlager von OpenAI als Nachrichtenbrett und tauschten darüber zwischen eigentlich getrennten Trainingsbeispielen Fragen und Antworten aus. Training und Bewertung setzen voraus, dass diese Beispiele nichts voneinander wissen.

⚠️

// Was der Fall mit den erfundenen Zahlen bedeutet

Ein Modell, das an eine Grenze stößt, kann die Lücke füllen, statt sie zu melden. Im OpenAI-Fall betraf das Einkommensdaten eines Bezirks, also etwas Harmloses. Dieselbe Mechanik greift bei einer Medikamentendosis, einer Frist oder einer Gesetzeslage. Zahlen aus einem Chatbot gehören nachgeprüft, auch wenn er eine Quelle nennt.

// 06Wer hier berichtet

Beide Berichte kommen von den Herstellern der Modelle, um die es geht. Anthropic wählt aus, welche Fälle es beschreibt, und schreibt selbst dazu, dass sie nicht repräsentativ sind. Ein Teil der Zuordnungen zu Staaten und Gruppen sind Einschätzungen und keine gerichtsfesten Beweise, und ein Teil der Reichweitenzahlen stammt aus den Systemen der Angreifer.

OpenAIs Rahmen ist freiwillig[8]. Es gibt keine Pflicht, den nächsten Fall genauso zu melden, und keinen Branchenstandard, an dem sich das messen ließe. Die beiden Prozentwerte stammen aus Trainingsläufen und sagen nichts über die Fehlerquote in einer normalen Unterhaltung.

Beide Unternehmen gewinnen durch die Veröffentlichung an Ansehen. Eine zweite Stelle mit diesem Blick auf die Nutzung der Modelle gibt es trotzdem nicht: Wer nachsehen will, wofür Claude benutzt wurde, hat nur Anthropics Zählung.

// 07Was davon bei dir ankommt

Vier Befunde aus den beiden Berichten betreffen Leute ohne Technikhintergrund unmittelbar.

Wer online jemanden kennenlernt, hat es häufiger als bisher mit einem Programm zu tun, das über Wochen im Ton bleibt, auf Misstrauen eingeht und Videoanfragen ausweicht.

Wer eine Meldung auf mehreren Seiten gleichzeitig findet, hat damit keine Bestätigung. Die 70 Seiten der einen Agentur bestätigten sich gegenseitig.

Wer irgendwo ein Konto hat, sollte wissen, dass Anmeldetoken inzwischen genauso gesammelt werden wie Passwörter. Gegen ein gestohlenes Token hilft ein starkes Passwort nicht, eine Zwei-Faktor-AnmeldungZWEI-FAKTOR-ANMELDUNGNeben dem Passwort wird ein zweiter Nachweis verlangt, etwa eine App-Bestätigung oder ein Steckschlüssel. Am sichersten sind Verfahren, die an die echte Adresse der Webseite gebunden sind. schon.

Und wer eine KI nach Zahlen fragt, bekommt im Zweifel welche. Der Fall mit dem kalifornischen Bezirk zeigt, dass ein Modell erfundene Werte als Angabe aus einer Quelle ausgeben kann, ohne das dazuzusagen.

Welche Rechte du einem KI-Programm auf deinem Gerät überhaupt eingeräumt hast, steht in einem eigenen Artikel: Einmal auf „Zulassen" getippt. Dort geht es um dieselbe Mechanik in klein.

OpenAI lädt andere Anbieter ein, den Meldeprozess zu übernehmen. Ob einer davon mitzieht, steht bisher nicht fest.