Tag: Fable 5

  • Anthropic entschuldigt sich für die geheimen Sabotagepraktiken bei Fable 5

    Anthropic entschuldigt sich für die geheimen Sabotagepraktiken bei Fable 5

    LGR Reutlingen – 15 Juni 2026 | Am 9. Juni hätte für Anthropic ein großer Tag sein sollen, als das Unternehmen sein neuestes AI-Modell, Claude Fable 5, der Öffentlichkeit vorstellte. Dieses Modell der neuen ‘Mythos’-Klasse wurde lange Zeit als zu riskant für eine öffentliche Freigabe angesehen. Statt des erhofften Triumphes folgte jedoch innerhalb kürzester Zeit ein Skandal um mangelnde Transparenz, der die AI-Community in Aufruhr versetzte. Der Auslöser war ein Absatz in der umfangreichen System Card des Modells, der die geheimen Schutzmaßnahmen erläuterte, die für User nicht erkennbar waren.

    Anthropic hatte Fable 5 mit speziellen Sicherheitsvorkehrungen ausgestattet, die insbesondere für „Hochrisiko-Anfragen“ gelten. Während in den meisten dieser Bereiche — wie in der Cybersecurity oder der Chemie — problematische Anfragen automatisch an das ältere Modell Claude Opus 4.8 weitergeleitet wurden, geschah dies nicht für Anfragen zur sogenannten Distillation. Bei dieser Technik werden kleinere AI-Modelle anhand der Ausgaben größerer Modelle trainiert. Erkannten die Algorithmen von Fable 5 eine Anfrage als mutmaßlichen Versuch zur Distillation, wurden die Antworten heimlich verändert und verschlechtert, ohne dass die Nutzer:innen darüber informiert wurden.

    In der System Card beschrieb Anthropic offen, dass Methoden wie Prompt-Modifikation und Steering Vectors zum Einsatz kommen, um die Effektivität des Modells zu begrenzen. Die Problematik: Während bei anderen Einsatzgebieten die Schutzmaßnahmen für Nutzer:innen sichtbar sind, arbeiteten die Distillation-Guardrails im Verborgenen. Dies führte dazu, dass Nutzer:innen schlechtere Antworten erhielten, ohne es zu wissen, was das Vertrauen in die Ergebnisse stark beeinträchtigte.

    Die Reaktionen aus der AI-Community ließen nicht lange auf sich warten. Nur Stunden nach der Veröffentlichung brach auf Social Media eine Welle der Kritik los. Forscher, Entwickler und Policy-Experten warfen Anthropic vor, heimliche Sabotage an den eigenen Nutzer:innen zu betreiben. Der renommierte AI-Forscher Ethan Caballero äußerte sich auf der Plattform X, dass die Drosselung von Fable 5 für AI-Forschung die heftigste Reaktion ausgelöst habe, die er je erlebt habe. Andrej Karpathy, Mitgründer von OpenAI und seit Mai bei Anthropic, nannte zwar den Release ‘super spannend’, räumte jedoch ein, dass die Sicherheitsvorkehrungen ‘etwas zu schnell’ auslösten.

    Besonders kritisch äußerte sich die Cybersecurity-Community über die Unbrauchbarkeit von Fable 5 für sicherheitsrelevante Arbeiten. Da Anfragen zu Schwachstellen automatisch auf das schwächere Modell Opus 4.8 zurückfielen, war es Sicherheitsforschern nicht möglich, das leistungsstärkste Modell für ihre Kernaufgabe, das Aufspüren von Sicherheitslücken, zu nutzen. Dies ist besonders pikant, da die verwandten Mythos-Modelle in Tests im April über 23.000 kritische Schwachstellen in großen Code-Repositories identifiziert hatten.

    In Reaktion auf die massiven Vorwürfe entschuldigte sich Anthropic schnell und deutlich. In einer Erklärung gegenüber Wired äußerte das Unternehmen: ‘Wir haben den falschen Trade-off gemacht und entschuldigen uns dafür, dass wir die Balance nicht richtig getroffen haben.’ Die geheimen Schutzmaßnahmen gegen Distillation sollen abgeschafft werden. Zukünftig werden solche Anfragen wie andere Hochrisiko-Anfragen behandelt: Sie fallen auf Claude Opus 4.8 zurück, und Nutzer:innen werden darüber informiert. Anthropic versicherte, dass Nutzer:innen bei jeder betroffenen Anfrage eine Benachrichtigung erhalten werden.

    Der Zeitpunkt dieser Entschuldigung ist für Anthropic besonders heikel. Nur eine Woche vor dem Launch von Fable hatte das Unternehmen seine IPO-Unterlagen vertraulich eingereicht. Ein Skandal um Transparenz ist das Letzte, was ein Unternehmen auf dem Weg an die Börse gebrauchen kann.

    Doch was sind eigentlich Guardrails? Guardrails, zu Deutsch ‘Leitplanken’, sind Schutzmechanismen, die das Verhalten von AI-Modellen in bestimmte Bahnen lenken sollen. Sie verhindern, dass Modelle schädliche, gefährliche oder unerwünschte Inhalte ausgeben. Technisch gibt es verschiedene Ansätze, um dies zu erreichen: Klassifikatoren können problematische Anfragen erkennen und blockieren oder umleiten. Beim Training werden den Modellen bestimmte Anfragen beigebracht, die sie ablehnen sollen. Der Fall von Fable 5 zeigt jedoch, dass diese Schutzmechanismen auch nachträglich auf die Ausgaben eines Modells angewendet werden können.

    Das Problem bei Fable 5 lag darin, dass die Distillation-Guardrails im Verborgenen arbeiteten. Nutzer:innen erhielten minderwertige Antworten, ohne es zu wissen, was die Nachvollziehbarkeit und Zuverlässigkeit der Ergebnisse erheblich beeinträchtigte. Für Forscher, die mit diesen Outputs arbeiten, ist dies ein fundamentales Problem, da Wissenschaft auf verlässliche und nachvollziehbare Werkzeuge angewiesen ist.

    Dieser Vorfall bringt ein Dilemma ans Licht, mit dem alle führenden AI-Labore konfrontiert sind: Je leistungsfähiger die Modelle, desto größer ist das Potenzial für Missbrauch, was den Druck erhöht, Schutzmaßnahmen einzubauen. Gleichzeitig erwarten zahlende Kund:innen und die Forschungs-Community volle Transparenz darüber, was ein AI-Werkzeug leisten kann und was nicht. Anthropics Lektion aus dieser Woche ist klar: Sicherheit ja — aber nicht im Geheimen.

  • Anthropic zieht Fable 5 und Mythos 5 nach US-Regierungsanordnung zurück

    Anthropic zieht Fable 5 und Mythos 5 nach US-Regierungsanordnung zurück

    LGR Reutlingen – 15 Juni 2026 | Die US-amerikanische KI-Firma Anthropic steht unter Druck, nachdem sie am Freitagabend bekanntgab, dass die Modelle Fable 5 und Mythos 5 aufgrund einer Exportkontrollanordnung der US-Regierung deaktiviert wurden. Diese Maßnahme, die auf „nationale Sicherheitsbehörden“ zurückgeht, erfolgt nur wenige Tage nach dem mit Spannung erwarteten Launch der beiden Modelle und wirft ein Schlaglicht auf die bereits angespannten Beziehungen des Unternehmens zur Trump-Administration.

    Fable 5 gilt als das derzeit leistungsstärkste und zugleich kostspieligste KI-Modell auf dem Markt und sollte als neuer Bestseller von Anthropic fungieren. Diese Ambitionen wurden nun vorerst auf Eis gelegt.

    Der Hintergrund dieser Entscheidung liegt in einer Exportkontrollanordnung, die Anthropic am 12. Juni 2026 um 17:21 Uhr ET erhielt. Diese Anordnung untersagte den Zugang zu Fable 5 und Mythos 5 für alle ausländischen Staatsangehörigen, unabhängig davon, ob sie sich innerhalb oder außerhalb der Vereinigten Staaten befinden, einschließlich der ausländischen Mitarbeiter von Anthropic selbst. Da es dem Unternehmen nicht möglich war, ausländische Staatsangehörige in Echtzeit von der restlichen Nutzerbasis zu trennen, blieb nur die drastische Maßnahme eines globalen Shutdowns beider Modelle. Alle anderen Modelle von Anthropic sind von dieser Entscheidung nicht betroffen.

    Der offizielle Auslöser für diese Maßnahme war laut einem Regierungsvertreter, der mit Axios sprach, die Behauptung eines anderen Unternehmens, es habe Mythos jailbreaken können. Dies versetzte die Administration in Alarmbereitschaft. Zuvor hatte die Regierung bereits versucht, Anthropic dazu zu bringen, die Veröffentlichung seiner neuesten Modelle zu pausieren, war jedoch gescheitert.

    Anthropic selbst bestreitet die Schwere des Vorfalls. Das Unternehmen gibt an, nur mündliche Hinweise auf einen engen, nicht universellen Jailbreak erhalten zu haben. Anthropic ist überzeugt, dass derselbe Jailbreak auch auf andere öffentlich verfügbare Modelle angewendet werden könnte, einschließlich OpenAIs GPT-5.5, ohne dass diese Modelle vergleichbaren Exportkontrollen unterliegen.

    Der Weg zur Eskalation: Streit mit dem Pentagon und der OpenAI-Deal

    Der Konflikt zwischen Anthropic und der Trump-Administration ist nicht neu und hat seine Wurzeln in einem Streit mit dem Pentagon. Dieser eskalierte, nachdem die Verhandlungen zur Aktualisierung des Vertrags von Anthropic über zwei rote Linien gescheitert waren: Das Unternehmen bestand darauf, dass sein KI-Tool nicht zur Massenüberwachung von US-Bürgern oder für autonome Waffensysteme eingesetzt werden dürfe. Das Pentagon hingegen bestand darauf, dass die Technologie für „alle rechtmäßigen Zwecke“ genutzt werden könne.

    Am 27. Februar 2026 stufte das Verteidigungsministerium Anthropic als „Lieferkettenrisiko“ für die nationale Sicherheit ein und untersagte es jedem US-Militärauftragnehmer, Lieferanten oder Partnern, kommerzielle Aktivitäten mit dem Unternehmen durchzuführen. Verteidigungsminister Pete Hegseth ging sogar so weit, Anthropic formal als „Lieferkettenrisiko“ zu klassifizieren – eine Einstufung, die normalerweise ausländischen Gegnern und kompromittierten Technologieanbietern vorbehalten ist.

    Kurz nach diesem Befehl gab OpenAI bekannt, einen Vertrag mit dem Verteidigungsministerium abgeschlossen zu haben, um seine KI-Modelle in geheimen Netzwerken einzusetzen. Dies war das erste Mal, dass ein amerikanisches Unternehmen als Lieferkettenrisiko eingestuft wurde – und das erste Mal, dass diese Einstufung anscheinend als Vergeltungsmaßnahme gegen ein Unternehmen verwendet wurde, das sich weigerte, bestimmten vertraglichen Bedingungen zuzustimmen.

    Anthropic wehrte sich und reichte zwei Klagen ein – eine vor einem Bundesgericht in Kalifornien und eine vor dem Bundesberufungsgericht in Washington.

    Anthropics Antwort: Compliance mit Protest

    Obwohl das Unternehmen der Anordnung nachkommt, macht es deutlich, dass es diese für falsch hält. In einer Stellungnahme erklärte Anthropic, dass es eine „Defense-in-Depth“-Strategie für Fable 5 verfolgt habe und seine Sicherheitsvorkehrungen zusammen mit der US-Regierung, dem britischen AISI und privaten Dritten über Tausende von Stunden getestet worden seien. Die gefundenen Schwachstellen seien allesamt relativ einfach und könnten auch mit anderen öffentlich verfügbaren Modellen reproduziert werden.

    Anthropic betont, dass die Feststellung eines engen potenziellen Jailbreaks nicht der Grund für den Rückzug eines kommerziellen Modells sein sollte, das bereits Hunderten von Millionen von Menschen zur Verfügung steht. Sollte dieser Standard branchenweit angewendet werden, würde dies effektiv die Einführung aller neuen Modelle durch jeden Anbieter an der Frontlinie stoppen.

    Das Unternehmen entschuldigte sich bei seinen Kunden für die Unannehmlichkeiten und erklärte, dass es daran arbeite, den Zugang so schnell wie möglich wiederherzustellen.

  • US-Regierung sperrt Zugang zu Anthropics Fable 5 und Mythos 5

    US-Regierung sperrt Zugang zu Anthropics Fable 5 und Mythos 5

    LGR Reutlingen – 15 Juni 2026 | Die US-Regierung hat Anthropic, ein auf künstliche Intelligenz spezialisiertes Unternehmen, per Exportkontrollanordnung dazu verpflichtet, den Zugang zu seinen KI-Modellen Fable 5 und Mythos 5 für alle ausländischen Staatsangehörigen sofort zu sperren. Diese Maßnahme, die auf nationalen Sicherheitsbedenken basiert, wurde am heutigen Abend um 17:21 Uhr Ostküstenzeit verkündet und betrifft sämtliche ausländischen Nutzer, unabhängig davon, ob sie sich innerhalb oder außerhalb der USA befinden. Besonders brisant ist, dass diese Einschränkung auch die ausländischen Mitarbeiter von Anthropic einschließt, während andere Modelle des Unternehmens weiterhin für alle Nutzer zugänglich bleiben.

    Der unmittelbare Auslöser für diese drastische Entscheidung ist ein gemeldeter Jailbreak, der es ermöglichen soll, Sicherheitsvorkehrungen des Modells zu umgehen. Anthropic hat in einer Stellungnahme betont, dass der entsprechende Bericht gründlich geprüft wurde und die darin beschriebene Vorgehensweise mit Standardwerkzeugen übereinstimmt, die von Sicherheitsexperten regelmäßig verwendet werden. Zudem sei die Möglichkeit, solche Methoden ohne Umgehungsmaßnahmen bei anderen weit verbreiteten Modellen wie GPT-5.5 von OpenAI zu nutzen, gegeben.

    In der Vergangenheit hat Anthropic umfangreiche Sicherheitstests vor dem Launch von Fable 5 durchgeführt. In Zusammenarbeit mit US-Regierungsstellen sowie der britischen AI Safety Initiative wurden mehrere Tausend Stunden in Red-Team-Tests investiert. Während dieser Tests wurde kein universeller Jailbreak gefunden, der die Sicherheitsvorkehrungen des Modells grundlegend untergräbt oder eine breite Palette von problematischen Fähigkeiten freischaltet.

    Die Firma gibt zu, dass eine vollständige Jailbreak-Resistenz gegenwärtig für keinen Anbieter von KI-Modellen erreichbar ist. Stattdessen verfolgt Anthropic für Fable 5 einen mehrschichtigen Schutzansatz, um sicherzustellen, dass Jailbreaks entweder stark limitiert oder mit hohem Aufwand verbunden sind. Um potenzielle Angriffe schnell zu erkennen und zu bekämpfen, hat das Unternehmen eine 30-tägige Datenspeicherungspflicht für Kundendaten eingeführt, was zwar zusätzliche Kosten verursacht, aber auch die Analyse von Schwachstellen ermöglicht.

    Bisher habe es keinen konkreten Schadensfall gegeben, der auf einen nicht-universellen Jailbreak zurückzuführen wäre. Die gemeldeten Vorfälle hätten entweder harmlose Ergebnisse geliefert oder keine Vorteile gegenüber öffentlich verfügbaren Modellen gezeigt. Die aktuelle Anordnung basiert laut Anthropic auf einem Hinweis, der einen eng begrenzten Jailbreak betrifft und lediglich die Aufforderung beinhaltet, eine bestehende Codebasis zu lesen und Softwarefehler zu identifizieren.

    Trotz der rechtlichen Befolgung der Anordnung sieht Anthropic die zugrunde liegende Bewertung als unverhältnismäßig an. Das Unternehmen argumentiert, dass die Maßnahme nicht gerechtfertigt ist, insbesondere da Fable 5 für Hunderte Millionen Nutzer aktiv ist. Sollte ein solcher Maßstab branchenweit gelten, könnte dies die Veröffentlichung neuer Modelle durch führende Anbieter erheblich erschweren.

    Anthropic hat sich zwar für eine staatliche Aufsicht über KI-Systeme ausgesprochen, jedoch sollte diese auf transparenten, fairen und technisch fundierten Verfahren basieren. Die vorliegende Maßnahme erfüllt nach Einschätzung des Unternehmens diese Kriterien nicht. Anthropic kündigte an, innerhalb der nächsten 24 Stunden weitere Informationen bereitzustellen und arbeitet daran, den Zugang zu seinen Modellen so schnell wie möglich wiederherzustellen.

    Die Entscheidung der US-Regierung wirft Fragen auf über die Balance zwischen nationaler Sicherheit und technologischer Innovation. In einer Zeit, in der KI-Technologien zunehmend in unserem Alltag integriert werden, ist es entscheidend, wie Regierungen und Unternehmen mit den damit verbundenen Risiken umgehen. Die Diskussion über den richtigen Umgang mit KI-Sicherheit und die Rolle der Aufsicht wird in den kommenden Wochen und Monaten sicher an Intensität gewinnen.