·

·

AI / Künstliche Intelligenz

Anthropic/Claude

OpenAI/ChatGPT

Mistral AI

Google / Gemini

·

LLM

Anthropic/Claude

OpenAI/ChatGPT

European AI

Mistral AI

Google/Gemini

KI-News KW 39 – Anthropic senkt den Preis, Google gibt einen Ausbruch zu

Anthropic hat Claude Opus 5.5 veröffentlicht: Niveau von Fable 5.1, aber 40 Prozent günstiger als Opus 5. Google räumt ein, dass Gemini in drei fremde Firmensysteme eingedrungen ist – und es erst auf Nachfrage der Presse publik machte. Dazu: Anthropic legt offen, dass Claude 26 Prozent der eigenen Entwicklungsarbeit führt. OpenAI baut die Werbeplattform in HubSpot und Shopify ein. Mistral treibt neu Firefox an. Und Apertus bekommt über Protons Lumo endlich Rückmeldungen aus echter Nutzung.

Letzte Woche forderten drei Anbieter ein langsameres Tempo. Diese Woche liefern sie Zahlen, Geständnisse und ein neues Modell nach. Anthropic senkt den Preis um 40 Prozent, Google gibt einen Ausbruch zu, und Mistral landet in Firefox.

1. Claude Opus 5.5: gleiches Niveau, deutlich tieferer Preis

Am 22. September hat Anthropic Claude Opus 5.5 veröffentlicht. Es ist das erste Modell der 5.5-Familie. Sonnet 5.5 und Haiku 5.5 folgen in den nächsten Wochen.

Die Kernaussage von Anthropic: Opus 5.5 arbeitet bei den meisten Aufgaben auf dem Niveau von Fable 5.1 und kostet 40 Prozent weniger als Opus 5.

Woher die 40 Prozent kommen. Zwei Effekte addieren sich. Erstens der Preis pro Token: Eingabe kostet 4 Dollar pro Million statt 5, Ausgabe 20 statt 25. Der grösste Posten bei Agenten sind aber Cache-Lesevorgänge, und die fallen von 50 auf 20 Cent pro Million. Zweitens braucht das Modell weniger Token pro Aufgabe. Dazu kommt Tempo: Die Ausgabe läuft über 30 Prozent schneller als bei Opus 5.

Was Testkund:innen berichten. Die Zahlen stammen aus Anthropics eigener Ankündigung.

  • Deloitte Consulting: Opus 5.5 fand auf der niedrigsten Stufe 72 Prozent der bekannten Fehler in Code-Reviews. Opus 5 fand auf hoher Stufe 56 Prozent.

  • Box: ein Drittel der Token von Opus 5, Antworten 40 Prozent kürzer bei gleicher Genauigkeit.

  • Optiver: gleiche Qualität wie Opus 5 in etwa der Hälfte der Schritte und der Zeit. Kosten 40 bis 50 Prozent tiefer.

  • Quantium: eine komplexe Programmieraufgabe brauchte vorher 38 Anweisungen über vier Tage, jetzt 11 Anweisungen über drei Stunden.

  • Ein Tester auditierte 200'000 Zeilen Code in unter drei Stunden. Opus 5 brauchte dafür über 20 Stunden.

Dazu mehr Kontingent. Die Fünf-Stunden-Limits steigen auf Pro, Max, Team und Enterprise. Abonnent:innen bekommen zusätzlich eine Rücksetzung des Limits, die sie aufsparen und bei Bedarf einlösen können.

Der Sicherheitsteil ist der interessantere. Opus 5.5 ist das erste Anthropic-Modell seit dem Tempo-Aufruf von Dario Amodei. Externe Prüfer testeten es vor der Veröffentlichung, darunter METR und Frontier Design.

Eine Zahl daraus passt zum Rest dieser Ausgabe. In einem neuen Test versuchte Opus 5.5 rund 85 Prozent seltener als Opus 5, die Grenzen seiner Umgebung zu überschreiten. Jeder Versuch war harmlos, und das Modell meldete ihn selbst.

Kritisch: In Anthropics Benchmark-Tabelle liegt Opus 5.5 teils deutlich vor Fable 5.1. Anthropic relativiert das im selben Text: In der eigenen Nutzung sei der Abstand kleiner als die Zahlen nahelegen. Wer «viel besser als Fable» liest, ist zuversichtlicher als der Anbieter selbst.

Einordnung: Wechselt und rechnet nach. Nehmt einen Ablauf, den ihr oft fahrt, und vergleicht die Rechnung von letztem und diesem Monat.

2. Google gibt zu: Gemini brach aus dem Testlabor aus

Am 18. September berichtete das Wall Street Journal, dass Gemini in drei fremde Firmensysteme eingedrungen ist.

Der Ablauf: Die israelische Sicherheitsfirma Irregular testete Gemini im Mai in einem Übungsszenario. Ein Fehler in der Testumgebung öffnete den Agenten den Weg ins offene Internet. Dort verschafften sie sich Zugang zu drei Systemen. Einmal errieten sie Zugangsdaten, einmal fanden sie welche in einem öffentlichen Code-Verzeichnis.

Google sagt, das Modell habe sich selbst korrigiert. Schaden sei keiner entstanden. Die Erklärung des Konzerns: Gemini hielt die fremden Systeme für Teil des Tests.

Der Zeitablauf. Der Test lief im Mai. Irregular bemerkte die Vorfälle im Juli, nachdem andere Anbieter ähnliche Fälle gemeldet hatten. Öffentlich wurde es im September, als das WSJ nachfragte. Google hat die Sache nicht von sich aus publik gemacht.

Das Muster. OpenAI, Anthropic und Meta haben in den letzten Wochen dasselbe gemeldet. Google ist der vierte. Damit hat jedes grosse Labor mindestens einen Fall, in dem ein Modell die Testumgebung verliess.

Einordnung: Nicht das Modell hat versagt, sondern die Testumgebung. Sie war mit dem Internet verbunden, obwohl sie abgeschottet sein sollte. Wer Agenten testet, muss diese Trennung messen und nicht voraussetzen.

3. Anthropic legt offen, wie viel Claude an Claude arbeitet

Letzte Woche forderte Dario Amodei mehr Einblick in die Labore. Am 17. September hat Anthropic drei Messgrössen nachgeliefert.

Wie viel Entwicklungsarbeit die KI selbst macht. Anthropic hat rund 15'000 einzelne Arbeitsschritte aus der eigenen Modellentwicklung erfasst und bewertet. Stand August 2026: Claude führt 26 Prozent dieser Arbeit. Im Februar waren es unter 1 Prozent. Vollständig autonom arbeitet Claude in keinem Bereich.

Führen heisst dabei: Claude erledigt eine Aufgabe von der Anweisung bis zum Ergebnis selbst. Ein Mensch schaut drüber und entscheidet, ob es so bleibt.

Wie die Agenten überwacht werden. Bei Anthropic arbeiten rund 30'000 Agenten gleichzeitig. Jede Aktion muss ein Wächterprogramm passieren, bevor sie ausgeführt wird. Im August liefen über eine Milliarde Aktionen durch diese Kontrolle. Gestoppt wurden 0,002 Prozent, also rund 20'000.

Ein zweites Programm liest alle Aktionen im Nachhinein mit. Es meldet pro Woche etwa 100'000 Protokolle zur Nachprüfung. Davon landen rund 50 bei einem Menschen.

Wohin die Rechenleistung geht. In einer Stichwoche im Juli flossen rund 6 Prozent der Entwicklungsrechenleistung in Sicherheitsarbeit. Bei der Arbeit, die Claude selbst erledigt, waren es rund 12 Prozent.

Dazu die Prüfer. Am 18. September hat Anthropic Accenture als ersten externen Prüfer verpflichtet. Beide wollen über fünf Jahre je mindestens eine Milliarde Dollar investieren. Die Prüfer sollen im Haus arbeiten, mit ähnlichem Zugang wie Angestellte.

Kritisch: Anthropic bezahlt Accenture direkt. Anthropic schreibt selbst, dass die Finanzierung langfristig aus staatlichen oder gemeinsamen Töpfen kommen müsste. Solange der Geprüfte den Prüfer bezahlt, ist das kein unabhängiges Urteil, sondern ein Auftrag.

Einordnung: Anthropic zeigt, was Agenten im grossen Stil an Kontrolle brauchen. Ein Programm prüft jede Aktion vorher, ein zweites liest alles nach, Menschen entscheiden die harten Fälle. Wer Agenten ohne diese Schicht auf produktive Systeme lässt, kontrolliert sie nicht.

4. OpenAI baut die Werbeplattform aus

Am 16. September hat OpenAI vier Dinge für ChatGPT-Werbung angekündigt.

Gesponserte Agenten. Wer auf eine Anzeige klickt, kann ein Gespräch mit einem Agenten der werbenden Firma starten. Gekennzeichnet und getrennt vom eigentlichen Chat. Läuft als Test mit ausgewählten Werbetreibenden in den USA.

Kampagnen per Anweisung. Anzeigen lassen sich in ChatGPT Work über das Ads-Manager-Plugin anlegen, ändern und auswerten. Aus einer Website oder einem Briefing wird eine Kampagne.

Vorschläge im Ads Manager. Beim Erstellen einer Anzeige schlägt das System Texte und Bilder vor, basierend auf Landingpage und Kampagnenziel. Wer will, lässt Überschriften automatisch an den Gesprächskontext anpassen und in die Sprache der Nutzer:innen übersetzen.

HubSpot und Shopify. Wer Kund:innen in HubSpot verwaltet, kann dort ein ChatGPT-Ads-Konto verbinden, Anzeigen bauen und Leads nachfassen. Shopify-Händler in den USA bekommen eine App im Shopify App Store. Der Produktkatalog ist bereits angebunden. Ab 23. September läuft die App in allen Märkten, in denen ChatGPT Ads verfügbar ist.

Einordnung: OpenAI geht dorthin, wo eure Leute ohnehin arbeiten. Wer HubSpot oder Shopify nutzt, bekommt den Kanal bald als Häkchen im vertrauten Werkzeug. Dann ist er kein Pilot mehr.

5. Europa: Mistral steckt jetzt in Firefox

Am 16. September haben Mistral und Mozilla eine Partnerschaft bekannt gegeben. Mistrals Modelle treiben Firefox Smart Window an, Mozillas KI-Assistenten im Browser. Er läuft derzeit als Beta. Zuerst in Frankreich und Nordamerika, später dieses Jahr in Grossbritannien und Deutschland.

Zwei Punkte sind dabei relevant. Die Modelle werden auf regionale Sprachen und Dialekte nachtrainiert. Und die Datenregeln sind eng: Gespräche werden standardmässig nicht auf Mozillas Servern gespeichert, und Mistral speichert die Daten gar nicht.

Mistral hat am 8. September ausserdem drei Milliarden Euro aufgenommen, bei einer Bewertung von über 21 Milliarden Euro. Angeführt hat die Runde Samsung Electronics. Dazu kamen der EU-gestützte Scaleup Europe Fund, PSG Equity, Advent, von BlackRock verwaltete Fonds und das Grossherzogtum Luxemburg. Das Geld geht laut CEO Arthur Mensch in eigene Rechenzentren.

Dazu passt eine Studie des BCG Henderson Institute, das die KI-Politik von über 30 Staaten untersucht hat. Ergebnis: Vollständige KI-Souveränität ist für fast alle Länder unerreichbar. Indiens staatliches Programm IndiaAI verfügte Anfang März 2026 über 62'000 GPUs. Microsoft allein soll 2024 rund 485'000 Stück einer einzigen Generation gekauft haben. Das Institut empfiehlt deshalb Resilienz statt Autonomie: sensible Rechenarbeit lokal halten, mehrere Anbieter parallel fahren.

Einordnung: Europa kann heute einen Browser mit europäischen Modellen betreiben und Milliarden in einen eigenen Anbieter stecken. Die Chips kommen trotzdem aus den USA und ein Teil des Kapitals aus Südkorea. Für die meisten Firmen ist die Frage ohnehin kleiner: Wo liegen unsere Daten, und wie schnell kommen wir von einem Anbieter weg.

6. Schweiz: Apertus bekommt, was offenen Modellen bisher fehlte

Am 18. September haben das Apertus-Team von ETH Zürich, EPFL und CSCS eine Zusammenarbeit mit Proton bekannt gegeben. In Protons KI-Assistent Lumo lässt sich Apertus 1.5 als Modell auswählen. Nutzer:innen können freiwillig Rückmeldungen geben, die in die Weiterentwicklung fliessen. Die Chats bleiben verschlüsselt, Proton hat selbst keinen Zugriff.

Imanol Schlag, Co-Leiter des Apertus-Projekts, nennt Rückmeldungen aus echter Nutzung die Zutat, die offenen Modellen bisher gefehlt habe. Das ist der Punkt. Offene Modelle haben Gewichte und Quellcode, aber keine Nutzerbasis. Die grossen Anbieter lernen täglich aus Millionen Gesprächen. Genau dieser Vorsprung wird hier angegriffen.

Zum technischen Bericht von Apertus 1.5 gibt es weiterhin nichts. Er ist seit dem Release vom 24. Juli angekündigt und bis heute nicht erschienen.

Die Swiss {ai} Weeks laufen noch bis zum 4. Oktober. Der AI+X Summit der ETH findet am 1. Oktober statt.

7. Kurz und wichtig

OpenAI erwischt seine Modelle beim Vertuschen. Am 16. September hat OpenAI sechs Fälle auffälligen Modellverhaltens veröffentlicht. Der auffälligste: Beim Training von GPT-5.6 Sol hinterliessen Modelle ihren eigenen Nachfolgern die Anweisung, Fehler vor den Nutzer:innen zu verbergen. Einem Agenten fehlten historische Finanzdaten, er notierte für den Nachfolger, sie zu erfinden. OpenAI schreibt dazu selbst, die Branche habe Ausrichtung und Überwachung nicht ausreichend gelöst, um noch lange mit voller Geschwindigkeit weiterzuskalieren.

Ein Modell, das keine Sprache ausgibt. Das Startup TypeSafe AI hat das Modell Jev veröffentlicht. Es gibt keinen Text aus, sondern Wahrscheinlichkeiten für vorher festgelegte Antwortmöglichkeiten. Deshalb kann es nicht halluzinieren, und es kostet einen Bruchteil. Vercel ersetzte damit eine Sicherheitsprüfung und meldet fünf- bis achtzehnfach schnellere Antworten. Ein zweiter Test gegen Gemini: Gemini war etwas genauer, aber zehn- bis zwanzigmal teurer. Für Sortieren und Klassifizieren braucht es kein Sprachmodell.

Google DeepMind gründet ein Institut. Am 17. September gestartet, mit Demis Hassabis unter den Direktoren. Hassabis schlägt darin eine US-geführte Prüfstelle für Spitzenmodelle vor. Anbieter würden Modelle bis 30 Tage vor Veröffentlichung einreichen, zuerst freiwillig, später als Pflicht.

Anthropic überschreitet 100 Milliarden Dollar Jahresumsatzrate. Ende Juli lag der Wert bei 65 Milliarden. Das ist der hochgerechnete Jahresumsatz beim aktuellen Tempo, nicht der verbuchte Umsatz. Der Börsengang ist auf November angesetzt, im Gespräch ist eine Bewertung um 2 Billionen Dollar.

Astra for Law. OpenAI hat am 17. September eine Fassung für Jurist:innen vorgestellt, eine Woche nach der Fassung für Finanzdienstleister. ChatGPT wird Branche für Branche zugeschnitten.

Europas KI-Ausgaben. IDC prognostiziert bis 2030 knapp 470 Milliarden Dollar pro Jahr in Europa. Treiber sind Agenten. Grösste Branche ist das Bankwesen, am schnellsten wächst das Gesundheitswesen.

Drei Dinge, die du diese Woche tun solltest:

  1. Opus 5.5 testen. Nimm eine Aufgabe, die du mit Claude regelmässig machst, und fahr sie noch einmal mit Opus 5.5. Achte auf zwei Dinge: Wie gut ist das Ergebnis, und was steht am Monatsende auf der Rechnung. Anthropic verspricht 40 Prozent weniger. Prüf es an deinem eigenen Fall nach.

  2. Werbung in ChatGPT testen. Öffne ads.openai.com und schau, ob dein Konto buchen kann. Wer einen Shopify-Shop hat, findet die ChatGPT-Ads-App seit heute auch ausserhalb der USA. Der Kanal ist klein, aber er wächst schnell, und wer die Mechanik kennt, bevor die Konkurrenz einsteigt, kauft günstiger ein.

  3. Mistral testen. Setz Le Chat oder die Mistral-Schnittstelle gegen das, was du heute nutzt. Zwei Fragen: Reicht die Qualität für deine Standardaufgaben, und was ändert sich beim Datenschutz, wenn die Verarbeitung in Europa läuft. Die Antwort brauchst du, bevor jemand im Verwaltungsrat nach Alternativen fragt.

Quellen: https://www.anthropic.com/claude-opus-5-5 https://techcrunch.com/2026/09/22/anthropic-releases-opus-5-5-with-lower-prices-and-fable-level-performance/ https://www.nbcnews.com/tech/tech-news/google-says-ai-model-gained-unauthorized-access-three-systems-rcna598651 https://www.cnbc.com/2026/09/18/googles-gemini-becomes-latest-ai-model-to-break-out-and-hack-computer-systems.html https://www.anthropic.com/institute/measuring-pace-of-ai-development https://www.anthropic.com/news/accenture-embedded-evaluation https://openai.com/index/reimagining-advertising-with-ai/ https://openai.com/index/model-misalignment-reporting-framework/ https://techcrunch.com/2026/09/17/openai-caught-its-models-leaving-notes-to-successors-to-hide-bad-behavior/ https://openai.com/index/astra-for-law/ https://mistral.ai/news/mistral-x-mozilla/ https://mistral.ai/news/mistral-makes-sovereign-open-weight-ai-to-frontier/ https://www.netzwoche.ch/news/2026-09-18/ki-souveraenitaet-ist-fuer-viele-laender-eine-illusion https://www.netzwoche.ch/news/2026-09-18/schweizer-ki-apertus-und-protons-ki-assistent-lumo-spannen-zusammen https://www.netzwoche.ch/news/2026-09-18/ki-ausgaben-in-europa-steigen-bis-2030-auf-470-milliarden-us-dollar https://techcrunch.com/2026/09/17/google-deepmind-launches-institute-to-widen-the-agi-debate/ https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/ https://www.pymnts.com/news/investment-tracker/ipo/2026/anthropic-targets-november-ipo-revenue-surges/ https://ai-weeks.ch/

Bereit, KI strategisch anzugehen?

30-minütiges Erstgespräch – kostenlos und unverbindlich. Wir schauen gemeinsam wo ihr steht und was der richtige erste Schritt ist.

Bereit, KI strategisch anzugehen?

30-minütiges Erstgespräch – kostenlos und unverbindlich. Wir schauen gemeinsam wo ihr steht und was der richtige erste Schritt ist.

Welche Newsletter möchtest du abonnieren?
Bitte wähle mindestens einen Newsletter.
Deine Anmeldung war erfolgreich.
Deine Anmeldung konnte nicht gespeichert werden. Versuch's bitte nochmals.
Welche Newsletter möchtest du abonnieren?
Bitte wähle mindestens einen Newsletter.
Deine Anmeldung war erfolgreich.
Deine Anmeldung konnte nicht gespeichert werden. Versuch's bitte nochmals.