Google hat am 30. September 2026 sein neues Spitzenmodell Gemini 4 Argon vorgestellt – das erste echte Flaggschiff seit fast einem Jahr. In den von Google selbst veröffentlichten Benchmarks setzt sich Argon in der Mehrheit der Disziplinen vor Anthropics Claude Opus 5.5 und OpenAIs GPT-6 Astra. Doch der breite Start lässt auf sich warten: Zunächst erhalten nur ausgewählte Cybersecurity-Expertinnen und -Experten Zugriff – und aus dem eigenen Haus kommen bereits erste Zweifel an der Alltagstauglichkeit.
Benchmark-Führung in 13 von 19 Disziplinen
Laut Googles eigener Vergleichstabelle führt Argon in 13 von 19 Benchmarks. Beim Vals Index, der die wirtschaftliche Nützlichkeit von KI-Modellen misst, erreicht Argon 68,9 Prozent – vor Claude Opus 5.5 (67,0 Prozent), Claude Fable 5.1 (65,8 Prozent) und GPT-6 Astra (63,1 Prozent). Auch beim Software-Engineering-Benchmark DeepSWE v1.1 liegt Argon mit 77,9 Prozent knapp vor Opus 5.5 (74,2 Prozent) und Astra (74,1 Prozent). Besonders deutlich fällt der Vorsprung bei AutomationBench aus: 51,3 gegenüber 42,5 Prozent für Opus 5.5.
Die Krone sitzt allerdings nicht auf allen Köpfen gleich fest: Bei Terminal-Bench 4.0 bleibt Claude Opus 5.5 mit 66,4 zu 57,4 Prozent klar vorn, und beim anspruchsvollen FrontierSWE v2 schlägt GPT-6 Astra das Google-Modell mit 65,5 zu 55 Prozent. Googles Chief AI Architect Koray Kavukcuoglu lässt sich dennoch mit großen Worten zitieren: Gemini 4 Argon verändere grundlegend, wie Google arbeite und entwickle.
Eine Million Output-Tokens und Kampfpreise
Technisch sticht vor allem eine Zahl heraus: Argon kann bis zu eine Million Tokens pro Antwort ausgeben – bisher lag das Limit bei 64.000. Damit lassen sich erstmals sehr umfangreiche Dokumente, Codebasen oder Berichte in einem einzigen Durchgang erzeugen.
Auch beim Preis greift Google an. Zum Start kostet Argon über die API:
- 2 US-Dollar pro Million Input-Tokens (gecachte Inputs: 0,10 US-Dollar)
- 10 US-Dollar pro Million Output-Tokens
Nach der Einführungsphase sollen die Preise auf 4 bzw. 20 US-Dollar steigen – dann läge Argon gleichauf mit Claude Opus 5.5 (4/20 US-Dollar), aber weiter deutlich unter GPT-6 Astra (10/50 US-Dollar). Wann die Einführungsphase endet, verrät Google nicht.
Start nur für Cyber-Verteidiger – und Zweifel aus dem eigenen Haus
Verfügbar ist Argon zunächst nur für einen kleinen Kreis: Über das sogenannte Fairwind-Programm erhalten vertrauenswürdige Cyber-Verteidiger frühen Zugriff, zudem nimmt Google am freiwilligen Pre-Release-Programm der US-Regierung teil. API-Kunden und Abonnenten von Google AI Ultra sollen „so bald wie möglich" folgen – ein konkretes Datum nennt Google nicht.
Pikant: Laut einem Bloomberg-Bericht, den Trending Topics zitiert, schneidet Argon im praktischen Einsatz durch Google-Mitarbeitende schlechter ab, als die Benchmark-Tabellen vermuten lassen – insbesondere bei bestimmten Programmieraufgaben. Unabhängige Tests stehen noch aus, die Benchmark-Auswahl stammt komplett von Google selbst.
Was bedeutet das für Anwender in Deutschland?
Einen EU-Termin nennt Google bislang nicht – der Rollout startet über ein US-Programm, deutsche Nutzer müssen sich gedulden. Wer Argon später im Abo nutzen will, braucht Google AI Ultra: In Deutschland kostet das Paket 99,99 Euro pro Monat, die 20x-Variante mit höheren Limits liegt nach einer kürzlichen Preissenkung bei 219,99 Euro. Für den API-Einsatz ist der Einführungspreis von 2/10 US-Dollar attraktiv – Unternehmen sollten aber einkalkulieren, dass sich die Kosten danach verdoppeln.
DSGVO-seitig gilt wie bei Gemini generell: Für geschäftliche Nutzung gehört die API über Google Cloud mit Auftragsverarbeitungsvertrag eingerichtet, nicht die Consumer-App. Als Allzweck-KI-Modell fällt Argon zudem unter die Transparenzpflichten des EU AI Act für GPAI-Modelle. Wer sensible Daten gar nicht erst in die Cloud geben will, findet mit Googles offener Modellfamilie Gemma 4 eine lokale Alternative, die auf eigener Hardware läuft.
Unsere Empfehlung für den Mittelstand: unabhängige Benchmarks und erste Praxisberichte abwarten, die günstige Einführungsphase dann gezielt für eigene Tests nutzen – und sich von Googles selbst kuratierter Benchmark-Tabelle nicht blenden lassen. Der Dreikampf zwischen Google, OpenAI und Anthropic drückt die Preise weiter, und davon profitieren am Ende vor allem die Anwender.