KI & Automatisierung
Claude Opus 5 im Vergleich: Besser als Fable 5, GPT‑5.6 Sol, Kimi K3 und Sonnet 5?
Claude Opus 5 führt in mehreren agentischen Benchmarks und kostet pro Token nur halb so viel wie Fable 5. Der Vergleich zeigt, welches KI-Modell sich für Coding, Wissensarbeit und Automatisierung eignet.
Veröffentlicht am 25. Juli 2026 · Stand: 25. Juli 2026. Claude Opus 5 ist erst seit dem 24. Juli verfügbar. Entsprechend dünn ist die unabhängige Datenlage noch. Dieser Vergleich trennt deshalb Herstellerangaben von externen Tests und nennt bei jedem wichtigen Ergebnis Denkstufe, Agent und Testaufbau.
Die kurze Antwort: Claude Opus 5 ist derzeit eine der interessantesten Optionen für anspruchsvolle Wissensarbeit, Coding und lange agentische Aufgaben. Im unabhängigen Intelligence Index von Artificial Analysis liegt es mit maximaler Denkstufe knapp vorn und praktisch gleichauf mit Claude Fable 5. In Tests für realistische Büro- und Wissensarbeit setzt es sich deutlicher ab. Das macht Opus 5 aber nicht automatisch zum besten Modell für jeden Zweck: GPT‑5.6 Sol bleibt bei Terminal-Aufgaben und wissenschaftlichem Denken stark, Kimi K3 bietet viel Leistung zu niedrigeren Tokenpreisen, Sonnet 5 ist für viele Alltagsaufgaben wirtschaftlicher und Fable 5 behält Vorteile bei besonders schwierigen Langläufern und Faktenwissen.
Für Unternehmen ist genau diese Differenzierung wichtiger als ein Siegerpokal. Wer KI in Recherche, Dokumentation, Softwareentwicklung oder Automatisierung einsetzt, kauft kein abstraktes Benchmark-Ergebnis. Entscheidend sind Ergebnisqualität, Laufzeit, Gesamtkosten, Datenschutz, Integrationsaufwand und die Frage, wie viel menschliche Kontrolle ein Prozess braucht.
Tabelle seitlich verschieben →
| Frage | Antwort |
|---|---|
| Bester Gesamtwert? | Opus 5 max führt den AA Intelligence Index mit 61 Punkten – nur einen Punkt vor Fable 5. |
| Beste Wissensarbeit? | Opus 5 führt GDPval-AA v2 und AA-Briefcase; GPT‑5.6 Sol liefert dort die stärkere Präsentationsqualität. |
| Bestes Terminal-Coding? | GPT‑5.6 Sol liegt in zwei externen Terminal-Bench-Runs knapp vor Opus 5. Die Abstände sind praktisch offen. |
| Bestes Preis-Leistungs-Verhältnis? | Für anspruchsvolle Standardaufgaben meist Sonnet 5; für hohe Qualität Opus 5 high oder xhigh. |
| Klare Empfehlung? | Kein Universalmodell einkaufen: zwei passende Modelle mit eigenen Aufgaben, identischem Agenten und festem Budget testen. |
Was ist Claude Opus 5?
Claude Opus 5 ist Anthropics neues Premium-Arbeitsmodell unterhalb der Fable-Klasse. Es folgt auf Opus 4.8 und richtet sich an komplexes Coding, Computersteuerung und professionelle Wissensarbeit. Anthropic bietet es in Claude, Claude Code und über die API unter der festen Modell-ID claude-opus-5 an.
Tabelle seitlich verschieben →
| Merkmal | Claude Opus 5 | Praktische Bedeutung |
|---|---|---|
| Veröffentlichung | 24. Juli 2026 | Erste unabhängige Tests liegen vor, Langzeiterfahrung noch nicht. |
| API-Modell-ID | claude-opus-5 | Fester Snapshot statt automatisch wechselndem Evergreen-Alias. |
| Ein- und Ausgabe | Text und Bilder hinein, Text hinaus | Dokumente, Screenshots, Diagramme und Code lassen sich gemeinsam auswerten. |
| Kontextfenster | 1.000.000 Tokens | Kapazität für große Bestände; keine Garantie, dass jedes Detail zuverlässig genutzt wird. |
| Maximale Ausgabe | 128.000 Tokens synchron | Thinking und sichtbare Antwort teilen sich das Ausgabelimit. |
| Batch-Ausgabe | bis 300.000 Tokens mit Beta-Header | Nur asynchron und nicht bei allen Cloud-Anbietern verfügbar. |
| Wissensstand | Mai 2026 | Aktuelle Fakten brauchen weiterhin Recherche oder angebundene Quellen. |
| Thinking und Effort | Thinking standardmäßig aktiv; low bis max | Denkstufe verändert Qualität, Laufzeit und Kosten erheblich. |
| Standardpreis | 5 $ Input / 25 $ Output je 1 Mio. Tokens | Gleich teuer wie Opus 4.8, halb so teuer wie Fable 5. |
Neu ist vor allem die große Spannweite der fünf Denkstufen. Bei GDPval-AA v2 lagen zwischen low und max 407 Elo-Punkte; der Output unterschied sich ungefähr um den Faktor acht. Ein Modellname ohne Effort-Stufe ist deshalb nur die halbe Information. Anthropics Bestwerte bei Frontier-Bench, CursorBench, ARC-AGI 3, AutomationBench und OSWorld 2.0 bleiben zudem Hersteller- oder Partnerangaben, bis mehrere unabhängige Replikationen vorliegen.
Die wichtigsten Benchmarkergebnisse – sauber getrennt
Artificial Analysis und Vals haben Opus 5 extern geprüft. Die Tabelle nennt nicht nur den Score, sondern auch Denkstufe und Agenten- beziehungsweise Laufzeitumgebung. Genau dort entstehen sonst irreführende Vergleiche.
Tabelle seitlich verschieben →
| Test und Aufbau | Opus 5 | Stärkster Vergleich | Was daraus folgt |
|---|---|---|---|
| AA Intelligence Index v4.1 · max | 61 Punkte | Fable 5: 60 · GPT‑5.6 Sol: 59 | Opus führt, aber ein Punkt Abstand ist praktisch Gleichstand. |
| GDPval-AA v2 · Stirrup-Agent · max | 1.861 Elo | Fable 5: 1.747 · Sol: 1.736 | Klarer Opus-Vorsprung bei professioneller Wissensarbeit. |
| AA-Briefcase · Stirrup-Agent · max | 1.720 Elo | Fable 5: 1.574 | Opus führt bei fertigen Berichten, Tabellen und Präsentationen. |
| Terminal-Bench 2.1 · Terminus 2/E2B | 89,1 % · max | GPT‑5.6 Sol: 89,5 % · xhigh | Nominell Sol; 0,4 Punkte sind kein allgemeiner Coding-Sieg. |
| Long-Context Reasoning · 10k–100k Tokens | 70,0 % · max | GPT‑5.6 Sol: 73,7 % · max | Eine Million Kontext bedeutet nicht automatisch beste Langkontext-Nutzung. |
| AA-Omniscience · Faktenwissen | 31 · max | Fable 5: 40 · mit Opus-4.8-Fallback | Fable führt; der Fallback verwässert aber die reine Modellmessung. |
| Vals SWE-bench Verified · mini-SWE-agent/Bash | 97,00 % ± 0,76 · max | GPT‑5.6 Sol: 96,20 % ± 0,86 | Opus führt nominell; die Fehlerbereiche überlappen sich. |
| Vals LiveCodeBench v6 | 89,03 % ± 0,91 · max | Fable 5: 89,78 % ± 0,89 | Fable führt knapp; auch hier kein belastbarer Universalvorsprung. |
Am aussagekräftigsten für Unternehmen ist AA-Briefcase: Statt Multiple Choice verarbeitet der Agent Tausende Eingabedateien und erstellt verwertbare Berichte, Tabellen oder Präsentationen. Opus 5 führte bei Aufgabenerfüllung und analytischer Qualität. Bei der Präsentationsqualität lag GPT‑5.6 Sol max mit 1.666 Elo vor Opus 5 max mit 1.628 Elo. Schon innerhalb eines Benchmarks wechselt also der Sieger je nach Qualitätskriterium.
Der Vals-Wert von 97 Prozent in SWE-bench Verified sieht spektakulär aus, sollte aber nicht übergewichtet werden: Die Spitzengruppe liegt eng beieinander, die Unsicherheitsbereiche überlappen sich und der Benchmark gilt inzwischen als stark gesättigt. Aussagekräftiger für den eigenen Betrieb ist ein identisches Repository- und Agenten-Setup mit echten Fehlern aus dem eigenen Alltag.
Auch der Preisvergleich hat zwei Ebenen. Pro Token kostet Opus 5 exakt halb so viel wie Fable 5. Im Intelligence Index kostete eine Opus-Aufgabe mit max im Mittel 2,03 US-Dollar gegenüber 2,75 US-Dollar für Fable mit möglichem Opus-4.8-Fallback – 26 Prozent weniger, nicht 50 Prozent. In AA-Briefcase übertraf Opus 5 high Fable knapp und kostete 10,41 statt 22,30 US-Dollar. Dafür brauchten hohe Opus-Stufen 26 bis 36 Minuten pro Aufgabe.
Sechs Modelle im direkten Vergleich
Tabelle seitlich verschieben →
| Modell | Stärken | Grenzen | Einordnung |
|---|---|---|---|
| Claude Opus 5 | Agentische Wissensarbeit, komplexes Coding, Computer Use | Langsam und ausführlich auf hohen Stufen; Fakten weiterhin prüfen | Neuer Allround-Favorit für schwierige, wertvolle Aufgaben |
| Claude Fable 5 | Faktenwissen, extrem schwierige und lange autonome Aufgaben | Doppelter Tokenpreis; strengere Filter; 30 Tage Retention | Spezialmodell, wenn der letzte Qualitätsgewinn den Aufpreis trägt |
| GPT‑5.6 Sol | Terminal-Coding, Physik, präsentationsreife Ergebnisse, OpenAI-Tools | Teurer Output als Opus 5; nicht führend bei AA-Briefcase | Mindestens gleichwertige Alternative für technische Agenten |
| Kimi K3 | Hohe Gesamtleistung, großer Kontext, niedrigere Listenpreise | Langsame erste Antwort, sehr ausführlich; Datenwege gesondert prüfen | Preisoption nur nach Messung der echten Gesamtkosten |
| Claude Sonnet 5 | Tempo, Alltagsentwicklung, Extraktion, häufige Automatisierung | Weniger Spitzenleistung; max kann sehr viele Tokens erzeugen | Meist bestes Arbeitsmodell für Standardfälle |
| Claude Opus 4.8 | Erprobtes Verhalten und gute Aufgabenkosten | Schwächer bei neuer agentischer Wissensarbeit | Bestehende stabile Prozesse nicht ungeprüft migrieren |
Preise und Kontextfenster im Überblick
Tabelle seitlich verschieben →
| Modell | Input | Output | Kontext | Wichtiger Kostenhinweis |
|---|---|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ | 1 Mio. | Cache Read 0,50 $; Batch halbiert, Fast Mode verdoppelt den Preis. |
| Claude Fable 5 | 10 $ | 50 $ | 1 Mio. | Bei Sicherheitsfiltern kann ein Opus-4.8-Fallback greifen. |
| GPT‑5.6 Sol | 5 $ | 30 $ | 1,05 Mio. | Cache Read 0,50 $; über 272k Input gelten höhere Langkontextpreise. |
| Kimi K3 | 3 $ | 15 $ | 1 Mio. | Cache Read 0,30 $; Verbosität kann den Preisvorteil verkleinern. |
| Claude Sonnet 5 | 2 $* | 10 $* | 1 Mio. | *Einführungspreis bis 31.08.2026, danach 3 $ / 15 $. |
| Claude Opus 4.8 | 5 $ | 25 $ | 1 Mio. | Im AA-Index mit 1,80 $ je Aufgabe günstiger als Opus 5 max. |
Die Tabelle enthält keine Steuern, Regionalaufschläge, Werkzeuge oder Agenten-Infrastruktur. Für die Kalkulation zählt ohnehin der Preis pro akzeptiertem Ergebnis. Ein Modell mit günstigem Tokenpreis kann durch lange Denkphasen, umfangreiche Ausgabe und Korrekturschleifen am Ende teurer sein.
Auch das Kontextfenster ist keine Qualitätsgarantie. Eine Million Tokens bedeutet zunächst nur, dass sehr viel Text in eine Anfrage passt. Ob das Modell eine relevante Information in diesem Umfang zuverlässig findet, Zusammenhänge über viele Dokumente hält und dabei wirtschaftlich bleibt, ist eine andere Frage. Für die meisten KMU-Prozesse ist eine gute Dokumentauswahl mit sauberer Suche sinnvoller, als jedes verfügbare Dokument ungefiltert in den Kontext zu laden.
Was ändert sich gegenüber Opus 4.8 in der Praxis?
Tabelle seitlich verschieben →
| Änderung | Risiko im Betrieb | Empfehlung |
|---|---|---|
| Thinking standardmäßig aktiv | Alte Output-Limits können Thinking plus sichtbare Antwort zu früh abschneiden. | Effort und maximales Output-Limit gemeinsam testen. |
| Fünf Effort-Stufen | max erzeugt nicht automatisch das wirtschaftlich beste Ergebnis. | Mit medium, high und xhigh auf denselben Aufgaben beginnen. |
| Mehr Eigeninitiative und Subagenten | Offene Prompts können zu mehr Schritten und höherem Verbrauch führen. | Werkzeuggrenzen, Abbruchbedingungen und Akzeptanzkriterien festlegen. |
| Stärkere Selbstprüfung | Doppelte Prüfaufforderungen fördern unnötige Verifikationsschleifen. | Alte „prüfe alles nochmals“-Prompts entschlacken. |
| Automatische Safety-Fallbacks | Im Lauf kann tatsächlich Opus 4.8 statt Opus 5 antworten. | Modellidentität und Fallbacks für Tests und sensible Prozesse protokollieren. |
Ein Upgrade ist deshalb kein reiner Modellschalter. Wer produktiv migriert, sollte Qualität, Latenz, Input, Output, Kosten, Werkzeugaufrufe und menschliche Nacharbeit je erfolgreicher Aufgabe messen. Besonders bei regulierten oder reproduzierbaren Abläufen gehört die tatsächlich verwendete Modellversion ins Protokoll.
Welches Modell eignet sich wofür?
Tabelle seitlich verschieben →
| Einsatz | Zuerst testen | Alternative | Warum |
|---|---|---|---|
| Berichte, Tabellen, Präsentationen aus vielen Dateien | Opus 5 high/xhigh | GPT‑5.6 Sol | Opus führt AA-Briefcase; Sol hat dort die bessere Präsentationswertung. |
| Terminal-, DevOps- und Coding-Agenten | GPT‑5.6 Sol | Opus 5 | Sol liegt in den zitierten Terminal-Runs knapp vorn; das Agenten-Setup entscheidet. |
| Sehr schwierige Langläufer | Opus 5 xhigh | Fable 5 | Fable nur zuschalten, wenn ein eigener Test den doppelten Preis rechtfertigt. |
| Häufige Text-, Extraktions- und Standardaufgaben | Sonnet 5 | Kimi K3 | Tempo und Preis sind hier meist wichtiger als der letzte Benchmarkpunkt. |
| Große, kostenbewusste Kontextaufgaben | Kimi K3 | Sonnet 5 | Nur mit gemessener Latenz, Tokenmenge und geprüften Datenwegen. |
| Bestehender stabiler Opus-4.8-Prozess | Opus 4.8 behalten | Opus 5 Pilot | Migration nur bei messbar besserer Qualität oder weniger Nacharbeit. |
Unsere Empfehlung für Unternehmen lautet daher nicht „ein Modell für alles“, sondern eine kleine, kontrollierte Modellstrategie. Ein schnelleres und günstigeres Modell übernimmt häufige Standardfälle. Ein stärkeres Modell wird nur zugeschaltet, wenn Komplexität, Risiko oder erwarteter Wert es rechtfertigen. Für besonders wichtige Ergebnisse folgt eine menschliche Freigabe. In einer Automatisierung lässt sich diese Staffelung beispielsweise über klare Regeln und Qualitätsprüfungen abbilden.
Das passt auch zur digitalen Souveränität: Nicht der Name des Modells entscheidet, sondern der beherrschbare Gesamtprozess. Vor einem produktiven Einsatz gehören Datenarten, Anbieterrolle, Speicherfristen, Region, Unterauftragnehmer, Zugriffsrechte und Löschwege auf den Tisch. Kundendaten oder vertrauliche Dokumente sollten nicht allein wegen eines guten Benchmarks ungeprüft an eine externe API gesendet werden.
Grenzen von Benchmarkvergleichen
Erstens messen Benchmarks immer ein System, nicht nur ein nacktes Modell. Opus 5 wurde beim Coding mit Claude Code, bei Wissensarbeit mit dem offenen Stirrup-Agenten und in einigen Tests mit Opus 4.8 als Sicherheits-Fallback ausgeführt. GPT‑5.6 Sol läuft in einer anderen Agenten- und Werkzeugumgebung. Ein besserer Wert kann daher aus Modell, Prompt, Denkstufe, Agent, Werkzeugen oder deren Zusammenspiel entstehen.
Zweitens stammen viele Werte zum Veröffentlichungszeitpunkt vom Hersteller oder aus Tests, die gemeinsam mit dem Hersteller vor dem Start durchgeführt wurden. Artificial Analysis arbeitet unabhängig und veröffentlicht seine Methodik, hat Anthropic bei der Vorab-Evaluation aber unterstützt. Das ist belastbarer als eine reine Marketinggrafik, ersetzt jedoch keine breite Replikation durch mehrere unabhängige Labore.
Drittens sind Modellversionen, Fallbacks und Denkbudgets bewegliche Ziele. Ein Dienst kann Anfragen auf ein anderes Modell umleiten, Sicherheitsfilter verändern oder ein Modell hinter derselben Bezeichnung aktualisieren. Gerade bei Fable 5 beeinflusst der mögliche Opus-4.8-Fallback, was tatsächlich getestet wird.
Viertens bleiben Halluzinationen ein praktisches Risiko. Opus 5 führt mehrere anspruchsvolle Ranglisten an und zeigte im Faktenwissen-Test dennoch eine Halluzinationsquote von 50 Prozent. Ein starkes Modell kann sehr überzeugend falsch liegen. Quellen, Rechenwege und wichtige Entscheidungen müssen weiterhin überprüft werden.
Der beste Test ist deshalb ein kleines eigenes Prüfset aus echten, anonymisierten Aufgaben: typische Dokumente, gewünschte Ausgabe, klare Bewertungskriterien und mindestens mehrere Wiederholungen. Gemessen werden sollten nicht nur Trefferquote, sondern auch Nacharbeit, Laufzeit, Tokenverbrauch, Fehlerrisiko und die Qualität der Quellen.
Fazit: Opus 5 ist der neue Allround-Favorit – mit Vorbehalten
Claude Opus 5 erreicht tatsächlich nahezu Fable-5-Leistung zum halben Tokenpreis und übernimmt in mehreren agentischen Benchmarks die Führung. Besonders bei komplexer Wissensarbeit ist der Vorsprung derzeit überzeugend. Die sinnvollste Einstellung dürfte für viele Unternehmen high oder xhigh sein, weil max viel Zeit und zusätzliche Tokens verbraucht.
Eine allgemeine Krone bekommt Opus 5 trotzdem nicht. GPT‑5.6 Sol bleibt bei Terminal-Arbeit, Wissenschaft und präsentationsreifen Ergebnissen stark. Kimi K3 bietet hohe Leistung zu niedrigeren Listenpreisen, verlangt aber eine genaue Prüfung von Latenz, realem Tokenverbrauch und Datenwegen. Sonnet 5 ist für häufige Alltagsaufgaben oft wirtschaftlicher. Fable 5 lohnt sich vor allem dort, wo sein letzter Qualitätsvorsprung bei extrem schwierigen Langläufern den doppelten Tokenpreis rechtfertigt.
Praktisch heißt das: Opus 5 auf die Auswahlliste setzen, aber nicht anhand der Rangliste einkaufen. Zwei oder drei passende Modelle mit eigenen Aufgaben testen, den gesamten Prozess kalkulieren und sensible Datenflüsse bewusst gestalten. Das ist weniger spektakulär als „bestes KI-Modell der Welt“ – und deutlich näher an einer tragfähigen Digitalisierung.
Häufige Fragen
Ist Claude Opus 5 besser als Claude Fable 5?
Im unabhängigen Artificial Analysis Intelligence Index liegt Opus 5 max mit 61 Punkten praktisch gleichauf mit Fable 5 max mit 60. Bei agentischer Wissensarbeit führt Opus 5 deutlich und ist günstiger. Fable 5 behält Vorteile bei Faktenwissen und besonders schwierigen, langen autonomen Aufgaben.
Wie viel kostet Claude Opus 5?
Die Standard-API kostet 5 US-Dollar je Million Eingabetokens und 25 US-Dollar je Million Ausgabetokens. Das ist pro Token halb so viel wie Fable 5 und entspricht dem Preis von Opus 4.8. Cache, Fast Mode und regionale Optionen haben eigene Preise.
Ist Claude Opus 5 besser als GPT‑5.6 Sol?
Nicht in jeder Disziplin. Opus 5 führt im Gesamtindex und bei agentischer Wissensarbeit knapp bis deutlich. GPT‑5.6 Sol bleibt bei Terminal-Coding, einigen wissenschaftlichen Tests und der Präsentationsqualität sehr stark. Die Agenten-Umgebung und der konkrete Anwendungsfall entscheiden.
Lohnt sich Kimi K3 als günstige Alternative?
Kimi K3 erreicht mit 57 Punkten ein hohes Leistungsniveau und kostet 3 US-Dollar für Eingabe sowie 15 US-Dollar für Ausgabe. Es antwortete in unabhängigen Messungen jedoch langsam und sehr ausführlich. Außerdem müssen Unternehmen Anbieter, Vertragsbedingungen und Datenübermittlung gesondert prüfen.
Wann ist Sonnet 5 die bessere Wahl als Opus 5?
Für häufige Alltagsaufgaben, normale Programmierung, Extraktion und viele Automatisierungen ist Sonnet 5 meist schneller und pro Token günstiger. Opus 5 lohnt sich eher, wenn schwierige, mehrstufige Aufgaben und die Qualität des fertigen Arbeitsergebnisses den höheren Aufwand rechtfertigen.
Welches KI-Modell ist für Unternehmen am besten?
Es gibt kein pauschal bestes Modell. Sinnvoll ist eine gestufte Auswahl: ein schnelles, günstiges Modell für Standardfälle, ein stärkeres Modell für komplexe Aufgaben und menschliche Freigabe bei wichtigen Ergebnissen. Eigene Tests mit realistischen, anonymisierten Aufgaben sind aussagekräftiger als eine einzelne Rangliste.
Passend dazu
Quellen
- Anthropic – Introducing Claude Opus 5 (Herstellerangaben, 24.07.2026) · anthropic.com
- Anthropic – Opus-5-Spezifikationen, Thinking und Änderungen · platform.claude.com
- Anthropic – Modellübersicht mit Output-Limits und Wissensstand · platform.claude.com
- Anthropic – Prompting-Hinweise für Opus 5 · platform.claude.com
- Artificial Analysis – Opus 5: Fable-5-Niveau bei niedrigeren Aufgabenkosten · artificialanalysis.ai
- Artificial Analysis – Opus 5 bei agentischer Wissensarbeit · artificialanalysis.ai
- Vals AI – Coding-Benchmarks und Methodik · vals.ai
- OpenAI – Warum SWE-bench Verified keine Frontier-Fortschritte mehr zuverlässig misst · openai.com
- Anthropic – Claude Fable 5: Modell, Safeguards und Datenaufbewahrung · anthropic.com
- OpenAI – GPT‑5.6: Benchmarks, Verfügbarkeit und Preise · openai.com
- OpenAI – GPT‑5.6 Sol: API-Preis und Kontextfenster · developers.openai.com
- Moonshot AI – Kimi K3: Modellbeschreibung · moonshot.ai
- Artificial Analysis – Kimi K3: unabhängige Leistungs-, Preis- und Tempomessung · artificialanalysis.ai
- Anthropic – Introducing Claude Sonnet 5 · anthropic.com
- Artificial Analysis – Claude Sonnet 5: unabhängige Messwerte · artificialanalysis.ai
Konkrete Frage zu Ihrer Dokumentation?
Erstgespräch anfragen