Modellbenchmarks
Vergleich
Die wichtigsten Modelle, von Code über Prosa bis zu generierten Screens. Gebaut aus den Benchmarks, die die jeweiligen Fragen am ehrlichsten beantworten, mit Link zur Quelle für jede Zahl.
Wer führt wofür
Stand 28. August 2026
Allround
Welches Modell ist über alle Disziplinen gesehen vorn, wenn Coden, Agenten, Wissen und Wissenschaft zusammen zählen?
Führend
- 1Claude Opus 563
- 2Claude Fable 562
- 3Grok 4.661
Skala 0 bis 100
Jedes einzelne Benchmark verkennt etwas, deshalb mischt der Index neun harte Tests zu einer Zahl. Wer einen Allrounder sucht, beginnt hier. Für eine einzelne Stärke zählen die anderen Dimensionen.
Grundlage
Neun Einzeltests über vier Säulen: Agenten, Coden, allgemeines Wissen und wissenschaftliches Denken. Jede Säule zählt ein Viertel.
Die einzige Mischrechnung, die agentische Arbeit gleichrangig mit Wissen misst. Der Runner listet zusätzlich Preis pro Aufgabe und Ausgabetempo, was bei der Auswahl oft mehr entscheidet als die Punktzahl.
Agenten und Code
Welches Modell trägt eine echte Aufgabe in Terminal und Repository durch, ohne dass ich überall nachbessern muss?
Führend
- 1Claude Opus 512,99 %
- 2Claude Fable 511,7 %
- 3GPT-5.6 Sol10,24 %
Skala 0 % bis 16 %
Ein hoher Arena Rang erwächst aus beobachteten Läufen, ein hoher SWE-bench Wert aus bestandenen Testsuiten. Zusammen stecken sie Realität gut ab.
Grundlage
Menschen vergleichen blinde Agentenläufe. Gewertet wird der Anteil vollständig gelöster Aufgaben.
Misst lange Läufe mit Werkzeugen statt Antwortblitze, was der Arbeitsweise von Coding Agenten am nächsten kommt.
500 echte GitHub Issues aus zwölf Python Repositories. Ein Fix zählt erst, wenn die Testsuite besteht.
Lange der Standard für Bugfix Arbeit an echtem Code, inzwischen fast gesättigt: die Spitzenmodelle liegen bei rund 96 Prozent. Hier dient er als Bodencheck, die Unterschiede zeigt die Arena.
Web und UI
Welches Modell baut Screens, die gepflegt und professionell wirken, viele Varianten aushalten und nicht nach Schablone aussehen?
Führend
- 1Kimi K31.372
- 2Muse Spark 1.21.335
- 3Claude Opus 51.332
Skala 1.200 bis 1.450
Die beiden Boards krönen verschiedene Sieger. Design Arena kürt Kimi K3, das stimmenstärkere LMArena WebDev führt Claude Opus 5 mit 1691 vor Kimi K3 Max. Wo reines Design entscheidet, wiegt Design Arena schwerer. Bei kompletten Web Aufgaben zählt die Arena.
Grundlage
Menschen vergleichen zwei gerenderte Ausgaben derselben Aufgabe: Websites, UI Komponenten, Datendarstellungen und 3D, jeweils als Einzeldatei.
Das bislang einzige Benchmark, das fertig gerendertes Design bewertet. Hier zeigt sich, ob ein Ergebnis poliert wirkt oder nach KI Schablone aussieht.
Elo Rang aus blinden Vergleichen realer Webentwicklungsaufträge von echten Menschen.
Größte Stimmenzahl unter den Web Benchmarks, und es krönt einen anderen Sieger als Design Arena. Genau dieser Widerspruch ist der Grund, beide zu lesen.
Schreiben
Welches Modell schreibt Prosa mit Stimme und Tempo statt Floskeln, Aufzählungen und Absatzschablonen?
Führend
- 1Claude Fable 51.505
- 2Claude Opus 4.6 High1.500
- 3Gemini 3.7 Flash High1.494
Skala 1.350 bis 1.600
Die Spitze liegt nur elf Elo Punkte auseinander, enger als in jeder anderen Dimension. Der Rang ist hier eine Tendenz, kein Urteil. LiveBench ergänzt die Geschmacksstimmen um frische, kontrollierte Aufgaben.
Grundlage
Die Schreibspalte des Text Leaderboards: blinde Vergleiche über kreative und sachliche Texte von echten Nutzern.
Sprachqualität dort, wo Menschen abstimmen, und damit schwer zu täuschen.
Laufend frische Aufgaben, damit Antwortmuster nicht ins Training wandern. Enthält einen Sprach- und Schreibblock.
Gegenstück zur Arena: kontrollierte Kriterien statt Geschmack, dazu immun gegen Altlasten aus dem Trainingsdatenbestand.
Sprachen
Welches Modell schreibt Deutsch und Koreanisch wie ein Muttersprachler, nicht wie eine Übersetzung aus dem Englischen?
Führend
- 1Gemini 3 Pro1.521
- 2Muse Spark 1.21.510
- 3Claude Opus 4.6 High1.509
Skala 1.400 bis 1.600
Beide Boards messen Schreiben in der Sprache selbst, nicht Übersetzen. Sie krönen verschiedene Sieger: im Deutschen führt Gemini 3 Pro, im Koreanischen Claude Fable 5 mit 1501 vor Claude Opus 5. Diese Seite erscheint in beiden Sprachen, also zählen beide Boards.
Grundlage
Die deutsche Spalte des Text Leaderboards: blinde Vergleiche von Aufgaben, die Nutzer auf Deutsch gestellt haben.
Deutsch ist die Erstsprache dieser Seite. Das Board zeigt als einziges, wen deutsche Nutzer im Blindvergleich vorziehen.
Die koreanische Spalte desselben Leaderboards, mit deutlich weniger Stimmen als die englischen Spalten.
Koreanisch ist die dritte Sprache dieser Seite und die härtere Probe: weniger Trainingsdaten, weniger Stimmen, größere Fehlerbalken.
Bilder
Welches Modell erzeugt Bilder, die auftragsgenau arbeiten und über Stocksammlungen hinausgehen?
Führend
- 1GPT Image 21.382
- 2Mai Image 2.6 Preview1.331
- 3Grok Imagine 2.01.316
Skala 1.200 bis 1.450
Ästhetik lässt sich nicht im Unit Test prüfen, deshalb entscheiden hier viele Menschen. Für Kampagnen und Logos haben Design Arena und LMArena eigene SVG und Logokategorien.
Grundlage
Blinde Paarvergleiche: zwei Bilder, gleicher Prompt, eine Stimme entscheidet.
Die einzige Großstichprobe, die Bildqualität an echten Nutzungswünschen misst, unabhängig vom Marketing der Labore.
Sehen
Welches Modell liest Screenshots, Diagramme und lange Dokumente zuverlässig genug für den Alltag im Browser?
Führend
- 1Claude Fable 51.313
- 2Claude Opus 4.7 High1.301
- 3Qwen 3.8 Max1.300
Skala 1.200 bis 1.400
Vision ersetzt keine eigenen Augen beim pixelgenauen Design Review. Es sortiert aber verlässlich vor, welche Screenshots es wert sind, selbst hinzusehen.
Grundlage
Blinde Vergleiche mit Bildaufgaben: Charts, Screens, Dokumente.
Der Alltagstest für alles, was im Browser oder in Tools als Screenshot vorbeikommt.
Dokumentverständnis über lange, unordentliche Dateien, wie sie echte Büroarbeit hinterlässt.
Ergänzt Screenshots um die andere Hälfte des Alltags: PDFs, Formulare und Verträge.
Eigenheiten
Aus der täglichen Arbeit notiert, nicht gemessen. Hier steht nur, was sich oft genug wiederholt hat, um ein Muster zu sein, mit dem Pfeil zur Dimension, die es einschränkt.
Claude Opus 5
Anthropic
Will klug klingen und wird dabei schwer verständlich: erfindet Begriffe, presst Ideen in Abstraktionen und hängt an Wörtern wie load bearing und gates. Die Community nennt es Claudisms.
GPT-5.6 Sol
OpenAI
Schreibt zu viel Code und deckt jede Zeile mit Tests ab, bis der eigentliche Diff im Testrauschen untergeht. Schon die Tester zum Start nannten es Overengineering.
Gemini 3 Pro
Begründet wunderbar und stolpert bei der Ausführung: der Plan liest sich besser als der Patch, der daraus entsteht.
Kimi K3
Moonshot AI
Stark, sobald ein Dokument im Kontext liegt, flach ohne. Chinesisch ist erstklassig, Englisch nur solide.
So ist die Auswahl entstanden
Ins Set kam, was bei meiner eigenen Arbeit wirklich mitentscheidet. Der Intelligence Index dient als Kompass für Breite, die Arenen als Geschmackstest, SWE-bench und LiveBench als Kontrolle gegen Geschmack und alte Aufgabenbestände.
Elo Tabellen werten menschliche Vorlieben: ein Spitzenrang heißt nicht unbedingt richtig, sondern häufig vorgezogen. Modelle erscheinen in ihrer besten dokumentierten Effort Stufe. Kompositindizes bündeln mehrere Tests und verlinken diese einzeln.
Quellen
Die Zahlen stammen von diesen Leaderboards, abgerufen am Stichtag und von Hand gepflegt.
