Modellbenchmarks

Vergleich

Die wichtigsten Modelle, von Code über Prosa bis zu generierten Screens. Gebaut aus den Benchmarks, die die jeweiligen Fragen am ehrlichsten beantworten, mit Link zur Quelle für jede Zahl.

Wer führt wofür

Stand 28. August 2026

Allround

Welches Modell ist über alle Disziplinen gesehen vorn, wenn Coden, Agenten, Wissen und Wissenschaft zusammen zählen?

Führend

  1. 1Claude Opus 563
  2. 2Claude Fable 562
  3. 3Grok 4.661

Skala 0 bis 100

Jedes einzelne Benchmark verkennt etwas, deshalb mischt der Index neun harte Tests zu einer Zahl. Wer einen Allrounder sucht, beginnt hier. Für eine einzelne Stärke zählen die anderen Dimensionen.

Grundlage

Neun Einzeltests über vier Säulen: Agenten, Coden, allgemeines Wissen und wissenschaftliches Denken. Jede Säule zählt ein Viertel.

Die einzige Mischrechnung, die agentische Arbeit gleichrangig mit Wissen misst. Der Runner listet zusätzlich Preis pro Aufgabe und Ausgabetempo, was bei der Auswahl oft mehr entscheidet als die Punktzahl.

Agenten und Code

Welches Modell trägt eine echte Aufgabe in Terminal und Repository durch, ohne dass ich überall nachbessern muss?

Führend

  1. 1Claude Opus 512,99 %
  2. 2Claude Fable 511,7 %
  3. 3GPT-5.6 Sol10,24 %

Skala 0 % bis 16 %

Ein hoher Arena Rang erwächst aus beobachteten Läufen, ein hoher SWE-bench Wert aus bestandenen Testsuiten. Zusammen stecken sie Realität gut ab.

Grundlage

Menschen vergleichen blinde Agentenläufe. Gewertet wird der Anteil vollständig gelöster Aufgaben.

Misst lange Läufe mit Werkzeugen statt Antwortblitze, was der Arbeitsweise von Coding Agenten am nächsten kommt.

SWE-bench VerifiedSWE-bench Team

500 echte GitHub Issues aus zwölf Python Repositories. Ein Fix zählt erst, wenn die Testsuite besteht.

Lange der Standard für Bugfix Arbeit an echtem Code, inzwischen fast gesättigt: die Spitzenmodelle liegen bei rund 96 Prozent. Hier dient er als Bodencheck, die Unterschiede zeigt die Arena.

Web und UI

Welches Modell baut Screens, die gepflegt und professionell wirken, viele Varianten aushalten und nicht nach Schablone aussehen?

Führend

  1. 1Kimi K31.372
  2. 2Muse Spark 1.21.335
  3. 3Claude Opus 51.332

Skala 1.200 bis 1.450

Die beiden Boards krönen verschiedene Sieger. Design Arena kürt Kimi K3, das stimmenstärkere LMArena WebDev führt Claude Opus 5 mit 1691 vor Kimi K3 Max. Wo reines Design entscheidet, wiegt Design Arena schwerer. Bei kompletten Web Aufgaben zählt die Arena.

Grundlage

Menschen vergleichen zwei gerenderte Ausgaben derselben Aufgabe: Websites, UI Komponenten, Datendarstellungen und 3D, jeweils als Einzeldatei.

Das bislang einzige Benchmark, das fertig gerendertes Design bewertet. Hier zeigt sich, ob ein Ergebnis poliert wirkt oder nach KI Schablone aussieht.

Elo Rang aus blinden Vergleichen realer Webentwicklungsaufträge von echten Menschen.

Größte Stimmenzahl unter den Web Benchmarks, und es krönt einen anderen Sieger als Design Arena. Genau dieser Widerspruch ist der Grund, beide zu lesen.

Schreiben

Welches Modell schreibt Prosa mit Stimme und Tempo statt Floskeln, Aufzählungen und Absatzschablonen?

Führend

  1. 1Claude Fable 51.505
  2. 2Claude Opus 4.6 High1.500
  3. 3Gemini 3.7 Flash High1.494

Skala 1.350 bis 1.600

Die Spitze liegt nur elf Elo Punkte auseinander, enger als in jeder anderen Dimension. Der Rang ist hier eine Tendenz, kein Urteil. LiveBench ergänzt die Geschmacksstimmen um frische, kontrollierte Aufgaben.

Grundlage

Die Schreibspalte des Text Leaderboards: blinde Vergleiche über kreative und sachliche Texte von echten Nutzern.

Sprachqualität dort, wo Menschen abstimmen, und damit schwer zu täuschen.

Laufend frische Aufgaben, damit Antwortmuster nicht ins Training wandern. Enthält einen Sprach- und Schreibblock.

Gegenstück zur Arena: kontrollierte Kriterien statt Geschmack, dazu immun gegen Altlasten aus dem Trainingsdatenbestand.

Sprachen

Welches Modell schreibt Deutsch und Koreanisch wie ein Muttersprachler, nicht wie eine Übersetzung aus dem Englischen?

Führend

  1. 1Gemini 3 Pro1.521
  2. 2Muse Spark 1.21.510
  3. 3Claude Opus 4.6 High1.509

Skala 1.400 bis 1.600

Beide Boards messen Schreiben in der Sprache selbst, nicht Übersetzen. Sie krönen verschiedene Sieger: im Deutschen führt Gemini 3 Pro, im Koreanischen Claude Fable 5 mit 1501 vor Claude Opus 5. Diese Seite erscheint in beiden Sprachen, also zählen beide Boards.

Grundlage

Die deutsche Spalte des Text Leaderboards: blinde Vergleiche von Aufgaben, die Nutzer auf Deutsch gestellt haben.

Deutsch ist die Erstsprache dieser Seite. Das Board zeigt als einziges, wen deutsche Nutzer im Blindvergleich vorziehen.

Die koreanische Spalte desselben Leaderboards, mit deutlich weniger Stimmen als die englischen Spalten.

Koreanisch ist die dritte Sprache dieser Seite und die härtere Probe: weniger Trainingsdaten, weniger Stimmen, größere Fehlerbalken.

Bilder

Welches Modell erzeugt Bilder, die auftragsgenau arbeiten und über Stocksammlungen hinausgehen?

Führend

  1. 1GPT Image 21.382
  2. 2Mai Image 2.6 Preview1.331
  3. 3Grok Imagine 2.01.316

Skala 1.200 bis 1.450

Ästhetik lässt sich nicht im Unit Test prüfen, deshalb entscheiden hier viele Menschen. Für Kampagnen und Logos haben Design Arena und LMArena eigene SVG und Logokategorien.

Grundlage

Blinde Paarvergleiche: zwei Bilder, gleicher Prompt, eine Stimme entscheidet.

Die einzige Großstichprobe, die Bildqualität an echten Nutzungswünschen misst, unabhängig vom Marketing der Labore.

Sehen

Welches Modell liest Screenshots, Diagramme und lange Dokumente zuverlässig genug für den Alltag im Browser?

Führend

  1. 1Claude Fable 51.313
  2. 2Claude Opus 4.7 High1.301
  3. 3Qwen 3.8 Max1.300

Skala 1.200 bis 1.400

Vision ersetzt keine eigenen Augen beim pixelgenauen Design Review. Es sortiert aber verlässlich vor, welche Screenshots es wert sind, selbst hinzusehen.

Grundlage

Blinde Vergleiche mit Bildaufgaben: Charts, Screens, Dokumente.

Der Alltagstest für alles, was im Browser oder in Tools als Screenshot vorbeikommt.

Dokumentverständnis über lange, unordentliche Dateien, wie sie echte Büroarbeit hinterlässt.

Ergänzt Screenshots um die andere Hälfte des Alltags: PDFs, Formulare und Verträge.

Eigenheiten

Aus der täglichen Arbeit notiert, nicht gemessen. Hier steht nur, was sich oft genug wiederholt hat, um ein Muster zu sein, mit dem Pfeil zur Dimension, die es einschränkt.

Claude Opus 5

Anthropic

PrivatvokabularSchreiben

Will klug klingen und wird dabei schwer verständlich: erfindet Begriffe, presst Ideen in Abstraktionen und hängt an Wörtern wie load bearing und gates. Die Community nennt es Claudisms.

GPT-5.6 Sol

OpenAI

Schreibt zu viel Code und deckt jede Zeile mit Tests ab, bis der eigentliche Diff im Testrauschen untergeht. Schon die Tester zum Start nannten es Overengineering.

Gemini 3 Pro

Google

Plant, liefert nichtAgenten und Code

Begründet wunderbar und stolpert bei der Ausführung: der Plan liest sich besser als der Patch, der daraus entsteht.

Kimi K3

Moonshot AI

Braucht AnkerWeb und UI

Stark, sobald ein Dokument im Kontext liegt, flach ohne. Chinesisch ist erstklassig, Englisch nur solide.

So ist die Auswahl entstanden

Ins Set kam, was bei meiner eigenen Arbeit wirklich mitentscheidet. Der Intelligence Index dient als Kompass für Breite, die Arenen als Geschmackstest, SWE-bench und LiveBench als Kontrolle gegen Geschmack und alte Aufgabenbestände.

Elo Tabellen werten menschliche Vorlieben: ein Spitzenrang heißt nicht unbedingt richtig, sondern häufig vorgezogen. Modelle erscheinen in ihrer besten dokumentierten Effort Stufe. Kompositindizes bündeln mehrere Tests und verlinken diese einzeln.

Quellen

Die Zahlen stammen von diesen Leaderboards, abgerufen am Stichtag und von Hand gepflegt.