Neuer Stand der Technik für Coding und Wissensarbeit, zum unveränderten Preis von $5/$25 pro Million Tokens, mit Effort-Regler und optionalem Fast Mode. Wurde am ersten Tag das Standardmodell auf Claude Max und in Claude Code.
Opus 5 setzt den Standard, OpenAI senkt die Preise, MCP wird zustandslos, und DeepSeek stellt V4-Flash unter MIT.
Der Juli gehörte Opus 5, beweglichen Frontier-Preisen und einem MCP, das seinen Zustand wegwirft. Wie immer führt jeder Link zur Primärquelle.
Neuer Stand der Technik für Coding und Wissensarbeit, zum unveränderten Preis von $5/$25 pro Million Tokens, mit Effort-Regler und optionalem Fast Mode. Wurde am ersten Tag das Standardmodell auf Claude Max und in Claude Code.
OpenAI liefert GPT-5.6 als Sol, Terra und Luna aus. Am 30. Juli fiel Luna dann um 80 Prozent auf $0.20/$1.20 pro Million Tokens und Terra auf $2/$12, was die Rechnung für Agent-Subtasks mit hohem Volumen neu aufmacht.
Ein 284B-MoE mit 1M Token Kontext, als offene Gewichte unter MIT. Damit ist Flash eine ernsthafte Option für selbst gehostete Coding-Agents; das große V4-Pro blieb vorerst in der Preview.
Googles Flash-Reihe rückt auf. Für API-Nutzer wichtig: temperature, top_p und top_k sind auf den neuen Flash-Modellen deprecated.
Zwei Embodied-Reasoning-Endpunkte bringen räumliches Denken, mehrstufige Tool-Orchestrierung und Momentsuche in Videos. Der Vorgänger gemini-robotics-er-1.6-preview wird am 31. August abgeschaltet, abhängige Projekte müssen migrieren.
Das Protokoll wird zustandslos: Initialize-Handshake und Session-IDs entfallen, Version und Client-Identität reisen in _meta mit jedem Request, und Multi Round-Trip Requests ersetzen serverseitige Streams. Jeder MCP-Server-Autor muss migrieren; alle vier Tier-1-SDKs sind aktualisiert.
Interpretability-Arbeit, die einen internen Arbeitsraum identifiziert, in dem Gedanken liegen, die nie im Output auftauchen, samt einer Technik, ihn zu lesen. Nützlicher Hintergrund, wenn das erklärte Reasoning eines Modells vom Verhalten abweicht.
Verlegt das Agent-Gedächtnis in den Prozess und drückt die Latenz auf rund 100 Mikrosekunden, womit Speicherzugriff pro Schritt statt pro Turn praktikabel wird. Eine günstige Architekturidee zum Stehlen.
215 Angriffsszenarien über 24 Enterprise-Integrationen zeigen ohne Leitplanken Erfolgsquoten von 32 bis 81 Prozent; das mitgelieferte AgentRedGuard senkt sie um rund 75 Punkte. Ein konkretes Eval für alle, die Agents an Werkzeuge der Klasse Gmail oder Jira anschließen; im Juli in überarbeiteter Fassung erschienen.
Frontier-Red-Team-Ergebnisse zu modellgetriebener Entdeckung kryptografischer Schwachstellen. Ein Beleg, dass offensive Security-Fähigkeit inzwischen eine normale Modelleigenschaft ist.
Kostenloser Zugang zu Modellen der Sol-Pro-Klasse, startend mit 10.000 und wachsend auf 100.000 Forschende bis 2027. Zeigt, wohin subventionierte Frontier-Rechenleistung fließt.