Die erste Ausgabe dieser Reihe. Einmal im Monat sammle ich hier, was sich in AI wirklich bewegt hat: Modell-Releases, Agent-Tooling, Forschung und was Builder sonst betrifft. Jeder Link führt zur Primärquelle. Der Januar gehörte der Standardisierung des Agent-Stacks: interaktive UIs für MCP, eine offene Responses-Spezifikation, und offene Gewichte, die weiter zur Frontier aufschließen.
Ein 1T-MoE mit 32B aktiv, Vision, 256k Kontext und modifizierter MIT-Lizenz,
dazu native Zerlegung von Aufgaben in parallele Sub-Agents (Agent Swarm). Eine
der stärksten offenen Optionen für agentische Workloads, selbst gehostet oder
günstig geroutet.
Die Codex-Variante von GPT-5.2 ist direkt über die Responses API abrufbar,
also in eigene Harnesses einbaubar statt nur im Codex-Produkt. Abgestimmt auf
Agentic Coding, mit Context Compaction für lange Aufgaben.
Der technische Report zu Mistrals kleiner Modellreihe. Relevant für alle, die
lokale oder Edge-Modelle fahren und dokumentierte Trainings- und Eval-Details
wollen statt eines bloßen Weights-Drops.
MCP-Tools können interaktive HTML-Oberflächen zurückgeben, gerendert in
sandboxed iframes mit JSON-RPC über postMessage und einem offiziellen SDK.
Claude, Goose, VS Code Insiders und ChatGPT lieferten Client-Support in
derselben Woche, eine UI läuft also über Hosts hinweg.
Großes Release für Skill- und Agent-Autoren: Hot-Reload für Skills, context:
fork für Skills im abgezweigten Sub-Agent, Hooks im Frontmatter und
Wildcard-Permissions wie Bash(npm *). Danach folgten im Januar zügige
2.1.x-Releases.
Eine Open-Source-Spezifikation für interoperable LLM-Schnittstellen auf Basis
der Responses-API-Form. Wichtig für alle, die Provider-Abstraktionen pflegen:
ein Kandidat als Nachfolger von "alle klonen das Chat-Completions-Schema".
Das Paper argumentiert, dass Embedding-Skalierung bei gleichem Budget mehr
bringt als zusätzliche MoE-Experten, und stellt damit das Standardrezept in
Frage. Nützlicher Kontext, um aktuelle MoE-Release-Notes zwischen den Zeilen
zu lesen.
Vollständiger Report zur schnellen MiMo-V2-Variante, Teil einer Januarwelle
ungewöhnlich transparenter Reports chinesischer Labs. Lesenswert für alle, die
auf Geschwindigkeit-Qualität-Abwägungen bei offenen Modellen achten.
Der Blackwell-Nachfolger ist in Produktion, mit rund fünffacher
Inferenzleistung und Tokens zu einem Bruchteil der heutigen Kosten, Systeme ab
der zweiten Jahreshälfte. Diese Kurve bestimmt, welche Agent-Workloads
nächstes Jahr bezahlbar sind.
Ein langer Essay mit fünf Risikokategorien für mächtige AI und einem konkreten
Plan dagegen, gestützt auf Anthropics eigene Red-Team-Ergebnisse. Setzt den
Rahmen für die Sicherheitsdebatten, die Builder als Policy erreichen werden.