Google hat am Donnerstag Gemini 3.7 Flash veröffentlicht, ein kostengünstiges Modell für Codierung und Agenten, das jetzt allgemein verfügbar ist.
OpenAI hat GPT-5.6 Sol Ultrafast vorgestellt, eine auf Cerebras basierende Stufe, die ihr leistungsfähigstes Modell bis zu 14-mal schneller ausführt.
Das Geschwindigkeitsrennen hat sich von roher Intelligenz zu Echtzeit-Agenten verlagert, aber nur Googles Modell erreicht heute jeden Entwickler.
Google und OpenAI haben heute dieselbe Botschaft vermittelt: KI ist jetzt schnell genug, um für diejenigen, die KI-Agenten nutzen, beeindruckend zu wirken. Beide Unternehmen kündigten ultraschnelle Modelle an.
Die beiden Veröffentlichungen sind unterschiedlich aufgebaut, und nur eine ist heute tatsächlich in Ihren Händen.
Google hat Gemini 3.7 Flash veröffentlicht, sein neuestes Modell, das für Softwarecodierung und autonome Geschäftsworkflows optimiert ist. OpenAI hat eine begrenzte Vorschau von GPT-5.6 Sol Ultrafast eröffnet, eine neue Dienststufe, die sein leistungsfähigstes Modell mit bis zu 750 Ausgabetoken pro Sekunde ausführt.
Heute führen wir Gemini 3.7 Flash ein, unser bisher intelligentes Arbeitstier-Modell für Codierung und Agenten.
Dieses Modell bringt erhebliche Verbesserungen in den Bereichen Softwareentwicklung, Webentwicklung und komplexe Wissensarbeit.
Gemini 3.7 Flash ist ein allgemein verfügbares Modell. Es verarbeitet bis zu eine Million Eingabetoken (ungefähr 750.000 Wörter) und gibt 64.000 zurück, verarbeitet Text, Bilder, Videos, Audio und PDFs, und es kann Tools aufrufen und einen Computer steuern. Google bewirbt es als das kostengünstige Gehirn für autonome Systeme, die Aufgaben planen und mehrstufige Arbeiten mit weniger menschlicher Hilfe erledigen.
Das Modell opfert keine Qualität für Geschwindigkeit. Es ist sowohl leistungsfähiger als auch effizienter und schafft unsere Testcodierungsaufgabe in 2 Minuten und 13 Sekunden, während das neueste Flash-Modell mehr als 5 Minuten benötigte. Auch der Qualitätsunterschied zwischen den beiden ist spürbar.
Vorschau auf den Ultrafast-Modus: GPT-5.6 Sol mit bis zu 14-facher Geschwindigkeit.
Zuerst in der OpenAI-API für eine ausgewählte Gruppe von Kunden verfügbar, mit erweitertem Zugang für weitere Unternehmen, sobald die Kapazität wächst. pic.twitter.com/a5dleofiDJ
Die Wafer-Scale-Chips von Cerebras erzeugen bis zu 750 Token pro Sekunde, etwa 560 Wörter, schnell genug, dass ein Sprachagent mitten im Gespräch denken kann.
Die Zahlen, die zählen
Googles eigenes Benchmark-Blatt setzt Gemini 3.7 Flash vor Claude Sonnet 5, GPT-5.6 Terra und anderen in 11 von 18 getesteten Kategorien, einschließlich einer Top-Code-Arena-Webdev-Punktzahl von 1.588 Elo und 30,4% bei AutomationBench für Unternehmensworkflows. Das basiert alles auf Googles Methodik, also betrachten Sie die Führung als Behauptung des Unternehmens.
Wie jeder Gemini Flash ist auch das Modell günstig. Bei 75 Cent pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token bis zum Jahresende ist es die Hälfte des ursprünglichen Tarifs von Gemini 3.6 Flash. Dieser Einführungspreis läuft am 31. Dezember ab und verdoppelt sich dann auf 1,50 $ und 7,50 $, was für ein Google-Modell immer noch günstig ist.
OpenAI hat keine direkten Vergleichswerte für Ultrafast veröffentlicht, abgesehen von Kundenreferenzen. Jane Street AI-Ingenieur John Crepezzi sagte in OpenAIs Ankündigung, dass Cerebras' Geschwindigkeit "verschiedene Arten der Nutzung der Modelle ermöglicht." Podium-Produktleiter Courtland Lykins nannte es "unschätzbar in unserem Voice-Stack" und sagte, die Geschwindigkeit "verändert das Anruferlebnis völlig." Die Stufe ist derzeit nur auf Einladung zugänglich.
Der Geschwindigkeitsschub kommt, während die Labore von "Wer ist am klügsten?" zu "Wer ist schnell genug für Agenten?" übergehen. Googles Timing ist pointiert. Sein Flaggschiff Gemini 3.5 Pro fehlt immer noch, ohne Angabe eines Veröffentlichungsdatums, drei Wochen nach 3.6 Flash und Tage nach einer DeepMind-Führungsumstrukturierung, die Demis Hassabis für seinen Stellvertreter Koray Kavukcuoglu beiseite schob. OpenAI hingegen mietet die Geschwindigkeit von Cerebras, anstatt auf den eigenen Stack zu warten.
Gemini 3.7 Flash ist jetzt in mehr als 160 Ländern live; GPT-5.6 Sol Ultrafast ist weiterhin nur auf Einladung zugänglich.