Ist Gemini 3.7 Flash wirklich das schnellste KI-Modell?
Gemini 3.7 Flash erreicht 340,1 Token pro Sekunde. Doch der Rekord gilt nur unter klar definierten Bedingungen.

Google hat Gemini 3.7 Flash am 13. August veröffentlicht, nur drei Wochen nach Gemini 3.6 Flash. Laut der «Smartphones24» richtet sich das Modell besonders an Programmierung, Wissensarbeit und KI-Agenten.
Eine Messung von Artificial Analysis setzt Gemini 3.7 Flash bei 340,1 Token pro Sekunde an. «Pasquale Pillitteri» zufolge bedeutet dies Platz eins unter 186 getesteten Modellen bei der Ausgabegeschwindigkeit.
Damit scheint die Bezeichnung als schnellstes KI-Modell zunächst eindeutig. Die zugrunde liegende Messung beschreibt jedoch nicht jede Form von Geschwindigkeit.
Entscheidend ist die Messmethode
Die 340,1 Token pro Sekunde beziehen sich auf die Dekodierung nach dem Beginn der Antwort. Laut «Pasquale Pillitteri» misst diese Kennzahl weder die Zeit bis zum ersten Token noch die vollständige Antwortlatenz.
Auch das gewählte Reasoning-Level verändert die Messwerte deutlich. Bei «high» werden rund 340 Token, bei «medium» rund 274 und bei «low» rund 253 Token pro Sekunde erreicht.
Beim mittleren Level beträgt die Zeit bis zum ersten Token laut der Quelle 4,22 Sekunden. Beim niedrigen Level sinkt diese Zeit dagegen auf lediglich 0,74 Sekunden.
Gemini 3.7 Flash: Schneller, günstiger und stärker beim Coding
Google positioniert Gemini 3.7 Flash als Modell für Programmierung und Agenten. Die «Smartphones24» berichtet zudem über Verbesserungen beim Debugging, bei Webentwicklung sowie bei komplexer Wissensarbeit.
Auch die Benchmarkwerte gegenüber Gemini 3.6 Flash fallen deutlich höher aus. FrontierCode 1.1 Main steigt von 34,4 auf 43,6 Prozent, wie das «Swiss IT Magazine» berichtet.
Beim Softwareentwicklungstest DeepSWE v1.1 verbessert sich das Ergebnis von 49 auf 65,3 Prozent. Bei AutomationBench steigt der Wert demnach von 17 auf 30,4 Prozent.
Preisvorteil und ein schnellerer Konkurrent
Hinzu kommt ein deutlich niedrigerer Einführungspreis für Entwickler. Bis Ende 2026 kostet Gemini 3.7 Flash 0,75 Dollar je Million Input-Token und 3,75 Dollar je Million Output-Token.
Ob Gemini 3.7 Flash als schnellstes Modell gilt, hängt vom zugrunde liegenden Vergleich ab. Laut «Pasquale Pillitteri» erreicht OpenAIs GPT-5.6 Sol Ultrafast auf Cerebras-Hardware bis zu 750 Token pro Sekunde.

Dieses Modell sei allerdings nur auf Einladung verfügbar und deshalb nicht Bestandteil der genannten Rangliste. Gemini 3.7 Flash führt damit bei Artificial Analysis unter den dort berücksichtigten öffentlich zugänglichen Modellen.












