studio raoulsoftware innovation, architecture & development
← Blog
KI in der Praxis · 15. August 2026

Googles neue Coding-KI ist deutlich besser — und bis Januar günstiger

Googles neues Gemini 3.7 Flash ist bei Programmieraufgaben deutlich besser geworden und bis Ende 2026 zum halben Normalpreis erhältlich — aber es scheitert noch bei den meisten komplexen Mehrschrittaufgaben.

Auf einen Blick
65.3%
Punktzahl beim DeepSWE-Benchmark für Software-Engineering
$0.75 / 1M tokens
Eingabepreis bis 31. Dezember 2026
340 tokens/sec
Ausgabegeschwindigkeit — schnellstes von 186 getesteten Modellen
23 days
Zeit zwischen Gemini 3.6 Flash und 3.7 Flash

Google hat gerade einen der größten Versionssprünge in der KI-Programmierleistung hingelegt. Am 13. August veröffentlichte das Unternehmen Gemini 3.7 Flash — ein Modell, das im Vergleich zu seinem Vorgänger von vor nur 23 Tagen bei jedem Coding-Test deutlich zulegte: Beim DeepSWE-Benchmark, der echte Software-Engineering-Aufgaben simuliert, stieg die Punktzahl von 49 % auf 65,3 %. Ein weiterer Test, AutomationBench, hat sich fast verdoppelt — von 17 % auf 30,4 %.

Der Preis ist das, was diese Nachricht für alle mit einem Team besonders relevant macht. Bis zum 31. Dezember 2026 berechnet Google 0,75 US-Dollar pro Million Tokens — Tokens sind die kleinen Textbausteine, die eine KI liest und schreibt, etwa drei Viertel eines Wortes. Das ist der halbe Normalpreis bis Januar, wenn der Satz auf 1,50 Dollar verdoppelt. Die nächsten fünf Monate sind das beste Zeitfenster, um mit diesem Modell zu bauen und zu messen, wie nützlich es wirklich ist.

Es gibt eine wichtige Einschränkung. Selbst auf diesem verbesserten Niveau scheitert es noch bei den meisten komplexen Mehrschrittaufgaben — also bei Projekten, bei denen eine KI eine ganze Aufgabe von Anfang bis Ende übernehmen soll. AutomationBench hat sich fast verdoppelt, was groß klingt, aber sieben von zehn komplexen Versuchen schlagen noch fehl. Und in Europa ist die Consumer-Version derzeit gar nicht verfügbar.

In der Praxis eignet sich Gemini 3.7 Flash gut für einzelne Coding-Aufgaben: Funktionen schreiben, Pull Requests reviewen, Tests generieren oder unbekannten Code erklären. Der richtige Zeitpunkt zum Testen ist jetzt, solange der Einführungspreis gilt. Messen Sie es an Ihren echten Aufgaben — der Abstand zwischen KI-Tools verändert sich alle paar Wochen, und eigene Tests sagen mehr als jede Bestenliste.

Quellen
← Das KI-Experiment ist vorbei← Wenn ein leistungsfähiges KI-Modell nichts pro Anfrage kostet
Googles neue Coding-KI ist deutlich besser — und bis Januar günstiger