Googles nieuwe coding-AI is een stuk beter — en goedkoper tot januari
Googles nieuwe Gemini 3.7 Flash is dramatisch verbeterd voor programmeertaken en kost tot eind 2026 de helft van de normale prijs — maar faalt nog steeds bij de meeste complexe meerstappentaken.
- 65.3%
- score op de DeepSWE-benchmark voor software-engineering
- $0.75 / 1M tokens
- inputprijs tot 31 december 2026
- 340 tokens/sec
- outputsnelheid — snelste van 186 geteste modellen
- 23 days
- tijd tussen Gemini 3.6 Flash en 3.7 Flash
Google heeft zojuist een van de grootste versiesprungen in AI-codingprestaties gemaakt. Op 13 augustus lanceerde het bedrijf Gemini 3.7 Flash — een model dat vergeleken met zijn voorganger van slechts 23 dagen eerder op elke codingtest een grote sprong maakte: op DeepSWE, een benchmark die echte software-engineeringtaken simuleert, steeg de score van 49% naar 65,3%. Een andere test, AutomationBench, verdubbelde bijna van 17% naar 30,4%.
De prijs is wat dit nieuws nu relevant maakt voor iedereen die software bouwt. Tot 31 december 2026 rekent Google $0,75 per miljoen tokens — tokens zijn de kleine stukjes tekst die een AI leest en schrijft, ongeveer drie kwart van een woord. Dat is de helft van de normale prijs tot januari, wanneer het tarief verdubbelt naar $1,50. De komende vijf maanden zijn het beste moment om met dit model te bouwen en te meten hoe nuttig het echt is.
Er is een belangrijke beperking. Zelfs op dit verbeterde niveau faalt Gemini 3.7 Flash nog steeds bij de meeste complexe meerstappentaken — die waarbij je een AI vraagt een heel project van begin tot eind te beheren. AutomationBench verdubbelde bijna, wat veel klinkt, maar zeven van de tien complexe pogingen mislukken nog steeds. En in Europa is de consumentenversie voorlopig helemaal niet beschikbaar.
In de praktijk is Gemini 3.7 Flash een sterk instrument voor enkelvoudige codingtaken: een functie schrijven, een pull request reviewen, tests genereren of onbekende code uitleggen. Het juiste moment om te testen is nu, zolang de introductieprijs geldt. Test het op je echte taken — het verschil tussen AI-tools verandert elke paar weken, en eigen tests zeggen meer dan welke benchmark dan ook.