Gemini 3.8 Flash – uitleg & geschiedenis

5 mins read

Gemini 3.8 Flash is de Flash-variant die Google op 2 september 2026 uitbracht binnen de Gemini-modellijn, met model-id gemini-3.8-flash. Flash blijft binnen Gemini het snelle en goedkope werkpaard voor taken die in volume draaien, waar doorlooptijd en kosten per aanroep zwaarder wegen dan het laatste procentje kwaliteit.

Op ai-feiten.nl gebruiken we deze pagina als cornerstone: een uitleg die je helpt Gemini 3.8 Flash te plaatsen in de Gemini-tijdlijn en te begrijpen wanneer zo’n modelversie in de praktijk relevant is.

Wat Gemini 3.8 Flash is

Het model verscheen ongeveer drie weken na Gemini 3.7 Flash. Artificial Analysis telde het als het vierde Flash-model in minder dan vier maanden, wat het tempo van deze lijn illustreert: kortere cycli en kleinere stappen in plaats van een enkele grote sprong per jaar.

De inhoudelijke verschuiving zit in het gedrag, niet in de omvang. Gemini 3.8 Flash ruilt tokens in voor nauwkeurigheid: het zet meer redeneerstappen, doet meer gereedschapsaanroepen en verbruikt daardoor meer per taak dan zijn voorganger. Het contextvenster van 1 miljoen tokens en de uitvoerlimiet van 65.000 tokens blijven gelijk aan die van 3.7 Flash. Wel verdween het thinking-niveau MINIMAL, dat in 3.7 Flash nog kon worden gekozen om het redeneren zo kort mogelijk te houden.

Prijs en beschikbaarheid

De prijs blijft tot en met 31 december 2026 staan op 0,75 dollar per miljoen invoertokens en 3,75 dollar per miljoen uitvoertokens. Vanaf 1 januari 2027 verdubbelen die bedragen naar 1,50 en 7,50 dollar. Dat is hetzelfde tarief als bij Gemini 3.7 Flash, dus de rekensom verschuift vooral door het hogere tokenverbruik per taak.

Het model is beschikbaar via de Gemini API, Google AI Studio, Android Studio, de agentomgeving Antigravity en Gemini Enterprise.

Wat de benchmarks laten zien

De duidelijkste sprong staat op Terminal-Bench 2.1, waar de score van 81,6 procent voor 3.7 Flash naar 90,8 procent gaat. Op DeepSWE v1.1, dat werk over langere horizon meet, komt het model volgens Google boven een aantal beduidend grotere frontiermodellen uit.

Google noemt daarnaast resultaten op taken die dichter bij zakelijk werk liggen: Vals Finance Agent V2 voor financiële analyse en de Legal Agent Benchmark van Harvey voor juridisch werk. Op beide zet 3.8 Flash betere cijfers neer dan 3.7 Flash.

Die cijfers komen grotendeels van de fabrikant en meten afgebakende taken. Ze zeggen iets over de richting van de verbetering, niet over hoe het model presteert op jouw eigen data.

De cybervariant en het Fairwind Program

Bij de release kwam ook Gemini 3.8 Flash Cyber, een variant met dezelfde kern maar een ander toegangsregime. Google geeft die niet vrij in de API. Toegang loopt per geval via het nieuwe Fairwind Program en is bedoeld voor overheidsinstanties, beheerders van kritieke infrastructuur en onderhouders van software.

De reden voor die scheiding is de capaciteit zelf. Volgens Google haalt de cybervariant een ontdekkingspercentage van meer dan 70 procent op echte kwetsbaarheden en zit hij op de Pareto-grens van CWE-Bench voor het schrijven van patches, met 47,2 procent pass@1. Bij beveiligingswerk aan Chrome leverde het model 2,6 keer zoveel correcte patches op als veel grotere commerciële modellen. Beveiligingsbedrijf Wiz mat bij pentests een recall die 7,5 tot 9,7 procentpunt hoger lag, tegen lagere kosten.

Een model dat kwetsbaarheden vindt om ze te dichten, vindt ze ook om ze te misbruiken. Dat is de reden dat Google deze variant achter een aanmeldprocedure houdt, en het past in een bredere beweging bij de grote aanbieders om cybercapaciteiten apart te behandelen van de gewone modelrelease.

Plaats in de Gemini-tijdlijn

Gemini 3.8 Flash begrijp je het best in verhouding tot de eerdere Flash-versies en de Pro-modellen uit dezelfde periode. Flash is de keuze wanneer je veel aanroepen doet en de kosten per taak wilt drukken. Pro blijft de keuze voor werk waarbij één antwoord veel gewicht heeft.

Met deze versie schuift de Flash-lijn wel op. Waar Flash eerder vooral “goedkoop en snel” betekende, gaat 3.8 Flash bewust langer nadenken om hogere scores te halen. Voor agentische toepassingen is dat een reële afweging: een agent die per opdracht tientallen keren een model aanroept, merkt extra redeneerstappen direct in de factuur.

Waar je op moet letten

  • De prijs is tijdelijk. Wie nu begroot op 0,75 dollar per miljoen invoertokens, rekent vanaf januari 2027 met het dubbele.
  • Het tokenverbruik per taak ligt hoger dan bij 3.7 Flash. Gelijke tarieven betekenen hier dus geen gelijke kosten.
  • Het thinking-niveau MINIMAL bestaat niet meer. Wie daarop bouwde, moet de configuratie aanpassen.
  • De cybervariant is geen product dat je kunt aanschaffen. Zonder Fairwind-toegang krijg je de standaardversie.

Hoe je een Flash-model verantwoord inzet

Neem een taak die je nu met een duurder model doet, draai dezelfde honderd voorbeelden door 3.8 Flash en vergelijk de uitkomsten handmatig. Let daarbij op hoe vaak je moest herstellen of opnieuw moest vragen, want dat aantal herhalingen bepaalt de werkelijke kosten vaker dan de prijs per token.

Voor productie geldt hetzelfde als bij elke modelwissel: houd de oude route beschikbaar, log de verschillen en verplaats verkeer in stappen. Meet bij deze versie ook het tokenverbruik, omdat het langere redeneren de kosten per taak kan optillen zonder dat het tarief verandert.