Googlers twijfelen aan codeerwerk van Gemini 4 Argon
3 mins read

Googlers twijfelen aan codeerwerk van Gemini 4 Argon

Google presenteerde Gemini 4 Argon op 30 september als zijn sterkste model tot nu toe. Een dag later meldde Bloomberg dat eigen medewerkers daar vragen bij stellen. Volgens die medewerkers doet Argon het minder goed zodra ze het echt aan het werk zetten, vooral bij programmeertaken en front-end ontwerp.

Wat de medewerkers zeggen

Bloomberg sprak met Googlers die toegang hebben tot het model. Hun kritiek richt zich niet op de scores, maar op het gat tussen die scores en dagelijks werk. Argon zou wisselvallig presteren bij praktische codeerklussen en bij het bouwen van interfaces. Enkele van hen vrezen dat het model op onderdelen achterblijft bij de modellen van Anthropic en OpenAI, terwijl de concurrentie sneller verbetert. Niet iedereen binnen Google deelt dat beeld: volgens een medewerker bestaat er juist brede consensus dat Argon op het hoogste niveau meedoet.

Google zelf houdt vol dat het onjuist is om te zeggen dat het model onderpresteert op coderen. Tulsee Doshi van het Gemini-team wijst op sterke prestaties bij Googlers die Argon inzetten op hun moeilijkste code- en onderzoeksproblemen. DeepMind-baas Koray Kavukcuoglu zei op 24 september nog dat het een zekerheid is dat Google altijd aan de frontier zal zitten, kort nadat hij Gemini 4 in post-training had aangekondigd.

Twee collega-ontwikkelaars overleggen bij een glazen whiteboard

De cijfers geven beide kampen munitie

In de tabel die Google bij de aankondiging van Gemini 4 Argon liet zien, haalt het model 77,9 procent op DeepSWE v1.1 tegen 74,2 procent voor Claude Opus 5.5 en 74,1 procent voor GPT-6 Astra. Op Terminal-Bench 4 draait de volgorde om: daar blijft Argon op 57 procent steken, achter Claude Sonnet 5.5 met 64 procent, Opus 5.5 met 60 procent en Astra met 59 procent. Op de Artificial Analysis Intelligence Index staat Argon op 53 punten, gelijk met Astra en Claude Fable 5.1, en onder Opus 5.5 met 58. In Text Arena staat het model wel eerste met 1.525 punten.

Twee bronnen die bekend zijn met Argon noemen tegenover Bloomberg benchmaxxing als verklaring: engineeringcapaciteit die naar testscores gaat in plaats van naar bruikbaarheid. Edwin Chen van Surge AI vergeleek het met een kind dat een hoge SAT-score haalt, en noemt die losgekoppelde meetlat een hardnekkig probleem. Bij de lancering had nog geen enkele externe partij de tabel van Google gereproduceerd.

Wie Argon mag gebruiken

Breed testen kan voorlopig ook niet. Argon gaat eerst naar deelnemers van het Fairwind-programma, die het model op hun eigen software mogen inzetten om kwetsbaarheden te vinden en te dichten. Daarna volgen betalende API-klanten en abonnees van Google AI Ultra, zonder dat Google een datum noemt. De introductietarieven liggen op 2 dollar per miljoen invoertokens en 10 dollar per miljoen uitvoertokens, exact het niveau waarop OpenAI GPT-6.1 Sol in de API zette.

Wat betekent dit

Voor wie een model kiest om code mee te schrijven, is dit een reden om zelf te meten in plaats van op de tabel te vertrouwen. Zolang niemand buiten Google de cijfers heeft nagerekend en de toegang beperkt blijft tot het Fairwind-programma, blijft het beeld van Argon gebaseerd op de benchmarks van de aanbieder zelf. De interne twijfel laat zien dat die cijfers en het werk op een echte codebase twee verschillende dingen meten.