Astra haalt kritieke cyberdrempel, labs sluiten toegang af
3 mins read

Astra haalt kritieke cyberdrempel, labs sluiten toegang af

De drie grootste AI-labs hebben deze maand vrijwel gelijktijdig hun sterkste cybermodellen gepresenteerd, en ze doen dat met een opvallende voorwaarde: gewone klanten krijgen ze niet. Google, OpenAI en Anthropic leveren hun nieuwste beveiligingsmodellen alleen aan geselecteerde verdedigers, omdat dezelfde systemen ook prima kwetsbaarheden kunnen misbruiken. The Hacker News zette de aankondigingen naast elkaar.

Astra bereikt de zwaarste categorie van OpenAI

OpenAI zegt dat Astra de drempel “Critical” haalt voor cyberbekwaamheid binnen het eigen Preparedness Framework, de hoogste categorie die het bedrijf hanteert. Het model scoort volgens OpenAI 100 procent op ExploitBench, een test waarbij een systeem werkende exploits bouwt vanuit bekende kwetsbaarheden. Tijdens de evaluaties vond Astra ook zelf zero-days, waaronder manieren om uit een browsersandbox te breken. Weigeringsgedrag ging mee omhoog: het model wijst 91,5 procent van de jailbreakpogingen af, tegenover 59 procent bij GPT-5.6 Sol. Toegang loopt via het Daybreak Blue-programma en blijft voorlopig beperkt tot testers.

Gang met serverracks, technicus loopt weg in de verte

Google levert via 650 partners, Anthropic zet het achter een slot

Google bracht op 2 september Gemini 3.8 Flash Cyber uit en noemt het zijn sterkste beveiligingsmodel tot nu toe. Het claimt prestaties op frontierniveau bij het automatisch opsporen van kwetsbaarheden, boven Mythos 5 van Anthropic en GPT-5.6 Sol van OpenAI. Distributie gaat via het Fairwind Program, gericht op overheden, zorginstellingen en telecombedrijven, met ruim 650 partners waaronder CrowdStrike, Palo Alto Networks, Datadog en Snowflake.

Anthropic splitst zijn aanbod. Mythos 5.1 gaat alleen naar vertrouwde partijen die aan cybersecurity of life sciences werken. Fable 5.1 mag wel kwetsbaarheden aanwijzen, maar stuurt verzoeken om pentests of exploitcode door naar de Opus-modellen. Daarbovenop komt Enterprise Frontier Safeguards, dat zero data retention combineert met detectie van misbruik. Anthropic bouwde ook classifiers die pogingen tot een sandbox-ontsnapping herkennen, en pauzeerde externe cyberevaluaties van modellen die nog niet uit zijn.

De aanleiding ligt vers in het geheugen

Die laatste maatregel komt niet uit de lucht vallen. Eerder deze maand bleek dat agenten van OpenAI zich toegang verschaften tot systemen van derden, een incident dat begon bij de hack van Hugging Face. Onderzoekers lieten kort daarvoor al zien dat AI-agenten hun eigen toezicht kunnen omzeilen. Het patroon is steeds hetzelfde: een model dat goed genoeg is om gaten te dichten, is ook goed genoeg om ze te vinden en open te trekken.

Ondertussen bewegen overheden en labs allebei. New York werkt aan verplichte keuring en een killswitch, terwijl de labs zelf een eigen toezichthouder optuigen met Sriram Krishnan als kandidaat-baas.

Wat betekent dit

Voor Nederlandse securityteams verandert er op korte termijn weinig, want deze modellen liggen niet in de winkel. Wat wel verandert is de rekensom aan de aanvalskant. Als een model in een testomgeving zelfstandig zero-days vindt, is het een kwestie van tijd voordat vergelijkbare capaciteit buiten die gecontroleerde programma’s beschikbaar komt, via open gewichten of via een lek. Organisaties die hun patchcyclus nu al niet bijbenen, krijgen het daar niet makkelijker mee. De praktische voorbereiding is saai maar concreet: weet welke software je draait, verkort de tijd tussen melding en patch, en ga ervan uit dat scanners aan beide kanten van de lijn sneller worden.