OpenHands 1.0 haalt 68 procent op SWE-bench Verified
De open-source codeagent OpenHands heeft versie 1.0 uitgebracht. Het project claimt ongeveer 68 procent op SWE-bench Verified, de benchmark met 500 echte GitHub-issues, en levert daarmee cijfers die tot voor kort waren voorbehouden aan betaalde agenten. De release valt samen met een bredere golf van agentnieuws deze week, waaronder de multi-agentmodus in GitHub Copilot Workspace.
Wat er onder de motorkap veranderde
De grootste ingreep zit in de architectuur. Waar OpenHands eerder een monoliet was, is de codebase nu opgeknipt in vier Python-pakketten: openhands.sdk, openhands.tools, openhands.workspace en openhands.agent_server. Die opzet, beschreven in het paper over de OpenHands Software Agent SDK, maakt het mogelijk om alleen de onderdelen te draaien die je nodig hebt. De SDK staat onder de MIT-licentie.
Het benchmarkcijfer hangt af van het model dat je eronder hangt. Met Claude Opus 4.6 komt OpenHands uit op 68,4 procent op SWE-bench Verified. Met het open-weight model Devstral 24B zakt dat naar 46,8 procent, ongeveer het niveau dat Devin 2.0 publiceerde. Dat verschil laat zien hoeveel van de prestatie in het onderliggende model zit en hoeveel in de agentlaag eromheen. Cognition, het bedrijf achter Devin, werd onlangs nog gewaardeerd op 47 miljard dollar.

Beveiliging als vast onderdeel van de lus
Een codeagent die zelfstandig commando’s uitvoert op je machine is een risico, en OpenHands 1.0 probeert dat expliciet af te dekken. Een SecurityAnalyzer geeft elke tool-aanroep een risicoscore van laag, gemiddeld of hoog. Het beleid ConfirmRisky vraagt bij een hoge score om menselijke goedkeuring voordat het commando draait. Daarnaast legt een event-sourced opzet elke stap vast, zodat een sessie deterministisch is terug te spelen.
De aanbevolen manier om te draaien is een Docker-sandbox met de parameter SANDBOX_VOLUMES, die bepaalt welke mappen de agent mag zien. Zonder die begrenzing kijkt de agent in principe naar het hele systeem. Installeren kan via de CLI met uv, of via Docker en kant-en-klare binaries.
Kosten en positie in de markt
Zelf hosten kost volgens de analyse op DEV Community ruwweg 0,20 tot 1,05 dollar per opgeloste taak bij H100-tarieven. Dat is aanzienlijk minder dan wat commerciële agenten per taak of per abonnement rekenen, al komt daar je eigen infrastructuurwerk bij. De vergelijking met de SDK’s van OpenAI, Anthropic en Google draait vooral om de combinatie van gesandboxte uitvoering, model-agnostische routering en ingebouwde risicoanalyse in één pakket.
Het patroon is bekend uit andere hoeken van de sector. In de open modellen uit Abu Dhabi en het vrijgegeven rijmodel Qwen-Drive zie je dezelfde beweging: de afstand tussen open en gesloten wordt kleiner op het moment dat de infrastructuur eromheen volwassen wordt. Ook de discussie over rekencapaciteit voor agenten, zichtbaar in de afspraken tussen Anthropic en Cursor, gaat over wie de agentlaag bezit.
Wat betekent dit
Voor teams die codeagenten willen inzetten maar hun broncode niet naar een externe dienst willen sturen, is er nu een serieuze optie die je zelf draait. Het scheelt dat de beveiligingsmechanismen niet als losse bijlage zijn toegevoegd maar in de agentlus zitten. Wie de stap overweegt, moet wel rekenen op eigen beheer: GPU-capaciteit, Docker-configuratie en het instellen van de mappen waar de agent bij mag. De keuze van het onderliggende model bepaalt daarbij het grootste deel van het resultaat, zoals eerdere agentreleases van Mistral ook al lieten zien.
