Cloudflare Clef: open model dat kiest in plaats van schrijft
2 mins read

Cloudflare Clef: open model dat kiest in plaats van schrijft

Cloudflare heeft op 1 oktober twee eigen AI-modellen uitgebracht die geen tekst schrijven. Clef (27 miljard parameters) en Clef-flash (9 miljard) geven op een vraag een kansscore terug, bijvoorbeeld “ja: 0,93”. Beide zijn open-weight onder de Apache 2.0-licentie, meldt DataNorth.

Wat een decision model doet

Een gewoon taalmodel genereert woord voor woord een antwoord. Een decision model krijgt een situatie (tekst, JSON of maximaal vier beelden) en een vraag met vaste antwoordopties. Het scoort die opties in één rekenstap. Volgens Marktechpost bouwde Cloudflare Clef op een Qwen-model en voegde het een klein onderdeel toe dat alle opties tegelijk beoordeelt.

Dat past bij werk waar je geen verhaal nodig hebt: welke tool moet een agent aanroepen, hoort dit supportticket bij facturatie, is deze actie veilig? Cloudflare noemt een mediane vertraging van 38,8 milliseconden voor Clef-flash en 209,3 milliseconden voor Clef. Beide hebben een context van 64.000 tokens.

Spoorwisselaar bij zonsopgang waar sporen uiteenlopen

Drie aanbieders in acht dagen

Cloudflare staat niet alleen. Volgens Startup Fortune kondigde OpenAI op 30 september een Decisions API aan, die draait op het gesloten model Luna en alleen via OpenAI zelf werkt. Amazon bracht op 1 oktober Strands Decider 2B uit, ook open-weight. Cloudflare is volgens dezelfde bron de enige van de drie die modellen in twee formaten vrijgeeft.

De cijfers komen vooral van Cloudflare zelf. In een test met bankklachten haalde Clef een macro-F1 van 94,2, tegen 79,74 voor het vergelijkingsmodel Jev. Op kennisbenchmarks als GPQA Diamond en MMLU-Pro scoort Jev juist beter, schrijft DataNorth. Clef is dus bedoeld om te sorteren, niet om te redeneren. Cloudflare publiceerde bovendien geen officiële prijs; volgens Digital Applied kost Clef op Workers AI 0,24 dollar per miljoen invoertokens en Clef-flash 0,09 dollar.

Waarom agents dit nodig hebben

Agents nemen tientallen kleine beslissingen per taak. Als elke beslissing een volledig taalmodel kost, loopt de rekening snel op. Startup Fortune noemt een voorbeeld waarbij het bewaken van een agent terugging van 372 naar 2,94 dollar. Dat is een claim uit één benchmark, geen vaste regel. Wie recent de ophef rond het FTC-onderzoek naar agents of OpenAI Dots volgde, ziet waarom goedkoop toezicht op agents interessant is.

Ook de rekenkracht speelt mee. Anthropic huurt tot 84,5 miljard dollar aan capaciteit; kleine modellen die de simpele keuzes overnemen, houden die capaciteit vrij voor het echte denkwerk.

Wat betekent dit

Voor bedrijven die agents bouwen is dit een extra gereedschap: een sorteermodel dat je zelf kunt hosten, zonder abonnement bij een van de grote labs. Houd wel in de gaten dat de snelheidscijfers gelden voor Cloudflares eigen netwerk. Zelf hosten kan trager uitpakken. Test het op je eigen data voordat je een bestaande koppeling vervangt.