Mistral OCR 4 houdt documenten binnen eigen muren
Mistral heeft met OCR 4 een nieuw documentmodel uitgebracht dat draait op de eigen servers van bedrijven, zonder dat gevoelige papieren de deur uit hoeven. Het Franse bedrijf presenteerde het model op 23 juni en positioneert het nadrukkelijk als antwoord op organisaties die hun data om juridische of concurrentieredenen niet naar een cloud-API willen sturen. VentureBeat noemt het een verschuiving van losse tekstherkenning naar een compleet enterprise-aanbod.
Wat OCR 4 doet
Het model zet documenten om in gestructureerde data en levert meer dan platte tekst. Bij elke pagina geeft OCR 4 begrenzingsvakken terug, een classificatie per blok (titels, tabellen, formules, handtekeningen) en een betrouwbaarheidsscore per onderdeel. Die output is direct bruikbaar voor zoeksystemen en RAG-pijplijnen, waarbij een taalmodel antwoorden onderbouwt met verwijzingen naar de bron. MarkTechPost wijst erop dat juist die citeerbare structuur het verschil maakt voor agentische toepassingen en bedrijfszoekmachines.
De taaldekking is breed: 170 talen verdeeld over tien taalgroepen. Volgens Mistral houdt het model zijn nauwkeurigheid vast bij gespecialiseerde en zeldzamere talen, waar veel concurrerende systemen juist inzakken.
Benchmarks en prijs
Op publieke tests scoort OCR 4 85,20 op OlmOCRBench en 93,07 op OmniDocBench. In een blinde vergelijking met ruim 600 documenten in meer dan twaalf talen kozen onafhankelijke beoordelaars gemiddeld in 72 procent van de gevallen voor OCR 4 boven de geteste alternatieven.
De toegang gaat via de API voor 4 dollar per 1.000 pagina’s, met de batchkorting van 50 procent zakt dat naar 2 dollar. Dat is twee keer zo duur als OCR 3, dat op 2 dollar startte. Mistral verdedigt het tarief met de extra mogelijkheden. Voor wie liever niets naar buiten stuurt, draait OCR 4 in een enkele container op eigen hardware. Omdat Mistral in Frankrijk is gevestigd en onder EU-recht valt, blijven documenten in dat scenario volledig binnen de eigen omgeving. Dat sluit aan bij de bredere roep om Europese AI-soevereiniteit en bij het Europese open-source AI-model dat momenteel wordt gebouwd.
Waarom on-premise nu telt
De timing is geen toeval. Per 2 augustus gaan nieuwe verplichtingen uit de EU AI Act in, en veel bedrijven kijken kritisch naar waar hun data belandt. Een model dat contracten, facturen en medische dossiers verwerkt zonder ze naar een externe partij te sturen, past in die voorzichtigheid. Tegelijk woedt er een prijzenoorlog aan de modelkant, met releases als Claude Sonnet 5 en Gemini 3.5 Flash die op snelheid en kosten concurreren. Mistral kiest voor een andere hoek: controle over de data als verkoopargument.
“Voor Nederlandse organisaties is de plek waar hun documenten worden verwerkt net zo belangrijk als hoe goed het model leest. Wie medewerkers leert wanneer lokale verwerking beter past dan een cloud-API, haalt veel meer uit dit soort tools.”
Leon Tindemans, AI-expert en Copilot- & ChatGPT-trainer, wijst op het belang van AI-geletterdheid binnen bedrijven.
Wat betekent dit
OCR 4 laat zien dat de strijd om zakelijke AI niet alleen over de slimste chatbot gaat, maar ook over documentverwerking en databeheer. Voor bedrijven die tot nu toe terugschrokken van cloud-OCR biedt een containerversie een concreet alternatief, zij het tegen een hoger tarief dan de vorige generatie. De komende maanden zal blijken of de combinatie van brede taaldekking, citeerbare output en on-premise draaien genoeg is om klanten weg te trekken bij gevestigde documentplatforms.
