Alibaba maakt audio-input voor Qwen 98 procent goedkoper
2 mins read

Alibaba maakt audio-input voor Qwen 98 procent goedkoper

Alibaba heeft Qwen3.8-Omni-Flash uitgebracht, een omnimodaal model dat tekst, beeld, audio en video in hetzelfde venster verwerkt. De opvallendste verandering zit niet in de architectuur maar in het prijskaartje: audio-input wordt 98 procent goedkoper, en audiovisuele input ruim 93 procent. Neowin schrijft dat Alibaba daarmee onder de tarieven van Gemini 3.8 Flash duikt.

Wat het model kan

Qwen3.8-Omni-Flash verwerkt een contextvenster van een miljoen tokens. Volgens Alibaba blijft de prestatie op pure teksttaken vergelijkbaar met een tekstmodel van dezelfde omvang, iets wat bij eerdere omnimodale generaties vaak sneuvelde. Het model praat via een OpenAI-compatibel endpoint, zodat bestaande code met een gewijzigde base-URL werkt.

Over 29 evaluaties ligt de gemiddelde score volgens Alibaba meer dan 25 procent hoger dan die van voorganger Qwen3.5-Omni-Plus. Op OmniVideoBench gaat de score van 63,4 naar 67,8, terwijl het tokenverbruik daalt van 145.736 naar 79.117, een reductie van 45,7 procent. Dat laatste cijfer is minstens zo relevant als de score zelf, want bij video betaal je per token en lopen de kosten hard op.

Studiomicrofoon aan een zwenkarm in een opnameruimte met camera op de achtergrond

Agenttaken en de kleine lettertjes

Alibaba claimt verder winst op agentachtige taken: 36,5 punten vooruitgang op WildClawBench-MM, 22,3 punten op AgenticVBench en een score van 69,6 op UniClawBench. Die getallen komen uit Alibaba’s eigen blogpost en zijn niet door onafhankelijke partijen nagerekend, zoals Neowin ook aantekent. Eigen benchmarkcijfers van modelbouwers hebben de neiging vriendelijk uit te pakken, dus wie hierop bouwt doet er goed aan zelf te meten op eigen data. Dat geldt breder, zoals eerder bleek toen frontier-modellen struikelden over echte bedrijfscode.

De prijsstrategie past in een patroon. Alibaba zette eerder deze maand Qwen3.8-Flash-Next in de markt voor 0,16 dollar per miljoen input-tokens en 0,47 dollar per miljoen output-tokens. Chinese labs drukken de tarieven consequent omlaag, iets wat ook zichtbaar was bij het open agentmodel Atria Dawn van Shanghai AI Lab en in de bredere open-sourcebeweging binnen de BRICS.

Wat betekent dit

Voor Nederlandse organisaties die met spraak of video werken, verschuift hiermee de rekensom. Callcenter-transcripties, ondertiteling en videoanalyse waren tot nu toe duur genoeg om projecten af te blazen. Bij een audio-tarief dat met 98 procent omlaag gaat, kantelt die afweging. Google voelt de druk het scherpst, want Gemini 3.8 Live mikt op precies dezelfde spraaktoepassingen.

De kanttekening blijft dataverwerking. Wie audio van klanten naar QwenCloud stuurt, moet nagaan waar die data terechtkomt en of dat past binnen de eigen AVG-afspraken. Goedkoper betekent hier niet automatisch verstandiger. Wel is duidelijk dat de prijsbodem voor multimodale AI opnieuw een stuk lager ligt dan een maand geleden.