Qwen-UI-Agent van Alibaba bedient schermen beter dan GPT-5.6
2 mins read

Qwen-UI-Agent van Alibaba bedient schermen beter dan GPT-5.6

Alibaba heeft een model uitgebracht dat telefoons en pc’s bedient zoals een mens dat doet: het kijkt naar het scherm, klikt, typt en veegt. Qwen-UI-Agent verscheen op 20 augustus en klopt volgens het bijbehorende technisch rapport op meerdere tests GPT-5.6 Sol en Claude Opus 4.8.

Kijken naar pixels in plaats van API’s

De meeste AI-agents praten met software via API’s. Dat werkt zolang er een koppeling bestaat. Voor het overgrote deel van de programma’s op een telefoon of laptop bestaat die koppeling niet, en daar loopt een agent vast.

Qwen-UI-Agent pakt het anders aan. Het model leest de pixels van een scherm en voert daar zijn acties op uit, getraind en getest op fysieke apparaten in plaats van in een simulatie. Het technisch rapport van het Qwen-UI-team op arXiv beschrijft drie varianten: 27B, 35B-A3B en 4B. Alibaba mikt op vier omgevingen: Android-telefoons, desktops, webapplicaties en zoekopdrachten die meerdere stappen kosten. Het bedrijf bracht eerder deze maand ook eigen downloadcijfers voor Qwen naar buiten.

Ontwikkelaar achter twee lege beeldschermen en een tablet op een standaard

De scores op een rij

Op MobileWorld-Real, een test die op echte Android-toestellen draait, haalt het model 92,2 procent. Dat is 6,8 procentpunt boven GPT-5.6 Sol en 7,5 procentpunt boven Claude Opus 4.8. Op de bredere MobileWorld-benchmark staat de teller op 82,1 procent, waarmee het gat met Claude Opus 4.8 oploopt tot 14,6 procentpunt. AndroidDaily komt uit op 97,5 procent.

Buiten de telefoon zijn de cijfers ook stevig. Het rapport noteert 79,5 procent op OSWorld-Verified, 81,5 procent op ScreenSpot-Pro en 70,0 procent op UI-Vision. Op WebArena, waar het model zelfstandig door websites moet navigeren, staat 73,6 procent. Pandaily beschreef de release als een poging om modellen elk scherm te laten bedienen, van telefoon tot browser.

Waar het model nog vastloopt

Een getal valt uit de toon. Op OSWorld-v2, een zwaardere desktoptest, haalt Qwen-UI-Agent 13,9 procent volledig afgeronde taken, tegenover 40,0 procent als je gedeeltelijke voortgang meetelt. Het model zet dus regelmatig de juiste stappen zonder de klus af te maken. Over open weights of een licentie zegt het technisch rapport niets, terwijl Alibaba vorige week Qwen3.8-27B onder Apache 2.0 online zette.

Wat dit betekent

Schermbediening is precies de plek waar agents in de praktijk sneuvelen. Google positioneerde Gemini 3.6 Flash met Computer Use als het goedkope alternatief, en partijen als Binance laten agents zelfstandig transacties uitvoeren binnen afgebakende rechten. Een Chinees model dat op mobiele taken boven de westerse top uitkomt, verlegt de concurrentie naar terrein waar OpenAI en Anthropic tot nu toe voorop liepen.

Wat de benchmarks niet vertellen: hoe zo’n model zich houdt op een rommelig bureaublad vol inlogschermen, pop-ups en trage verbindingen. Dat blijkt pas buiten de testomgeving. Voor bedrijven die nu met agents experimenteren is de nuchtere les dat die 13,9 procent op OSWorld-v2 een eerlijker maatstaf is dan de 97,5 procent op AndroidDaily.