Onderzoek: agent-skills werken, tot de bibliotheek groeit
Wie een AI-agent bouwt, geeft hem tegenwoordig skills mee: mapjes met instructies, voorbeelden en scripts die het model bij een taak inleest. Anthropic, OpenAI en tal van agent-frameworks zetten er stevig op in. Onderzoekers van Princeton University en UC San Diego vroegen zich af wat die pakketjes nu precies doen, en publiceerden op 14 augustus de paper “Demystifying Agent Skills: Why They Work-Until They Don’t” op arXiv. Techsite The Decoder pikte het werk deze week op.
Skills injecteren geen kennis, ze houden de agent op koers
Het team draaide gecontroleerde experimenten over meerdere benchmarks, agent-harnassen en taalmodellen. In totaal normaliseerden de auteurs 8.135 trial-records en codeerden ze 240 trajecten met de hand, goed voor 238 bruikbare labels. Daaruit rolde een indeling met drie hoofdcategorieen en twaalf manieren waarop een agent een skill gebruikt.
De belangrijkste uitkomst gaat in tegen het gangbare beeld. In 65,7 procent van de gevallen hielp een skill doordat hij als procedureel anker werkte: het model bleef bij een werkwijze in plaats van halverwege af te dwalen. Expliciete kennisinjectie, dus het model iets vertellen wat het nog niet wist, verklaarde slechts 4,5 procent. Tegenover Workflow Memory leverden skills in vergelijkbare opstellingen 6,06 punten winst op.

Het knelpunt zit in het terugvinden
Vervelender is de tweede bevinding. Groeit de verzameling skills van 5 naar 100, dan zakt de precisie waarmee de agent de juiste eruit pikt en ook echt gebruikt van 29,6 naar 3,3 procent. Een grote bibliotheek maakt een agent dus niet vanzelf capabeler. Het retrieval-probleem is volgens de auteurs een apart vraagstuk, los van de vraag of een skill op zichzelf goed geschreven is.
Opvallend: verwarrende, sterk op elkaar lijkende skills maakten het offline identificeren lastiger, terwijl het uiteindelijke slagingspercentage stabiel bleef. Precies de bedoelde skill aanroepen is volgens de metingen niet noodzakelijk en ook niet voldoende voor een goed resultaat. Dat raakt aan discussies over uitwisselbare formaten, zoals bij Agent Plugins als gedeelde standaard, en aan tools die skills automatisch laten ontstaan, zoals Claude Cowork dat taken leert van een schermopname.
Waar het misgaat
De onderzoekers noemen drie faalpatronen: skills met te brosse aannames over de omgeving, skills die in een andere context worden ingezet dan waarvoor ze bedoeld zijn, en skills die het model onvoldoende aanpast aan de taak van dat moment. In die gevallen zorgt de instructie eerder voor koppig vasthouden aan een verkeerd pad dan voor houvast.
Daarmee sluit het onderzoek aan bij pogingen om skills systematisch bij te schaven, zoals de optimizer SkillOpt, en bij de bredere golf van agents die zelfstandig software en schermen bedienen, van Alibaba’s Qwen-UI-Agent tot cloud-agents in ontwikkelomgevingen.
Wat betekent dit
Voor organisaties die met agents experimenteren is de les vrij praktisch. Meer skills toevoegen is geen strategie. Wie een handvol goed afgebakende procedures vastlegt en die scherp houdt, haalt volgens deze metingen meer rendement dan wie een bibliotheek van honderd overlappende instructies aanlegt. En omdat de winst vooral uit stabiliteit komt, is de vraag bij elke nieuwe skill: welk pad wil ik dat de agent consequent volgt? Wie daar geen antwoord op heeft, voegt vooral ruis toe aan het zoekprobleem.
