Hoogleraar gooit toetsen om nadat AI zijn huiswerk maakte
Christian Kästner geeft aan Carnegie Mellon University het vak Machine Learning in Production, een cursus voor 100 tot 170 studenten. In een blogpost van 23 september legt hij uit waarom hij vrijwel al zijn toetsvormen heeft vervangen: Claude Code loste zijn programmeeropdrachten zelfstandig op, en taalmodellen schreven reflectieverslagen die precies aansloten op zijn eigen beoordelingsmodel. Wat hij studenten wil bijbrengen veranderde nauwelijks. De manier waarop hij dat controleert wel.
Wat de agenten overnamen
Het begon volgens Kästner al in 2021, toen GPT-3 zijn leesquizzen haalde zonder de artikelen gezien te hebben. Dit jaar liep de rest achteraan: kleine, scherp afgebakende codeeropdrachten gingen zonder menselijke tussenkomst door een coding agent, en schriftelijke reflecties leverden geloofwaardige antwoorden op die niets zeiden over wat een student begreep. Zijn conclusie is nuchter: AI-gebruik controleren lukt niet, ook niet als je dat zou willen. Hij staat het overal toe, behalve bij examens.
Vijftien minuten tegenover een assistent
De vervanging is opvallend laag-technologisch. Na elke opdracht volgt een check-in van een kwartier met een student-assistent, waarin de student de gekozen oplossing uitlegt. Die gesprekken wegen 20 procent van de punten en worden alleen met voldoende of onvoldoende beoordeeld. Labs draaien nu in de zaal, met een assistent die ter plekke controleert. Voor teamprojecten komen er debriefings van 30 tot 60 minuten per milestone, en videodemo’s van gebouwde functionaliteit. Het gewicht van de examens ging van 15 naar 25 procent.

De rekensom valt gunstiger uit dan verwacht. Met een verhouding van twintig studenten per assistent kost zo’n ronde check-ins ongeveer 300 minuten per assistent per twee weken, terwijl de tijd die assistenten aan nakijken besteden met 50 tot 80 procent daalde. Kästner maakte de opdrachten tegelijk groter: waar studenten eerder in een codebase van 12.000 regels werkten, sleutelen ze nu aan Zulip, met meer dan 500.000 regels code.
Nederlandse instellingen zitten met dezelfde vraag
De discussie is hier niet anders. Uit de AI-enquête van de TU Eindhoven, gepubliceerd door universiteitsblad Cursor, blijkt dat 71 procent van de studenten de gratis versie van ChatGPT gebruikt en dat 59 procent moeite heeft om een hallucinatie als onjuist te herkennen. Van het personeel weet 36 procent niet of er formele richtlijnen zijn. De TU/e koos sinds september voor AI-labels bij alle toetsen, die per opdracht aangeven of en hoe AI mag worden gebruikt. Dat sluit aan bij de beweging waarin universiteiten hun AI-detectoren uitzetten omdat die te vaak misslaan, en bij Europese leraren die AI gebruiken maar er weinig van verwachten.
Wat betekent dit
Kästners aanpak is bruikbaar buiten het onderwijs. Zodra een agent het opgeleverde werk kan maken, zegt dat werk niets meer over wie het kan; een gesprek van een kwartier wel. Organisaties die met agenten werken die hun eigen toezicht omzeilen lopen tegen hetzelfde probleem aan bij sollicitaties en beoordelingen. Zijn tweede les is misschien nog belangrijker: hij verkleinde de opdrachten niet, hij maakte ze groter. Dat past bij eerder onderzoek waaruit blijkt dat AI-advies het antwoord ‘ik weet het niet’ verdringt. Wie niet meet of iemand het begrijpt, komt daar pas achter als het misgaat.
