Sony-AI Hakken voorspelt onbekende genverbanden
Sony AI heeft samen met een groep academische onderzoekers een systeem gepresenteerd dat voorspelt welke wetenschappelijke verbanden nog niet in de literatuur staan, maar er waarschijnlijk wel zijn. Het systeem heet Hakken en werd op 3 september op arXiv gepubliceerd. Japanse techmedia als TechnoEdge pikten het onderzoek dit weekend op in hun wekelijkse overzicht van generatieve AI.
Wat Hakken doet
De meeste AI-systemen voor wetenschappelijke literatuur vatten samen wat er al is. Hakken draait dat om. Het model kijkt naar de manier waarop verbanden tussen wetenschappelijke begrippen zich door de tijd hebben ontwikkeld en gokt vervolgens op verbanden die nog niemand heeft opgeschreven. Technisch combineert het een transformermodel dat werkt op tijdsgebonden kennisgrafieken met de semantische kennis van een groot taalmodel. De onderzoekers noemen het domeinonafhankelijk, al ligt de nadruk in het paper op biomedisch onderzoek.
Die aanpak sluit aan bij een bredere beweging waarin AI niet alleen leest maar ook hypotheses aandraagt. Anthropic ging een stap verder en opende een eigen wetlab voor biologisch onderzoek, en Novo Nordisk haalde Claude Science binnen voor medicijnonderzoek.

1,5 miljoen hypotheses, drie naar het lab
Het team liet Hakken los op verouderingsonderzoek. Dat leverde ruim 1,5 miljoen voorspelde verbanden op die boven de gekozen betrouwbaarheidsdrempel uitkwamen. Zo’n aantal is op zichzelf weinig waard, want geen enkel lab kan miljoenen suggesties natrekken. Biologen beoordeelden daarom een selectie handmatig en kozen drie voorspellingen uit voor experimentele toetsing.
Twee daarvan hielden stand. Het gaat om een tot dan toe niet gedocumenteerde interactie tussen de genen TP53 en BAMBI, en om een interactie tussen RAF1 en TNF. TP53 is een van de bekendste tumorsuppressorgenen, TNF speelt een rol bij ontstekingsprocessen. De onderzoekers zien daarin aanknopingspunten voor medicijnonderzoek, zonder harde claims over toepassingen te doen.
Waarom de filtering het echte probleem is
Dat twee van de drie geteste voorspellingen klopten, zegt iets over de kwaliteit van de selectie, niet over de trefkans van het model als geheel. De verhouding blijft ongemakkelijk: 1,5 miljoen suggesties, drie experimenten. De kosten zitten in het natrekken, en juist dat deel schaalt niet mee met de rekenkracht. Hetzelfde patroon zag je bij AI in de wiskunde, waar modellen wel records neerzetten op afgebakende problemen maar de verificatie mensenwerk bleef.
Verouderingsonderzoek is bovendien een gebied waar AI-resultaten snel groter worden gemaakt dan ze zijn. Insilico Medicine kwam eerder met klinische data waarin een AI-ontworpen middel de biologische leeftijd van longpatienten verlaagde, en ook daar ging het om een kleine groep deelnemers.
Wat betekent dit
Voor onderzoekers is Hakken vooral een zoekinstrument met een andere insteek: niet wat weten we, maar waar zit het gat. Of dat in de praktijk tijd bespaart, hangt af van de vraag hoe goed de voorselectie wordt. Twee bevestigde geninteracties zijn een nette eerste uitkomst, geen bewijs dat de methode breed werkt. Sony AI heeft de code en de volledige hypotheselijst nog niet vrijgegeven, dus onafhankelijke toetsing moet nog beginnen. Dat is de stap die telt.
