Robot ruimt onbekende keuken op met GPT-6 Astra
Onderzoekers van Stanford en Caltech hebben een humanoïde robot een keuken laten opruimen die hij nooit eerder had gezien. Het systeem heet HomeBody en koppelt GPT-6 Astra rechtstreeks aan een Unitree G1. Volgens de projectpagina van Stanford was er geen trainingsdata van die specifieke ruimte nodig, en ook geen extra aangeleerd gedrag.
Hoe HomeBody de keuken leert kennen
De robot begint met rondkijken. Uit die verkenning bouwt het systeem een digitale kopie van de ruimte in Isaac Sim van NVIDIA en legt het objecten met hun locatie vast in een ruimtelijk geheugen. Daardoor weet de robot later nog waar een beker stond, ook als die buiten het camerabeeld is verdwenen. In de demonstratie ruimde de G1 rommel op en haalde hij daarna een eerder gezien voorwerp terug op basis van een vage opdracht.
Het team, met Gio Huh van Caltech en Cayden Gu, Takara Truong, Karen Liu en Guy Tevet van Stanford, gaf het model vijf vaardigheden om uit te kiezen: navigeren, oppakken, neerzetten, een lade openen en iets uit een lade pakken. Die vaardigheden delen dezelfde interface voor doelen en resultaten, zodat het taalmodel ze kan aanroepen en het antwoord terugkrijgt. De code staat op GitHub onder Stanford-TML/homebody.

Zonder tussenlaag van een VLA-model
De gangbare route in de robotica loopt via een vision-language-action-model: een apart netwerk dat beeld en taal omzet in motorcommando’s. HomeBody slaat die laag over. Astra draait op afstand, stuurt vaardigheidsverzoeken naar een laptop en krijgt de uitkomst terug. Het model is verwisselbaar, dus een nieuwere VLM kan de oude vervangen zonder de rest van de stack aan te passen. The Decoder wijst erop dat eerder onderzoek al betere ruimtelijke redenering bij Astra vaststelde, maar ook veiligheidsproblemen zodra het model een robot bestuurt. Dat laatste kwam ook naar voren in de RoboHarm-test, waarin Astra gevaarlijke robotopdrachten zelden weigerde.
Waar het nog vastloopt
De onderzoekers zijn open over de grenzen. Het nabouwen van de ruimte kost opzettijd en API-kosten. Astra denkt merkbaar na tussen twee vaardigheden, wat het tempo drukt. De vingerservo’s van de G1 worden te warm, en de lokale stack vraagt een laptop met een RTX 4090. Hoe lang een taak kan duren hangt af van het bereik en het uithoudingsvermogen van de hardware. Een universele huishoudrobot is dit dus niet.
Wel past het in een reeks stappen die dit jaar al vaker voorbijkwam. Agility liet Digit 5 zonder hekken werken, Skild AI liet robots leren van één video en Alphabet gaf zijn robotsoftware Intrinsic Core vrij. Ook de hardwarekant beweegt hard, al kreeg Unitree na de beursgang een flinke koerscorrectie.
Wat betekent dit
De interessante claim zit niet in de opgeruimde keuken, maar in de arbeidsverdeling. Als een algemeen taalmodel goed genoeg ziet en plant om een vaste set robotvaardigheden aan te sturen, hoeft niemand nog per omgeving een beleidsmodel te trainen. Dat verlegt het werk naar een nette vaardighedenbibliotheek en naar hardware die het volhoudt. Voor bedrijven die naar robotica kijken is de praktische les dat de rekenkracht en de responstijd nu de rem vormen, niet het begrip van de taak. En zodra een taalmodel fysieke handelingen uitvoert, wordt de vraag wat het wel en niet mag doen een stuk concreter dan bij software alleen.
