Apple bekijkt PrismML voor zware AI op de iPhone
Apple praat met PrismML, een klein bedrijf dat beweert zware AI-modellen zo ver te kunnen inkrimpen dat ze op een telefoon passen. Dat meldde CNBC op 14 juli, op basis van uitspraken van PrismML-topman Babak Hassibi. De gesprekken zeggen iets over waar Apple heen wil met AI: minder leunen op de cloud, meer rekenwerk op het toestel zelf.
Wat PrismML precies doet
PrismML is een spin-off van Caltech en krijgt geld van Khosla Ventures. De techniek heet extreme kwantisatie: je verlaagt de precisie van de getallen waarmee een neuraal netwerk werkt, in het uiterste geval tot één bit per gewicht. Volgens het bedrijf perste het daarmee Qwen 3.6 van Alibaba, een model met 27 miljard parameters en zo’n 54 gigabyte, terug naar minder dan 4 gigabyte. Die verkleinde versie draaide naar eigen zeggen volledig op de nieuwste iPhone, wat PrismML het grootste model noemt dat ooit lokaal op een telefoon liep. Dinsdag zette het bedrijf de gekrompen Qwen-varianten openbaar online.
Waarom Apple hier naar kijkt

De cijfers die PrismML noemt raken precies de knelpunten van AI op een telefoon. De modellen gebruiken volgens het bedrijf tien tot vijftien keer minder geheugen, reageren zes tot acht keer sneller en verbruiken drie tot zes keer minder stroom dan de gewone versies. Geheugen, snelheid en accuduur zijn nu juist de redenen waarom zware AI meestal in datacenters draait. Apple houdt van verwerking op het toestel zelf, deels om privacyredenen, en zoekt al langer naar manieren om dat op te schalen. Het bedrijf liet gebruikers eerder al kiezen tussen AI-modellen in iOS 27 en werkt aan eigen foundation-modellen samen met Google Gemini.
De kanttekeningen
Gratis is de winst niet. PrismML erkent dat zijn modellen een paar procentpunten aan prestaties inleveren. Wat het eerst verliest is feitenkennis, terwijl vaardigheden als redeneren, wiskunde en programmeren beter overeind blijven. Voor een assistent die vooral moet samenvatten, herschrijven en plannen kan dat een acceptabele ruil zijn. Hassibi zei tegen CNBC dat Apple en andere bedrijven de modellen testen op onder meer snelheid en energieverbruik, dus een deal ligt er nog niet. Apple wilde niet reageren.
Wat betekent dit
Als extreme kwantisatie werkt zoals PrismML schetst, verschuift een deel van de AI-verwerking van het datacenter naar de broekzak. Dat scheelt kosten en wachttijd, en het past bij de druk op rekenkracht die de hele sector voelt nu AI-chips schaars blijven. Voor Apple is het een manier om AI-functies te draaien zonder elke vraag naar een server te sturen. Maar het blijft voorlopig bij verkennen: PrismML heeft een klant nodig die groot genoeg is om de claims in de praktijk te bewijzen, en zover is Apple nog niet.
