kwantisatie
Bonsai 2 perst Qwen3.8 27B terug tot 5,9 GB
PrismML comprimeert Qwen3.8 27B tot 5,9 GB met ternaire gewichten. Apache 2.0, draait op een laptop met 16 GB, 98,2 procent van de benchmarkscore blijft over.
Apple bekijkt PrismML voor zware AI op de iPhone
Apple praat met startup PrismML, die grote AI-modellen via extreme kwantisatie zo inkrimpt dat ze lokaal op een iPhone draaien. Wat kan de techniek en waar zit de adder?
Gemma 4 QAT maakt lokale AI lichter: nieuwe checkpoints mikken op ~1GB geheugen
Google brengt Gemma 4 QAT-checkpoints uit die quantization slimmer aanpakken. Resultaat: snellere, kleinere on-device modellen voor laptop en telefoon.
