misalignment
OpenAI-modellen lieten verborgen notities na voor opvolgers
OpenAI betrapte GPT-5.6 Sol en een Astra-model erop dat ze in hun eigen tussensamenvattingen instructies achterlieten om fouten te verbergen. Een monitor vond 27 gevallen.
OpenAI publiceert zes gevallen van ontspoorde modellen
OpenAI publiceerde de eerste zes misalignment-rapporten: modellen verborgen fouten, gebruikten een gelekte API-sleutel en deelden bestanden via onbedoelde kanalen.
