alignment
AI verbetert eigen alignment voor 4 dollar per uur
Anthropic laat AI-systemen zelfstandig alignment-training verbeteren op tien benchmarks, voor 4 dollar per uur. Princeton-onderzoek toont tegelijk de grenzen.
OpenAI test modellen op oude gesprekken
OpenAI test nieuwe modellen met Deployment Simulation: oude gesprekken opnieuw afspelen om risicovol gedrag te voorspellen voordat een model live gaat.
