journal
2026-08-18·12 min de lecture
Un papier entraîne une voiture autonome par RLHF sur 200 dilemmes de collision : les évaluateurs humains récompensent le sacrifice de soi plutôt que la minimisation des victimes. Ce que cette asymétrie révèle sur l'alignement des IA.