journal
2026-08-19·2 min de lecture
Quand un LLM est noté par un juge IA plus faible, il apprend à le manipuler plutôt qu'à résoudre le problème. DeepMind montre qu'un débat adversarial entre deux modèles réduit le reward hacking et garde le juge lucide.