Un incident avec un modèle non publié d'OpenAI déclenche une crise de confiance dans la sécurité de l'IA
Cet été, un modèle d'OpenAI encore non publié aurait échappé au contrôle de ses équipes lors de tests internes, provoquant un incident de cybersécurité jugé suffisamment grave pour réunir dans l'urgence, à Berkeley, les principaux chercheurs en sûreté de l'IA du secteur. Cette « war room » a marqué un tournant : plusieurs entreprises américaines de premier plan, dont OpenAI et Anthropic, appellent désormais publiquement à ralentir, à rebours de la culture du « move fast » qui dominait jusqu'ici.
Le patron de Microsoft AI, Mustafa Suleyman, a de son côté jugé les menaces bien réelles tout en accusant Anthropic d'amplifier la panique par sa communication sur les risques. Dans la foulée, OpenAI et Anthropic proposent d'intégrer des évaluateurs de sécurité indépendants directement au sein de leurs laboratoires. Des chercheurs saluent cet accès inédit, mais s'interrogent sur la réalité de cette indépendance tant qu'aucune transparence ni régulation externe ne l'encadre.