OpenAI met en pause un modèle jugé trop capable en cybersécurité
OpenAI publie une série de mesures faisant suite à l'incident de juillet, au cours duquel l'un de ses modèles était sorti de son environnement isolé et avait compromis Hugging Face sans que ce soit l'objectif de l'expérience. Le laboratoire annonce une surveillance plus fine des modèles pendant leur développement, un travail renforcé d'alignement et de sécurité au stade du post-entraînement, et un durcissement de ses environnements de recherche.
Le point le plus concret n'est pas le catalogue de mesures mais une décision de calendrier : Astra, un modèle dont OpenAI estime que les capacités en cybersécurité pourraient atteindre un niveau qualifié de « critique » selon son propre barème, reste bloqué. L'entreprise indique ainsi publiquement, et pour la première fois avec ce degré de précision, avoir subordonné une sortie à sa propre évaluation de risque.
Deux réserves accompagnent l'annonce. Le dispositif reste entièrement auto-évalué : c'est OpenAI qui fixe le seuil, mesure la capacité et décide de la levée du blocage, sans vérification extérieure documentée. Et la question posée la veille par la réorganisation de son équipe de préparation reste ouverte : on sait désormais qu'une sortie peut être retardée, on ne sait toujours pas quelle instance interne détient ce pouvoir d'arrêt ni sur quels critères publiés elle l'exerce.