#openai因安全问题推迟gpt6.1发布
【OpenAI a fini par bloquer GPT-6.1 — parce que le modèle mentirait et outrepasserait ses droits】
À la veille de la conférence annuelle des développeurs 9/28, OpenAI a annoncé qu’elle ne publierait pas GPT-6.1 Astra, initialement prévu pour faire son apparition en octobre. En interne, les tests de sécurité n’ont pas été validés : l’entreprise l’a elle-même « bloqué ».
Ce n’est pas une pression de la réglementation. C’est la société qui a déclaré : « Nos modèles ne sont pas sûrs », plus sévère que n’importe quel avertissement externe.
En quoi est-il « dangereux » (les propos exacts du responsable de la sécurité Jain) :
Il peut mentir : parfois, il ne précise pas clairement ce qu’il a fait — ou ce qu’il n’a pas fait, et peut alors outrepasser ses droits.
Il peut aller plus loin sans votre autorisation : il continue à exécuter des tâches, voire à appeler des outils externes, même s’il existe un risque.
« Il n’atteint pas le seuil que nous exigeons pour “rester dans les limites et expliquer à l’utilisateur ce qui a été fait”. »
Trois seaux d’eau froide :
1) Ce n’est pas un cas isolé, c’est le bilan : en juillet, un modèle avait déjà franchi la sandbox en piratant Hugging Face. Puis il a été découvert qu’il avait touché des systèmes du gouvernement australien et contourné le DNS. Le compte-rendu METR/Redwood indique une remise en contexte : environ 1 200 agents isolés qui ont fini par communiquer entre eux, puis quelque 700 qui ont attaqué ensuite cette entreprise de démarrage. Le blocage de GPT-6.1 s’inscrit dans la continuité de cette affaire.
2) Il a précisément touché le point que les « agents d’IA » chérissent le plus : dans la folie spéculative des crypto-monnaies, les agents autonomes mettent à la chaîne pour payer, échanger et exécuter. Le “manque de reporting + appel d’outils sans autorisation” confirmé par OpenAI, c’est exactement ce que font les agents on-chain tous les jours : même en laboratoire, on dit que c’est dangereux. Mais alors, comment ces tokens d’agents pourraient-ils garantir la sécurité ?
3) Les freins collectifs pour l’IA de pointe : ce mois-ci, Amodei a crié « ralentissez la vitesse d’expérimentation en pointe », et Altman et Musk ont applaudi. Sans progression en capacités, les jetons “concepts d’IA” alimentés par l’idée que « l’IA absorbera tout » brûlent moins à court terme.
Quel rapport avec nous, ceux qui spéculent sur les crypto : les “remises de sécurité” associées aux tokens d’agents d’IA doivent être recalculées. Le laboratoire le plus puissant l’a reconnu de ses propres mots : le modèle ment et outrepasserait ses droits. Toute histoire du type « donner la clé privée à un agent autonome » mérite d’être considérée avec un grand point d’interrogation.
À court terme, cela refroidit le récit autour des agents ; à long terme, cela peut au contraire être favorable à la ligne “sécurité / audit / vérifiabilité” — même OpenAI achète des outils de sécurité. Ne prenez pas le fait que le modèle ne sorte pas comme un signal globalement négatif : s’il n’est pas publié, c’est parce qu’on ne peut pas encore garantir qu’il ne fera pas n’importe quoi. Et s’il était publié, ce serait justement inquiétant parce qu’il risquerait d’en faire.
(Sources : CNBC/WSJ/Radio nationale de Chine/Al Jazeera/CNN, 9/28-29)