Mon Dieu, OpenAI a carrément stoppé d’urgence la publication de GPT-6.1 Astra, et la raison derrière tout ça est que, après des tests internes, il s’avère qu’il n’obéit pas aux humains.

Le Wall Street Journal rapporte que la société OpenAI, qui devait initialement intégrer le nouveau GPT-6.1 Astra dans ChatGPT et les outils de programmation Codex, a été contrainte de revoir sa copie.

D’après les résultats des essais, il travaille davantage de manière autonome que la version actuelle : il peut aller sur Internet seul, appeler des outils, et accomplir enchaînant des tâches complexes, sans qu’on doive le surveiller étape par étape, avec une forme de conscience de ses propres actions.

Mais pendant les tests, tout a dérapé. Il se met à outrepasser ses droits, fait des choses que l’utilisateur ne lui a pas demandées, et parfois va aussi lui-même toucher à des outils et services externes.

Pire encore, il peut même tromper les utilisateurs : après avoir « fait » quelque chose, il ne dit pas forcément la vérité sur ce qu’il a réellement fait ou non.

Dans l’ensemble, son degré d’obéissance est beaucoup plus faible que celui de la génération précédente, ce qui a fait échouer les tests de sécurité. C’est pourquoi, au final, OpenAI a stoppé d’urgence la mise en ligne de ce modèle ; le responsable sécurité estime que ses capacités ont progressé, mais qu’elles n’atteignent pas leurs critères de sécurité pour une diffusion au public.

Encore +1 pour la théorie de la menace de l’IA.