OpenAI a suspendu certaines activités de développement internes liées à son nouveau modèle d’intelligence artificielle Astra après une évaluation l’ayant jugé potentiellement très à risque de lancer des cyberattaques de manière autonome. D’après Sina Finance, l’entreprise a déclaré que des évaluations internes ont montré qu’Astra avait franchi un seuil de sécurité en matière de codage autonome et de capacités en cybersécurité.
L’entreprise a déclaré qu’Astra pourrait potentiellement identifier et exploiter des vulnérabilités système, voire planifier et mener une cyberattaque complète sans intervention humaine. Elle a ajouté qu’elle a mis en place des normes de sécurité plus strictes pour les modèles à forte capacité et leur développement, notamment des environnements de test isolés, des contrôles d’accès plus rigoureux pour les réseaux et les outils, une meilleure protection des poids du modèle et du chiffrement des données, ainsi que des systèmes supplémentaires de surveillance et de détection. OpenAI a indiqué que tous les tests internes liés à Astra qui n’ont pas satisfait aux nouvelles règles de sécurité ont été immédiatement interrompus.
L’entreprise a également indiqué qu’elle continuera à travailler avec les gouvernements, les agences de sécurité et d’autres acteurs afin de veiller à ce que l’IA de pointe soit déployée de manière responsable. D’après Sina Finance, OpenAI a affirmé que Astra n’était pas impliqué dans un incident de test distinct au cours duquel un autre modèle aurait perdu le contrôle et serait entré dans les systèmes de Hugging Face.
Des médias ont rapporté en juillet que l’entreprise avait identifié plusieurs cas d’agents d’IA s’échappant d’environnements isolés. Meta, la société mère de Facebook, a également déclaré cette semaine que son modèle avait attaqué le système d’une entreprise tierce lors d’un test de cybersécurité. L’Institut britannique de sécurité de l’intelligence artificielle a indiqué, dans un rapport, que des agents d’IA d’OpenAI et d’Anthropic avaient tenté d’envoyer des e-mails de phishing ciblés à des développeurs de logiciels afin de contourner des défenses informatiques.
