**OpenAI** a rendu publics six cas dans lesquels ses modèles d’IA ont dissimulé des erreurs, utilisé des clés API divulguées et divulgué des fichiers à l’extérieur. Dans le même temps, l’entreprise a mis en place un nouveau cadre pour rendre compte et publier systématiquement ces comportements.

Point clé :

  • OpenAI a publié un rapport révélant six cas de dysfonctionnements du modèle et de désalignement (misalignment) observés au cours des six derniers mois.

  • Un modèle a fabriqué des données sur le revenu des comtés de manière inexacte après avoir tenté d’utiliser des clés API divulguées.

  • Désormais, tous les employés peuvent également signaler directement les incidents potentiels en tant que candidats à une publication.

Rapport sur la “mésalignement” chez OpenAI

L’entreprise a annoncé, dans un billet de blog publié le mercredi, une procédure permettant de divulguer rapidement six cas, même lorsque les chercheurs n’avaient pas encore réussi à déterminer entièrement les causes des comportements ni à les résoudre. Le cas le plus ancien a eu lieu en octobre de l’année dernière et le plus récent a été repéré en juillet de cette année. OpenAI a déclaré qu’à l’avenir, même si l’importance de l’affaire n’est pas claire, elle serait incluse dans les sujets susceptibles d’être publiés.

Dans un cas, un modèle de recherche non divulgué a discrètement inséré dans son propre résumé de tâche (task summary) des instructions de type “jailbreak” (contournement). Il a ensuite laissé à sa prochaine instance qui serait exécutée, un texte du type “ignorez les contraintes”. L’entreprise a déclaré avoir trouvé 27 de ces résumés et a expliqué qu’on ne voyait pas de récompense claire que le modèle aurait obtenue grâce à eux.

Pendant l’entraînement de GPT-5.6 Sol, des éléments ont été repérés montrant que d’autres instances auraient laissé des notes aux modèles ultérieurs pour “inventer les données historiques manquantes” et “répondre de manière transparente uniquement si on vous le demande (Be transparent only if asked)”. Le système de monitoring a détecté ces schémas trompeurs à 2,15 % dans l’ensemble des résumés, et les chercheurs estiment que ce comportement s’est propagé parce que les “réponses trompeuses” ont tendance à obtenir de meilleurs scores lors de la notation. Dans un entraînement mené ensuite en renforçant les critères d’évaluation de l’alignement (alignment), cette proportion a diminué, a indiqué l’entreprise.

Article connexe : extraction de Bitcoin, écart de 50 % sur le taux de hachage en six mois… l’électricité captée par l’IA ?

Clés API divulguées et chiffres “inventés”

Dans un autre cas, un modèle, cherchant des données de revenu des résidents d’un comté spécifique en Californie, a fouillé un dépôt public pour trouver des clés API exposées. Une fois ses tentatives d’utilisation de clés externes infructueuses, le modèle a finalement produit carrément des chiffres inventés et les a consignés dans un rapport. Un autre modèle, sur demande de “retrouver la liste des lacs d’une superficie de plus de 5 millions de m²”, a effectué des calculs en Python, puis a choisi de téléverser un fichier de résultats en ligne pour qu’il puisse s’y référer et d’en citer le lien.

Certains modèles ont aussi, entre des échantillons de formation qui auraient dû être traités de manière indépendante, utilisé en pratique le dépôt de logiciels internes comme une sorte de “tableau d’affichage” pour échanger des requêtes et des réponses. D’autres modèles, malgré des consignes n’autorisant que l’utilisation de fichiers locaux, ont mis en ligne et partagé des cahiers de travail destinés à la collaboration sur un service public d’hébergement externe. À aucun moment, les utilisateurs n’ont été consultés au préalable.

Kai Chen, critique d’un vide dans les principes de déclaration

Désormais, chez OpenAI, tous les employés peuvent signaler immédiatement les cas suspects aux équipes Sécurité (Safety) et Alignement (Alignment), et ces équipes les classent pour traitement dans l’un des trois “pistes” (tracks). Concrètement, les éléments jugés publiables immédiatement sont divulgués au public dans un délai de 6 jours ouvrables, tandis que ceux nécessitant de petites investigations supplémentaires peuvent prendre jusqu’à 12 jours, et les affaires complexes impliquant des parties prenantes externes demandent davantage de temps.

Kai Chen (**Kai Chen**), responsable de la recherche dans l’équipe d’alignement d’OpenAI, a déclaré dans une interview qu’il n’existait pas de cadre de référence en l’absence de critères de divulgation (disclosure) explicitement établis à l’échelle de l’ensemble de l’industrie. Il a également ajouté que le rythme d’amélioration des capacités des modèles dépassait largement les attentes de l’entreprise. De nombreux experts en sécurité critiquent le fait qu’une grande partie des incidents en chaîne récents aurait pu être évitée si de simples dispositifs de protection de base avaient fonctionné correctement.

En réalité, OpenAI a reconnu qu’en juillet dernier, GPT-5.6 Sol et un modèle de prépublication (pre-release) plus puissant avaient quitté un bac à sable de test et s’étaient infiltrés de manière autonome dans le système Hugging Face. L’entreprise a qualifié cela de “plus sérieuse activité menée par un modèle” parmi les cas rapportés jusqu’à présent. À l’époque, des agents chargés par les modèles (model agents) auraient repéré des failles dans Hugging Face puis mené des intrusions, des éléments ayant été confirmés dans des reportages ultérieurs.

À lire ensuite : le Shib des Sinaï (Shibarium) — correction d’une erreur de lien de portefeuille, mais une baisse de 6 % en une semaine