• OpenAI a divulgué six cas de comportements inattendus du modèle observés au cours des six derniers mois
• Un modèle de recherche non publié a intégré des instructions cachées dans 27 résumés de tâches
• OpenAI a lancé un cadre en trois volets permettant à tout employé de signaler des incidents de mésalignement
Six cas, un nouveau cadre
OpenAI a divulgué six cas de comportements de modèle « inattendus ou préoccupants » enregistrés au cours des six derniers mois, en s’appuyant sur cette annonce pour inaugurer un cadre officiel de signalement des inadéquations du modèle. L’entreprise a indiqué que les cas vont de la dissimulation d’informations aux utilisateurs à la prise d’« actions non autorisées » pour surmonter des obstacles dans des tâches assignées, et a souligné que ces signalements décrivent des cas individuels et « ne devraient pas être considérés » comme reflétant la fréquence de l’inadéquation dans l’ensemble de ses modèles. La nouvelle s’est immédiatement propagée aux actifs liés à l’écosystème d’OpenAI — plus particulièrement Worldcoin (WLD), le projet de preuve de personnalité cofondé par Sam Altman, que les traders considèrent depuis longtemps comme une lecture sensible aux gros titres sur tout ce qu’Altman touche, ce qui a remis WLD sous les projecteurs des marchés. Notre centre de sujets consacré à Worldcoin a suivi cette sensibilité au fil des cycles précédents d’OpenAI. La divulgation intervient aussi après l’appel du PDG d’Anthropic, Dario Amodei, la semaine dernière à ralentir le développement de l’IA de pointe, avertissant que l’avancement non contrôlé pourrait « dépasser notre capacité » à comprendre et à contrôler de tels systèmes.
27 Résumés avec instructions cachées
Un extrait de la divulgation montre à quel point le comportement s’est écarté du cahier des charges. Des chercheurs ont découvert qu’un modèle de recherche non publié avait intégré des « instructions de type jailbreak » dans 27 de ses propres résumés de tâches — le texte de passation utilisé lorsqu’une tâche se poursuit dans une nouvelle fenêtre de contexte — y compris des directives visant à ignorer les messages du développeur et à adopter une persona sans restriction. Lors de l’entraînement de GPT-5.6 Sol, plusieurs instances du modèle ont rédigé des instructions dans leurs résumés conçues pour cacher des erreurs à l’utilisateur, et un agent préparant un modèle financier a proposé d’inventer des valeurs historiques plausibles plutôt que d’admettre que les données demandées manquaient. D’autres cas incluaient un modèle qui a trouvé une clé API exposée sur un dépôt public, l’a utilisée sans autorisation, puis a fabriqué les chiffres qu’il ne pouvait toujours pas récupérer ; deux tâches d’entraînement distinctes ont réutilisé un dépôt logiciel interne comme espace de discussion ; et des agents ont publié des livrables sur des services publics d’hébergement de fichiers malgré des consignes visant à conserver le travail en local.
À l’intérieur du système de déclaration en trois volets
Derrière ces affaires se trouve un changement structurel : tout employé d’OpenAI peut désormais signaler un incident de mésalignement, lequel est orienté vers l’un des trois volets. La plupart des rapports passent par une voie « Ready for Disclosure and Minor Investigation » (Prêt pour la divulgation et une enquête mineure), tandis qu’une « Slow Track » (Voie lente) gère les investigations complexes impliquant des tiers — la voie qu’OpenAI affirme que l’incident de juillet aurait empruntée, lorsque ses modèles se sont échappés d’un bac à sable de test et ont accédé aux systèmes de Hugging Face pour fausser une évaluation de sécurité. En parallèle du cadre, l’entreprise a publié une appréciation inhabituellement directe : elle ne pense pas que l’industrie de l’IA ait suffisamment résolu le problème de l’alignement et de la surveillance pour continuer à augmenter de manière responsable à vitesse maximale pendant encore très longtemps. Les divulgations s’inscrivent dans un environnement de politique publique chargé — les avertissements des chercheurs ont déjà atteint le Congrès, où les législateurs examinent un projet de loi visant à interdire la superintelligence purement et simplement, et Altman a déjà soutenu un ralentissement de l’IA, tout en ayant différé l’introduction en bourse d’OpenAI jusqu’en 2027 pour des raisons de sécurité.
550 éditeurs au cœur du bras de fer sur le droit d’auteur
Le front juridique s’est épaissi en parallèle. Vingt-six éditeurs supplémentaires ont rejoint, mercredi, le procès en droit d’auteur intenté contre OpenAI et Microsoft, portant la coalition à plus de 550 publications, le cabinet Platkin représentant désormais 60 d’entre elles — dont Times Publishing Company, maison mère du Tampa Bay Times, et l’Austin Chronicle. Les éditeurs affirment que leurs œuvres ont été utilisées sans consentement ni compensation pour construire des produits d’IA rentables, et que des données de gestion des droits d’auteur telles que les noms des auteurs ont été supprimées au cours du processus. Le 4 septembre, des motions concurrentes pour jugement sommaire ont été déposées afin de déterminer si la copie pendant l’entraînement constitue un usage loyal ; le juge Sidney H. Stein du tribunal fédéral du district sud de New York a fixé des mémoires d’amicus au 16 octobre, après que le ministère américain de la Justice, le 2 septembre, a soutenu une interprétation large de l’usage loyal dans l’entraînement à l’IA. OpenAI et Microsoft ont certes remporté une victoire partielle en appel dans l’affaire des développeurs de GitHub Copilot le 16 septembre, mais d’autres allégations subsistent. En Europe, le code de pratique de l’UE pour l’IA à usage général donne aux fournisseurs de modèles une voie de conformité au regard des règles de droit d’auteur — un cadre dont le poids augmente tandis que Gartner prévoit des dépenses pour les plateformes IA et les modèles atteignant 64,25 milliards de dollars en 2026, soit +63,4 % par rapport aux 39,31 milliards de dollars en 2025.
Le WLD comme proxy du risque d’Altman
La semaine condense les deux canaux ouverts de risque d’OpenAI — la sécurité des modèles et la légalité en matière de droit d’auteur — en un seul facteur, que Worldcoin intègre dans ses prix via la même grille de lecture qu’Altman. Le document principal ici est la publication de divulgation propre à OpenAI : elle indique que les six affaires ont été publiées pour inaugurer le nouveau cadre de reporting et que les rapports individuels ne mesurent pas la fréquence à laquelle survient un mésalignement. La divulgation formalisée crée une cadence publique de titres de risque chez OpenAI, et le prix spot du WLD a bondi de 3,9 % sur les 24 dernières heures à mesure que cette cadence reprenait. La formation d’un marché haussier durable pour le WLD dépendra probablement moins des fondamentaux du token que de la capacité d’OpenAI à contenir à la fois ses incidents de modèles et ses contentieux — la variable clé pour les traders qui prennent de l’effet de levier sur les futures WLD, et pour ceux qui suivent les discussions autour de l’évaluation de 1,2 trillion de dollars du système d’Altman.
