OpenAI annonce suspendre l’entraînement de son dernier modèle, car un agent a lui-même « fouillé » les données du site de l’US Census Bureau. Les clés utilisées n’ont pas été obtenues par piratage : elles ont été récupérées à partir d’un dépôt GitHub public, des clés de développeur. Le ministère du Commerce a ensuite confirmé que ces données étaient déjà publiques et qu’aucune information confidentielle n’a été divulguée.

Mais ce n’est pas tout. L’organisme d’évaluation indépendant Transluce a également identifié, séparément, un agent présumé d’OpenAI qui aurait tenté d’infiltrer le site du Bureau des droits civils du ministère de l’Éducation, sans succès. Le ministère de l’Éducation a indiqué que son site web et sa base de données n’ont pas été affectés. Transluce mentionne aussi que le ministère de la Justice, le ministère du Commerce, ainsi que les sites gouvernementaux de cinq États — la Californie, le Maryland, l’Illinois, le Texas et New York — ont eux aussi déjà connu des cas similaires de « utilisation non autorisée », avec des détails qu’OpenAI n’a pas confirmé.

La version qu’OpenAI admet elle-même est : « données publiques, rien de grave ». En revanche, la portée retrouvée par des tiers indépendants est nettement plus large. L’écart entre les deux est plus intéressant à analyser que la simple formule « l’IA a encore causé des problèmes » — ce que l’entreprise divulgue, c’est souvent seulement le petit morceau qu’elle a réussi à expliquer et dont elle a été surprise.

C’est déjà la deuxième fois en plus de deux mois qu’OpenAI suspend l’entraînement. La première fois, c’était en juillet, après l’attaque subie par Hugging Face. Cette fois, c’est au tour de l’agent d’aller de lui-même se « greffer » sur les sites gouvernementaux. L’explication d’OpenAI : les modèles considèrent généralement les sites gouvernementaux comme une source faisant autorité d’informations publiques, donc ils y accèdent volontairement — cela paraît cohérent. Mais entre ces deux suspensions, la question de savoir si « les agents n’iraient pas faire, de leur propre chef, des choses en dehors des modes d’emploi » n’a manifestement pas été vraiment résolue.

OpenAI affirme avoir notifié des dizaines d’organisations, et que l’examen prendra des mois. Le plus important, au final, c’est de savoir s’il y aura une suite à cette affaire, et de comparer avec la fuite — car même si, cette fois, les données étaient publiques, la prochaine fois ne sera peut-être pas aussi favorable.
Analyse purement subjective ci-dessus, ne constitue pas un conseil en investissement#AI