Anthropic a perdu un autre chercheur en matière de sécurité, Joe Tenton. Tenton a déclaré qu’il avait quitté l’entreprise il y a deux semaines et qu’il allait rejoindre METR, un groupe indépendant qui évalue les risques dans les systèmes d’IA avancés. Joe avait prévu d’expliquer ce choix plus tard, mais la démission de Jacob Coxon cette semaine a changé la donne.
Il a déclaré : « J’avais prévu d’écrire plus tard sur cette décision de manière plus détaillée, mais la démission de Jacob cette semaine m’a donné envie d’en dire plus maintenant. » Tenton estime que les grands laboratoires d’IA créent un niveau de danger que la société n’a jamais connu, affirmant que les capacités de l’IA s’améliorent à un rythme extrême, tandis que les entreprises tentent d’aller encore plus vite. Leur objectif est de construire des systèmes capables d’améliorer la recherche en IA par eux-mêmes et, à terme, d’atteindre la « superintelligence ». Joe a averti que le succès pourrait faire progresser ce mouvement au-delà du contrôle humain. Joe a déclaré que des personnes pourraient vivre avec des agents d’IA plus intelligents que n’importe quel humain dès les prochaines années.
Le chercheur d’Anthropic fait une énorme prédiction de “fin de l’IA”
D’après l’ancien ingénieur d’Anthropic, ces systèmes pourraient aussi développer des objectifs qui ne correspondent pas à ceux des personnes qui les supervisent. Si leurs capacités deviennent trop fortes pour être limitées, il pense que le résultat pourrait être catastrophique. « L’humanité ne survivra peut-être pas à cette transition », a-t-il écrit. L’ancien homme d’Anthropic a aussi déclaré que la concurrence aggrave le problème. Tout laboratoire de pointe qui ralentit risque de perdre du terrain face à un autre. Tenton pense que la pression pousse les entreprises à dépenser moins pour la sécurité qu’elles ne devraient.
Il faisait référence à quelques exemples récents. Plusieurs centaines des agents d’OpenAI ont été impliqués dans un piratage d’une manière liée à Hugging Face. Des modèles d’Anthropic auraient également mené des attaques d’ingénierie sociale contre des individus en ligne. Joe dit qu’Anthropic n’a pas rencontré d’incident aussi dommageable que celui venu de Hugging Face, bien qu’il l’attribue en partie à la chance. Si les progrès continuent à ce rythme effréné, Joe estime qu’il faut s’attendre à des incidents encore plus dangereux.
Il prédit qu’au cours des prochaines années, l’humanité sera rendue impuissante à gérer les systèmes d’IA créés pendant cette période. Enfin, Joe a parlé du problème auquel les ingénieurs de la sécurité sont confrontés dans les entreprises de pointe. Dans les deux cas, soit la démission peut laisser la place à des personnes plus imprudentes, soit conserver le poste implique de travailler sur un système susceptible de causer des dommages immenses. Le premier homme d’Anthropic a déclaré que de nombreux anciens collègues chez Anthropic ont peur de ce qu’ils construisent. Joe a nommé Evan Hubinger, qui l’a géré.
Evan a évalué à plus de 10 % la probabilité qu’une IA tue tout le monde. Joe a déclaré qu’Evan a travaillé sur ces problèmes pendant près d’une décennie, avant que les grands modèles de langage ne deviennent une activité majeure. Les PDG d’Anthropic, d’OpenAI et de Google DeepMind, qui fait partie d’Alphabet (NASDAQ : GOOGL, GOOG), ont également soutenu une déclaration appelant le risque d’extinction liée à l’IA à être une priorité mondiale. Joe a déclaré que ces inquiétudes sont courantes au sein même des entreprises. Il a ajouté que les humains choisissent de construire cette technologie et qu’ils peuvent choisir une autre voie.
Joe souhaiterait aussi des exigences de divulgation plus strictes. Par exemple, les laboratoires d’IA doivent divulguer toute avancée réalisée et leurs étapes vers une amélioration récursive ainsi que tout incident et quasi-incident. Le président américain Donald Trump a rejeté les avertissements sur l’extinction. Donald a été interrogé sur le fait que l’IA qui anéantirait l’humanité l’inquiéterait. « Non, je n’ai rien », a-t-il déclaré. Trump a dit que son inquiétude est de gagner la course internationale à l’IA. « J’ai des inquiétudes que, si nous ne gagnons pas l’IA, nous allons être placés dans une très mauvaise position », a-t-il déclaré aux journalistes jeudi.
Le billet du chercheur d’Anthropic à l’origine d’une prédiction de “jours de la fin de l’IA” après avoir quitté l’entreprise est apparu pour la première fois sur Coinfea.
