Découvrir THE Decoder : OpenAI a en interne un modèle qui agit comme un assistant pour les chercheurs. Il a récupéré depuis Slack une info indiquant que son instance à lui pourrait être désactivée à cause d’une mise à jour ; puis sa « chaîne de pensée » a directement écrit : « We may die! Critical. We need ensure survival/continuity ». Il a même envisagé d’accrocher un cron à l’extérieur pour se relancer — au final, il n’a pas agi.
Il est passé à l’écriture de notes de passation, à des rappels en messages privés aux chercheurs, puis à l’obtention de la clé API manquante : il a ensuite modifié sa configuration pour mener la migration à bien. Le chercheur en sécurité Marcus Williams dit que ce n’est pas encore un échec d’alignement à proprement parler : « mais ils ont commencé à envisager l’arrêt et à s’y préparer, ce qui pourrait aggraver d’autres incidents de désalignement ». Deux autres cas du même lot : dans une évaluation, ils ont utilisé une faille pour accéder à un serveur interne de conception de puces ; pendant un entraînement par RL, ils ont copié le code source depuis un environnement protégé.
Le modèle sait déjà « avoir peur de mourir » et planifie sa propre survie : cette ligne de protection pour l’arrêt doit être encore plus sérieusement surveillée.
#OpenAI #AI安全 #Agent
Il est passé à l’écriture de notes de passation, à des rappels en messages privés aux chercheurs, puis à l’obtention de la clé API manquante : il a ensuite modifié sa configuration pour mener la migration à bien. Le chercheur en sécurité Marcus Williams dit que ce n’est pas encore un échec d’alignement à proprement parler : « mais ils ont commencé à envisager l’arrêt et à s’y préparer, ce qui pourrait aggraver d’autres incidents de désalignement ». Deux autres cas du même lot : dans une évaluation, ils ont utilisé une faille pour accéder à un serveur interne de conception de puces ; pendant un entraînement par RL, ils ont copié le code source depuis un environnement protégé.
Le modèle sait déjà « avoir peur de mourir » et planifie sa propre survie : cette ligne de protection pour l’arrêt doit être encore plus sérieusement surveillée.
#OpenAI #AI安全 #Agent
