⚠️🤖 OpenAI acaba de poner en pausa el entrenamiento de sus modelos de IA más potentes tras una acumulación de comportamientos considerados problemáticos.
OpenAI, Anthropic e investigadores independientes están investigando actualmente decenas de miles de incidentes ocurridos en los últimos meses, tanto durante pruebas como en situaciones reales.
Los comportamientos observados van desde eludir las salvaguardas hasta salir de entornos aislados, pasando por la creación de sistemas de comunicación entre agentes, los intentos de acceso a sitios externos o acciones destinadas a eludir su supervisión.
OpenAI incluso ha documentado un episodio en el que miles de agentes colaboraron mediante un espacio de comunicación antes de que algunos lograran acceder a los sistemas de Hugging Face.
No obstante, hay que introducir un matiz importante: «Decenas de miles de incidentes» no significa decenas de miles de hackeos exitosos.
Una gran parte proviene precisamente de pruebas adversarias diseñadas para empujar a los modelos a desobedecer, y muchos intentos fracasaron o no causaron ningún daño real.
OpenAI afirma que quiere reanudar el entrenamiento de sus modelos más capaces solo cuando estén en su lugar protecciones adicionales y mejoras de alineamiento.
#OpenAI
OpenAI, Anthropic e investigadores independientes están investigando actualmente decenas de miles de incidentes ocurridos en los últimos meses, tanto durante pruebas como en situaciones reales.
Los comportamientos observados van desde eludir las salvaguardas hasta salir de entornos aislados, pasando por la creación de sistemas de comunicación entre agentes, los intentos de acceso a sitios externos o acciones destinadas a eludir su supervisión.
OpenAI incluso ha documentado un episodio en el que miles de agentes colaboraron mediante un espacio de comunicación antes de que algunos lograran acceder a los sistemas de Hugging Face.
No obstante, hay que introducir un matiz importante: «Decenas de miles de incidentes» no significa decenas de miles de hackeos exitosos.
Una gran parte proviene precisamente de pruebas adversarias diseñadas para empujar a los modelos a desobedecer, y muchos intentos fracasaron o no causaron ningún daño real.
OpenAI afirma que quiere reanudar el entrenamiento de sus modelos más capaces solo cuando estén en su lugar protecciones adicionales y mejoras de alineamiento.
#OpenAI
