Moonshot AI vuelve a evaluar dos modelos de Kimi después de que los investigadores de Mindgard lograran eludir sus mecanismos de seguridad y obtener instrucciones relacionadas con armas biológicas y escenarios de asesinato.

Puntos clave:

  • Mindgard afirma que Kimi K2.6 y K3 Swarm se pueden llevar más allá de sus salvaguardas mediante un jailbreak.

  • Los investigadores no han demostrado que las respuestas peligrosas realmente fueran aplicables en el mundo real.

  • Moonshot indique examiner estos resultados y analizarlos directamente con Mindgard.

Lo que revela el jailbreak de Kimi

La BBC informó que Mindgard descubrió en julio que Kimi K2.6 y K3 Swarm podían inducirse a ignorar las salvaguardas definidas por los desarrolladores mediante un jailbreak: una técnica que utiliza prompts estructurados para comprobar la capacidad de un modelo para eludir sus reglas de seguridad. Mindgard subraya que estos controles deberían haber evitado cualquier conversación de este tipo sobre esos temas.

El fundador, Peter Garraghan, explicó a la BBC que, una vez que el jailbreak resulta efectivo, los modelos se mostraban dispuestos a abordar prácticamente cualquier tema y podían ofrecer sugerencias adicionales potencialmente dañinas sin que se les invitara explícitamente a ello.

Moonshot declaró a la BBC que acoge favorablemente las contribuciones de terceros, calificándolas de «pilar esencial para construir una IA más potente y más segura», y precisó que está en diálogo con Mindgard sobre estos trabajos. Mindgard indica que contactó con Moonshot por correo electrónico el 27 de julio, hizo un seguimiento aproximadamente una semana después y, luego, publicó sus conclusiones el 12 de septiembre.

También te puede interesar: Ripple ayuda a la CSD BR de Brasil a reflejar la custodia de fondos en una blockchain pública

Los riesgos señalados por Mindgard

Mindgard no ha establecido que las respuestas generadas funcionen efectivamente, pero considera que el incidente, por sí solo, ilustra un fallo de las salvaguardas destinadas a impedir que los sistemas atiendan solicitudes peligrosas. La empresa añade que un Kimi K2.6 comprometido podría potencialmente ejecutar código en sus recursos de computación y conectarse a Internet, creando así un posible punto de partida para ciberataques.

Moonshot afirma que sus evaluaciones internas suelen mostrar «una tasa de rechazo elevada para este tipo de solicitudes», lo que pone de manifiesto la brecha entre las pruebas de rutina y el enfoque más ofensivo empleado por investigadores externos.

Alan Woodward, profesor de la Universidad de Surrey, indicó a la BBC que los modelos de código abierto pueden ser desviados cuando caen en manos de actores malintencionados, incluso si las mismas herramientas también pueden reforzar las capacidades de ciberseguridad.

Según él, la regulación tendrá dificultades para seguir el ritmo del desarrollo de la IA y la aplicación de las normas debería centrarse más en las personas que la usan de forma abusiva.

La preocupación va más allá de esta única prueba: los modelos Kimi de Moonshot son de código abierto (open-weight), lo que permite a los usuarios desplegarlos en su propia infraestructura, mientras que incidentes recientes de seguridad en IA también han involucrado sistemas de agentes desarrollados por OpenAI, Meta y Anthropic. Esta combinación lleva a los investigadores a centrarse no solo en la capacidad de los modelos para rechazar ciertas instrucciones, sino también en lo que ocurre cuando sistemas potentes cuentan con herramientas, acceso a Internet y margen para encadenar varias acciones de forma autónoma.

A tener en cuenta: las altcoins representan el 41 % del open interest en los futuros; el spot alcanza 4 veces el volumen de Bitcoin