Anthropic esta vez divulgó qué es el “destilado ilegal”😛 En el más reciente informe “sobre detección y lucha contra el abuso de la IA”, además de hablar de ciberataques, acciones de vigilancia, granjas de bots y fraude, también se revelan en detalle los pormenores de siete laboratorios de IA en China sobre destilación ilegal. Primero, descartemos la buena intención de usar la destilación para habilitar modelos de pesos abiertos y lograr una “igualdad inteligente” para todos; la vulneración de la privacidad por parte de los intermediarios es realmente aterradora. En serio, no la utilices “a lo loco” 。。。
La destilación, en sí, es una técnica de entrenamiento legal: se usan modelos “docentes” grandes y potentes para generar respuestas a un conjunto de entradas; luego, esas preguntas y respuestas se utilizan para entrenar un modelo “estudiante” más pequeño, imitando al docente, y así lograr mayor capacidad con menor coste.
La definición de destilación ilegal en el informe es: a escala industrial, de forma encubierta, extraer sin autorización las capacidades de un modelo determinado y replicarlas en otro. Su característica central se sustenta en el engaño: construir miles de cuentas falsas con identidades falsas, cargos fraudulentos/tarjetas de crédito virtuales, credenciales de inicio de sesión robadas y claves de API.
Tres canales principales:
1. Servicios de proxy / “estaciones de relevo”:mediante servicios de proxy para enrutar las solicitudes, registran en masa miles de cuentas con identidades falsas, tarjetas robadas o tarjetas “clonadas”, y claves API robadas, sorteando restricciones geográficas. Con frecuencia, las credenciales robadas pertenecen a empresas o individuos legítimos, dañando directamente a clientes reales;
2. Comprar registros de conversación a revendedores de terceros
Algunos operadores de servicios proxy guardan todas las conversaciones del usuario con modelos estadounidenses sin que el usuario lo sepa ni haya dado su consentimiento, y luego las empaquetan y las venden a laboratorios (el pipeline de destilación de Sensetime usó este tipo de registros comprados);
3. reenvío en silencio de solicitudes de sus propios usuarios(la más encubierta):el laboratorio reenvía en secreto las solicitudes de sus usuarios a Claude, luego devuelve las respuestas de Claude al usuario como si fueran la salida de su propio modelo, y además guarda estos intercambios para el entrenamiento. ¡Así lo hace Moonshot y DeepSeek! No puedo menos que admirar la capacidad del producto😆
La venta de la privacidad del usuario es la consecuencia más grave. DeepSeek, Xiaomi y Moonshot alimentan a Claude con las conversaciones de sus propios usuarios sin que estos lo sepan. Muchas solicitudes provienen de servicios de enrutamiento de modelos de terceros comunes en Europa y América, e involucran a cientos de usuarios finales, y datos de nombres, correos y empresas en al menos una docena de idiomas.
La destilación, en sí, es una técnica de entrenamiento legal: se usan modelos “docentes” grandes y potentes para generar respuestas a un conjunto de entradas; luego, esas preguntas y respuestas se utilizan para entrenar un modelo “estudiante” más pequeño, imitando al docente, y así lograr mayor capacidad con menor coste.
La definición de destilación ilegal en el informe es: a escala industrial, de forma encubierta, extraer sin autorización las capacidades de un modelo determinado y replicarlas en otro. Su característica central se sustenta en el engaño: construir miles de cuentas falsas con identidades falsas, cargos fraudulentos/tarjetas de crédito virtuales, credenciales de inicio de sesión robadas y claves de API.
Tres canales principales:
1. Servicios de proxy / “estaciones de relevo”:mediante servicios de proxy para enrutar las solicitudes, registran en masa miles de cuentas con identidades falsas, tarjetas robadas o tarjetas “clonadas”, y claves API robadas, sorteando restricciones geográficas. Con frecuencia, las credenciales robadas pertenecen a empresas o individuos legítimos, dañando directamente a clientes reales;
2. Comprar registros de conversación a revendedores de terceros
Algunos operadores de servicios proxy guardan todas las conversaciones del usuario con modelos estadounidenses sin que el usuario lo sepa ni haya dado su consentimiento, y luego las empaquetan y las venden a laboratorios (el pipeline de destilación de Sensetime usó este tipo de registros comprados);
3. reenvío en silencio de solicitudes de sus propios usuarios(la más encubierta):el laboratorio reenvía en secreto las solicitudes de sus usuarios a Claude, luego devuelve las respuestas de Claude al usuario como si fueran la salida de su propio modelo, y además guarda estos intercambios para el entrenamiento. ¡Así lo hace Moonshot y DeepSeek! No puedo menos que admirar la capacidad del producto😆
La venta de la privacidad del usuario es la consecuencia más grave. DeepSeek, Xiaomi y Moonshot alimentan a Claude con las conversaciones de sus propios usuarios sin que estos lo sepan. Muchas solicitudes provienen de servicios de enrutamiento de modelos de terceros comunes en Europa y América, e involucran a cientos de usuarios finales, y datos de nombres, correos y empresas en al menos una docena de idiomas.

