PrismML acaba de hacer una demostración técnica que podría cambiar la forma en que los dispositivos móviles —y, por extensión, las herramientas de cripto en el propio dispositivo y los dApps— interactúan con modelos de lenguaje de gran escala. ¿Qué ocurrió? - PrismML lanzó Bonsai 27B, un modelo de 27.000 millones de parámetros comprimido lo bastante como para ejecutarse en un smartphone. Un modelo 27B de precisión completa normalmente necesita aproximadamente 54 GB de memoria; la versión binaria de PrismML pesa 3,9 GB y su versión ternaria, 5,9 GB. - La variante binaria funciona a unos 11 tokens/seg en un iPhone 17 Pro Max; la versión ternaria alcanza ~26 tokens/seg en un portátil con M5 Pro. Ambas están disponibles de forma gratuita bajo la licencia Apache 2.0. Cómo lo comprimieron - La compresión se basa en la IP de Caltech y colapsa cada peso desde coma flotante de 16 bits hasta un solo signo en la versión binaria (+1 o −1), o hasta tres valores (−1, 0, +1) en la versión ternaria. - Grupos de 128 pesos comparten un factor de escala de 16 bits. Eso arroja un promedio de 1,125 bits por peso para el modelo binario (aprox. 14× más pequeño que el original de precisión completa) y 1,71 bits por peso para la versión ternaria. - A diferencia de muchas cuantizaciones de baja precisión, PrismML comprime todo de extremo a extremo —embeddings, atención y la cabeza del LM— en lugar de dejar “capas sensibles” en una precisión más alta. Por qué esto importa - No es solo un modelo más pequeño; es el comportamiento a escala (27B) comprimido en un formato que puede vivir en hardware de consumo. Esa escala es donde empiezan a aparecer de forma fiable el razonamiento de cadena de pensamiento largo, el uso consistente de herramientas y el comportamiento de agentes de varios pasos: capacidades que a menudo se pierden en modelos más pequeños. - El modelo usa un backbone híbrido de atención con ~75% de capas lineales en lugar de la atención cuadrática completa, lo que hace práctica una ventana de contexto de 262k tokens en el dispositivo —algo que una pila de atención convencional volvería prohibitivamente costoso en un teléfono. Resumen de rendimiento - PrismML ya había enviado Bonsai 8B (1,15 GB) en marzo, demostrando la arquitectura de 1 bit a menor escala. El salto a 27B es la prueba más importante. - En 15 benchmarks de “modo pensamiento” ejecutados en NVIDIA H100 (cubriendo conocimiento, matemáticas, programación, uso de herramientas), Bonsai 27B ternario promedió 80,49 —aprox. el 94,6% del modelo de precisión completa. La variante de 1 bit (binaria) obtuvo 76,11. - Frente a algunos modelos más grandes, Bonsai se defiende bien para su tamaño: en tests de matemáticas tipo AIME, el modelo ternario logra 93,7% frente a 95,3% para Qwen 3,6B; en puntuaciones de código, 86 frente a 88; y en conocimiento general, 77% frente a 83. El equipo afirma que, en términos globales, los resultados del benchmark son comparables de forma favorable con Gemma 4 y Qwen 3,6 en una métrica de capacidad para ese tamaño. Uso en el mundo real y herramientas para desarrolladores - PrismML incluye DSpark, una capa de decodificación especulativa que esboza bloques de tokens candidatos y los verifica en un solo pase forward. En GPUs H100, DSpark aportó un incremento de rendimiento de 1,37× sin pérdida de calidad; el soporte para Apple Silicon está en camino, pero aún no es predeterminado. - PrismML afirma que el modelo es práctico para tareas como la codificación iterativa y la escritura creativa en el dispositivo. Las pruebas independientes realizadas por los autores del artículo arrojaron resultados útiles: un juego de navegador orientado a un modo multijugador, “Zombie Type”, se construyó con dos rondas de prompts (colisiones, puntuación, gráficos), y la escritura creativa mostró una lógica interna y un ritmo consistentes —no necesariamente revolucionarios, pero sólidos para un modelo completamente local. Ángulos comerciales y del ecosistema - El CEO de PrismML, Babak Hassibi, le dijo a CNBC que la empresa está en conversaciones iniciales con Apple sobre la tecnología de compresión; se informa que lo siguiente sería un modelo comprimido de Gemma, seguido por construcciones de frontera más grandes. - Disponibilidad: Bonsai 27B de 1 bit es gratis para descargar ya bajo Apache 2.0. PrismML también publicó versiones anteriores de Bonsai y herramientas para desarrolladores; las instrucciones y una guía para ejecutar localmente están disponibles desde recursos de la comunidad. Por qué los interesados en cripto deberían prestar atención - Los LLMs en el dispositivo a esta escala abren posibilidades claras para cripto y web3: - Asistentes privados y offline para la gestión de carteras, orientación sobre firmas locales o explicación de transacciones sin enviar datos sensibles a APIs en la nube. - Mejoras en la UX para dApps móviles y carteras con interfaces de lenguaje natural locales y de baja latencia. - Nuevos flujos de trabajo para aplicaciones descentralizadas que quieren evitar dependencias de APIs centrales y reducir costos operativos. - No son productos cripto “listos para usar”, pero la dirección técnica —modelos potentes que se ejecutan localmente con huellas de memoria diminutas— elimina una fricción importante para herramientas privadas y auto-soberanas de custodia y para inteligencia nativa en el borde. Conclusión final Bonsai 27B no es solo otro modelo cuantizado: es una demostración de que los LLMs con más parámetros pueden comprimirse de extremo a extremo para ajustarse al hardware del consumidor sin una pérdida catastrófica de calidad. Para desarrolladores y proyectos cripto centrados en privacidad, auto-custodia e inteligencia en el dispositivo, este es un avance significativo —y se está lanzando bajo una licencia permisiva, así que la experimentación puede comenzar hoy. Lee más noticias de IA generada en: undefined/news