
El brazo de investigación de Tether acaba de darle al mundo de la IA mucha más tarea por delante. El conjunto de datos QVAC Genesis III, lanzado por Tether AI Research, reúne 191.43 mil millones de tokens de material de STEM diseñado para enseñar a modelos de IA más pequeños no solo a escupir respuestas, sino a explicar cómo llegaron a ellas. Es un movimiento destacable de una empresa mejor conocida por las stablecoins que por la investigación en aprendizaje automático, y señala una apuesta más amplia por una IA que funciona localmente en lugar de hacerlo en enormes centros de datos en la nube.
Puntos clave
Tether AI Research lanzó QVAC Genesis III, un conjunto de datos sintético de 191.43 mil millones de tokens que abarca 159.6 millones de documentos en 19 áreas de STEM.
El conjunto de datos utiliza dos métodos de entrenamiento, Análisis de Fallos y Razonamiento a Nivel de Opciones, para enseñar a los modelos a explicar errores y alternativas correctivas, no solo a dar respuestas finales.
Un modelo de 1,7 mil millones de parámetros entrenado con los datos de Nivel de Opciones alcanzó una tasa de respuestas válidas del 99,45% en pruebas de benchmark.
Genesis III mejoró el rendimiento en hasta 28,57 puntos porcentuales en ARC-Easy y 21,35 puntos en ARC-Challenge en comparación con modelos entrenados con el conjunto de datos Cosmopedia-v2.
El artículo de investigación fue aceptado para presentarse en la Conferencia sobre Modelado de Lenguaje (COLM) 2026.
Tether lanza QVAC Genesis III para impulsar el entrenamiento de IA en STEM
La idea central detrás del conjunto de datos QVAC Genesis III es simple de expresar pero difícil de ejecutar: los modelos más pequeños de IA pueden rendir mejor en problemas de ciencia y matemáticas si se entrenan con datos que muestran razonamiento, no solo respuestas correctas. Tether AI Research creó el conjunto de datos específicamente para cerrar esa brecha, apuntando a modelos que eventualmente pudieran ejecutarse en dispositivos comunes en lugar de depender de gran infraestructura cloud.
El conjunto de datos sintético amplía la cobertura de STEM
Genesis III no apareció de la nada. Se construye directamente sobre dos lanzamientos anteriores: Genesis I, publicado el 24 de octubre de 2025, y Genesis II, que siguió el 22 de diciembre de 2025. Según cifras citadas por Crypto Briefing, Genesis I contenía alrededor de 41 mil millones de tokens y Genesis II lo escaló hasta aproximadamente 148 mil millones. Genesis III impulsa el total del corpus a 191,43 mil millones de tokens distribuidos en 159,6 millones de documentos: un salto sustancial de escala en menos de un año.
El conjunto de datos abarca 19 áreas de STEM alineadas con el plan de estudios, que cubren material para secundaria, universidad y nivel profesional. Esto incluye biología, química, física, matemáticas, informática, medicina, astronomía, ingeniería eléctrica, estadística y aprendizaje automático. La amplitud es importante porque significa que, en teoría, el mismo conjunto de datos podría entrenar un tutor de IA que resuelva un problema de física en un momento y una pregunta de programación en el siguiente.
Presentación en conferencia y reconocimiento
El trabajo detrás de Genesis III ya superó un obstáculo académico. Al haber sido aceptado para presentarse en la Conferencia sobre Modelado de Lenguaje de 2026 (COLM), el artículo que detalla el conjunto de datos hará que Tether AI Research se una a otros investigadores de modelos de lenguaje en el escenario. Crypto Briefing también informó que un artículo de investigación que acompaña el lanzamiento se envió a arXiv el 17 de septiembre de 2026, brindando a investigadores externos una forma de comprobar las afirmaciones de manera independiente.
¿Por qué esto importa? La visibilidad entre pares en un entorno académico como COLM le da al conjunto de datos una capa de escrutinio que un lanzamiento típico de producto corporativo no tiene, y sugiere que Tether está posicionando Genesis III como una contribución de investigación tanto como una herramienta comercial.
Métodos de entrenamiento innovadores para enseñar razonamiento y explicación a la IA
Lo que distingue al conjunto de datos QVAC Genesis III de un conjunto de entrenamiento típico de preguntas y respuestas es cómo gestiona tanto los errores como las respuestas correctas. En lugar de simplemente emparejar una pregunta con una respuesta correcta, el conjunto de datos se construye en torno a dos técnicas destinadas a extraer más aprendizaje de cada problema.
Técnicas de Análisis de Fallos y Razonamiento a Nivel de Opciones
El primer método, llamado Análisis de Fallos, convierte los errores del modelo “estudiante” más pequeño en material de entrenamiento nuevo. Un modelo docente con más capacidad revisa en qué se descompuso el razonamiento del estudiante, explica la idea errónea detrás del fallo y luego resuelve la solución correcta paso a paso.
El segundo método, Razonamiento a Nivel de Opciones, funciona en preguntas en las que el modelo estudiante ya respondió correctamente. Aquí, el modelo docente explica no solo por qué la opción elegida es correcta, sino también por qué cada una de las demás opciones plausibles es incorrecta. Crypto Briefing describió este enfoque combinado como una “estrategia dual de destilación de docentes”, en la que tanto los aciertos como los fallos de un modelo más débil se convierten en material de enseñanza de diferentes maneras.
Los modelos aprenden a explicar más allá de las respuestas
En conjunto, ambos métodos buscan enseñar a los modelos algo que los datos de entrenamiento convencionales a menudo omiten: cómo reconocer razonamientos defectuosos y corregirlos, en lugar de solo memorizar patrones que producen la salida correcta. Esa distinción es central en la forma en que Tether plantea el lanzamiento.
“La mayor parte de la industria de la IA se ha centrado en hacer los modelos más grandes y darles más poder de cómputo. Genesis III muestra lo que puede pasar cuando, en su lugar, te enfocas en hacer que los modelos aprendan a partir de datos más pequeños, mejores”, dijo Paolo Ardoino, CEO de Tether. “Para STEM, eso significa enseñarle a un modelo más que la respuesta final. Significa enseñarle por qué algo está bien, dónde falló el razonamiento y cómo corregirlo. El objetivo es pasar de una IA útil basada en gran infraestructura cloud a los dispositivos que la gente ya tiene.”
Mejoras de rendimiento y beneficios de modelos de IA más pequeños y locales
El titular de los resultados de las pruebas de Tether es que los modelos entrenados con el conjunto de datos QVAC Genesis III superaron a los datos de entrenamiento abiertos comparables en benchmarks de razonamiento en STEM, y lo hicieron con una ventaja lo suficientemente amplia como para llamar la atención de investigadores independientes.
Mejora de rendimiento en benchmarks frente a otros conjuntos de datos
Un modelo de 1.700 millones de parámetros entrenado con los datos de Nivel de Opciones ofreció respuestas válidas en el 99,45% de las respuestas de los benchmarks. En comparación con un modelo que coincidía con tokens entrenado con Cosmopedia-v2, Genesis III mejoró el rendimiento en 28,57 puntos porcentuales en el benchmark ARC-Easy, 21,35 puntos en ARC-Challenge y 15,03 puntos en MMLU STEM. Crypto Briefing también señaló evaluaciones adicionales en GPQA Diamond y más subconjuntos de MMLU STEM que respaldaron la efectividad del conjunto de datos. El modelo preentrenado de Genesis III, según se informó, también superó a Cosmo-1B, un modelo más grande entrenado con datos adicionales de matemáticas y código, en los benchmarks que se probaron.
Esos números importan porque desafían una suposición común en el desarrollo de IA: que los modelos más grandes con más cómputo son el único camino hacia un mejor rendimiento. Aquí, un modelo relativamente pequeño de 1.700 millones de parámetros igualó o superó sistemas más grandes, simplemente debido a cómo fue entrenado.
La IA local habilita ventajas de privacidad y conectividad
Porque estos modelos más pequeños pueden ejecutarse localmente en lugar de depender de servidores remotos, las herramientas creadas a partir de Genesis III podrían funcionar en escuelas y comunidades donde la conectividad a internet es limitada o donde la privacidad es una preocupación. Para investigadores y profesionales, el mismo enfoque podría respaldar asistentes técnicos especializados que operen sin enviar de forma continua preguntas sensibles a un servidor externo.
Según Crypto Briefing, el conjunto de datos está disponible de forma gratuita en Hugging Face bajo la licencia Creative Commons CC-BY-NC 4.0, listado con el identificador qvac/GenesisIII, lo que lo hace accesible para cualquier investigador o desarrollador que quiera construir sobre él sin costo. Esa decisión de distribución encaja con la misión declarada de QVAC de promover Local AI y sistemas de inteligencia adaptativa descentralizada, un enfoque que favorece que la IA se ejecute en dispositivos individuales en lugar de concentrarse en centros de datos corporativos.
Esto también importa para el panorama más amplio de la IA. Si los modelos más pequeños y más baratos pueden rivalizar genuinamente con sistemas más grandes dependientes de la nube en tareas especializadas de STEM, podría desplazar parte de la presión competitiva en el desarrollo de IA desde el puro escalado de cómputo hacia la calidad de los datos y la metodología de entrenamiento, un argumento que Ardoino hace directamente en sus comentarios sobre el lanzamiento.
Preguntas frecuentes
¿Qué es QVAC Genesis III?
QVAC Genesis III es un conjunto de datos sintético de 191,43 mil millones de tokens lanzado por Tether AI Research para entrenar modelos de IA más pequeños para razonamiento en STEM.
¿Cómo mejora QVAC Genesis III el entrenamiento de IA para STEM?
Utiliza los métodos de Análisis de Fallos y Razonamiento a Nivel de Opciones para enseñar a los modelos de IA explicaciones más allá de solo respuestas, mejorando sus capacidades de razonamiento y corrección.
¿Qué beneficios ofrecen los modelos más pequeños entrenados con Genesis III?
Pueden ejecutarse localmente, lo que permite privacidad, mejor accesibilidad en entornos con conectividad deficiente y reduce la dependencia de gran infraestructura cloud.
¿Qué áreas de STEM abarca Genesis III?
Genesis III abarca 19 áreas del plan de estudios de STEM, incluyendo biología, química, física, matemáticas, informática y medicina.
Artículo producido con la asistencia de inteligencia artificial y revisado por el equipo editorial.
