
Le bras de recherche de Tether vient de donner au monde de l’IA bien plus d’exercices à résoudre. Le jeu de données QVAC Genesis III, publié par Tether AI Research, regroupe 191,43 milliards de tokens de contenus liés au STEM, conçus pour apprendre à de plus petits modèles d’IA non seulement à fournir des réponses, mais aussi à expliquer comment ils y sont parvenus. C’est une démarche notable de la part d’une entreprise davantage connue pour ses stablecoins que pour la recherche en apprentissage automatique, et elle témoigne d’un pari plus large sur une IA qui s’exécute localement plutôt que dans d’immenses centres de données cloud.
Points clés
Tether AI Research a publié QVAC Genesis III, un jeu de données synthétique de 191,43 milliards de tokens, couvrant 159,6 millions de documents répartis sur 19 domaines du STEM.
Le jeu de données utilise deux méthodes d’entraînement, Failure Analysis et Option-Level Reasoning, pour apprendre aux modèles à expliquer les erreurs et à corriger les alternatives, plutôt que de se limiter à fournir des réponses finales.
Un modèle de 1,7 milliard de paramètres entraîné sur les données de raisonnement au niveau des options a atteint un taux de réponses valides de 99,45 % lors de tests de benchmark.
Genesis III a amélioré les performances de jusqu’à 28,57 points de pourcentage sur ARC-Easy et 21,35 points sur ARC-Challenge, par rapport à des modèles entraînés sur le jeu de données Cosmopedia-v2.
L’article de recherche a été accepté pour présentation à la Conférence sur le modélisme linguistique (COLM) 2026.
Tether publie QVAC Genesis III pour faire avancer l’entraînement IA STEM
L’idée centrale derrière le jeu de données QVAC Genesis III est simple à énoncer, mais difficile à mettre en œuvre : des modèles d’IA plus petits peuvent mieux réussir sur des problèmes de science et de mathématiques s’ils sont entraînés sur des données qui montrent le raisonnement, et pas seulement des réponses correctes. Tether AI Research a construit ce jeu de données spécifiquement pour combler cet écart, en ciblant des modèles qui pourraient éventuellement fonctionner sur des appareils ordinaires plutôt que de dépendre de grandes infrastructures cloud.
Un jeu de données synthétique élargit la couverture STEM
Genesis III n’est pas apparu de nulle part. Il s’appuie directement sur deux sorties précédentes : Genesis I, publiée le 24 octobre 2025, et Genesis II, suivie le 22 décembre 2025. D’après des chiffres cités par Crypto Briefing, Genesis I contenait environ 41 milliards de tokens et Genesis II a fait passer ce total à environ 148 milliards. Genesis III pousse le corpus total à 191,43 milliards de tokens répartis sur 159,6 millions de documents : un saut d’ampleur significatif en moins d’un an.
Le jeu de données couvre 19 domaines STEM alignés sur les programmes, avec du contenu de niveau lycée, licence et professionnel. Cela inclut la biologie, la chimie, la physique, les mathématiques, l’informatique, la médecine, l’astronomie, le génie électrique, les statistiques et l’apprentissage automatique. L’ampleur compte car elle signifie qu’en théorie, le même jeu de données pourrait entraîner un tuteur IA capable de gérer un problème de physique un instant, puis une question de programmation le suivant.
Présentation en conférence et reconnaissance
Le travail à l’origine de Genesis III a déjà franchi une étape académique. Accepté pour présentation à la Conférence 2026 sur le modélisme linguistique (COLM), l’article détaillant le jeu de données verra Tether AI Research rejoindre d’autres chercheurs en modèles de langage sur scène. Crypto Briefing a aussi indiqué qu’un article de recherche accompagnant la sortie avait été soumis à arXiv le 17 septembre 2026, offrant ainsi aux chercheurs externes un moyen de vérifier les affirmations de manière indépendante.
Pourquoi est-ce important ? La visibilité par les pairs dans un cadre académique comme COLM donne au jeu de données une couche de contrôle que ne reçoit pas un lancement de produit d’entreprise typique, et cela suggère que Tether positionne Genesis III comme une contribution à la recherche autant que comme un outil commercial.
Méthodes d’entraînement innovantes pour apprendre à l’IA le raisonnement et l’explication
Ce qui distingue le jeu de données QVAC Genesis III d’un jeu d’entraînement classique question-réponse, c’est la manière dont il gère à la fois les erreurs et les réponses correctes. Au lieu de simplement associer une question à une bonne réponse, le jeu de données est construit autour de deux techniques conçues pour faire extraire davantage d’apprentissage de chaque problème.
Techniques d’analyse des échecs et de raisonnement au niveau des options
La première méthode, appelée Failure Analysis (analyse des échecs), transforme les erreurs d’un modèle « étudiant » plus petit en une nouvelle matière d’entraînement. Un modèle enseignant plus capable examine où le raisonnement de l’étudiant s’est dégradé, explique la méprise derrière l’erreur, puis résout correctement étape par étape.
La deuxième méthode, Option-Level Reasoning (raisonnement au niveau des options), s’applique à des questions auxquelles le modèle étudiant a déjà répondu correctement. Ici, le modèle enseignant explique non seulement pourquoi la réponse choisie est juste, mais aussi pourquoi chacune des autres options plausibles est fausse. Crypto Briefing a décrit cette approche combinée comme une « stratégie de double distillation enseignant-élève », où les réussites et les échecs d’un modèle plus faible deviennent, chacun à leur manière, du matériel pédagogique.
Les modèles apprennent à expliquer au-delà des réponses
Ensemble, ces deux méthodes visent à apprendre aux modèles quelque chose que les données d’entraînement classiques omettent souvent : reconnaître un raisonnement erroné et le corriger, plutôt que simplement mémoriser des schémas qui produisent la bonne sortie. Cette distinction est au cœur de la façon dont Tether présente la sortie.
« La plupart de l’industrie de l’IA s’est concentrée sur le fait de rendre les modèles plus grands et de leur fournir davantage de puissance de calcul. Genesis III montre ce qui peut se produire quand on choisit plutôt de rendre les modèles apprenants plus petits et de leur faire apprendre à partir de meilleures données », a déclaré Paolo Ardoino, PDG de Tether. « Pour la STEM, cela signifie enseigner à un modèle plus que la réponse finale. Il s’agit de lui apprendre pourquoi quelque chose est juste, où le raisonnement a échoué, et comment le corriger. L’objectif est de transférer une IA utile des grandes infrastructures cloud vers les appareils dont les gens disposent déjà. »
Gains de performance et bénéfices de modèles d’IA plus petits et fonctionnant localement
Le résultat principal des tests de Tether est que les modèles entraînés sur le jeu de données QVAC Genesis III ont surpassé des données d’entraînement open source comparables sur des benchmarks de raisonnement STEM, avec un écart suffisamment important pour attirer l’attention de chercheurs indépendants.
Dépassement en benchmarks par rapport à d’autres jeux de données
Un modèle de 1,7 milliard de paramètres entraîné sur les données de raisonnement au niveau des options a fourni des réponses valides dans 99,45 % des résultats de benchmark. Par rapport à un modèle dont les tokens correspondent, entraîné sur Cosmopedia-v2, Genesis III a amélioré les performances de 28,57 points de pourcentage sur le benchmark ARC-Easy, de 21,35 points sur ARC-Challenge et de 15,03 points sur MMLU STEM. Crypto Briefing a également noté des évaluations supplémentaires sur GPQA Diamond et d’autres sous-ensembles de MMLU STEM qui ont étayé l’efficacité du jeu de données. Le modèle préentraîné de Genesis III aurait aussi surpassé Cosmo-1B, un modèle plus grand entraîné avec des données supplémentaires de mathématiques et de code, sur l’ensemble des benchmarks testés.
Ces chiffres comptent parce qu’ils remettent en question une hypothèse courante dans le développement de l’IA : que seuls des modèles plus grands, avec davantage de calcul, mènent à de meilleures performances. Ici, un modèle relativement petit de 1,7 milliard de paramètres a égalé ou surpassé des systèmes plus grands, simplement grâce à la façon dont il a été entraîné.
L’IA locale permet des avantages en matière de confidentialité et de connectivité
Parce que ces modèles plus petits peuvent fonctionner localement plutôt que de dépendre de serveurs distants, les outils construits à partir de Genesis III pourraient être utilisés dans les écoles et les communautés où la connectivité Internet est limitée ou lorsque la confidentialité est une préoccupation. Pour les chercheurs et les professionnels, la même approche pourrait aider à créer des assistants techniques spécialisés capables de fonctionner sans envoyer en continu des questions sensibles à un serveur externe.
D’après Crypto Briefing, le jeu de données est disponible gratuitement sur Hugging Face sous licence Creative Commons CC-BY-NC 4.0, répertorié sous l’identifiant qvac/GenesisIII, ce qui le rend accessible à tout chercheur ou développeur qui souhaite s’appuyer dessus sans coût. Ce choix de diffusion correspond à la mission déclarée de QVAC qui vise à promouvoir le Local AI et des systèmes d’intelligence adaptative décentralisée : une approche qui privilégie une IA fonctionnant sur des appareils individuels plutôt que la concentration dans des centres de données d’entreprise.
Cela compte aussi pour le paysage plus large de l’IA. Si des modèles plus petits et moins coûteux peuvent réellement rivaliser avec des systèmes plus grands dépendants du cloud sur des tâches STEM spécialisées, cela pourrait déplacer une partie de la pression concurrentielle dans le développement de l’IA, du simple volume de calcul vers la qualité des données et la méthodologie d’entraînement — un argument qu’Ardoino formule directement dans ses commentaires sur la sortie.
FAQ
Qu’est-ce que QVAC Genesis III ?
QVAC Genesis III est un jeu de données synthétique de 191,43 milliards de tokens publié par Tether AI Research pour entraîner des modèles d’IA plus petits au raisonnement STEM.
Comment QVAC Genesis III améliore-t-il l’entraînement de l’IA pour la STEM ?
Il utilise les méthodes Failure Analysis (analyse des échecs) et Option-Level Reasoning (raisonnement au niveau des options) pour enseigner aux modèles d’IA des explications allant au-delà des simples réponses, en améliorant leurs capacités de raisonnement et de correction.
Quels avantages les modèles plus petits entraînés sur Genesis III offrent-ils ?
Ils peuvent fonctionner localement, ce qui permet la confidentialité, une meilleure accessibilité dans des environnements où la connectivité est difficile, et réduit la dépendance à de grandes infrastructures cloud.
Quels domaines de la STEM sont couverts par Genesis III ?
Genesis III couvre 19 domaines du programme de STEM, incluant la biologie, la chimie, la physique, les mathématiques, l’informatique et la médecine.
Article produit avec l’assistance de l’intelligence artificielle et relu par l’équipe éditoriale.
