Tether déploie un ensemble de données synthétiques STEM destiné aux petits modèles. 99,45% des réponses permettent d’extraire la réponse, ce n’est pas un taux de réussite.
Le 23 septembre, Tether AI Research a publié QVAC Genesis III, avec 191,43 milliards de tokens et environ 159,6 millions de documents, couvrant 19 domaines des sciences et de l’ingénierie, avec des difficultés allant du niveau lycée au niveau professionnel. La feuille de route poursuit Genesis I d’octobre 2025 et Genesis II de décembre. Quand les étudiants se trompent, leurs erreurs sont rédigées sous forme de correction ; quand ils ont raison, il est indiqué pour chaque option pourquoi elle est correcte et pourquoi elle ne l’est pas. Le but est d’entraîner des petits modèles capables de tourner sur un ordinateur portable, un téléphone et un serveur local, avec un accent sur l’explication du chemin de résolution.
Parmi les modèles de 1,7 milliard de paramètres entraînés de zéro, le taux de réponses valides au niveau de l’option sur MMLU STEM atteint 99,45%. Sur le corpus complet, qui correspond à une échelle de tokens comparable à celle de Cosmopedia-v2, les scores pour ARC-Easy, ARC-Challenge et MMLU STEM atteignent respectivement 51,85, 42,71 et 30,19, soit des gains de 28,57, 21,35 et 15,03 points.
Les données sont publiées sous CC-BY-NC 4.0, utilisables à des fins non commerciales. L’article a été accepté par COLM 2026.
Le 23 septembre, Tether AI Research a publié QVAC Genesis III, avec 191,43 milliards de tokens et environ 159,6 millions de documents, couvrant 19 domaines des sciences et de l’ingénierie, avec des difficultés allant du niveau lycée au niveau professionnel. La feuille de route poursuit Genesis I d’octobre 2025 et Genesis II de décembre. Quand les étudiants se trompent, leurs erreurs sont rédigées sous forme de correction ; quand ils ont raison, il est indiqué pour chaque option pourquoi elle est correcte et pourquoi elle ne l’est pas. Le but est d’entraîner des petits modèles capables de tourner sur un ordinateur portable, un téléphone et un serveur local, avec un accent sur l’explication du chemin de résolution.
Parmi les modèles de 1,7 milliard de paramètres entraînés de zéro, le taux de réponses valides au niveau de l’option sur MMLU STEM atteint 99,45%. Sur le corpus complet, qui correspond à une échelle de tokens comparable à celle de Cosmopedia-v2, les scores pour ARC-Easy, ARC-Challenge et MMLU STEM atteignent respectivement 51,85, 42,71 et 30,19, soit des gains de 28,57, 21,35 et 15,03 points.
Les données sont publiées sous CC-BY-NC 4.0, utilisables à des fins non commerciales. L’article a été accepté par COLM 2026.

