A Tether disponibiliza um conjunto de dados sintéticos STEM para pequenos modelos. 99,45% conseguem extrair as respostas, não é taxa de acerto.
Em 23 de setembro, a Tether AI Research publicou o QVAC Genesis III, com 191,43 bilhões de Tokens e cerca de 159,6 milhões de documentos, cobrindo 19 áreas de ciências e engenharia, com dificuldade indo do nível do ensino médio até o profissional. A linha continua com o Genesis I de outubro de 2025 e o Genesis II de dezembro. Para as respostas erradas dos alunos, foram escritas correções; para as respostas certas, foi explicado por que cada alternativa está certa e por que está errada. O que será treinado é um modelo pequeno que possa rodar em notebooks, celulares e servidores locais, com foco em explicar o caminho de resolução.
Entre os modelos com 1,7 bilhão de parâmetros treinados do zero, a taxa de respostas efetivas no MMLU STEM para dados no nível de alternativa é de 99,45%. Em comparação, o Cosmopedia-v2, com um tamanho de corpus completo equivalente ao de Tokens, apresenta acertos de 51,85 no ARC-Easy, 42,71 no ARC-Challenge e 30,19 no MMLU STEM, superando em 28,57, 21,35 e 15,03 pontos percentuais, respectivamente.
Os dados são disponibilizados sob CC-BY-NC 4.0, ou seja, não são utilizáveis para fins comerciais. O artigo já foi aceito pela COLM 2026.
Em 23 de setembro, a Tether AI Research publicou o QVAC Genesis III, com 191,43 bilhões de Tokens e cerca de 159,6 milhões de documentos, cobrindo 19 áreas de ciências e engenharia, com dificuldade indo do nível do ensino médio até o profissional. A linha continua com o Genesis I de outubro de 2025 e o Genesis II de dezembro. Para as respostas erradas dos alunos, foram escritas correções; para as respostas certas, foi explicado por que cada alternativa está certa e por que está errada. O que será treinado é um modelo pequeno que possa rodar em notebooks, celulares e servidores locais, com foco em explicar o caminho de resolução.
Entre os modelos com 1,7 bilhão de parâmetros treinados do zero, a taxa de respostas efetivas no MMLU STEM para dados no nível de alternativa é de 99,45%. Em comparação, o Cosmopedia-v2, com um tamanho de corpus completo equivalente ao de Tokens, apresenta acertos de 51,85 no ARC-Easy, 42,71 no ARC-Challenge e 30,19 no MMLU STEM, superando em 28,57, 21,35 e 15,03 pontos percentuais, respectivamente.
Os dados são disponibilizados sob CC-BY-NC 4.0, ou seja, não são utilizáveis para fins comerciais. O artigo já foi aceito pela COLM 2026.

