Um modelo com 125 bilhões de parâmetros agora roda em GPUs para consumidores a 94–140 tokens/s.
O Strata foi lançado esta semana: um mecanismo de inferência de código aberto, licenciado sob MIT, que distribui o Qwen3.8-Flash-Next entre a VRAM, a RAM do sistema e o SSD. O truque combina o descarregamento de camadas de especialistas com decodificação especulativa: os especialistas mais usados ficam na VRAM, os menos usados são carregados da RAM, as tabelas de consulta ficam no SSD, e um pequeno modelo preliminar prevê os próximos tokens para o modelo grande verificar de uma só vez.
Benchmarks em hardware real:
• RTX 5070 (12 GB de VRAM, 64 GB de RAM): 94 tokens/s na geração, mais de 2.000 tokens/s no processamento do prompt
• RTX 4090 (24 GB de VRAM, 128 GB de RAM): 124 tokens/s
• RX 9070 XT (12 GB de VRAM): 60 tokens/s
Requisitos mínimos: 12 GB de VRAM, 32 GB de RAM, 80 GB de SSD. Funciona com GeForce RTX 20/30/40/50 ou Radeon RX 6000/7000/9000. Windows ou Linux. API compatível com OpenAI em localhost:1234 e compatível com Anthropic em /v1/messages.
As opções de quantização variam conforme a RAM disponível: 32 GB permitem usar a versão Coder (metade dos especialistas, otimizada para código), 64 GB permitem rodar IQ2_XS ou IQ3_S, e 96 GB ou mais liberam as versões completas do Unsloth. Na primeira inicialização, dezenas de GB são carregados na RAM e o sistema pode congelar por 1–3 minutos — isso é normal.
Uso prático: aponte qualquer ferramenta compatível com a API da OpenAI para seu endpoint local. Sem medição de uso, sem limites de taxa e sem que os dados saiam da máquina. Agora você pode rodar uma configuração multiagente (CEO/engenheiro/pesquisador/arquivista/faz-tudo) em um único PC gamer, com um modelo da mesma categoria de tamanho que as variantes hospedadas do GPT-4.
A compressão sacrifica um pouco da qualidade em troca de velocidade, e o uso intenso de paginação vai deixar tudo mais lento se a RAM for insuficiente. Mas o limite acaba de mudar: modelos com quantidade de parâmetros de nível servidor em hardware de desktop, hoje e de graça.
Repositório: github.com/stratadotai/strata
Licença: MIT para o Strata; o modelo e as versões quantizadas têm licenças separadas — leia-as antes de usar em produção.
O Strata foi lançado esta semana: um mecanismo de inferência de código aberto, licenciado sob MIT, que distribui o Qwen3.8-Flash-Next entre a VRAM, a RAM do sistema e o SSD. O truque combina o descarregamento de camadas de especialistas com decodificação especulativa: os especialistas mais usados ficam na VRAM, os menos usados são carregados da RAM, as tabelas de consulta ficam no SSD, e um pequeno modelo preliminar prevê os próximos tokens para o modelo grande verificar de uma só vez.
Benchmarks em hardware real:
• RTX 5070 (12 GB de VRAM, 64 GB de RAM): 94 tokens/s na geração, mais de 2.000 tokens/s no processamento do prompt
• RTX 4090 (24 GB de VRAM, 128 GB de RAM): 124 tokens/s
• RX 9070 XT (12 GB de VRAM): 60 tokens/s
Requisitos mínimos: 12 GB de VRAM, 32 GB de RAM, 80 GB de SSD. Funciona com GeForce RTX 20/30/40/50 ou Radeon RX 6000/7000/9000. Windows ou Linux. API compatível com OpenAI em localhost:1234 e compatível com Anthropic em /v1/messages.
As opções de quantização variam conforme a RAM disponível: 32 GB permitem usar a versão Coder (metade dos especialistas, otimizada para código), 64 GB permitem rodar IQ2_XS ou IQ3_S, e 96 GB ou mais liberam as versões completas do Unsloth. Na primeira inicialização, dezenas de GB são carregados na RAM e o sistema pode congelar por 1–3 minutos — isso é normal.
Uso prático: aponte qualquer ferramenta compatível com a API da OpenAI para seu endpoint local. Sem medição de uso, sem limites de taxa e sem que os dados saiam da máquina. Agora você pode rodar uma configuração multiagente (CEO/engenheiro/pesquisador/arquivista/faz-tudo) em um único PC gamer, com um modelo da mesma categoria de tamanho que as variantes hospedadas do GPT-4.
A compressão sacrifica um pouco da qualidade em troca de velocidade, e o uso intenso de paginação vai deixar tudo mais lento se a RAM for insuficiente. Mas o limite acaba de mudar: modelos com quantidade de parâmetros de nível servidor em hardware de desktop, hoje e de graça.
Repositório: github.com/stratadotai/strata
Licença: MIT para o Strata; o modelo e as versões quantizadas têm licenças separadas — leia-as antes de usar em produção.
