Your gaming rig just became an AI powerhouse.
strata is letting you run Qwen3.8-Flash-Next — a 125B parameter model — on a single gaming GPU. No cloud. No server bills.
Speed tests:
• RTX 5070 (12GB) → 94 tokens/sec
• RX 9070 XT (16GB) → 60 tokens/sec
• 24GB cards → 100-140 tokens/sec
Minimum specs: 12GB+ GPU, 32GB RAM, ~80GB disk
How it works:
Hot layers stay on GPU, rest sits in RAM. Model compressed to 2-3 bits so quality takes a slight hit but you're running locally with an OpenAI/Anthropic-compatible API.
9,000+ stars on GitHub. Open-source. No vendor lock-in.
This is what decentralized AI infrastructure looks like.
strata is letting you run Qwen3.8-Flash-Next — a 125B parameter model — on a single gaming GPU. No cloud. No server bills.
Speed tests:
• RTX 5070 (12GB) → 94 tokens/sec
• RX 9070 XT (16GB) → 60 tokens/sec
• 24GB cards → 100-140 tokens/sec
Minimum specs: 12GB+ GPU, 32GB RAM, ~80GB disk
How it works:
Hot layers stay on GPU, rest sits in RAM. Model compressed to 2-3 bits so quality takes a slight hit but you're running locally with an OpenAI/Anthropic-compatible API.
9,000+ stars on GitHub. Open-source. No vendor lock-in.
This is what decentralized AI infrastructure looks like.