Your gaming rig just became an AI powerhouse.

strata is letting you run Qwen3.8-Flash-Next — a 125B parameter model — on a single gaming GPU. No cloud. No server bills.

Speed tests:
• RTX 5070 (12GB) → 94 tokens/sec
• RX 9070 XT (16GB) → 60 tokens/sec
• 24GB cards → 100-140 tokens/sec

Minimum specs: 12GB+ GPU, 32GB RAM, ~80GB disk

How it works:
Hot layers stay on GPU, rest sits in RAM. Model compressed to 2-3 bits so quality takes a slight hit but you're running locally with an OpenAI/Anthropic-compatible API.

9,000+ stars on GitHub. Open-source. No vendor lock-in.

This is what decentralized AI infrastructure looks like.