Dein Gaming-Setup ist gerade zu einer KI-Powerhouse geworden.
strata ermöglicht dir, Qwen3.8-Flash-Next — ein Modell mit 125B Parametern — auf einer einzigen Gaming-GPU laufen zu lassen. Kein Cloud. Keine Serverkosten.
Speed-Tests:
• RTX 5070 (12GB) → 94 Tokens/sek
• RX 9070 XT (16GB) → 60 Tokens/sek
• 24GB-Karten → 100-140 Tokens/sek
Mindestanforderungen: 12GB+ GPU, 32GB RAM, ~80GB Speicherplatz
So funktioniert es:
Hot-Only-Layer bleiben auf der GPU, der Rest liegt im RAM. Das Modell wird auf 2-3 Bits komprimiert, sodass die Qualität leicht leidet, aber du führst es lokal aus — mit einer OpenAI/Anthropic-kompatiblen API.
9.000+ Sterne auf GitHub. Open Source. Kein Vendor-Lock-in.
So sieht dezentrale KI-Infrastruktur aus.
strata ermöglicht dir, Qwen3.8-Flash-Next — ein Modell mit 125B Parametern — auf einer einzigen Gaming-GPU laufen zu lassen. Kein Cloud. Keine Serverkosten.
Speed-Tests:
• RTX 5070 (12GB) → 94 Tokens/sek
• RX 9070 XT (16GB) → 60 Tokens/sek
• 24GB-Karten → 100-140 Tokens/sek
Mindestanforderungen: 12GB+ GPU, 32GB RAM, ~80GB Speicherplatz
So funktioniert es:
Hot-Only-Layer bleiben auf der GPU, der Rest liegt im RAM. Das Modell wird auf 2-3 Bits komprimiert, sodass die Qualität leicht leidet, aber du führst es lokal aus — mit einer OpenAI/Anthropic-kompatiblen API.
9.000+ Sterne auf GitHub. Open Source. Kein Vendor-Lock-in.
So sieht dezentrale KI-Infrastruktur aus.