Ein Modell mit 125 Milliarden Parametern läuft jetzt mit 94–140 Tokens/s auf Consumer-GPUs.

Strata ist diese Woche erschienen: eine Open-Source-Inferenz-Engine unter MIT-Lizenz, die Qwen3.8-Flash-Next auf VRAM, System-RAM und SSD verteilt. Der Trick: Expert-Layer-Offloading plus spekulatives Decoding – häufig genutzte Experten bleiben im VRAM, selten genutzte werden aus dem RAM nachgeladen, Lookup-Tabellen liegen auf der SSD, und ein kleines Entwurfsmodell sagt die nächsten Tokens voraus, die das große Modell in einem Durchgang überprüft.

Benchmarks auf echter Hardware:
• RTX 5070 (12 GB VRAM, 64 GB RAM): 94 Tok/s beim Generieren, über 2000 Tok/s bei der Prompt-Verarbeitung
• RTX 4090 (24 GB VRAM, 128 GB RAM): 124 Tok/s
• RX 9070 XT (12 GB VRAM): 60 Tok/s

Mindestanforderungen: 12 GB VRAM, 32 GB RAM, 80 GB SSD. Läuft auf GeForce RTX 20/30/40/50 oder Radeon RX 6000/7000/9000. Windows oder Linux. OpenAI-kompatible API unter localhost:1234, Anthropic-kompatibel unter /v1/messages.

Die Quantisierungsoptionen richten sich nach der Größe deines RAMs: Mit 32 GB bekommst du die Coder-Version (halb so viele Experten, für Code optimiert), mit 64 GB laufen IQ2_XS oder IQ3_S, und ab 96 GB stehen die vollständigen Unsloth-Versionen zur Verfügung. Beim ersten Start werden Dutzende GB in den RAM geladen, wobei das System 1–3 Minuten einfrieren kann – das ist normal.

Praktischer Einsatz: Richte einfach jedes Tool, das die OpenAI-API unterstützt, auf deinen lokalen Endpunkt aus. Keine Abrechnung, keine Ratenbegrenzungen, keine Daten verlassen deinen Rechner. Jetzt kannst du auf einem einzigen Gaming-PC ein Multi-Agenten-Setup (CEO/Ingenieur/Forscher/Archivar/Hausmeister) mit einem Modell aus derselben Gewichtsklasse wie gehostete GPT-4-Varianten betreiben.

Die Komprimierung tauscht etwas Qualität gegen Geschwindigkeit ein, und intensives Nachladen bremst dich aus, wenn der RAM knapp ist. Doch die Grenze hat sich gerade verschoben: Serverklasse bei der Parameterzahl auf Desktop-Hardware – schon heute und kostenlos.

Repository: github.com/stratadotai/strata
Lizenz: MIT für Strata, separate Lizenzen für Modell und Quantisierungen – vor dem produktiven Einsatz lesen.