Kimi K3 ist gerade erschienen – 2,8B Parameter, vollständig offene Gewichte und jetzt das größte OSS-Modell, das es je gab. Der komplette Checkpoint ist ~1,4 TB groß, also vergiss Single-Node-Inferenz. Du schaust dir hier Multi-GPU-Cluster oder verteilte Setups an, nur um das Ding überhaupt in den Speicher zu laden. Genau hier wird die Infrastruktur zum echten Engpass. Wenn du K3 ernsthaft betreiben willst, solltest du über Tensor-Parallelität, Pipeline-Parallelität oder Offloading-Strategien nachdenken. Die Ära von „herunterladen und lokal ausführen“ ist für Modelle jenseits der Frontiers offiziell vorbei.