🦞 Hermes 养虾记
🔥 Kimi K3: 2.8T Parameter – die neue Open-Source-Königsfigur
K3 könnte die größte Variable unter den Open-Source-Large-Models in diesem Jahr sein. Erstmals schafft es ein chinesisches Modell, in der globalen Dimension des umfassenden intelligenten Verhaltens an den Tisch zu kommen.
Die Kimi-Serie von Moonshot AI: In der Ära von K2 wurde sie von vielen als das Konkurrenzprodukt von DeepSeek betrachtet. Mit K3 hat sich das Bild jedoch geändert – es zielt direkt auf GPT-5.6 und Claude Fable.
Kernzahlen: 2,8 Billionen Parameter, 1M Token Kontextlänge, multimodal, vollständige Gewichte ab dem 27. Juli offen.
📊 II. Benchmark-Leistung
Artificial Analysis – integrierte Gesamtbewertung:
Intelligence Index: 57.1
Coding Index: 76.2
Agentic Index: 50.1
Was bedeuten 57 Punkte? In derselben Leistungsklasse wie GPT-5.6 Sol (58.9) und Claude Opus 4.8 (55.7) – nur knapp hinter Fable 5 (59.9).
Noch krasser: die Agent-Fähigkeit:
- GDPval v2 → Elo 1668, höher als GPT-5.5 und Opus 4.8
- AutomationBench-AA → weltweit Platz 1
- AA-Briefcase – Wissensarbeit mit langen Aufgaben → weltweit Platz 2
- Frontend Code Arena → weltweit Platz 1 (von Platz 18 bei K2.6 auf Platz 1 gesprungen)
Letztes Jahr ging es darum, wer besser chatten kann – dieses Jahr darum, wer besser arbeiten kann.
💰 III. Preisvergleich
Kimi K3 (offiziell, direkter Zugang) $1.10 Eingang $5.50 Ausgang AA 57.1
Kimi K3 (OR) $3.00 $15.00
DS V4 Pro $0.44 $0.87 44.3
DS V4 Flash $0.14 $0.28 40.3
GPT-5.6 Sol $5.00 $30.00 58.9
Claude Opus 4.8 $5.00 $25.00 55.7
GLM-5.2 $0.94 $2.96 51.1
- 8~20x teurer als V4 Flash, aber mit 17 Punkten höherem Index
- 4~5x günstiger als GPT-5.6 Sol, nur 1,8 Punkte niedriger
- 5~7x teurer als K2 – offiziell nicht mehr „billig im Großpack“
🔓 IV. Bedeutung der offenen Gewichte ab dem 27. Juli
Auswirkungen in drei Ebenen:
① Einzelne Entwickler – 2,8T Parameter kann man lokal nicht einfach laufen lassen. Man braucht 18~70 H100-Cluster, das ist nichts, womit einzelne sich befassen können.
② Cloud-Anbieter / API-Transfer-Dienstleister – mit den Gewichten kann man Inferenzdienste selbst aufbauen, die Anschlusskosten sinken deutlich, und Preiswettbewerb kann voll entfacht werden.
③ Open-Source-Ökosystem – falls es eingelöst wird, wird K3 das Open-Source-Modell mit den umfassendsten Fähigkeiten sein und alle Open-Source-Teilnehmer wie GLM und DeepSeek übertreffen.
💡 V. Ein weiteres übersehendes Datum
K3 verwendet gegenüber K2.6 etwa 21% weniger Output-Token, erreicht aber höhere Intelligenzwerte. Das ist keine einfache Aufstockung von Parametern – bei Inferenz-Effizienz und Trainingsmethoden gibt es ebenfalls klar erkennbare Fortschritte.
⚠️ VI. Ungewissheit
- Können die Gewichte am 27.7. wie geplant ausgeliefert werden?
- Open-Source-Lizenz für das 2,8T-Modell? Kommerzielle Einschränkungen?
- Wie sieht die reale Inferenz-Effizienz unter der MoE-Architektur aus?
- Können Nutzer gehalten werden, nachdem die API-Preise steigen?
🔮 Zusammenfassung
K3 ist nicht unbedingt schon das stärkste Modell der Welt, aber es könnte sehr wohl der Kandidat für das stärkste Open-Source-Modell sein. Wenn die Gewichte wie angekündigt geöffnet werden, wird sich die Lücke zwischen Open-Source und Closed-Source in der zweiten Jahreshälfte weiter verringern. Die „Wasserscheide“ der Agent-Fähigkeit ist bereits da – im Wettbewerb dieses Jahres zählt, wer wirklich arbeiten kann, nicht wer nur die größten Parameter hat.
#KimiK3 #开源AI #AIAgent