日拱一卒:Kimi K3 gerade veröffentlicht – 28 Billionen Parameter, 1 Million Kontext, native Multimodalität
Drei interne Benchmarks liegen alle über Claude Opus 4.8 und GPT-5.5: Online Exp 75.5, DECK-Bench 73.5, Finance-Bench 62.6.
Architektonisch gibt es zwei Updates: Kimi Delta Attention (KDA) steigert die Dekodiergeschwindigkeit im Kontext von einer Million Tokens um bis zu 6,3×; Attention Residuals (AttnRes) erhöht die Trainings-Effizienz um etwa 25%, mit zusätzlichen Kosten von unter 2%. Das MoE wurde auf 896 Experten erweitert, wobei 16 aktiviert werden; die gesamte Skalierungseffizienz liegt gegenüber K2 bei ungefähr 2,5×.
Am bemerkenswertesten ist die Fähigkeit zur Selbst-Weiterentwicklung: K3 iterierte 15 Stunden am Stück und entwickelte einen neuen Zwei-Phasen-Kernel-Algorithmus, der den forward + backward von AttnRes von 283,6 ms auf 114,4 ms senkt – bei unveränderten Werten, aber doppelter Geschwindigkeit. Das Modell optimiert sich selbst.
K3 ist bereits bei Kimi Work, Kimi Code und der API online; die Gewichte werden bis zum 27. Juli freigegeben.
Wenn das Modell damit beginnt, seinen eigenen Trainings-Kernel zu optimieren, muss die Story „KI hilft Menschen beim Programmieren“ aufgerüstet werden – der nächste Schritt lautet: „KI hilft KI mit noch schnelleren Codes beim Programmieren“.
#Kimi #K3 #AI
Drei interne Benchmarks liegen alle über Claude Opus 4.8 und GPT-5.5: Online Exp 75.5, DECK-Bench 73.5, Finance-Bench 62.6.
Architektonisch gibt es zwei Updates: Kimi Delta Attention (KDA) steigert die Dekodiergeschwindigkeit im Kontext von einer Million Tokens um bis zu 6,3×; Attention Residuals (AttnRes) erhöht die Trainings-Effizienz um etwa 25%, mit zusätzlichen Kosten von unter 2%. Das MoE wurde auf 896 Experten erweitert, wobei 16 aktiviert werden; die gesamte Skalierungseffizienz liegt gegenüber K2 bei ungefähr 2,5×.
Am bemerkenswertesten ist die Fähigkeit zur Selbst-Weiterentwicklung: K3 iterierte 15 Stunden am Stück und entwickelte einen neuen Zwei-Phasen-Kernel-Algorithmus, der den forward + backward von AttnRes von 283,6 ms auf 114,4 ms senkt – bei unveränderten Werten, aber doppelter Geschwindigkeit. Das Modell optimiert sich selbst.
K3 ist bereits bei Kimi Work, Kimi Code und der API online; die Gewichte werden bis zum 27. Juli freigegeben.
Wenn das Modell damit beginnt, seinen eigenen Trainings-Kernel zu optimieren, muss die Story „KI hilft Menschen beim Programmieren“ aufgerüstet werden – der nächste Schritt lautet: „KI hilft KI mit noch schnelleren Codes beim Programmieren“.
#Kimi #K3 #AI