Loading market data...

Moonshot AIs Kimi K3 führt H100-Kernel 14,8-mal schneller aus als PyTorch und verschärft das US-China-KI-Rennen

Moonshot AIs Kimi K3 führt H100-Kernel 14,8-mal schneller aus als PyTorch und verschärft das US-China-KI-Rennen

Moonshot AI hat Kimi K3 veröffentlicht, ein Open-Weight-Modell mit 2,8 Billionen Parametern, das CUDA-Kernel für Nvidia H100-GPUs 14,82-mal schneller generiert als das standardmäßige PyTorch. Dieser Leistungssprung fordert die führenden US-KI-Labore direkt heraus und vertieft den ohnehin intensiven Wettbewerb zwischen den USA und China im Bereich der künstlichen Intelligenz.

Was die Beschleunigung bedeutet

Die 14,82-fache Verbesserung gegenüber PyTorch ist kein synthetischer Benchmark – es handelt sich um eine echte Kernel-Generierungsgeschwindigkeit. Das bedeutet, dass Kimi K3 niedrigstufigen GPU-Code weitaus schneller schreiben und optimieren kann als das weit verbreitete PyTorch-Framework. Für Entwickler, die groß angelegtes Training oder Inferenz auf H100-Clustern durchführen, führt der Unterschied zu drastisch kürzeren Wartezeiten und geringeren Rechenkosten. Moonshot AI gibt an, dass das Modell Open-Weight ist, sodass Forscher außerhalb des Unternehmens die Architektur einsehen und anpassen können.

Kimi K3 kommt zu einem Zeitpunkt, an dem Washington die Exportkontrollen für fortschrittliche Chips nach China verschärft. US-Labore wie OpenAI, Google DeepMind und Meta haben lange die Grenzen großer Sprachmodelle und GPU-Optimierung dominiert. Das Modell von Moonshot AI zeigt, dass chinesische Unternehmen die Hardwareleistung auch ohne Zugang zur neuesten Nvidia-Hardware steigern können – die H100 ist exportbeschränkt, aber in China durch vor dem Verbot angelegte Bestände weit verbreitet. Die Parameteranzahl von 2,8 Billionen macht Kimi K3 zu einem der größten jemals veröffentlichten Open-Weight-Modelle und übertrifft die Größenordnung geschlossener Modelle von US-Führern.

Der Open-Weight-Faktor

Indem Moonshot AI Kimi K3 als Open-Weight bereitstellt, lädt das Unternehmen globale Entwickler ein, auf seiner Arbeit aufzubauen. Dies könnte die Akzeptanz in China und anderswo beschleunigen, während US-Unternehmen ihre fortschrittlichsten Modelle in der Regel proprietär halten. Der Schritt setzt US-Labore unter Druck, entweder ihre eigenen Modelle zu öffnen oder Gefahr zu laufen, im Ökosystem der Optimierungen Dritter zurückzufallen. Nvidias CUDA-Plattform bleibt die dominierende GPU-Programmierumgebung, aber ein Modell, das CUDA-Kernel schneller schreibt als PyTorch, könnte die Herangehensweise der Entwickler an die Leistungsoptimierung verändern.

Moonshot AI hat weder die Trainingskosten noch die genaue Hardware offengelegt, die für das Training von Kimi K3 verwendet wurde. Das Unternehmen hat auch nicht gesagt, ob das Modell aktualisiert wird oder ob es eine für Nvidias kommende Blackwell-Architektur optimierte Version veröffentlichen will. Derzeit ist das Modell zum Download verfügbar, und die ersten unabhängigen Benchmarks werden innerhalb weniger Wochen erwartet.