Loading market data...

Moonshot AI’s Kimi K3 draait H100-kernels 14,8 keer sneller dan PyTorch, verscherpt de AI-wedloop tussen VS en China

Moonshot AI’s Kimi K3 draait H100-kernels 14,8 keer sneller dan PyTorch, verscherpt de AI-wedloop tussen VS en China

Moonshot AI heeft Kimi K3 uitgebracht, een open-gewicht model met 2,8 biljoen parameters dat CUDA-kernels voor Nvidia H100-GPU’s genereert met snelheden die 14,82 keer hoger liggen dan standaard PyTorch. Deze prestatieverbetering daagt de toonaangevende AI-labs in de VS direct uit en verscherpt de toch al intense kunstmatige intelligentie-wedloop tussen de VS en China.

Wat de snelheidswinst betekent

De 14,82x verbetering ten opzichte van PyTorch is geen synthetische benchmark – het is een echte kernel-generatiesnelheid. Dat betekent dat Kimi K3 low-level GPU-code veel sneller kan schrijven en optimaliseren dan het veelgebruikte PyTorch-framework. Voor ontwikkelaars die grootschalige training of inferentie op H100-clusters uitvoeren, vertaalt het verschil zich in aanzienlijk kortere wachttijden en lagere rekenkosten. Moonshot AI beweert dat het model open-gewicht is, zodat onderzoekers buiten het bedrijf de architectuur kunnen inspecteren en aanpassen.

Kimi K3 komt op een moment dat Washington de exportcontroles op geavanceerde chips naar China verscherpt. Amerikaanse labs zoals OpenAI, Google DeepMind en Meta hebben lange tijd de grens van grote taalmodellen en GPU-optimalisatie gedomineerd. Het model van Moonshot AI laat zien dat Chinese bedrijven nog steeds hardwareprestaties kunnen verbeteren zonder toegang tot de nieuwste Nvidia-hardware – de H100 is exportbeperkt maar in China ruim beschikbaar via voorraad van vóór het verbod. Het aantal van 2,8 biljoen parameters plaatst Kimi K3 bij de grootste open-gewicht modellen ooit uitgebracht, vergelijkbaar met de schaal van gesloten modellen van Amerikaanse leiders.

De open-gewicht factor

Door Kimi K3 open-gewicht te maken, nodigt Moonshot AI wereldwijde ontwikkelaars uit om op zijn werk voort te bouwen. Dat kan de adoptie in China en elders versnellen, terwijl Amerikaanse bedrijven hun meest geavanceerde modellen doorgaans propriëtair houden. De zet zet ook druk op Amerikaanse labs om hun eigen modellen open te stellen of het risico te lopen achterop te raken in het ecosysteem van optimalisaties van derden. Nvidia’s CUDA-platform blijft de dominante GPU-programmeeromgeving, maar een model dat CUDA-kernels sneller schrijft dan PyTorch zou kunnen verschuiven hoe ontwikkelaars prestatieoptimalisatie benaderen.

Moonshot AI heeft de trainingskosten of de exacte hardware die is gebruikt om Kimi K3 te trainen niet bekendgemaakt. Het bedrijf heeft ook niet gezegd of het model zal worden bijgewerkt of dat het van plan is een versie uit te brengen die is geoptimaliseerd voor Nvidia’s aanstaande Blackwell-architectuur. Voorlopig is het model beschikbaar om te downloaden, en de eerste onafhankelijke benchmarks worden binnen enkele weken verwacht.