Moonshot AI har släppt Kimi K3, en öppen viktmodell med 2,8 biljoner parametrar som genererar CUDA-kärnor för Nvidia H100 GPU:er med hastigheter 14,82 gånger snabbare än standard PyTorch. Prestandaökningen utmanar direkt de ledande AI-laboratorierna i USA och fördjupar den redan intensiva AI-konkurrensen mellan USA och Kina.
Vad hastighetsökningen innebär
Förbättringen på 14,82 gånger jämfört med PyTorch är inte ett syntetiskt riktmärke – det är en verklig kärngenereringshastighet. Det innebär att Kimi K3 kan skriva och optimera lågnivå-GPU-kod långt snabbare än det vida använda ramverket PyTorch. För utvecklare som kör storskalig träning eller inferens på H100-kluster översätts skillnaden till dramatiskt kortare väntetider och lägre beräkningskostnader. Moonshot AI hävdar att modellen har öppna vikter, så forskare utanför företaget kan granska och anpassa arkitekturen.
Kimi K3 lanseras samtidigt som Washington skärper exportkontrollerna av avancerade chips till Kina. USA:s laboratorier som OpenAI, Google DeepMind och Meta har länge dominerat frontlinjen för stora språkmodeller och GPU-optimering. Moonshot AIs modell visar att kinesiska företag fortfarande kan pressa hårdvaruprestanda utan tillgång till den senaste Nvidia-hårdvaran – H100 är exportbegränsad men allmänt tillgänglig i Kina genom lager som byggts upp före exportförbudet. Modellens 2,8 biljoner parametrar placerar den bland de största öppna viktmodellerna som någonsin släppts, och rivaliserar i skala med stängda modeller från amerikanska ledare.
Faktorn med öppna vikter
Genom att göra Kimi K3 öppen med vikter bjuder Moonshot AI in globala utvecklare att bygga vidare på deras arbete. Det kan påskynda användningen i Kina och på andra håll, medan amerikanska företag vanligtvis håller sina mest avancerade modeller proprietära. Draget sätter också press på USA:s laboratorier att antingen öppna sina egna modeller eller riskera att hamna efter i ekosystemet av tredjepartsoptimeringar. Nvidias CUDA-plattform är fortfarande den dominerande GPU-programmeringsmiljön, men en modell som skriver CUDA-kärnor snabbare än PyTorch kan förändra hur utvecklare angriper prestandajustering.
Moonshot AI avslöjade inte träningskostnaden eller den exakta hårdvaran som användes för att träna Kimi K3. Företaget har inte heller sagt om modellen kommer att uppdateras eller om de planerar att släppa en version optimerad för Nvidias kommande Blackwell-arkitektur. För närvarande är modellen tillgänglig för nedladdning, och de första oberoende riktmärkena förväntas inom några veckor.




