Moonshot AI telah merilis Kimi K3, model dengan 2,8 triliun parameter bersifat open-weight yang menjalankan kernel CUDA untuk H100 dengan kecepatan 14,82 kali lebih cepat dibandingkan PyTorch standar. Lonjakan performa ini secara langsung menantang laboratorium AI terkemuka di AS dan memperdalam persaingan kecerdasan buatan antara AS dan China.
Apa arti peningkatan kecepatan
Peningkatan 14,82x dibandingkan PyTorch bukanlah tolok ukur sintetis — ini adalah kecepatan pembuatan kernel yang sebenarnya. Artinya, Kimi K3 dapat menulis dan mengoptimalkan kode GPU tingkat rendah jauh lebih cepat daripada PyTorch. Bagi pengembang yang menjalankan pelatihan atau inferensi skala besar di klaster H100, perbedaan ini berarti waktu tunggu yang jauh lebih singkat dan biaya komputasi yang lebih rendah. Moonshot AI mengklaim model ini bersifat open-weight, sehingga peneliti di luar perusahaan dapat memeriksa dan mengadaptasi arsitekturnya.
Kimi K3 hadir di saat Washington semakin memperketat kontrol ekspor chip canggih ke China. Laboratorium AS seperti OpenAI, Google DeepMind, dan Meta selama ini mendominasi batas terdepan model bahasa besar dan optimasi GPU. Model Moonshot AI ini menunjukkan bahwa perusahaan China masih dapat mendorong batas kinerja perangkat keras tanpa akses ke perangkat keras Nvidia terbaru — H100 memang dibatasi ekspor tetapi masih tersedia luas di China melalui stok sebelum larangan. Jumlah parameter 2,8 triliun menempatkan Kimi K3 di antara model open-weight terbesar yang pernah dirilis, menyamai skala model tertutup dari para pemimpin AS.
Faktor open-weight
Dengan menjadikan Kimi K3 open-weight, Moonshot AI mengundang pengembang global untuk membangun di atas karyanya. Ini dapat mempercepat adopsi di China dan negara lain, sementara perusahaan AS biasanya merahasiakan model tercanggih mereka. Langkah ini juga menekan laboratorium AS untuk membuka model mereka sendiri atau berisiko tertinggal dalam ekosistem optimasi pihak ketiga. Platform CUDA milik Nvidia tetap menjadi lingkungan pemrograman GPU yang dominan, tetapi model yang dapat menulis kernel CUDA lebih cepat dari PyTorch dapat mengubah cara pengembang melakukan penalaan performa.
Moonshot AI tidak mengungkapkan biaya pelatihan atau perangkat keras pasti yang digunakan untuk melatih Kimi K3. Perusahaan juga belum mengatakan apakah model ini akan diperbarui atau apakah mereka berencana merilis versi yang dioptimalkan untuk arsitektur Blackwell milik Nvidia yang akan datang. Untuk saat ini, model tersedia untuk diunduh, dan tolok ukur independen pertama diharapkan dalam beberapa minggu ke depan.




