Moonshot AI发布了Kimi K3,一个拥有2.8万亿参数的开源权重模型,能为Nvidia H100 GPU生成CUDA内核,速度比标准PyTorch快14.82倍。这一性能飞跃直接挑战了美国顶尖AI实验室,并加剧了本已激烈的中美人工智能竞争。
速度提升意味着什么
相比PyTorch的14.82倍提升并非合成基准测试——而是真实的内核生成速度。这意味着Kimi K3编写和优化底层GPU代码的速度远快于广泛使用的PyTorch框架。对于在H100集群上运行大规模训练或推理的开发者来说,这种差异意味着大幅缩短等待时间和降低计算成本。Moonshot AI声称该模型是开源权重的,因此公司外部的研究人员可以检查并调整其架构。
Kimi K3发布之际,华盛顿正在收紧对华先进芯片的出口管制。美国实验室如OpenAI、Google DeepMind和Meta长期以来在大语言模型和GPU优化领域占据前沿。Moonshot AI的模型表明,即使无法获得最新的Nvidia硬件,中国公司仍能推动硬件性能——H100虽受出口限制,但中国通过禁令前的库存仍可广泛获得。2.8万亿参数使Kimi K3成为有史以来发布的最大开源权重模型之一,规模可与美国领先者的闭源模型相媲美。
开源权重因素
通过将Kimi K3开源权重,Moonshot AI邀请全球开发者在其基础上进行开发。这可能加速该模型在中国及其他地区的采用,而美国公司通常将其最先进的模型保持为专有。此举也向美国实验室施压,要么开放自己的模型,要么在第三方优化的生态系统中落后。Nvidia的CUDA平台仍然是主导的GPU编程环境,但一个比PyTorch更快编写CUDA内核的模型可能会改变开发者处理性能调优的方式。
Moonshot AI未披露训练成本或用于训练Kimi K3的具体硬件。该公司也未说明该模型是否会更新,或是否计划发布针对Nvidia即将推出的Blackwell架构优化的版本。目前,该模型可供下载,首批独立基准测试预计将在数周内公布。




