Loading market data...

Moonshot AI ra mắt Kimi K3: Chạy nhân H100 nhanh hơn 14,8 lần so với PyTorch, leo thang cuộc đua AI Mỹ-Trung

Moonshot AI ra mắt Kimi K3: Chạy nhân H100 nhanh hơn 14,8 lần so với PyTorch, leo thang cuộc đua AI Mỹ-Trung

Moonshot AI đã phát hành Kimi K3, một mô hình trọng số mở với 2,8 nghìn tỷ tham số, có khả năng tạo nhân CUDA cho GPU Nvidia H100 với tốc độ nhanh hơn 14,82 lần so với PyTorch tiêu chuẩn. Bước nhảy vọt về hiệu suất này trực tiếp thách thức các phòng thí nghiệm AI hàng đầu của Mỹ và làm sâu sắc thêm cuộc cạnh tranh trí tuệ nhân tạo vốn đã khốc liệt giữa Mỹ và Trung Quốc.

Ý nghĩa của tốc độ tăng tốc

Mức cải thiện 14,82 lần so với PyTorch không phải là một điểm chuẩn tổng hợp — đó là tốc độ tạo nhân thực tế. Điều này có nghĩa là Kimi K3 có thể viết và tối ưu hóa mã GPU cấp thấp nhanh hơn nhiều so với framework PyTorch được sử dụng rộng rãi. Đối với các nhà phát triển chạy các tác vụ huấn luyện hoặc suy luận quy mô lớn trên cụm H100, sự khác biệt này chuyển thành thời gian chờ ngắn hơn đáng kể và chi phí tính toán thấp hơn. Moonshot AI tuyên bố mô hình này là trọng số mở, vì vậy các nhà nghiên cứu bên ngoài công ty có thể kiểm tra và điều chỉnh kiến trúc.

Kimi K3 ra mắt trong bối cảnh Mỹ thắt chặt các biện pháp kiểm soát xuất khẩu chip tiên tiến sang Trung Quốc. Các phòng thí nghiệm AI của Mỹ như OpenAI, Google DeepMind và Meta từ lâu đã dẫn đầu trong lĩnh vực mô hình ngôn ngữ lớn và tối ưu hóa GPU. Kimi K3 của Moonshot AI cho thấy các công ty Trung Quốc vẫn có thể đẩy mạnh hiệu suất phần cứng mà không cần tiếp cận phần cứng Nvidia mới nhất — H100 bị hạn chế xuất khẩu nhưng vẫn có sẵn ở Trung Quốc thông qua kho dự trữ trước lệnh cấm. Với 2,8 nghìn tỷ tham số, Kimi K3 nằm trong số các mô hình trọng số mở lớn nhất từng được phát hành, sánh ngang quy mô của các mô hình độc quyền từ các nhà lãnh đạo Mỹ.

Yếu tố trọng số mở

Bằng cách công bố Kimi K3 dưới dạng trọng số mở, Moonshot AI mời các nhà phát triển toàn cầu xây dựng dựa trên công trình của mình. Điều này có thể thúc đẩy việc áp dụng tại Trung Quốc và các nơi khác, trong khi các công ty Mỹ thường giữ các mô hình tiên tiến nhất của họ ở dạng độc quyền. Động thái này cũng gây áp lực lên các phòng thí nghiệm Mỹ, buộc họ phải mở các mô hình của riêng mình hoặc có nguy cơ tụt hậu trong hệ sinh thái tối ưu hóa của bên thứ ba. Nền tảng CUDA của Nvidia vẫn là môi trường lập trình GPU thống trị, nhưng một mô hình viết nhân CUDA nhanh hơn PyTorch có thể thay đổi cách các nhà phát triển tiếp cận việc tinh chỉnh hiệu suất.

Moonshot AI không tiết lộ chi phí huấn luyện hoặc phần cứng chính xác được sử dụng để huấn luyện Kimi K3. Công ty cũng chưa cho biết liệu mô hình có được cập nhật hay có kế hoạch phát hành phiên bản tối ưu hóa cho kiến trúc Blackwell sắp tới của Nvidia hay không. Hiện tại, mô hình đã có sẵn để tải xuống và các điểm chuẩn độc lập đầu tiên dự kiến sẽ có trong vài tuần tới.