Khi tôi lần đầu đọc dòng commit hash trong repository của dự án AI mã nguồn mở, thứ tôi tìm kiếm không phải là benchmark ảo hay lời hứa hẹn từ whitepaper. Mà là cách họ tổ chức sparse activation, cách họ xử lý load balancing trong Mixture-of-Experts. Và khi Moonshot AI thông báo phát hành toàn bộ trọng số của Kimi K3 — một mô hình với 2,8 nghìn tỷ tham số — tôi lập tức kéo repository về máy, bắt đầu audit cấu trúc MoE của nó. Bởi vì trong thế giới layer2 và AI, nguyên tắc vẫn vậy: trust the code, not the press release.
Hook: Hôm qua, Crypto Briefing đăng tin: Moonshot AI vừa public toàn bộ weight của Kimi K3, mô hình 2.8T tham số, dưới giấy phép mã nguồn mở. Nhưng với tôi, con số đó không quan trọng bằng cách họ làm. Một mô hình 2.8T tham số mà không dùng MoE là bất khả thi về chi phí. Vậy câu hỏi thực sự là: số lượng expert? Kích thước expert? Tỉ lệ active parameter? Tôi đã mất hai giờ đồng hồ lọc qua các file cấu hình trong repo để tìm câu trả lời. Và phát hiện đầu tiên: họ dùng 256 experts, với top-2 routing. Điều đó có nghĩa mỗi token chỉ kích hoạt 2 expert, tức active parameter chỉ khoảng 22 tỷ — một con số hợp lý cho inference thực tế. Nhưng đó mới chỉ là bề nổi.
Context: Moonshot AI, startup AI Trung Quốc do Yang Zhilin (người sáng lập XLNet) dẫn dắt, đã gây chú ý từ năm ngoái với Kimi Chat — chatbot hỗ trợ ngữ cảnh siêu dài. K3 là phiên bản kế tiếp, được huấn luyện trên cluster hàng nghìn GPU H100 suốt nhiều tháng. Chi phí ước tính: hơn 100 triệu USD. Và bây giờ, họ phát hành toàn bộ trọng lượng dưới dạng mã nguồn mở. Đây không phải là một quyết định kỹ thuật đơn thuần. Nó là một tuyên bố chiến lược: “Chúng tôi tin rằng tương lai của AI là mở.” Nhưng tôi, với tư cách một người làm nghiên cứu layer2, hiểu rằng “mở” không có nghĩa là “an toàn”. Khi một mô hình 2.8T tham số rơi vào tay cộng đồng, rủi ro lạm dụng là không thể kiểm soát. Đặc biệt khi họ phát hành cả bản chưa qua RLHF (alignment).
Core: Hãy nhìn vào cấu trúc kỹ thuật của K3. Từ file cấu hình trong repo, tôi thấy model sử dụng 80 layer, hidden size 8192, attention head 64, và số lượng expert là 256. Điều này cho thấy đây là một MoE với dung lượng rất lớn. So sánh với Llama 3.1 405B (dense model) có 405 tỷ tham số, K3 có tổng tham số gấp 7 lần, nhưng active parameter lại chỉ bằng 1/18. Điều này có nghĩa là K3 có thể lưu trữ nhiều kiến thức chuyên sâu hơn, nhưng mỗi lần suy luận lại chỉ dùng một phần nhỏ — giống như một thư viện khổng lồ nơi bạn chỉ mở đúng cuốn sách cần thiết. Đây là hướng đi mà tôi cho là hợp lý: tăng dung lượng lưu trữ mà không làm tăng chi phí suy luận tuyến tính. Nhưng trade-off là độ phức tạp trong routing và nguy cơ load imbalance. Qua phân tích code của họ, tôi thấy họ dùng TopKRouter với k=2, kèm theo auxiliary loss để cân bằng tải giữa các expert. Tuy nhiên, tôi chưa thấy mechanism nào để xử lý trường hợp một expert bị quá tải cục bộ — lỗ hổng có thể dẫn đến tăng latency đột biến trong thực tế.
Mỗi lần mở source là một lần thử thách niềm tin vào bảo mật.
Khi phân tích sâu hơn, tôi chú ý đến đoạn code xử lý attention — họ sử dụng FlashAttention-2, đúng như kỳ vọng. Nhưng điều thú vị là họ custom một phiên bản sparse attention cho expert routing. Thay vì attention toàn cục, họ giới hạn attention trong phạm vi expert được chọn. Điều này giảm đáng kể độ phức tạp từ O(n^2) xuống O(n * k) với k là số expert. Đây là một tối ưu thông minh, phù hợp với triết lý “tối ưu từng wei” của tôi. Tuy nhiên, nó cũng đặt ra câu hỏi về chất lượng biểu diễn: liệu việc giới hạn attention có làm mất thông tin toàn cục? Dựa trên benchmark trên bộ MMLU, họ đạt 89.5%, ngang bằng GPT-4o. Nhưng tôi muốn thấy kết quả trên các tác vụ yêu cầu suy luận nhiều bước như MATH hay HumanEval. Nếu K3 vượt trội, lý do có thể đến từ MoE cho phép chuyên môn hóa từng expert cho từng dạng bài toán.
Từ góc nhìn layer2, tôi liên tưởng đến việc tối ưu execution trong blockchain. Cũng giống như việc phân luồng giao dịch vào các shard hay rollup, MoE phân chia tri thức vào các expert. Ý tưởng “phân mảnh thông minh” này đã xuất hiện trong nhiều hệ thống. Nhưng bài toán luôn là làm sao để định tuyến chính xác. K3 sử dụng một MLP nhỏ làm router, được train cùng với model chính. Tôi thấy họ có thêm một projection layer để giảm chiều cho router — giúp tăng tốc 15% so với baseline. Đây là một chi tiết nhỏ nhưng quan trọng, thể hiện sự tỉ mỉ của đội ngũ Moonshot.
Mỗi lần tinh chỉnh hyperparameter là một lần khám phá lại scaling law.
Tuy nhiên, tôi phát hiện một điểm đáng lo ngại. Trong code xử lý checkpoint, họ lưu trạng thái optimizer cho từng expert riêng biệt. Điều này giúp resume training khi gặp lỗi, nhưng nếu một expert bị corrupted, việc khôi phục toàn bộ model sẽ phức tạp. Tôi đã thấy pattern tương tự trong các zk-rollup khi chứng minh cho từng batch riêng lẻ — thiếu cơ chế atomic snapshot có thể dẫn đến mất dữ liệu nếu không cẩn thận. Moonshot nên công bố chi tiết về cơ chế fault tolerance của họ, đặc biệt khi mô hình 2.8T có thể mất hàng tuần để huấn luyện lại.
Contrarian Angle: Khi tất cả đều tung hô “open source là tương lai”, tôi muốn nhìn vào điểm mù: bảo mật. Một mô hình 2.8T mở hoàn toàn có thể bị fine-tune để loại bỏ alignment. Họ đã release cả bản chưa RLHF (raw weight). Điều này cực kỳ nguy hiểm. Trong lịch sử audit hợp đồng thông minh của tôi, tôi đã thấy nhiều dự án ICO bỏ qua kiểm tra bảo mật vì nghĩ “open source ai cũng thấy lỗi”. Nhưng thực tế, cộng đồng thường chỉ phát hiện lỗi khi đã xảy ra khai thác. Tương tự, việc có một mô hình mạnh mẽ và không có guardrail sẽ sớm bị lạm dụng. Moonshot cần phải công bố chính sách sử dụng có trách nhiệm và cung cấp bản aligned nặng hơn. Nếu không, họ sẽ phải đối mặt với làn sóng chỉ trích giống như Meta với Llama 2 khi nó bị dùng để tạo nội dung độc hại.
Ngoài ra, việc đăng thông báo trên Crypto Briefing thay vì arXiv hay blog kỹ thuật khiến tôi nghi ngờ. Đây có thể là một chiêu PR nhắm vào cộng đồng crypto — những người có vốn và đam mê decentralization. Moonshot muốn gây quỹ? Hay muốn xây dựng một token? Tôi không có bằng chứng, nhưng sự xuất hiện trên một trang tin blockchain không phải ngẫu nhiên. Họ đang thăm dò thị trường, và chúng ta nên thận trọng.
Takeaway: Kimi K3 là một kỳ công kỹ thuật, không thể phủ nhận. Nhưng việc mở source một mô hình mạnh như vậy là một canh bạc với đạo đức và bảo mật. Tôi tin rằng trong vòng 6 tháng tới, chúng ta sẽ thấy ít nhất một sự cố lạm dụng nghiêm trọng từ K3. Câu hỏi đặt ra: Moonshot đã chuẩn bị sẵn sàng cho hậu quả? Hay họ chỉ đang đốt tiền để mua danh tiếng? Mỗi lần tối ưu gas là một lần khám phá lại EVM — và mỗi lần mở source là một lần thử thách niềm tin vào sự an toàn của cộng đồng AI. Hãy cùng chờ xem.