Những điều cần biết về Kimi K3

Kimi K3 là mô hình thế hệ tiếp theo của Moonshot AI — một hệ thống có MoE khoảng 2,8 nghìn tỷ với cửa sổ ngữ cảnh 1 triệu token, được ra mắt vào ngày 16 tháng 7 năm 2026 trên Kimi Code và ứng dụng Kimi.

Kimi K3

Mục lục bài viết

  • Kimi K3 là gì?
  • Bạn có thể làm gì với Kimi K3?
  • Giá của Kimi K3
  • Ai nên dùng Kimi K3?

Kimi K3 là gì?

Đặc điểm Kimi K3 (chính thức)
Model ID kimi-k3
Tổng tham số 2.8 tỷ
Các tham số hoạt động Chưa được tiết lộ
Kiến trúc Kimi Delta Attention + Attention Residuals
Cửa sổ ngữ cảnh 1,048,576 token (1M)
Đầu ra tối đa Mặc định 131,072 tokens, có thể cấu hình lên đến 1,048,576
Phương thức Đầu vào văn bản, ảnh và video; đầu ra là text
Lý luận Luôn bật; trường reasoning_effort, hiện chỉ có max
Giá input (cache hit) $0.30/1M token
Giá input (cache miss) $3.00/1M token
Giá đầu ra $15.00/1M token
Phân cấp ngữ cảnh Không có gì — giá cố định trong mọi ngữ cảnh.
Có sẵn Kimi API, OpenRouter, Kimi.com, Kimi Code

Kimi K3 là mô hình chủ lực mới của Moonshot AI, và những con số nổi bật thực sự đáng kinh ngạc:

  • 2,8 nghìn tỷ tham số — mô hình lớn nhất từng được một phòng thí nghiệm AI Trung Quốc tung ra thị trường, và lớn gấp khoảng 2,8 lần so với người tiền nhiệm K2.6
  • Cửa sổ ngữ cảnh 1 triệu token — đủ để chứa toàn bộ mã nguồn, tài liệu dài như sách, hoặc dữ liệu hoạt động của tác nhân trong nhiều ngày chỉ trong một lời nhắc
  • Khả năng đa phương thức tích hợp — hiểu văn bản, hình ảnh và video được xây dựng từ đầu, chứ không phải là thêm vào sau
  • Suy luận liên tục — K3 luôn suy nghĩ trước khi trả lời, với mức độ nỗ lực suy luận có thể cấu hình thông qua API

Bạn có thể làm gì với Kimi K3?

  • Lập trình tự động phiên dài. K2.6 đã chứng minh khả năng chạy lập trình tự động 12-13 giờ với hàng nghìn lệnh gọi công cụ, và K3 mở rộng hướng này với biến thể K3 Swarm Max để xử lý song song quy mô lớn.
  • Nghiên cứu và phân tích ngữ cảnh lớn. Với cửa sổ ngữ cảnh 1 triệu token đã được xác nhận, K3 nằm trong cùng cấp độ với các công cụ hàng đầu về ngữ cảnh dài để xem xét mã toàn bộ kho lưu trữ, tổng hợp tài liệu dài và nghiên cứu đa tài liệu.
  • Các hệ thống phụ trợ tác nhân lập trình. Người thử nghiệm sớm ChrissGPT đã định vị K3 trước khi ra mắt là "một mô hình lập trình Opus 4.7+" mà "vượt trội hơn GPT 5.5 và GPT 5.6 Terra trên MỘT SỐ đánh giá lập trình", đồng thời lưu ý rằng Fable 5 và GPT-5.6 Sol vẫn chiếm ưu thế trên Terminal-Bench 2.1, trong một bài đăng ngày 14 tháng 7. Khi ra mắt, ông đánh giá K3 ở mức độ lập trình tương đương Opus 4.8.
  • Điều phối đa tác nhân. K2.6 đã tích hợp Claw Groups để điều phối các tác nhân bên ngoài không đồng nhất; K3 Swarm Max tiếp tục hướng này với hỗ trợ xử lý song song quy mô lớn rõ ràng.

Giá của Kimi K3

Tất cả các phiên bản Kimi được phát hành trước đây đều cạnh tranh chủ yếu về giá cả. K3 thì không. Dưới đây là vị trí của nó so với các sản phẩm cùng dòng và các đối thủ cạnh tranh hàng đầu (tất cả giá đều tính trên 1 triệu token; giá đầu vào là tỷ lệ lỗi bộ nhớ cache):

Model Input Output Cache-hit input Context
Kimi K2.6 $0.95 $4.00 $0.16 256K
Kimi K2.7 Code $0.95 $4.00 $0.19 256K
DeepSeek V4 Pro $1.74 $3.48 $0.145 128K
Kimi K3 $3.00 $15.00 $0.30 1M
Claude Opus 4.8 $5.00 $25.00 200K
GPT-5.5 $5.00 $30.00 400K

Ai nên dùng Kimi K3?

Dựa trên những thông tin đã được xác nhận: K3 hiện tại phù hợp cho các tác vụ dựa trên tác nhân có tầm nhìn dài hạn, nơi chất lượng mỗi tác vụ quan trọng hơn chi phí mỗi token — các tác nhân lập trình nhiều giờ điều hướng kho lưu trữ lớn, tập dữ liệu tài liệu hàng triệu token được truy vấn lặp đi lặp lại dựa trên tiền tố được lưu vào bộ nhớ cache, và tác vụ suy luận đa phương thức cần hình ảnh, video và mã trong cùng một ngữ cảnh. Tài liệu tích hợp của Moonshot nhắm chính xác vào dữ liệu đó, với hướng dẫn thiết lập ngay từ ngày đầu tiên cho Kimi Code, Claude Code, Codex, Cline, RooCode, OpenCode, OpenClaw và Hermes Agent.

Tuy nhiên, nó không phải là lựa chọn phù hợp hiện nay cho các sản phẩm tương tác nhạy cảm với độ trễ (28 tok/s), nhóm cần lấy mẫu có thể điều chỉnh hoặc các chế độ suy luận nhẹ (mọi thứ đều bị khóa ở mức tối đa), cho các quy trình yêu cầu trọng số mở (chưa được công bố), và cho các chiến lược tối ưu hóa chi phí thuần túy (đó là mục đích của K2.6 và DeepSeek V4).