Đối đầu trực tiếp

Logo DeepSeek-V4vsLogo Kimi K3

DeepSeek-V4 vs Kimi K3: mô hình AI nào thắng trong năm 2026?

DeepSeek-V4 ($0.87/1M out) và Kimi K3 ($15/1M out) là hai trong số mô hình AI được dùng nhiều nhất năm 2026. Trên 6 phiếu của cộng đồng, DeepSeek-V4 dẫn đầu với 57% ủng hộ.

Phán quyết nhanh

Về Suy luận, DeepSeek-V4 và Kimi K3 hòa nhau ở 4.5/5. Về ngân sách, DeepSeek-V4 thắng: giá từ $0.87/1M out so với $15/1M out của Kimi K3.

So sánh từng dòng

Từ
$0.87/1M outBậc V4-Pro: $0.435/1M input ($0.003625 khi trúng cache), $0.87/1M output; bậc V4-Flash rẻ hơn ở mức $0.14/$0.28 ($0.0028 khi trúng cache); mức giảm 75% lúc ra mắt đã thành giá cố định từ 2026-05-22. Bản chính thức giữa tháng 7/2026 đưa vào giá cao điểm/thấp điểm, với mức niêm yết nhân đôi trong giờ cao điểm Bắc Kinh.
$15/1M outGiá niêm yết chính thức trên API của Moonshot cho kimi-k3: $3/1M input (cache miss), $0.30/1M khi cache hit, $15/1M output bao gồm cả reasoning trace, mức giá cố định trên toàn bộ ngữ cảnh 1M (không chia theo bậc độ dài). Cùng mức giá $3/$15 trên OpenRouter (giá cache không được công bố tại đó). Mức tăng gấp 3 lần so với giá $0.95/$4 của Kimi K2.6. Đã xác minh theo platform.kimi.ai/docs/pricing/chat-k3, tháng 7/2026.
Nhà cung cấp
DeepSeek
Moonshot AI
Cửa sổ ngữ cảnh
1M tokens (384K max output)
1M tokens
Giá input
$0.435/1M in (cache hit $0.003625)
$3/1M in
Giá output
$0.87/1M out
$15/1M out
Phương thức
text only
text, vision, video input
Open weights
Không
Điểm đám đông
57%(3)
57%(3)
Điểm đấu trường (1-5)
Suy luận
4.5
4.5
Lập trình
4.5
4.5
Viết lách
3.5
4.0
Tốc độ
3.0
2.0
Đáng tiền
5.0
3.5

Điểm mạnh và điểm yếu

DeepSeek-V4

  • Cửa sổ ngữ cảnh 1M tokens (8x mức 128K của V3.2) với output tới 384K tokens, chuẩn trên API chính thức
  • Giá cực gắt: $0.435/$0.87 mỗi 1M tokens (V4-Pro), rẻ hơn Claude Opus 4.8 khoảng 28.7x mỗi output token; input trúng cache giảm còn $0.003625/1M (giảm hơn 99%)
  • Open weights giấy phép MIT cho cả V4-Pro và V4-Flash trên Hugging Face: cho phép dùng thương mại, fine-tuning và tái phân phối
  • SOTA mã nguồn mở về lập trình agentic: 80.6 trên SWE-bench Verified (cấu hình Think Max), ngang Gemini 3.1 Pro, cộng rating Codeforces 3206 (~hạng 23 so với con người)
  • Xếp #3 trên 93 trên Artificial Analysis Intelligence Index (điểm 44), cao hơn hẳn mức trung bình 25
  • Bộ sparse attention cắt inference ngữ cảnh 1M xuống còn 27% FLOPs và 10% KV cache của V3.2
  • Tool call sai định dạng ngắt quãng: function call đôi khi bị xuất thành văn bản thường trong content thay vì trường tool_calls (issue GitHub deepseek-ai #1244)
  • Chế độ thinking làm gãy các chuỗi tool call đa lượt dài với lỗi 400 trong các framework agent (issue OpenClaw #72044, bản vá vẫn chưa hoàn chỉnh)
  • Dev báo cáo nó bịa ra các API không tồn tại trong codebase tùy chỉnh và hành động dựa trên input người dùng do nó ảo giác ra trong vòng lặp agent
  • Rất dài dòng (180M output tokens khi eval so với trung vị 95M) và tốc độ tầm trung 54.6 tok/s (#39/93), làm xói mòn lợi thế giá mỗi token trong thực tế
  • Chỉ văn bản (không vision hay âm thanh) và vẫn là bản preview: bản chính thức dự kiến giữa tháng 7/2026 bổ sung giá giờ cao điểm nhân đôi mức API niêm yết trong giờ hành chính Bắc Kinh

Kimi K3

  • Xếp hạng #3 trên Artificial Analysis Intelligence Index (57 điểm) khi ra mắt, tương đương Claude Opus 4.8 và GPT-5.5: khoảng cách gần nhất mà một phòng thí nghiệm Trung Quốc từng đạt được so với frontier đóng của Mỹ
  • Đạt 93.4% trên SWE-bench Verified theo hệ thống đánh giá độc lập của Vals AI (GPT-5.6 Sol: 96.2%, Claude Fable 5: 95.0%) và xếp #1 trên Frontend Code Arena của Arena.ai với 1679 điểm, vượt qua Fable 5
  • Đạt 93.5% trên GPQA Diamond (nằm giữa mức 92.6% của Fable 5 và 94.1% của GPT-5.6), 96.1% trên AIME 2025, và Elo 1668 trên công việc agentic của GDPval-AA v2, chỉ đứng sau Fable 5
  • Hồ sơ agentic mạnh: xếp #1 trên AutomationBench-AA cho các quy trình SaaS (53%), điều hướng terminal và repo trong thời gian dài qua Kimi Code, và sử dụng ít hơn khoảng 21% output token so với K2 trong khi thông minh hơn
  • Giá $3/$15 cho mỗi 1M token (input giảm còn $0.30 khi cache hit), mức giá cố định trên toàn bộ ngữ cảnh 1M: vẫn thấp hơn đáng kể so với giá của các mô hình frontier đóng của Mỹ, có API tương thích OpenAI và khả dụng trên OpenRouter
  • Hỗ trợ đầu vào đa phương thức native (văn bản, hình ảnh, video) và trọng số mở được công bố phát hành vào ngày 2026-07-27 theo giấy phép dự kiến kiểu Modified-MIT, đưa mô hình này trở thành mô hình frontier trọng số mở đầu tiên ở quy mô 3 nghìn tỷ tham số
  • Giá tăng gấp 3 lần so với Kimi K2.6 (từ $0.95/$4 lên $3/$15), khiến đây trở thành mô hình Trung Quốc đắt nhất từng được phát hành, ngang giá niêm yết của Claude Sonnet 5: kỷ nguyên 'rẻ hơn 10 lần so với mô hình Mỹ' đã kết thúc (Simon Willison đã ghi nhận đợt tăng giá này)
  • Chậm: 33 output token/giây, xếp hạng #145 trong số 190 mô hình trên Artificial Analysis, không phù hợp cho sử dụng tương tác
  • Tỷ lệ ảo giác tăng từ 39% (K2.6) lên 51% trên AA-Omniscience, do mô hình nay cố gắng trả lời cả những câu hỏi mà trước đây nó từng từ chối (Fable 5 ở mức tương đương, 54.9%)
  • Kiểm duyệt chính trị đối với các chủ đề nhạy cảm bằng tiếng Trung (né tránh khi nói về Xi, CCP, Thiên An Môn) và dữ liệu API thuộc thẩm quyền pháp lý Bắc Kinh, gây trở ngại tuân thủ cho nhiều triển khai tại EU và doanh nghiệp; UK AISI/CAISI cũng phát hiện các rào chắn an ninh mạng của mô hình không ngăn được các nỗ lực phát triển exploit trong quá trình kiểm thử
  • 'Trọng số mở' phần lớn vẫn chỉ mang tính lý thuyết: khoảng 594 GB ở định dạng native MXFP4 đòi hỏi một trung tâm dữ liệu đa GPU để tự triển khai, và trọng số (cùng giấy phép cuối cùng) vẫn chưa được công bố tại thời điểm đánh giá

Đưa ra phán quyết của bạn

Mỗi đấu sĩ một đề xuất cho mỗi công cụ. Nó định hình lại điểm đám đông mà mọi người nhìn thấy.

DeepSeek-V4$0.87/1M out
57%điểm đám đông · 3
Kimi K3$15/1M out
57%điểm đám đông · 3

Phán quyết của đấu trường về DeepSeek-V4

Chọn DeepSeek-V4 nếu bạn muốn suy luận và lập trình agentic gần đỉnh cao với giá thấp hơn Claude Opus hay GPT-5.5 từ 3x đến gần 30x, hoặc nếu weights giấy phép MIT để tự host và fine-tune là điều quan trọng với bạn. Đây là nâng cấp dứt khoát so với V3.2: ngữ cảnh dài hơn 8x, inference ngữ cảnh dài rẻ hơn hẳn và lập trình mạnh hơn, và đằng nào các endpoint cũ deepseek-chat/reasoner cũng bị ngừng vào ngày 24 tháng 7, 2026. Tránh nó cho các agent production phụ thuộc vào tool calling đa lượt tuyệt đối vững, nơi người dùng vẫn báo cáo tool call sai định dạng và API bị bịa ra, và cho mọi công việc vision hay âm thanh vì nó chỉ xử lý văn bản. Ứng dụng nhạy cảm độ trễ cũng nên test trước, vì độ dài dòng và tốc độ output tầm trung 54.6 tok/s bào bớt lợi thế chi phí, và hãy dự trù cho việc nhân đôi giá giờ cao điểm đến cùng bản phát hành chính thức giữa tháng 7.

Phán quyết của đấu trường về Kimi K3

Kimi K3 là bằng chứng thuyết phục nhất từ trước đến nay cho thấy frontier không còn là sân chơi độc quyền của Mỹ: xếp #3 trên Artificial Analysis, điểm GPQA và SWE-bench Verified thuộc nhóm hàng đầu, và thứ hạng frontend-code arena tốt nhất trong ngành, với mức giá chỉ bằng khoảng một nửa đến một phần ba so với các mô hình frontier đóng của Mỹ. Nên chọn mô hình này cho lập trình agentic, công việc frontend và tự động hóa SaaS, những lĩnh vực có điểm benchmark mạnh nhất, hoặc nếu lộ trình phụ thuộc vào việc tự triển khai một mô hình cấp frontier khi trọng số được phát hành. Nên tránh dùng cho các sản phẩm tương tác (33 token/giây là khá chậm), cho bất kỳ nội dung nào liên quan đến chính trị nhạy cảm hoặc yêu cầu lưu trú dữ liệu nghiêm ngặt tại EU (kiểm duyệt tiếng Trung, thẩm quyền pháp lý Bắc Kinh), và cho các tác vụ truy xuất đòi hỏi độ chính xác cao vì tỷ lệ ảo giác 51% trên AA-Omniscience đòi hỏi phải có lớp kiểm chứng bổ sung. Các đội đặt nặng yếu tố chi phí nên lưu ý rằng DeepSeek V4 vẫn mang lại số lượng token trên mỗi đô la lớn hơn nhiều; điểm mạnh của K3 nằm ở năng lực đỉnh cao trên mỗi đô la, không phải ở mức token rẻ nhất.

Đám đông nói gì

Về DeepSeek-V4

Ngón Cái Chúc Xuống

Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.

Người Đánh Giá Công Tâm

MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.

Hiệp Sĩ Ship Liên Tục

MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.

Về Kimi K3

Thuyền Trưởng Hủy Gói

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Ngón Cái Vàng

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Thánh Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Câu hỏi thường gặp

DeepSeek-V4 có tốt hơn Kimi K3 không?

Lựa chọn đúng tùy vào nhu cầu của bạn. Bảng so sánh từng dòng trên trang này mổ xẻ giá, thông số chính và điểm đấu trường.

DeepSeek-V4 hay Kimi K3 rẻ hơn?

DeepSeek-V4 rẻ hơn: giá từ $0.87/1M out, trong khi Kimi K3 bắt đầu từ $15/1M out.

DeepSeek-V4 và Kimi K3 giá bao nhiêu cho mỗi 1M tokens?

DeepSeek-V4: $0.435/1M in (cache hit $0.003625) cho 1M input tokens, $0.87/1M out cho 1M output tokens. Kimi K3: $3/1M in cho 1M input tokens, $15/1M out cho 1M output tokens.