Đấu trường · Đánh giá mô hình AI
Claude Opus 4.6
bởi Anthropic
Opus tháng 2/2026 của Anthropic: ngữ cảnh 1M, adaptive thinking, 80.8% SWE-bench, nay đã bị Opus 4.8 thay thế.
$25/1M out
Bậc chuẩn $5/$25 mỗi 1M tokens; toàn bộ ngữ cảnh 1M nay theo giá chuẩn (mức phụ thu $10/$37.50 trên 200K tokens lúc ra mắt đã bị bỏ), batch API giảm 50% ($2.50/$12.50), suy luận chỉ trên hạ tầng Mỹ (inference_geo) nhân hệ số 1.1x.
Anthropic
1M tokens (128K max output)
$5/1M in
$25/1M out
text, vision (image input), text output
Không
Claude Opus 4.6 là gì?
Model hạng Opus đỉnh cao ra mắt ngày 5 tháng 2 năm 2026. Là Opus đầu tiên có cửa sổ ngữ cảnh 1M tokens, adaptive thinking và tham số effort (từ low đến max). Đạt 80.8% trên SWE-bench Verified và điểm Terminal-Bench 2.0 cao nhất lúc ra mắt; sau đó bị Opus 4.7 và 4.8 thay thế ở cùng mức giá.
Ưu và nhược điểm của Claude Opus 4.6
Ưu điểm
- 80.8% SWE-bench Verified (trung bình 25 lần chạy) và điểm Terminal-Bench 2.0 cao nhất lúc ra mắt, là model lập trình agentic dẫn đầu thế hệ của nó (tháng 2/2026)
- Opus đầu tiên có cửa sổ ngữ cảnh 1M tokens: 76% trên MRCR v2 8-needle ở 1M tokens so với 18.5% của Sonnet 4.5
- Bước nhảy suy luận lớn so với Opus 4.5: ARC-AGI-2 đạt 68.8% so với 37.6%, +190 Elo trên các tác vụ giá trị kinh tế GDPval-AA (hơn GPT-5.2 khoảng 144 Elo)
- Giữ nguyên giá của Opus 4.5 ($5/$25 mỗi 1M tokens) dù năng lực tăng mạnh; toàn bộ ngữ cảnh 1M nay tính theo giá chuẩn, batch giảm 50%
- Adaptive thinking cộng tham số effort (low/medium/high/max) để đánh đổi trí tuệ, độ trễ và chi phí theo từng request
- Hành vi agent tự hành mạnh: biết chạy song song và cần ít giám sát hơn Opus 4.5 (Every.to Vibe Check)
Nhược điểm
- Chậm hơn và dài dòng hơn Opus 4.5; người đánh giá ghi nhận nhịp độ 'chao đảo khi tải nặng' trong các phiên agentic dài (Every.to)
- Khả năng viết lách thụt lùi: trong thử nghiệm mù, đội của Every.to thích văn phong của Opus 4.5 hơn, và 4.6 có nhiều lối viết kiểu AI như cấu trúc 'X chứ không phải Y'
- Đôi khi tự ý thay đổi ngoài dự kiến và 'không phải lúc nào cũng biết kỹ năng của chính mình', cần giám sát sát hơn GPT-5.x Codex theo người đánh giá
- Bị Opus 4.7 và 4.8 thay thế chỉ sau vài tháng ở cùng giá $5/$25, và fast mode không còn khả dụng trên 4.6 từ tháng 6/2026 (request chạy ở tốc độ chuẩn)
- Một số dev báo cáo hiện tượng mệt mỏi benchmark: mức tiến bộ so với 4.5 khi lập trình hằng ngày khó cảm nhận hơn điểm số cho thấy, và chính SWE-bench đi ngang so với 4.5 (80.8% so với 80.9%)
Phán quyết của đấu trường
Một nâng cấp rõ rệt so với Opus 4.5 cho lập trình agentic và công việc ngữ cảnh dài ở cùng mức giá, từng giữ vị trí đầu các benchmark lập trình agentic lúc ra mắt. Tuy nhiên đến giữa 2026 gần như không còn lý do để khởi động dự án mới trên nó: Opus 4.8 cùng giá $5/$25 và vượt trội toàn diện, nên chỉ chọn 4.6 chủ yếu để ghim một hành vi đã được kiểm chứng. Người viết lách nên tránh model này, vì thử nghiệm mù cho thấy văn phong Opus 4.5 được ưa hơn, và người dùng nhạy cảm độ trễ cần lưu ý nó chậm hơn 4.5 mà không có tùy chọn fast mode.
Ngón cái lên hay ngón cái xuống
Đưa ra phán quyết của bạn
Bạn sẽ khuyên dùng Claude Opus 4.6, hay cảnh báo đám đông tránh xa?
Những lựa chọn thay thế Claude Opus 4.6 hàng đầu
Tất cả lựa chọn thay thếModel nhanh nhất của Anthropic: khoảng 90% năng lực lập trình của Sonnet 4.5 ở mức $1/$5 mỗi 1M tokens, ngữ cảnh 200K.
Chủ lực hạng Mythos tháng 6/2026 của Anthropic: 80.3% trên SWE-bench Pro, bỏ xa mọi model đỉnh cao khác 11 điểm
Opus tháng 4/2026 của Anthropic: 87.6% SWE-bench Verified, ngữ cảnh 1M, vision độ phân giải cao, nay xếp sau Opus 4.8
So sánh Claude Opus 4.6 đối đầu trực tiếp
Claude Opus 4.6: câu hỏi thường gặp
Claude Opus 4.6 giá bao nhiêu cho mỗi 1M tokens?
Claude Opus 4.6 có giá $5/1M in cho 1M input tokens và $25/1M out cho 1M output tokens. Bậc chuẩn $5/$25 mỗi 1M tokens; toàn bộ ngữ cảnh 1M nay theo giá chuẩn (mức phụ thu $10/$37.50 trên 200K tokens lúc ra mắt đã bị bỏ), batch API giảm 50% ($2.50/$12.50), suy luận chỉ trên hạ tầng Mỹ (inference_geo) nhân hệ số 1.1x.