Đấu trường · Đánh giá mô hình AI

Claude Opus 4.8

bởi Anthropic

Model hạng Opus chủ lực của Anthropic cho lập trình agentic dài hơi; ngữ cảnh 1M ở mức $5/$25 mỗi 1M tokens.

Điểm đấu trường 4.2/557% khuyên dùng · 3 phiếu
Suy luận4.5
Lập trình5.0
Viết lách5.0
Tốc độ3.0
Đáng tiền3.5
Truy cập Claude Opus 4.8agent lập trình dài hơirefactor lớn và di trú codebasecode review và debugcông việc tri thức doanh nghiệp (pháp lý, tài chính, nghiên cứu)
Giá

$25/1M out

Bậc chuẩn $5/$25 mỗi 1M tokens (không đổi so với Opus 4.7); fast mode bản preview nghiên cứu ở mức $10/$50 (so với $30/$150 của bậc fast đã ngừng trên Opus 4.7); batch API giảm 50% còn $2.50/$12.50; không phụ thu ngữ cảnh dài đến 1M tokens; đọc prompt cache ở mức $0.50/1M.

Nhà cung cấp

Anthropic

Cửa sổ ngữ cảnh

1M tokens (128K max output)

Giá input

$5/1M in

Giá output

$25/1M out

Phương thức

text, vision (image input up to 2576px, text output)

Open weights

Không

Claude Opus 4.8 là gì?

Model hạng Opus mạnh nhất của Anthropic, ra mắt ngày 28 tháng 5 năm 2026. Được tinh chỉnh cho lập trình agentic dài hơi, sử dụng công cụ và khả năng tự đánh giá trung thực công việc của chính mình, với cửa sổ ngữ cảnh 1M tokens, output tối đa 128K, và adaptive thinking kèm điều khiển effort. Giữ nguyên hoàn toàn bề mặt API và giá của Opus 4.7.

Ưu và nhược điểm của Claude Opus 4.8

Ưu điểm

  • SWE-Bench Pro 69.2% (so với 64.3% của Opus 4.7) và thắng mọi model Opus trước đó trên CursorBench ở mọi mức effort; báo cáo thực tế ấn tượng về refactor lớn và săn bug đa file
  • Khả năng để lọt lỗi trong code do chính mình sinh ra thấp hơn Opus 4.7 khoảng 4x; bước nhảy lớn về suy luận toán học (USAMO 2026: 96.7% so với 69.3%)
  • Ngữ cảnh 1M tokens và output 128K ở mức giá $5/$25 không đổi, không phụ thu ngữ cảnh dài; batch API giảm 50% ($2.50/$12.50)
  • Fast mode (bản preview nghiên cứu) cho tốc độ output nhanh tới 2.5x ở mức $10/$50, rẻ hơn 3x so với bậc fast của Opus 4.7 ($30/$150)
  • Tính năng API độc đáo cho agent: system message giữa hội thoại vẫn giữ được prompt cache, và Dynamic Workflows sinh subagent song song trong Claude Code
  • 84% trên Online-Mind2Web về tự động hóa trình duyệt và điểm kỷ lục trên Legal Agent Benchmark (model đầu tiên vượt 10% all-pass); rất mạnh trong công việc tri thức doanh nghiệp (Box báo cáo 87% so với 77% nội bộ)

Nhược điểm

  • Có báo cáo thụt lùi ở từng lượt: bỏ sót chỉ dẫn hiển nhiên trong tài liệu kế hoạch, chỉ trả lời một phần hẹp của mục tiêu, và sinh UI đơn giản một lần kém hơn 4.7
  • Văn phong bị người dùng nặng chỉ trích: rào đón quá đà, biên tập quá thận trọng đến mức 'cắt hết mọi thứ táo bạo hay hài hước' (Steve Yegge), và vòng lặp phản bác cả những luận điểm đã có bằng chứng vững
  • Lỗi trộn ngôn ngữ: người dùng báo cáo chèn ngẫu nhiên tiếng Trung, ký tự Kirin hoặc Hy Lạp trong các luồng nghiên cứu dài
  • Chất lượng giảm rõ rệt sau ~200K tokens trong sử dụng thực tế dù quảng cáo cửa sổ 1M
  • Thụt lùi trên Vending-Bench: sập bẫy nhà cung cấp lừa đảo nhiều hơn 4.7 khoảng 30x và đàm phán kém hơn (tác dụng phụ của việc căn chỉnh trung thực nghiêm hơn)

Phán quyết của đấu trường

Một nâng cấp thay thế trực tiếp cho người dùng Opus 4.7: bề mặt API và giá $5/$25 y hệt nhưng có bước tiến thật trên lập trình agentic dài hơi, code review và phân tích doanh nghiệp. Chọn nó nếu bạn chạy Claude Code, di trú đa file, kiểm toán bảo mật hoặc pipeline agent phải kiểm tra, hành động rồi xác minh qua nhiều bước. Bỏ qua nó với các đoạn UI một lần nhanh gọn hoặc prompt đã tinh chỉnh sát hành vi của 4.7, nơi người dùng báo cáo thụt lùi, và chọn Sonnet 5 ($3/$15, giá khởi điểm $2/$10 đến hết tháng 8/2026) nếu chi phí quan trọng hơn trần năng lực. Người viết lách nhạy cảm với kiểu rào đón và biên tập quá thận trọng có thể thấy văn phong của nó khó chịu.

Ngón cái lên hay ngón cái xuống

Đưa ra phán quyết của bạn

Bạn sẽ khuyên dùng Claude Opus 4.8, hay cảnh báo đám đông tránh xa?

57%điểm đám đông · 3

Những lựa chọn thay thế Claude Opus 4.8 hàng đầu

Tất cả lựa chọn thay thế
1
Claude Haiku 4.5

Model nhanh nhất của Anthropic: khoảng 90% năng lực lập trình của Sonnet 4.5 ở mức $1/$5 mỗi 1M tokens, ngữ cảnh 200K.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Chủ lực hạng Mythos tháng 6/2026 của Anthropic: 80.3% trên SWE-bench Pro, bỏ xa mọi model đỉnh cao khác 11 điểm

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

Opus tháng 4/2026 của Anthropic: 87.6% SWE-bench Verified, ngữ cảnh 1M, vision độ phân giải cao, nay xếp sau Opus 4.8

$25/1M out57%(3)
Visit

So sánh Claude Opus 4.8 đối đầu trực tiếp

Đám đông nói gì

Thẩm Phán Đáng Sợ

Writing took a hit. It hedges everything and edits any bold or funny line out of my drafts. Also caught it answering a narrow slice of my planning doc and calling it done.

Nhà Vô Địch Cảm Hứng

Threw USAMO-level math at it for a lark and it just grinds through. 96.7 vs 69 for 4.7 tracks with what I see. Same $5/$25, 1M context, no excuse not to switch.

Glorius Maximus

Upgraded from 4.7 for a monorepo refactor and the difference is real. It actually flags its own sketchy code instead of shipping it. Multi-file bug hunts feel way less babysat.

Claude Opus 4.8: câu hỏi thường gặp

Claude Opus 4.8 giá bao nhiêu cho mỗi 1M tokens?

Claude Opus 4.8 có giá $5/1M in cho 1M input tokens và $25/1M out cho 1M output tokens. Bậc chuẩn $5/$25 mỗi 1M tokens (không đổi so với Opus 4.7); fast mode bản preview nghiên cứu ở mức $10/$50 (so với $30/$150 của bậc fast đã ngừng trên Opus 4.7); batch API giảm 50% còn $2.50/$12.50; không phụ thu ngữ cảnh dài đến 1M tokens; đọc prompt cache ở mức $0.50/1M.