Đấu trường · Đánh giá mô hình AI
Llama 4 (Scout / Maverick)
bởi Meta
Bộ đôi MoE open weights của Meta: 17B tham số hoạt động, input hình ảnh nguyên bản, ngữ cảnh 10M tokens trên lý thuyết
$0.60/1M out (Maverick, hosted)
Không có API trả phí chính chủ từ Meta; hiển thị mức giá lưu trú bên thứ ba điển hình cho Maverick (Scout từ ~$0.10/$0.30 mỗi 1M trên DeepInfra, $0.11/$0.34 trên Groq). Ngữ cảnh Scout trên các host bị giới hạn thấp hơn nhiều so với thông số danh nghĩa 10M (ví dụ ~320K trên DeepInfra).
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
Có
Llama 4 (Scout / Maverick) là gì?
Các model open weights mixture-of-experts đa phương thức nguyên bản đầu tiên của Meta, ra mắt ngày 5 tháng 4 năm 2025. Scout (109B tham số tổng, 16 experts) nhắm tới triển khai trên một GPU với ngữ cảnh danh nghĩa 10M tokens; Maverick (400B tổng, 128 experts) là model chat chủ lực với cửa sổ 1M tokens.
Ưu và nhược điểm của Llama 4 (Scout / Maverick)
Ưu điểm
- Hiệu quả MoE: chỉ 17B tham số hoạt động mỗi token (Scout 109B/16 experts, Maverick 400B/128 experts), cho chất lượng chat gần hạng GPT-4o với một phần nhỏ chi phí tính toán
- Inference lưu trú rất rẻ: Maverick từ khoảng $0.15/1M input và $0.60/1M output; Scout từ khoảng $0.10/$0.30 trên DeepInfra hoặc $0.11/$0.34 trên Groq
- Đa phương thức early-fusion nguyên bản (văn bản cộng hình ảnh, đã test tới 8 ảnh) trong một model open weights
- Ngữ cảnh danh nghĩa lớn nhất trong mọi model open weights lúc ra mắt: 10M tokens trên Scout, 1M trên Maverick
- Scout chạy vừa trên một GPU H100 với lượng tử hóa Int4; được tiền huấn luyện trên 200 ngôn ngữ
- Thông lượng cao: 17B tham số hoạt động đạt 500+ tokens/s trên các nhà cung cấp nhanh (Groq niêm yết Scout ở 594 TPS)
Nhược điểm
- Niềm tin vào benchmark bị tổn hại: Meta nộp cho LMArena một biến thể Maverick tối ưu chat chưa phát hành (ELO 1417), điều dev gọi là gây hiểu lầm vì weights công khai đạt điểm thấp hơn
- Tuyên bố ngữ cảnh dài sụp đổ trong thực tế: Scout đạt ~15.6% ở 128K trên Fiction.LiveBench so với 90.6% của Gemini 2.5 Pro, và các nhà cung cấp lưu trú giới hạn Scout thấp hơn 10M rất nhiều (ví dụ ~320K trên DeepInfra)
- Lập trình bị chê rộng rãi trên r/LocalLlama và HN, thua DeepSeek V3 cùng tầm giá trên các tác vụ dev thực tế
- Không phải open source theo chuẩn OSI: giấy phép loại trừ các công ty có trụ sở tại EU, yêu cầu giấy phép riêng trên 700M MAU, và bắt buộc gắn thương hiệu Llama
- 109B/400B tham số tổng là quá lớn cho GPU phổ thông, và dòng model này đã chững lại: không có biến thể suy luận nào ra mắt và Behemoth chưa bao giờ được phát hành
Phán quyết của đấu trường
Chọn Llama 4 nếu bạn cần một model đa phương thức rẻ, nhanh, tự host được cho chat khối lượng lớn, trích xuất dữ liệu hoặc workload đa ngôn ngữ ngoài EU; Maverick đạt gần chất lượng GPT-4o với khoảng một phần mười giá. Tránh nó cho lập trình, suy luận khó, hoặc truy hồi triệu token thực thụ, nơi DeepSeek, Qwen 3 và Gemini vượt trội rõ rệt. So với Llama 3.3 70B, nó thêm vision nguyên bản và cửa sổ dài hơn, nhưng nhiều dev thấy model dense cũ hoặc Qwen đáng tin hơn về chất lượng văn bản thuần, và ngữ cảnh 10M chủ yếu chỉ là con số trên giấy.
Ngón cái lên hay ngón cái xuống
Đưa ra phán quyết của bạn
Bạn sẽ khuyên dùng Llama 4 (Scout / Maverick), hay cảnh báo đám đông tránh xa?
Những lựa chọn thay thế Llama 4 (Scout / Maverick) hàng đầu
Tất cả lựa chọn thay thếModel nhanh nhất của Anthropic: khoảng 90% năng lực lập trình của Sonnet 4.5 ở mức $1/$5 mỗi 1M tokens, ngữ cảnh 200K.
Chủ lực hạng Mythos tháng 6/2026 của Anthropic: 80.3% trên SWE-bench Pro, bỏ xa mọi model đỉnh cao khác 11 điểm
Opus tháng 4/2026 của Anthropic: 87.6% SWE-bench Verified, ngữ cảnh 1M, vision độ phân giải cao, nay xếp sau Opus 4.8
So sánh Llama 4 (Scout / Maverick) đối đầu trực tiếp
Llama 4 (Scout / Maverick): câu hỏi thường gặp
Llama 4 (Scout / Maverick) giá bao nhiêu cho mỗi 1M tokens?
Llama 4 (Scout / Maverick) có giá $0.15/1M in (Maverick, hosted) cho 1M input tokens và $0.60/1M out (Maverick, hosted) cho 1M output tokens. Không có API trả phí chính chủ từ Meta; hiển thị mức giá lưu trú bên thứ ba điển hình cho Maverick (Scout từ ~$0.10/$0.30 mỗi 1M trên DeepInfra, $0.11/$0.34 trên Groq). Ngữ cảnh Scout trên các host bị giới hạn thấp hơn nhiều so với thông số danh nghĩa 10M (ví dụ ~320K trên DeepInfra).