สังเวียน · รีวิวโมเดล AI
Llama 4 (Scout / Maverick)
โดย Meta
คู่หู MoE แบบ open weights ของ Meta: พารามิเตอร์ active 17B, รับ input ภาพแบบ native, context 10M โทเค็นบนกระดาษ
$0.60/1M out (Maverick, hosted)
ไม่มี API แบบจ่ายเงินจาก Meta โดยตรง ราคาที่แสดงคือเรต hosted ของบุคคลที่สามทั่วไปสำหรับ Maverick (Scout เริ่มราว $0.10/$0.30 ต่อ 1M บน DeepInfra, $0.11/$0.34 บน Groq) Context ของ Scout แบบ hosted ถูกจำกัดต่ำกว่าสเปก 10M มาก (เช่น ~320K บน DeepInfra)
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
มี
Llama 4 (Scout / Maverick) คืออะไร?
โมเดล mixture-of-experts แบบ open weights ที่เป็นมัลติโหมดโดยกำเนิดชุดแรกของ Meta เปิดตัว 5 เมษายน 2025 Scout (พารามิเตอร์รวม 109B, 16 experts) เล็งการใช้งานบน GPU เดียวพร้อม context ตามสเปก 10M โทเค็น ส่วน Maverick (รวม 400B, 128 experts) คือโมเดลแชทเรือธงที่มีหน้าต่าง 1M โทเค็น
ข้อดีและข้อเสียของ Llama 4 (Scout / Maverick)
ข้อดี
- ประสิทธิภาพแบบ MoE: พารามิเตอร์ active แค่ 17B ต่อโทเค็น (Scout 109B/16 experts, Maverick 400B/128 experts) ให้แชทระดับใกล้ GPT-4o ด้วยพลังประมวลผลเพียงเสี้ยวเดียว
- Hosted inference ถูกมาก: Maverick เริ่มราว $0.15/1M input และ $0.60/1M output; Scout เริ่มราว $0.10/$0.30 บน DeepInfra หรือ $0.11/$0.34 บน Groq
- มัลติโหมดแบบ early-fusion โดยกำเนิด (ข้อความบวกภาพ ทดสอบถึง 8 ภาพ) ในโมเดล open weights
- Context ตามสเปกใหญ่ที่สุดของโมเดล open weights ณ ตอนเปิดตัว: 10M โทเค็นบน Scout และ 1M บน Maverick
- Scout รันได้บน GPU H100 ตัวเดียวด้วย Int4 quantization และ pretrain มาบน 200 ภาษา
- Throughput สูง: พารามิเตอร์ active 17B ทำได้ 500+ โทเค็น/วินาทีบนผู้ให้บริการสายเร็ว (Groq ระบุ Scout ที่ 594 TPS)
ข้อเสีย
- ความเชื่อมั่นใน benchmark เสียหาย: Meta ส่ง Maverick เวอร์ชันจูนสำหรับแชทที่ไม่เผยแพร่ไปขึ้น LMArena (ELO 1417) ซึ่งนักพัฒนาเรียกว่าชี้นำผิด เพราะ weights สาธารณะทำคะแนนต่ำกว่า
- คำอ้าง long-context พังในการใช้จริง: Scout ทำได้ ~15.6% ที่ 128K บน Fiction.LiveBench เทียบกับ 90.6% ของ Gemini 2.5 Pro และผู้ให้บริการ hosted จำกัด Scout ต่ำกว่า 10M มาก (เช่น ~320K บน DeepInfra)
- งานโค้ดถูกสับเละบน r/LocalLlama และ HN แพ้ DeepSeek V3 ที่ราคาพอกันในงานพัฒนาจริง
- ไม่ใช่โอเพนซอร์สตามนิยาม OSI: ไลเซนส์กีดกันบริษัทที่จดทะเบียนใน EU ต้องขอไลเซนส์พิเศษเมื่อเกิน 700M MAU และบังคับติดแบรนด์ Llama
- พารามิเตอร์รวม 109B/400B ใหญ่เกินไปสำหรับ GPU ผู้บริโภค และสายพันธุ์นี้ก็ชะงัก: ไม่มีรุ่น reasoning ออกมา และ Behemoth ไม่เคยเปิดตัว
คำตัดสินของสังเวียน
เลือก Llama 4 ถ้าคุณต้องการโมเดลมัลติโหมดที่ถูก เร็ว และ self-host ได้ สำหรับแชทปริมาณสูง งานสกัดข้อมูล หรืองานหลายภาษานอก EU; Maverick ให้คุณภาพใกล้ GPT-4o ที่ราวหนึ่งในสิบของราคา ควรเลี่ยงสำหรับงานโค้ด การใช้เหตุผลยาก หรือการดึงข้อมูลระดับล้านโทเค็นของจริง ซึ่ง DeepSeek, Qwen 3 และ Gemini เหนือกว่าชัดเจน เทียบกับ Llama 3.3 70B มันเพิ่มวิชันแบบ native และหน้าต่างที่ยาวขึ้น แต่นักพัฒนาจำนวนมากพบว่าโมเดล dense รุ่นเก่าหรือ Qwen น่าเชื่อถือกว่าสำหรับคุณภาพข้อความล้วน และ context 10M ส่วนใหญ่เป็นแค่ตัวเลขบนกระดาษ
ยกนิ้วให้หรือคว่ำนิ้วลง
ออกคำตัดสินของคุณ
คุณจะแนะนำ Llama 4 (Scout / Maverick) หรือจะเตือนฝูงชนให้ถอยห่าง?
ทางเลือกที่ดีที่สุดแทน Llama 4 (Scout / Maverick)
ทางเลือกทั้งหมดโมเดลที่เร็วที่สุดของ Anthropic: ฝีมือโค้ดราว 90% ของ Sonnet 4.5 ที่ $1/$5 ต่อ 1M โทเค็น context 200K
เรือธงคลาส Mythos ของ Anthropic เดือน มิ.ย. 2026: 80.3% บน SWE-bench Pro นำโมเดล frontier ทุกตัวอยู่ 11 แต้ม
Opus ของ Anthropic เดือน เม.ย. 2026: SWE-bench Verified 87.6%, context 1M, วิชันความละเอียดสูง ปัจจุบันตามหลัง Opus 4.8
เปรียบเทียบ Llama 4 (Scout / Maverick) แบบตัวต่อตัว
Llama 4 (Scout / Maverick): คำถามที่พบบ่อย
Llama 4 (Scout / Maverick) ราคาเท่าไหร่ต่อ 1M tokens?
Llama 4 (Scout / Maverick) ราคา $0.15/1M in (Maverick, hosted) ต่อ 1M input tokens และ $0.60/1M out (Maverick, hosted) ต่อ 1M output tokens ไม่มี API แบบจ่ายเงินจาก Meta โดยตรง ราคาที่แสดงคือเรต hosted ของบุคคลที่สามทั่วไปสำหรับ Maverick (Scout เริ่มราว $0.10/$0.30 ต่อ 1M บน DeepInfra, $0.11/$0.34 บน Groq) Context ของ Scout แบบ hosted ถูกจำกัดต่ำกว่าสเปก 10M มาก (เช่น ~320K บน DeepInfra)