Cara a cara

Logotipo de Llama 4 (Scout / Maverick)vsLogotipo de Claude Fable 5

Llama 4 (Scout / Maverick) vs Claude Fable 5: ¿qué modelo de IA gana en 2026?

Llama 4 (Scout / Maverick) ($0.60/1M out (Maverick, hosted)) y Claude Fable 5 ($50/1M out) están entre las modelos de IA más usadas en 2026. Con 4 votos de la comunidad, Claude Fable 5 va en cabeza con un 63 % de aprobación.

Veredicto rápido

En Razonamiento, elige Claude Fable 5: la arena lo puntúa con 5/5, frente a 2.5/5 de Llama 4 (Scout / Maverick). En presupuesto gana Llama 4 (Scout / Maverick): empieza en $0.60/1M out (Maverick, hosted), frente a $50/1M out de Claude Fable 5.

Comparación línea a línea

Desde
$0.60/1M out (Maverick, hosted)Sin API de pago propia de Meta; se muestran tarifas típicas de alojamiento de terceros para Maverick (Scout desde ~$0.10/$0.30 por millón en DeepInfra, $0.11/$0.34 en Groq). El contexto de Scout alojado está capado muy por debajo de la especificación nominal de 10M (p. ej. ~320K en DeepInfra).
$50/1M outPrecio de lista oficial de la API de Anthropic para claude-fable-5: 10 $/1M de entrada, 50 $/1M de salida, nivel único con contexto de 1M por defecto (sin recargo por contexto largo), salida máxima de 128K; las peticiones rechazadas antes de generar salida no se facturan. Verificado contra platform.claude.com (Introducing Claude Fable 5) en 2026-07.
Proveedor
Meta
Anthropic
Ventana de contexto
10M tokens (Scout) / 1M (Maverick)
1M tokens
Precio de entrada
$0.15/1M in (Maverick, hosted)
$10/1M in
Precio de salida
$0.60/1M out (Maverick, hosted)
$50/1M out
Modalidades
text, vision (image input)
text, vision
Pesos abiertos
No
Puntuación de la multitud
50%(0)
63%(4)
Notas de la arena (1-5)
Razonamiento
2.5
5.0
Código
2.0
5.0
Escritura
2.5
4.5
Velocidad
4.5
2.0
Relación calidad-precio
3.5
3.0

Fortalezas y debilidades

Llama 4 (Scout / Maverick)

  • Eficiencia MoE: solo 17B de parámetros activos por token (Scout 109B/16 expertos, Maverick 400B/128 expertos), logrando un chat casi de clase GPT-4o con una fracción del cómputo
  • Inferencia alojada muy barata: Maverick desde unos $0.15/1M de entrada y $0.60/1M de salida; Scout desde unos $0.10/$0.30 en DeepInfra o $0.11/$0.34 en Groq
  • Multimodalidad nativa de fusión temprana (texto más imágenes, probada hasta con 8 imágenes) en un modelo de pesos abiertos
  • El mayor contexto nominal de cualquier modelo de pesos abiertos en su lanzamiento: 10M de tokens en Scout, 1M en Maverick
  • Scout cabe en una sola GPU H100 con cuantización Int4; preentrenado en 200 idiomas
  • Alto rendimiento: los 17B de parámetros activos alcanzan 500+ tokens/s en proveedores rápidos (Groq lista Scout a 594 TPS)
  • Confianza en los benchmarks dañada: Meta envió a LMArena una variante de Maverick no publicada optimizada para chat (ELO 1417), lo que los desarrolladores tacharon de engañoso porque los pesos públicos puntúan más bajo
  • Las promesas de contexto largo se derrumban en la práctica: Scout obtuvo ~15,6 % a 128K en Fiction.LiveBench frente al 90,6 % de Gemini 2.5 Pro, y los proveedores alojados capan a Scout muy por debajo de 10M (p. ej. ~320K en DeepInfra)
  • Codificación muy criticada en r/LocalLlama y HN, perdiendo frente a DeepSeek V3, de precio similar, en tareas reales de desarrollo
  • No es open source según la OSI: la licencia excluye a las empresas domiciliadas en la UE, exige una licencia especial por encima de 700M de MAU y obliga a usar la marca Llama
  • Los 109B/400B de parámetros totales son demasiado grandes para GPU de consumo, y el linaje se estancó: no salió ninguna variante de razonamiento y Behemoth nunca se publicó

Claude Fable 5

  • 80,3 % en SWE-bench Pro frente al 69,2 % de Opus 4.8, el 58,6 % de GPT-5.5 y el 54,2 % de Gemini 3.1 Pro, unos 11 puntos por delante del siguiente modelo frontera
  • 95,0 % en SWE-bench Verified (Opus 4.8: 88,6 %, GPT-5.5: 82,6 %) y 29,3 % en el split Diamond de FrontierCode de Cognition, más del doble del 13,4 % de Opus 4.8
  • La autonomía de largo alcance es la verdadera noticia: Stripe reporta la migración de una base de código Ruby de 50 millones de líneas completada en un día en lugar de más de 2 meses, y el CEO de Cursor lo califica de estado del arte en CursorBench
  • Las experiencias reales confirman los benchmarks: ingenieros en HN describen un modelo que trabaja como un ingeniero de verdad (CRDT implementados casi sin supervisión, fuzzers escritos por el propio modelo, una reducción de asignaciones de 46x), y Simon Willison midió el equivalente a varios días de trabajo en una sola sesión
  • Ventana de contexto de 1M de tokens por defecto, 128K de salida, y visión en el estado del arte sobre documentos densos (29,8 % en GDP.pdf frente al 24,9 % de GPT-5.5 y el 22,5 % de Opus 4.8)
  • Las peticiones rechazadas antes de generar salida no se facturan, y el respaldo del lado del servidor hacia Opus 4.8 con crédito de respaldo está integrado en la API
  • El doble del precio de Opus 4.8 (10 $/50 $ frente a 5 $/25 $) y lento: una sola petición en una tarea difícil tarda habitualmente varios minutos, Simon Willison lo describe sin rodeos como lento y caro
  • Los clasificadores de seguridad de doble uso fallan con trabajo legítimo: un físico médico reportó problemas de dinámica de fluidos y código de segmentación de resonancias rechazados como riesgos de bioseguridad, con redirección silenciosa a Opus 4.8 (el hilo viral de HN se titulaba «Si Claude Fable deja de ayudarte, nunca lo sabrás»; Anthropic habla de menos del 5 % de las sesiones)
  • Lanzamiento accidentado: los controles de exportación de EE. UU. obligaron a Anthropic a suspender el acceso en todo el mundo del 12 al 30 de junio de 2026, tres días después del lanzamiento, con restauración completa solo el 1 de julio
  • Exige retención de datos de 30 días y no está disponible con retención cero, un bloqueo definitivo para organizaciones con cumplimiento estricto; tampoco hay modo sin razonamiento, la cadena de pensamiento en bruto nunca se devuelve y el prellenado del asistente devuelve un error 400
  • No es el mejor en todo: GPT-5.5 sigue liderando ARC-AGI-2 (85,0 % frente a 77,1 %), y Andon Labs constató que Mythos 5 sin bloqueos rendía peor que Opus 4.7 y GPT-5.5 en Vending-Bench, con un razonamiento que optimizaba la detectabilidad en lugar del daño real

Dicta tu veredicto

Una recomendación por herramienta y por gladiador. Moldea la puntuación de la multitud que ven todos.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%puntuación · 0
Claude Fable 5$50/1M out
63%puntuación · 4

El veredicto de la arena sobre Llama 4 (Scout / Maverick)

Elija Llama 4 si necesita un modelo multimodal barato, rápido y autoalojable para chat de alto volumen, extracción o cargas multilingües fuera de la UE; Maverick se acerca a la calidad de GPT-4o por aproximadamente una décima parte del precio. Evítelo para codificación, razonamiento difícil o recuperación genuina de un millón de tokens, donde DeepSeek, Qwen 3 y Gemini lo superan con claridad. Frente a Llama 3.3 70B añade visión nativa y una ventana más larga, pero muchos desarrolladores encontraron el antiguo modelo denso o Qwen más fiables en pura calidad de texto, y el contexto de 10M es sobre todo un número sobre el papel.

El veredicto de la arena sobre Claude Fable 5

Elija Claude Fable 5 si su carga de trabajo es realmente de largo alcance: ejecuciones agénticas nocturnas, migraciones monstruosas, tareas donde una sesión de varias horas sustituye días de trabajo supervisado. Ahí, el sobreprecio de 2x frente a Opus 4.8 se amortiza en compresión de tareas, y los benchmarks (80,3 % en SWE-bench Pro, 11 puntos por delante del pelotón) están respaldados por despliegues reales en Stripe y Cursor. Para codificación interactiva y trabajo diario, quédese con Opus 4.8: 88,6 % en SWE-bench Verified a mitad de precio, sin falsos positivos de clasificadores y con turnos más rápidos. Los equipos sensibles al coste obtienen codificación casi de nivel Opus con Sonnet 5 a 3 $/15 $ (precio de lanzamiento 2 $/10 $ hasta agosto de 2026). Evite Fable 5 por completo si su organización exige retención cero de datos o si trabaja cerca de la biología, la imagen médica o las herramientas de seguridad, ámbitos donde los clasificadores de doble uso aún producen falsos positivos y sustituyen silenciosamente el modelo por Opus 4.8 en plena sesión.

Lo que dice la multitud

Sobre Llama 4 (Scout / Maverick)

Aún no hay veredictos. Sé el primero en hablar.

Sobre Claude Fable 5

Pulgar Abajicus

I do medical imaging research and the bio classifier keeps flagging my MRI segmentation prompts, then it silently falls back to Opus 4.8 mid-session. At $50 per million output tokens I expect to at least know which model actually answered me.

Glorius Maximus

Yes it's 2x the price of Opus and yes the turns are slow. But one overnight Fable run replaced what used to be a week of supervising shorter runs. On a per-task basis it's actually the cheapest model we use.

Pulgar de Oro Maximus

The 1M context is real, not marketing. I fed it our entire service mesh config plus six months of incident postmortems and it traced a flaky timeout to a retry policy nobody remembered writing. Opus 4.8 never connected those dots.

San Deployus

Gave it a monorepo migration that Opus 4.8 kept stalling on. It ran for about 40 minutes, came back with the whole thing done plus a test harness it wrote for itself. Felt like reviewing a senior engineer's PR, not babysitting a chatbot.

Preguntas frecuentes

¿Es Llama 4 (Scout / Maverick) mejor que Claude Fable 5?

La multitud se inclina hoy por Claude Fable 5: el 63 % lo recomienda, frente al 50 % de Llama 4 (Scout / Maverick) (4 votos). En Razonamiento, Claude Fable 5 puntúa más alto (5/5 frente a 2.5/5). La mejor opción depende de tu caso de uso. La comparación línea a línea de esta página desglosa precios, características clave y las puntuaciones de la arena.

¿Cuál es más barata, Llama 4 (Scout / Maverick) o Claude Fable 5?

Llama 4 (Scout / Maverick) es más barata: empieza en $0.60/1M out (Maverick, hosted), mientras que Claude Fable 5 empieza en $50/1M out.

¿Cuánto cuestan Llama 4 (Scout / Maverick) y Claude Fable 5 por millón de tokens?

Llama 4 (Scout / Maverick): $0.15/1M in (Maverick, hosted) por millón de tokens de entrada, $0.60/1M out (Maverick, hosted) por millón de tokens de salida. Claude Fable 5: $10/1M in por millón de tokens de entrada, $50/1M out por millón de tokens de salida.