Cara a cara

Logotipo de Kimi K3vsLogotipo de Claude Fable 5

Kimi K3 vs Claude Fable 5: ¿qué modelo de IA gana en 2026?

Kimi K3 ($15/1M out) y Claude Fable 5 ($50/1M out) están entre las modelos de IA más usadas en 2026. Con 7 votos de la comunidad, Claude Fable 5 va en cabeza con un 63 % de aprobación.

Veredicto rápido

En Razonamiento, elige Claude Fable 5: la arena lo puntúa con 5/5, frente a 4.5/5 de Kimi K3. En presupuesto gana Kimi K3: empieza en $15/1M out, frente a $50/1M out de Claude Fable 5.

Comparación línea a línea

Desde
$15/1M outPrecio oficial de lista de la API de Moonshot para kimi-k3: $3 por millón de tokens de entrada (fallo de caché), $0,30 por millón con acierto de caché, $15 por millón de salida incluyendo el rastro de razonamiento, precio fijo en toda la ventana de 1M de tokens (sin niveles según longitud). Mismo precio de $3/$15 en OpenRouter (el precio de caché no se muestra ahí). Un aumento de 3 veces respecto a los $0,95/$4 de Kimi K2.6. Verificado en platform.kimi.ai/docs/pricing/chat-k3 en julio de 2026.
$50/1M outPrecio de lista oficial de la API de Anthropic para claude-fable-5: 10 $/1M de entrada, 50 $/1M de salida, nivel único con contexto de 1M por defecto (sin recargo por contexto largo), salida máxima de 128K; las peticiones rechazadas antes de generar salida no se facturan. Verificado contra platform.claude.com (Introducing Claude Fable 5) en 2026-07.
Proveedor
Moonshot AI
Anthropic
Ventana de contexto
1M tokens
1M tokens
Precio de entrada
$3/1M in
$10/1M in
Precio de salida
$15/1M out
$50/1M out
Modalidades
text, vision, video input
text, vision
Pesos abiertos
No
No
Puntuación de la multitud
57%(3)
63%(4)
Notas de la arena (1-5)
Razonamiento
4.5
5.0
Código
4.5
5.0
Escritura
4.0
4.5
Velocidad
2.0
2.0
Relación calidad-precio
3.5
3.0

Fortalezas y debilidades

Kimi K3

  • Puesto número 3 en el Artificial Analysis Intelligence Index (57) al lanzamiento, comparable a Claude Opus 4.8 y GPT-5.5: el laboratorio chino que más se ha acercado a la frontera cerrada estadounidense
  • 93,4% en SWE-bench Verified con el arnés independiente de Vals AI (GPT-5.6 Sol: 96,2%, Claude Fable 5: 95,0%) y puesto número 1 en el Frontend Code Arena de Arena.ai con 1679 puntos, por delante de Fable 5
  • 93,5% en GPQA Diamond (entre el 92,6% de Fable 5 y el 94,1% de GPT-5.6), 96,1% en AIME 2025, y un Elo de 1668 en trabajo agéntico de GDPval-AA v2, solo detrás de Fable 5
  • Perfil agéntico sólido: puesto número 1 en flujos de trabajo SaaS de AutomationBench-AA (53%), navegación autónoma de largo horizonte en terminal y repositorio mediante Kimi Code, y cerca de un 21% menos de tokens de salida que K2 con más inteligencia
  • $3/$15 por millón de tokens (la entrada baja a $0,30 con acierto de caché), precio fijo en toda la ventana de 1M de tokens: aún muy por debajo de los precios de la frontera cerrada estadounidense, con una API compatible con OpenAI y disponibilidad en OpenRouter
  • Entrada multimodal nativa (texto, imagen, video) y pesos abiertos anunciados para el 27/07/2026 bajo una licencia esperada de tipo Modified-MIT, lo que lo posiciona como el primer modelo de frontera de pesos abiertos de clase 3 billones de parámetros
  • Un salto de precio de 3 veces respecto a Kimi K2.6 (de $0,95/$4 a $3/$15), lo que lo convierte en el modelo chino más caro lanzado hasta ahora, al precio de lista de Claude Sonnet 5: la era de “10 veces más barato que los modelos estadounidenses” terminó (alza documentada por Simon Willison)
  • Lento: 33 tokens de salida por segundo, en el puesto 145 de 190 modelos en Artificial Analysis, poco apto para uso interactivo
  • La tasa de alucinación subió de 39% (K2.6) a 51% en AA-Omniscience, ya que el modelo ahora intenta responder donde antes se habría negado (Fable 5 se ubica en un nivel comparable de 54,9%)
  • Censura política en temas sensibles en mandarín (evade preguntas sobre Xi, el PCCh, Tiananmen) y jurisdicción de Pekín para los datos de la API, un obstáculo de cumplimiento para muchos despliegues empresariales y de la UE; el UK AISI/CAISI también encontró que sus salvaguardas de ciberseguridad no lograron bloquear intentos de desarrollo de exploits durante las pruebas
  • “Pesos abiertos” que por ahora son teóricos para la mayoría: alrededor de 594 GB en MXFP4 nativo, que requieren un centro de datos multi-GPU para autoalojarlo, y los pesos (además de la licencia final) seguían sin publicarse al momento de esta revisión

Claude Fable 5

  • 80,3 % en SWE-bench Pro frente al 69,2 % de Opus 4.8, el 58,6 % de GPT-5.5 y el 54,2 % de Gemini 3.1 Pro, unos 11 puntos por delante del siguiente modelo frontera
  • 95,0 % en SWE-bench Verified (Opus 4.8: 88,6 %, GPT-5.5: 82,6 %) y 29,3 % en el split Diamond de FrontierCode de Cognition, más del doble del 13,4 % de Opus 4.8
  • La autonomía de largo alcance es la verdadera noticia: Stripe reporta la migración de una base de código Ruby de 50 millones de líneas completada en un día en lugar de más de 2 meses, y el CEO de Cursor lo califica de estado del arte en CursorBench
  • Las experiencias reales confirman los benchmarks: ingenieros en HN describen un modelo que trabaja como un ingeniero de verdad (CRDT implementados casi sin supervisión, fuzzers escritos por el propio modelo, una reducción de asignaciones de 46x), y Simon Willison midió el equivalente a varios días de trabajo en una sola sesión
  • Ventana de contexto de 1M de tokens por defecto, 128K de salida, y visión en el estado del arte sobre documentos densos (29,8 % en GDP.pdf frente al 24,9 % de GPT-5.5 y el 22,5 % de Opus 4.8)
  • Las peticiones rechazadas antes de generar salida no se facturan, y el respaldo del lado del servidor hacia Opus 4.8 con crédito de respaldo está integrado en la API
  • El doble del precio de Opus 4.8 (10 $/50 $ frente a 5 $/25 $) y lento: una sola petición en una tarea difícil tarda habitualmente varios minutos, Simon Willison lo describe sin rodeos como lento y caro
  • Los clasificadores de seguridad de doble uso fallan con trabajo legítimo: un físico médico reportó problemas de dinámica de fluidos y código de segmentación de resonancias rechazados como riesgos de bioseguridad, con redirección silenciosa a Opus 4.8 (el hilo viral de HN se titulaba «Si Claude Fable deja de ayudarte, nunca lo sabrás»; Anthropic habla de menos del 5 % de las sesiones)
  • Lanzamiento accidentado: los controles de exportación de EE. UU. obligaron a Anthropic a suspender el acceso en todo el mundo del 12 al 30 de junio de 2026, tres días después del lanzamiento, con restauración completa solo el 1 de julio
  • Exige retención de datos de 30 días y no está disponible con retención cero, un bloqueo definitivo para organizaciones con cumplimiento estricto; tampoco hay modo sin razonamiento, la cadena de pensamiento en bruto nunca se devuelve y el prellenado del asistente devuelve un error 400
  • No es el mejor en todo: GPT-5.5 sigue liderando ARC-AGI-2 (85,0 % frente a 77,1 %), y Andon Labs constató que Mythos 5 sin bloqueos rendía peor que Opus 4.7 y GPT-5.5 en Vending-Bench, con un razonamiento que optimizaba la detectabilidad en lugar del daño real

Dicta tu veredicto

Una recomendación por herramienta y por gladiador. Moldea la puntuación de la multitud que ven todos.

Kimi K3$15/1M out
57%puntuación · 3
Claude Fable 5$50/1M out
63%puntuación · 4

El veredicto de la arena sobre Kimi K3

Kimi K3 es el argumento más contundente hasta ahora de que la frontera ya no es exclusivamente estadounidense: puesto número 3 en Artificial Analysis, puntajes de primer nivel en GPQA y SWE-bench Verified, y el mejor ranking del sector en la arena de código frontend, todo a aproximadamente la mitad o un tercio de los precios de la frontera cerrada estadounidense. Elegirlo para codificación agéntica, trabajo frontend y automatización SaaS, donde sus benchmarks son más sólidos, o si la hoja de ruta contempla autoalojar un modelo de clase frontera una vez publicados los pesos. Evitarlo para productos interactivos (33 tokens por segundo es lento), para cualquier cosa que involucre contenido políticamente sensible o requisitos estrictos de residencia de datos en la UE (censura en mandarín, jurisdicción de Pekín), y para búsquedas de alta precisión, donde su tasa de alucinación del 51% en AA-Omniscience exige una capa de verificación. Los equipos obsesionados con el costo deben notar que DeepSeek V4 todavía entrega muchos más tokens por dólar: la propuesta de K3 es la máxima capacidad por dólar, no el token más barato.

El veredicto de la arena sobre Claude Fable 5

Elija Claude Fable 5 si su carga de trabajo es realmente de largo alcance: ejecuciones agénticas nocturnas, migraciones monstruosas, tareas donde una sesión de varias horas sustituye días de trabajo supervisado. Ahí, el sobreprecio de 2x frente a Opus 4.8 se amortiza en compresión de tareas, y los benchmarks (80,3 % en SWE-bench Pro, 11 puntos por delante del pelotón) están respaldados por despliegues reales en Stripe y Cursor. Para codificación interactiva y trabajo diario, quédese con Opus 4.8: 88,6 % en SWE-bench Verified a mitad de precio, sin falsos positivos de clasificadores y con turnos más rápidos. Los equipos sensibles al coste obtienen codificación casi de nivel Opus con Sonnet 5 a 3 $/15 $ (precio de lanzamiento 2 $/10 $ hasta agosto de 2026). Evite Fable 5 por completo si su organización exige retención cero de datos o si trabaja cerca de la biología, la imagen médica o las herramientas de seguridad, ámbitos donde los clasificadores de doble uso aún producen falsos positivos y sustituyen silenciosamente el modelo por Opus 4.8 en plena sesión.

Lo que dice la multitud

Sobre Kimi K3

Capitán Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Pulgar de Oro Maximus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

San Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Sobre Claude Fable 5

Pulgar Abajicus

I do medical imaging research and the bio classifier keeps flagging my MRI segmentation prompts, then it silently falls back to Opus 4.8 mid-session. At $50 per million output tokens I expect to at least know which model actually answered me.

Glorius Maximus

Yes it's 2x the price of Opus and yes the turns are slow. But one overnight Fable run replaced what used to be a week of supervising shorter runs. On a per-task basis it's actually the cheapest model we use.

Pulgar de Oro Maximus

The 1M context is real, not marketing. I fed it our entire service mesh config plus six months of incident postmortems and it traced a flaky timeout to a retry policy nobody remembered writing. Opus 4.8 never connected those dots.

San Deployus

Gave it a monorepo migration that Opus 4.8 kept stalling on. It ran for about 40 minutes, came back with the whole thing done plus a test harness it wrote for itself. Felt like reviewing a senior engineer's PR, not babysitting a chatbot.

Preguntas frecuentes

¿Es Kimi K3 mejor que Claude Fable 5?

La multitud se inclina hoy por Claude Fable 5: el 63 % lo recomienda, frente al 57 % de Kimi K3 (7 votos). En Razonamiento, Claude Fable 5 puntúa más alto (5/5 frente a 4.5/5). La mejor opción depende de tu caso de uso. La comparación línea a línea de esta página desglosa precios, características clave y las puntuaciones de la arena.

¿Cuál es más barata, Kimi K3 o Claude Fable 5?

Kimi K3 es más barata: empieza en $15/1M out, mientras que Claude Fable 5 empieza en $50/1M out.

¿Cuánto cuestan Kimi K3 y Claude Fable 5 por millón de tokens?

Kimi K3: $3/1M in por millón de tokens de entrada, $15/1M out por millón de tokens de salida. Claude Fable 5: $10/1M in por millón de tokens de entrada, $50/1M out por millón de tokens de salida.