Cara a cara

Logotipo de DeepSeek-V4vsLogotipo de Kimi K3

DeepSeek-V4 vs Kimi K3: ¿qué modelo de IA gana en 2026?

DeepSeek-V4 ($0.87/1M out) y Kimi K3 ($15/1M out) están entre las modelos de IA más usadas en 2026. Con 6 votos de la comunidad, DeepSeek-V4 va en cabeza con un 57 % de aprobación.

Veredicto rápido

En Razonamiento, DeepSeek-V4 y Kimi K3 empatan con 4.5/5. En presupuesto gana DeepSeek-V4: empieza en $0.87/1M out, frente a $15/1M out de Kimi K3.

Comparación línea a línea

Desde
$0.87/1M outNivel V4-Pro: $0.435/1M de entrada ($0.003625 con acierto de caché), $0.87/1M de salida; nivel V4-Flash más barato a $0.14/$0.28 ($0.0028 con acierto de caché); el descuento de lanzamiento del 75 % pasó a ser el precio permanente el 22/05/2026. El lanzamiento oficial de mediados de julio de 2026 introduce precios de hora punta/valle, con las tarifas listadas duplicándose en las horas punta de Pekín.
$15/1M outPrecio oficial de lista de la API de Moonshot para kimi-k3: $3 por millón de tokens de entrada (fallo de caché), $0,30 por millón con acierto de caché, $15 por millón de salida incluyendo el rastro de razonamiento, precio fijo en toda la ventana de 1M de tokens (sin niveles según longitud). Mismo precio de $3/$15 en OpenRouter (el precio de caché no se muestra ahí). Un aumento de 3 veces respecto a los $0,95/$4 de Kimi K2.6. Verificado en platform.kimi.ai/docs/pricing/chat-k3 en julio de 2026.
Proveedor
DeepSeek
Moonshot AI
Ventana de contexto
1M tokens (384K max output)
1M tokens
Precio de entrada
$0.435/1M in (cache hit $0.003625)
$3/1M in
Precio de salida
$0.87/1M out
$15/1M out
Modalidades
text only
text, vision, video input
Pesos abiertos
No
Puntuación de la multitud
57%(3)
57%(3)
Notas de la arena (1-5)
Razonamiento
4.5
4.5
Código
4.5
4.5
Escritura
3.5
4.0
Velocidad
3.0
2.0
Relación calidad-precio
5.0
3.5

Fortalezas y debilidades

DeepSeek-V4

  • Ventana de contexto de 1M de tokens (8x los 128K de V3.2) con hasta 384K tokens de salida, estándar en la API oficial
  • Precios agresivos: $0.435/$0.87 por millón de tokens (V4-Pro), unas 28,7x más barato por token de salida que Claude Opus 4.8; la entrada con acierto de caché baja a $0.003625/1M (más del 99 % de descuento)
  • Pesos abiertos con licencia MIT para V4-Pro y V4-Flash en Hugging Face: uso comercial, fine-tuning y redistribución permitidos
  • SOTA de código abierto en codificación agéntica: 80,6 en SWE-bench Verified (configuración Think Max), empatado con Gemini 3.1 Pro, más un rating de Codeforces de 3206 (~puesto 23 frente a humanos)
  • Puesto #3 de 93 en el Intelligence Index de Artificial Analysis (puntuación 44), muy por encima de la media de 25
  • El stack de atención dispersa reduce la inferencia con contexto de 1M al 27 % de los FLOPs de V3.2 y al 10 % de su caché KV
  • Llamadas a herramientas malformadas intermitentes: llamadas a funciones emitidas a veces como texto plano en el contenido en lugar del campo tool_calls (issue de GitHub deepseek-ai #1244)
  • El modo de razonamiento rompe cadenas largas de llamadas a herramientas multivuelta con errores 400 en frameworks de agentes (issue OpenClaw #72044, corrección aún incompleta)
  • Los desarrolladores reportan que fabrica API inexistentes en bases de código propias y actúa sobre entradas de usuario alucinadas en bucles de agentes
  • Muy verboso (180M de tokens de salida en evaluación frente a una mediana de 95M) y velocidad media de 54,6 tokens/s (#39/93), lo que erosiona en la práctica el bajo precio por token
  • Solo texto (sin visión ni audio) y aún en vista previa: el lanzamiento oficial previsto para mediados de julio de 2026 añade precios de hora punta que duplican las tarifas de API listadas durante el horario laboral de Pekín

Kimi K3

  • Puesto número 3 en el Artificial Analysis Intelligence Index (57) al lanzamiento, comparable a Claude Opus 4.8 y GPT-5.5: el laboratorio chino que más se ha acercado a la frontera cerrada estadounidense
  • 93,4% en SWE-bench Verified con el arnés independiente de Vals AI (GPT-5.6 Sol: 96,2%, Claude Fable 5: 95,0%) y puesto número 1 en el Frontend Code Arena de Arena.ai con 1679 puntos, por delante de Fable 5
  • 93,5% en GPQA Diamond (entre el 92,6% de Fable 5 y el 94,1% de GPT-5.6), 96,1% en AIME 2025, y un Elo de 1668 en trabajo agéntico de GDPval-AA v2, solo detrás de Fable 5
  • Perfil agéntico sólido: puesto número 1 en flujos de trabajo SaaS de AutomationBench-AA (53%), navegación autónoma de largo horizonte en terminal y repositorio mediante Kimi Code, y cerca de un 21% menos de tokens de salida que K2 con más inteligencia
  • $3/$15 por millón de tokens (la entrada baja a $0,30 con acierto de caché), precio fijo en toda la ventana de 1M de tokens: aún muy por debajo de los precios de la frontera cerrada estadounidense, con una API compatible con OpenAI y disponibilidad en OpenRouter
  • Entrada multimodal nativa (texto, imagen, video) y pesos abiertos anunciados para el 27/07/2026 bajo una licencia esperada de tipo Modified-MIT, lo que lo posiciona como el primer modelo de frontera de pesos abiertos de clase 3 billones de parámetros
  • Un salto de precio de 3 veces respecto a Kimi K2.6 (de $0,95/$4 a $3/$15), lo que lo convierte en el modelo chino más caro lanzado hasta ahora, al precio de lista de Claude Sonnet 5: la era de “10 veces más barato que los modelos estadounidenses” terminó (alza documentada por Simon Willison)
  • Lento: 33 tokens de salida por segundo, en el puesto 145 de 190 modelos en Artificial Analysis, poco apto para uso interactivo
  • La tasa de alucinación subió de 39% (K2.6) a 51% en AA-Omniscience, ya que el modelo ahora intenta responder donde antes se habría negado (Fable 5 se ubica en un nivel comparable de 54,9%)
  • Censura política en temas sensibles en mandarín (evade preguntas sobre Xi, el PCCh, Tiananmen) y jurisdicción de Pekín para los datos de la API, un obstáculo de cumplimiento para muchos despliegues empresariales y de la UE; el UK AISI/CAISI también encontró que sus salvaguardas de ciberseguridad no lograron bloquear intentos de desarrollo de exploits durante las pruebas
  • “Pesos abiertos” que por ahora son teóricos para la mayoría: alrededor de 594 GB en MXFP4 nativo, que requieren un centro de datos multi-GPU para autoalojarlo, y los pesos (además de la licencia final) seguían sin publicarse al momento de esta revisión

Dicta tu veredicto

Una recomendación por herramienta y por gladiador. Moldea la puntuación de la multitud que ven todos.

DeepSeek-V4$0.87/1M out
57%puntuación · 3
Kimi K3$15/1M out
57%puntuación · 3

El veredicto de la arena sobre DeepSeek-V4

Elija DeepSeek-V4 si quiere razonamiento y codificación agéntica casi frontera a precios de 3x a casi 30x por debajo de Claude Opus o GPT-5.5, o si le importan los pesos con licencia MIT para autoalojamiento y fine-tuning. Es una mejora decisiva sobre V3.2: contexto 8x más largo, inferencia de contexto largo mucho más barata y mejor codificación, y los endpoints heredados deepseek-chat/reasoner quedan de todos modos obsoletos el 24 de julio de 2026. Evítelo para agentes en producción que dependan de llamadas a herramientas multivuelta a prueba de fallos, donde los usuarios aún reportan llamadas malformadas y API inventadas, y para cualquier trabajo de visión o audio, ya que es solo texto. Las apps sensibles a la latencia también deberían probar primero, pues su verbosidad y su velocidad media de 54,6 tokens/s compensan parte de la ventaja de coste, y presupueste la duplicación de precios en hora punta que llega con el lanzamiento oficial de mediados de julio.

El veredicto de la arena sobre Kimi K3

Kimi K3 es el argumento más contundente hasta ahora de que la frontera ya no es exclusivamente estadounidense: puesto número 3 en Artificial Analysis, puntajes de primer nivel en GPQA y SWE-bench Verified, y el mejor ranking del sector en la arena de código frontend, todo a aproximadamente la mitad o un tercio de los precios de la frontera cerrada estadounidense. Elegirlo para codificación agéntica, trabajo frontend y automatización SaaS, donde sus benchmarks son más sólidos, o si la hoja de ruta contempla autoalojar un modelo de clase frontera una vez publicados los pesos. Evitarlo para productos interactivos (33 tokens por segundo es lento), para cualquier cosa que involucre contenido políticamente sensible o requisitos estrictos de residencia de datos en la UE (censura en mandarín, jurisdicción de Pekín), y para búsquedas de alta precisión, donde su tasa de alucinación del 51% en AA-Omniscience exige una capa de verificación. Los equipos obsesionados con el costo deben notar que DeepSeek V4 todavía entrega muchos más tokens por dólar: la propuesta de K3 es la máxima capacidad por dólar, no el token más barato.

Lo que dice la multitud

Sobre DeepSeek-V4

Pulgar Abajicus

Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.

El Juez Benévolo

MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.

Sir Shipea-Mucho

MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.

Sobre Kimi K3

Capitán Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Pulgar de Oro Maximus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

San Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Preguntas frecuentes

¿Es DeepSeek-V4 mejor que Kimi K3?

La mejor opción depende de tu caso de uso. La comparación línea a línea de esta página desglosa precios, características clave y las puntuaciones de la arena.

¿Cuál es más barata, DeepSeek-V4 o Kimi K3?

DeepSeek-V4 es más barata: empieza en $0.87/1M out, mientras que Kimi K3 empieza en $15/1M out.

¿Cuánto cuestan DeepSeek-V4 y Kimi K3 por millón de tokens?

DeepSeek-V4: $0.435/1M in (cache hit $0.003625) por millón de tokens de entrada, $0.87/1M out por millón de tokens de salida. Kimi K3: $3/1M in por millón de tokens de entrada, $15/1M out por millón de tokens de salida.