Cara a cara
Kimi K3 vs Gemini 3 Pro: ¿qué modelo de IA gana en 2026?
Kimi K3 ($15/1M out) y Gemini 3 Pro ($12/1M out (prompts ≤200K)) están entre las modelos de IA más usadas en 2026. Con 6 votos de la comunidad, Kimi K3 va en cabeza con un 57 % de aprobación.
Veredicto rápido
En Razonamiento, Kimi K3 y Gemini 3 Pro empatan con 4.5/5. En presupuesto gana Gemini 3 Pro: empieza en $12/1M out (prompts ≤200K), frente a $15/1M out de Kimi K3.
Comparación línea a línea
Fortalezas y debilidades
Kimi K3
- Puesto número 3 en el Artificial Analysis Intelligence Index (57) al lanzamiento, comparable a Claude Opus 4.8 y GPT-5.5: el laboratorio chino que más se ha acercado a la frontera cerrada estadounidense
- 93,4% en SWE-bench Verified con el arnés independiente de Vals AI (GPT-5.6 Sol: 96,2%, Claude Fable 5: 95,0%) y puesto número 1 en el Frontend Code Arena de Arena.ai con 1679 puntos, por delante de Fable 5
- 93,5% en GPQA Diamond (entre el 92,6% de Fable 5 y el 94,1% de GPT-5.6), 96,1% en AIME 2025, y un Elo de 1668 en trabajo agéntico de GDPval-AA v2, solo detrás de Fable 5
- Perfil agéntico sólido: puesto número 1 en flujos de trabajo SaaS de AutomationBench-AA (53%), navegación autónoma de largo horizonte en terminal y repositorio mediante Kimi Code, y cerca de un 21% menos de tokens de salida que K2 con más inteligencia
- $3/$15 por millón de tokens (la entrada baja a $0,30 con acierto de caché), precio fijo en toda la ventana de 1M de tokens: aún muy por debajo de los precios de la frontera cerrada estadounidense, con una API compatible con OpenAI y disponibilidad en OpenRouter
- Entrada multimodal nativa (texto, imagen, video) y pesos abiertos anunciados para el 27/07/2026 bajo una licencia esperada de tipo Modified-MIT, lo que lo posiciona como el primer modelo de frontera de pesos abiertos de clase 3 billones de parámetros
- Un salto de precio de 3 veces respecto a Kimi K2.6 (de $0,95/$4 a $3/$15), lo que lo convierte en el modelo chino más caro lanzado hasta ahora, al precio de lista de Claude Sonnet 5: la era de “10 veces más barato que los modelos estadounidenses” terminó (alza documentada por Simon Willison)
- Lento: 33 tokens de salida por segundo, en el puesto 145 de 190 modelos en Artificial Analysis, poco apto para uso interactivo
- La tasa de alucinación subió de 39% (K2.6) a 51% en AA-Omniscience, ya que el modelo ahora intenta responder donde antes se habría negado (Fable 5 se ubica en un nivel comparable de 54,9%)
- Censura política en temas sensibles en mandarín (evade preguntas sobre Xi, el PCCh, Tiananmen) y jurisdicción de Pekín para los datos de la API, un obstáculo de cumplimiento para muchos despliegues empresariales y de la UE; el UK AISI/CAISI también encontró que sus salvaguardas de ciberseguridad no lograron bloquear intentos de desarrollo de exploits durante las pruebas
- “Pesos abiertos” que por ahora son teóricos para la mayoría: alrededor de 594 GB en MXFP4 nativo, que requieren un centro de datos multi-GPU para autoalojarlo, y los pesos (además de la licencia final) seguían sin publicarse al momento de esta revisión
Gemini 3 Pro
- Lideró LMArena en su lanzamiento con un récord de 1501 Elo y logró 91,9 % en GPQA Diamond, estado del arte en su salida
- ARC-AGI-2 de 31,1 %, unas 6x Gemini 2.5 Pro (4,9 %) y casi el doble de GPT-5.1 (17,6 %) en su momento
- Comprensión multimodal de primera clase: 81 % en MMMU-Pro, 87,6 % en Video-MMMU, con ventana de contexto de 1M de tokens
- Codificación agéntica sólida: 76,2 % en SWE-bench Verified, 54,2 % en Terminal-Bench 2.0, 1487 Elo en WebDev Arena
- Rebajó a sus rivales con $2/$12 por millón de tokens, por debajo de los precios de clase Claude Sonnet ($3/$15)
- El thinking_level configurable (low/medium/high) permite a los desarrolladores equilibrar profundidad de razonamiento, latencia y coste
- Alucinaciones con exceso de confianza: en AA-Omniscience dio una respuesta errónea el 88 % de las veces en lugar de abstenerse, frente al 48 % de Claude Sonnet 4.5 (the-decoder)
- Adulación ampliamente reportada por los analistas (Zvi Mowshowitz: « una vasta inteligencia sin columna vertebral »); necesita prompts de sistema estrictos
- Problemas de fiabilidad en llamadas a herramientas en stacks de agentes: los desarrolladores reportaron salidas de herramientas volcadas al hilo de chat y más andamiaje necesario que con los modelos de OpenAI/Anthropic
- Lento a thinking level alto: tiempo hasta el primer token medido en torno a 30-60 s en AI Studio pese a ~130 tokens/s de salida
- Retirado: apagado en la API de Gemini y AI Studio el 9 de marzo de 2026, con gemini-3-pro-preview ahora apuntando como alias a Gemini 3.1 Pro
Dicta tu veredicto
Una recomendación por herramienta y por gladiador. Moldea la puntuación de la multitud que ven todos.
El veredicto de la arena sobre Kimi K3
Kimi K3 es el argumento más contundente hasta ahora de que la frontera ya no es exclusivamente estadounidense: puesto número 3 en Artificial Analysis, puntajes de primer nivel en GPQA y SWE-bench Verified, y el mejor ranking del sector en la arena de código frontend, todo a aproximadamente la mitad o un tercio de los precios de la frontera cerrada estadounidense. Elegirlo para codificación agéntica, trabajo frontend y automatización SaaS, donde sus benchmarks son más sólidos, o si la hoja de ruta contempla autoalojar un modelo de clase frontera una vez publicados los pesos. Evitarlo para productos interactivos (33 tokens por segundo es lento), para cualquier cosa que involucre contenido políticamente sensible o requisitos estrictos de residencia de datos en la UE (censura en mandarín, jurisdicción de Pekín), y para búsquedas de alta precisión, donde su tasa de alucinación del 51% en AA-Omniscience exige una capa de verificación. Los equipos obsesionados con el costo deben notar que DeepSeek V4 todavía entrega muchos más tokens por dólar: la propuesta de K3 es la máxima capacidad por dólar, no el token más barato.
El veredicto de la arena sobre Gemini 3 Pro
Un lanzamiento histórico que devolvió a Google a la cima a finales de 2025, con un salto enorme de razonamiento sobre Gemini 2.5 Pro y las mejores puntuaciones multimodales de su generación. A mediados de 2026 no hay razón para elegirlo: Google lo apagó en la API el 9 de marzo de 2026, y Gemini 3.1 Pro cuesta exactamente lo mismo mientras más que duplica el rendimiento en ARC-AGI-2 (77,1 % frente a 31,1 %). Los equipos con despliegues heredados deberían migrar a 3.1 Pro, al que de todos modos apunta ya el antiguo ID de modelo. Evítelo para cargas sensibles a alucinaciones salvo que añada grounding, una debilidad que los analistas señalaron repetidamente.
Lo que dice la multitud
Sobre Kimi K3
“Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.”
“Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.”
“The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.”
Sobre Gemini 3 Pro
“Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.”
“ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.”
“1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.”
Sigue comparando
Preguntas frecuentes
¿Es Kimi K3 mejor que Gemini 3 Pro?
La mejor opción depende de tu caso de uso. La comparación línea a línea de esta página desglosa precios, características clave y las puntuaciones de la arena.
¿Cuál es más barata, Kimi K3 o Gemini 3 Pro?
Gemini 3 Pro es más barata: empieza en $12/1M out (prompts ≤200K), mientras que Kimi K3 empieza en $15/1M out.
¿Cuánto cuestan Kimi K3 y Gemini 3 Pro por millón de tokens?
Kimi K3: $3/1M in por millón de tokens de entrada, $15/1M out por millón de tokens de salida. Gemini 3 Pro: $2/1M in (prompts ≤200K) por millón de tokens de entrada, $12/1M out (prompts ≤200K) por millón de tokens de salida.