Kimi K3: el modelo “open source” que no vas a poder correr
El 16 de julio de 2026, por la mañana, me llegaron cuatro mensajes casi idénticos. Todos decían alguna versión de lo mismo: "Bezael, ha salido Kimi K3, ¿esto lo puedo bajar y correrlo en local?".
Entiendo la ilusión. Moonshot AI lo anunció como el mayor modelo open source del mundo. Y "open source" en la cabeza de cualquier developer significa una cosa muy concreta: lo descargo, lo pongo en mi máquina, dejo de pagar tokens.
Con este no.
Kimi K3 tiene 2.8 billones de parámetros. Los pesos son abiertos, sí. Pero abrir los pesos de un modelo de ese tamaño es como regalarte los planos de un portaaviones. Técnicamente lo tienes todo. Prácticamente no lo vas a construir en el garaje.
Así que la pregunta interesante no es "¿supera a Fable 5?". Esa la contesta cualquier tabla de benchmarks y encima se queda obsoleta en tres semanas. La pregunta que sí te cambia el mes es: ¿me conviene mover mi agente de coding a K3, y a partir de cuándo?
Vamos con eso.
¿Qué es Kimi K3?
Kimi K3 es el modelo de lenguaje que Moonshot AI (Pekín) lanzó el 16 de julio de 2026. Tiene 2.8 billones de parámetros con pesos abiertos, entrada multimodal de imagen y una ventana de contexto de 1M tokens, con razonamiento siempre activo y sin modo rápido. Moonshot lo distribuye en dos variantes: K3 Max, orientada a chat y agentes, y K3 Swarm Max, para paralelismo a gran escala.
En el índice independiente de Artificial Analysis, Kimi K3 puntúa 57 y ocupa el puesto #4 de 187 modelos evaluados. Su precio de API es de $3 por millón de tokens de entrada y $15 por millón de salida, con cache hit a $0.30.
Hasta ahí la ficha. Lo interesante empieza cuando la cruzas con lo que necesitas tú.
El "open source" de 2.8T no significa lo que crees
Haz la cuenta conmigo, porque es aritmética de servilleta y te ahorra la tarde.
2.8 billones de parámetros. Aun cuantizando agresivamente a 4 bits —medio byte por parámetro— necesitas del orden de 1,4 TB de memoria solo para tener los pesos residentes. Sin contar el KV cache, que con una ventana de 1M tokens no es precisamente pequeño.
Tu Mac con 128 GB de RAM unificada no entra. Ni el doble. Ni el de tu amigo el del homelab con dos 4090.
Estás hablando de un rack. De órdenes de magnitud por encima de lo que un dev individual —o una startup pequeña— monta para inferencia propia.
Entonces, ¿qué gana el mundo con que los pesos sean abiertos? Gana algo real, pero indirecto: cualquier proveedor puede servirlo, nadie te encierra en una única API, y el precio tiende a bajar por competencia entre hosts. Eso es valioso. Pero no es soberanía local. Es no depender de un solo vendor.
Si lo que buscabas era de verdad correr modelos en tu máquina, esa es otra conversación y la tengo escrita aparte: los mejores modelos de IA para ejecutar en local en 2026. Ahí sí hay opciones que caben en tu hardware.
Para K3 vas a pagar tokens igual que con cualquier modelo cerrado. La forma más rápida de probarlo sin abrirte cuenta en Moonshot es a través de un router; te expliqué el mecanismo completo en qué es OpenRouter y para qué sirve.
Kimi K3: qué está verificado y qué es marketing de Moonshot
Aquí voy a ser quisquilloso a propósito, porque el 90% de lo que se ha publicado sobre él estos días mezcla las dos categorías sin avisarte.
Lo verificado en fuentes independientes (ficha de Kimi K3 en OpenRouter y Artificial Analysis):
- Kimi K3 se lanzó el 16 de julio de 2026, desarrollado por Moonshot AI (Pekín).
- Kimi K3 tiene 2.8T parámetros con pesos abiertos y es multimodal con entrada de imagen.
- Kimi K3 ofrece una ventana de contexto de 1M tokens.
- Kimi K3 razona siempre: a día de hoy no existe una versión "rápida sin pensar".
- El precio de Kimi K3 es de $3 por 1M de tokens de entrada y $15 por 1M de salida, con cache hit a $0.30 (un 90% menos).
- Kimi K3 obtiene 57 en el Artificial Analysis Intelligence Index, puesto #4 de 187 modelos. La media de modelos comparables está en 31.
- OpenRouter advierte en la ficha del modelo de que la capacidad upstream de Kimi K3 está limitada y son frecuentes los errores 429.
Lo que dice el fabricante y no está auditado:
- SWE-bench Verified 76.8%, Terminal-Bench 2.1 en 88.3, FrontierSWE 81.2.
- Un Coding Index de 76.24 que lo pondría por encima de Fable 5 — dato que circula de terceros y que aún no aparece en la ficha oficial de Artificial Analysis.
- Las dos variantes, K3 Max y K3 Swarm Max, las anuncia Moonshot y las recogen los medios, pero no aparecen diferenciadas en la ficha de OpenRouter.
Y aquí una que no está sin confirmar, sino directamente refutada. Moonshot afirma que K3 compite con Fable 5 y supera a Opus 4.8 y a GPT-5.6. Coge el mismo índice independiente que la propia Moonshot cita y mira la tabla completa:
| Modelo | Intelligence Index |
|---|---|
| Claude Fable 5 | 59.9 |
| GPT-5.6 Sol | 58.9 |
| Kimi K3 | 57.1 |
| Claude Opus 4.8 | 56 |
Lo de superar a Opus 4.8 es cierto. Lo de superar a GPT-5.6 es falso: queda casi dos puntos por debajo de Sol. Y "competir con Fable 5" es defendible si por competir entendemos quedarse a tres puntos, que para un modelo de pesos abiertos es una noticia enorme — pero no es lo mismo que empatar.
Que quede claro: puesto #4 de 187 no se regala y K3 no es humo. Lo que digo es que las cifras de coding, que son las que más te importan a ti, son hoy marketing sin auditar. Trátalas como hipótesis a validar en tu repo, no como hechos.
El mercado, en cambio, se lo creyó de golpe: según la prensa financiera, el lanzamiento tumbó acciones de semiconductores y le valió el apodo de "segundo shock DeepSeek".
El coste real de Kimi K3: el impuesto de la verbosidad
Este es el dato que más me llamó la atención, y está publicado en la misma ficha de Artificial Analysis que todo el mundo cita para el ranking — pero que casi nadie lee hasta el final.
Kimi K3 consumió 130 millones de tokens de salida para completar el Intelligence Index. La media de los modelos evaluados es de 63M. La propia ficha lo califica de "very verbose".
Multiplica: 130M × $15 por millón. Son casi 2.000 dólares de output solo para pasar una batería de evaluación.
Ahí está el punto. El precio de lista de un modelo no es su coste. Su coste es el precio de lista multiplicado por lo que le da la gana escribir.
K3 razona siempre, y razona largo: algo más del doble que la media. Haz la traducción a dinero — un modelo de $15/1M que emite 2,06 veces los tokens de la media te sale, en la práctica, como uno de ~$31.
Sigue estando por debajo de Fable 5 a ~$50. Pero la distancia real es la mitad de la que sugiere la tabla de precios:
| Modelo | Output / 1M tokens |
|---|---|
| Fable 5 | ~$50 |
| Kimi K3 | $15 |
| GLM-5.2 | $3.52 |
| DeepSeek V4 Pro | $0.87 |
Parece que K3 está en un punto dulce. Y puede que lo esté. Pero esa tabla es engañosa mientras no le añadas la columna que casi nadie mira: tokens emitidos por tarea resuelta. Artificial Analysis publica el agregado de su índice; lo que ningún benchmark publica es ese número para tus tareas.
Y ojo con el consuelo del cache: el descuento del 90% a $0.30 juega a favor de K3 en agentes, donde reenvías el mismo contexto una y otra vez. Pero aplica a la entrada, no a la salida. Y tu problema con este modelo es la salida.
¿Cuándo conviene migrar tu agente de coding a Kimi K3?
Te conviene mirarlo en serio si:
- Trabajas con repos grandes de verdad y el millón de tokens de contexto te ahorra la gimnasia de trocear y resumir. Ahí sí compensa.
- Haces agentic de horizonte largo, con sesiones de muchos pasos, y el razonamiento permanente reduce las veces que el agente se descarrila a mitad de tarea.
- Estás pagando facturas de cuatro cifras con un frontier caro, y una reducción de coste por token —aun con la verbosidad descontada— te sale a cuenta.
- Te importa la portabilidad. Pesos abiertos significa que si mañana un proveedor sube precios, te llevas la carga a otro. Eso es apalancamiento real de negociación.
No te molestes si:
- Necesitas latencia estable en producción hoy. Los 429 que advierte OpenRouter no son teóricos: la demanda obligó a Moonshot a parar nuevas suscripciones por saturación de GPUs a los pocos días del lanzamiento. Un agente que falla una de cada siete llamadas no es un agente, es una lotería.
- Tu caso son tareas cortas y bien acotadas. Vas a pagar razonamiento que no necesitas en cada llamada, sin opción de apagarlo.
- Ya tienes un harness afinado alrededor de otro modelo.
Y este último es el punto que más me duele repetir: cambiar de modelo casi nunca es donde está tu ganancia. Lo desarrollé entero en por qué el harness agéntico, no el LLM, es el producto. Tus prompts, tus herramientas, tu gestión de contexto y tus validaciones pesan más en el resultado final que dos puntos de diferencia en un índice.
Si tu agente falla porque le das mal el contexto, K3 va a fallar igual. Solo que escribiendo más y cobrándotelo.
Es exactamente lo que trabajamos en el curso de Construye con IA: de la idea al producto con Claude Code — montar el sistema alrededor del modelo, para que el día que salga el siguiente K3 puedas cambiarlo en una línea de configuración y seguir con tu vida.
Veredicto: ¿merece la pena Kimi K3 hoy?
Kimi K3 es genuinamente bueno. Puesto #4 de 187 en un índice independiente no se regala, y el precio frente a la gama alta occidental es agresivo de verdad.
Pero no es el modelo que vas a correr en tu máquina, y su coste real está por encima de lo que sugiere su precio de lista. Dos cosas que el anuncio no te dice.
Mi posición hoy: lo evalúo, no lo migro. Si dependes de coding en producción, espera a dos señales concretas antes de mover nada: que Artificial Analysis publique el Coding Index en su ficha oficial, y que la capacidad upstream se estabilice. Escribo esto la semana del lanzamiento (20 de julio de 2026); si llegas a este post más tarde, comprueba ambas antes de darlas por pendientes.
Comparar contra la otra familia frontier también ayuda a calibrar: tienes los números de la de OpenAI en la guía práctica de GPT-5.6 vía API.
Cómo decidirlo con tus propios datos en una hora
No te fíes de mi veredicto ni del anuncio de Moonshot. Mide:
- Coge diez tareas reales de tu backlog — no de un benchmark. Tareas que ya sabes resolver, para poder juzgar el resultado.
- Pásalas por tu modelo actual y por K3, con el mismo harness y los mismos prompts.
- Apunta tres columnas por tarea: tokens de salida, coste total y si la tarea quedó resuelta o no.
- Compara coste por tarea resuelta, no precio por millón de tokens. Es la única cifra que decide.
Ese número tuyo vale más que todos los benchmarks del anuncio juntos. Y va a haber sorpresas en las dos direcciones.
Ese blindaje empieza incluso antes del harness: si escribes la especificación de lo que quieres construir, el modelo pasa a ser una pieza intercambiable. Es la tesis completa del libro de Spec-Driven Development.
Si haces el experimento, comparte los resultados en Dominicode Labs — estamos juntando mediciones reales de la comunidad, que es exactamente el dato que ningún benchmark publica.
Preguntas frecuentes sobre Kimi K3
¿Qué es Kimi K3?
Kimi K3 es el modelo de lenguaje de Moonshot AI lanzado el 16 de julio de 2026. Tiene 2.8 billones de parámetros con pesos abiertos, ventana de contexto de 1M tokens, entrada multimodal de imagen y razonamiento permanente. Puntúa 57 en el Artificial Analysis Intelligence Index, puesto #4 de 187 modelos.
¿Kimi K3 es realmente open source?
Los pesos de Kimi K3 son abiertos, pero eso no equivale a poder ejecutarlo. Con 2.8T parámetros, la barrera de hardware lo deja fuera del alcance de cualquier developer o startup pequeña. El beneficio real de esos pesos abiertos es que cualquier proveedor puede servir el modelo: evita el lock-in de vendor y presiona el precio a la baja, pero no da soberanía local.
¿Puedo ejecutar Kimi K3 en local?
En la práctica, no. Con 2.8T parámetros necesitas del orden de 1,4 TB de memoria solo para los pesos, incluso cuantizando a 4 bits. Eso es infraestructura de datacenter, no de escritorio. Los pesos son abiertos, pero eso beneficia a quien pueda servirlos, no a tu portátil.
¿Cuánto cuesta Kimi K3?
$3 por millón de tokens de entrada y $15 por millón de salida, con los cache hits a $0.30 (un 90% de descuento). Ojo: por su verbosidad, el coste efectivo por tarea suele quedar bastante por encima de lo que sugiere esa tarifa.
¿Kimi K3 es mejor que Fable 5 para programar?
Moonshot lo afirma y circula un Coding Index de 76.24 que lo situaría por encima. Ese dato viene de terceros y todavía no aparece en la ficha oficial de Artificial Analysis. En inteligencia general sí hay dato auditado, y no respalda la afirmación: Fable 5 puntúa 59.9 y Kimi K3, 57.1. En coding concretamente, trátalo como hipótesis hasta que se confirme.
¿Cuál es la diferencia entre K3 Max y K3 Swarm Max?
Según Moonshot, K3 Max está orientado a chat y flujos agénticos convencionales, mientras que K3 Swarm Max está pensado para ejecución paralela a gran escala. Para un agente de coding individual, tu variante es K3 Max.
¿Por qué Kimi K3 sale más caro de lo que dice su precio?
Porque razona siempre y razona largo. Kimi K3 emitió 130M tokens de salida completando el Intelligence Index de Artificial Analysis, frente a una media de 63M — algo más del doble. A $15 por millón de salida, esa verbosidad sitúa el coste efectivo en torno a los $31 por millón. El precio de lista de un modelo no es su coste: su coste es el precio de lista por lo que decide escribir.
¿Por qué me devuelve errores 429?
OpenRouter avisa en la propia ficha del modelo de que la capacidad upstream está limitada tras el lanzamiento. Si lo llevas a producción, necesitas reintentos con backoff y un modelo de fallback configurado.
Por Bezael Pérez — Developer senior con más de 15 años de experiencia y fundador de Dominicode.
Analizo lanzamientos como este en detalle en el canal de YouTube de Dominicode.
