# Kimi K3 Explicado: El Mayor Modelo de IA Open Source de la Historia, Benchmarks y Precios | Alher Tech

> Moonshot AI lanzó Kimi K3 el 17 de julio de 2026: 2,8 billones de parámetros, contexto de 1M de tokens, visión nativa y tercer puesto en el Artificial Analysis Index. Pesos el 27 de julio con licencia MIT modificada, API a 3 $/15 $ por 1M de tokens. Qué cambia en producción.

- Canonical page: https://alhertech.com/es/blog/kimi-k3-explicado/
- Site: Alher Tech (custom software, AI agents and SEO engineering, https://alhertech.com/)
- Contact: https://alhertech.com/es/contacto/

---

El 17 de julio de 2026, la startup pekinesa Moonshot AI lanzó Kimi K3, un modelo de 2,8 billones de parámetros que se convirtió al instante en el mayor modelo de IA open-weight jamás publicado. El lanzamiento llegó una semana antes de la World Artificial Intelligence Conference de Shanghái y provocó reacciones de mercado que muchos analistas compararon con el shock de DeepSeek de principios de 2025. El titular no es solo el tamaño. Kimi K3 llega con una ventana de contexto de 1 millón de tokens, visión nativa, un modo de razonamiento siempre activo y resultados que lo sitúan tercero en el Artificial Analysis Intelligence Index, justo detrás de Claude Fable 5 y GPT-5.6 Sol, superando a ambos en varios benchmarks de código y escritura. Los pesos completos del modelo se publicarán el 27 de julio bajo una licencia MIT modificada. En este artículo desglosamos qué es exactamente Kimi K3, la arquitectura que hay detrás, los benchmarks publicados, los precios y qué significa un modelo abierto de este calibre si construyes software o agentes de IA en producción.

## ¿Qué es Kimi K3?

Kimi K3 es el nuevo modelo insignia de Moonshot AI, la startup respaldada por Alibaba detrás del asistente Kimi y la familia K2 anterior. Es un sistema disperso de mixture-of-experts (MoE), de sus 2,8 billones de parámetros totales, cada token se enruta solo por 16 de 896 subredes expertas, aproximadamente el 1,8% del modelo cada vez. Esa dispersión es lo que hace económicamente viable servir un modelo de clase 3T.

- El mayor modelo open-weight de la historia, con 2,8 billones de parámetros, Kimi K3 es el primer modelo abierto de clase 3T. Los pesos se publicarán el 27 de julio de 2026 bajo una licencia MIT modificada, con un informe técnico posterior.
- Contexto de 1M de tokens, multimodal por defecto, kimi K3 procesa texto, imágenes y vídeo en una arquitectura unificada, con una ventana de contexto máxima de un millón de tokens.
- Razonamiento siempre activo. El modelo funciona por defecto con esfuerzo de razonamiento máximo. Moonshot ha anunciado modos de menor esfuerzo para cargas sensibles a la latencia.
- Disponible hoy, pesos pronto, el modelo está activo en kimi.com, Kimi Code y la API de Kimi desde el día del lanzamiento; el nivel gratuito lleva saturado desde entonces.

## La Arquitectura, cómo Moonshot Escaló hasta 2,8T

Moonshot atribuye el salto a un conjunto de innovaciones arquitectónicas propias que en conjunto ofrecen aproximadamente 2,5 veces la eficiencia de escalado de Kimi K2:

- Kimi Delta Attention (KDA). Un mecanismo híbrido de atención lineal que acelera la decodificación de secuencias largas, hasta 6,3 veces más rápida en contextos de un millón de tokens según Moonshot.
- Attention Residuals (AttnRes). Un sustituto directo de las conexiones residuales que recupera representaciones de forma selectiva entre capas en lugar de acumularlas uniformemente, al que la compañía atribuye mejoras de escalado consistentes.
- Stable LatentMoE con Quantile Balancing. El framework de enrutamiento que activa 16 de 896 expertos por token. La asignación de expertos se deriva directamente de los cuantiles de puntuación del router, eliminando un hiperparámetro de balanceo notoriamente sensible.
- Per-Head Muon y servido cuantizado. El optimizador trata las cabezas de atención de forma independiente para un aprendizaje más adaptativo a escala, y el modelo llega con pesos MXFP4 y activaciones MXFP8 para amplia compatibilidad de hardware.

## Benchmarks, tercero en General, Primero en Varias Categorías

Los números publicados son notables para un modelo abierto. Kimi K3 es tercero en el Artificial Analysis Intelligence Index con 57 puntos, detrás de Claude Fable 5 (60) y GPT-5.6 Sol (59), y gana directamente en varios benchmarks publicados:

Dos matices antes de sacar conclusiones. Primero, la mayoría de estas cifras salen del material de lanzamiento del propio Moonshot, y el ciclo de replicación independiente apenas ha empezado. Segundo, el propio Moonshot reconoce una brecha pendiente frente a Claude Fable 5 y GPT-5.6 Sol en capacidad general, y señala problemas conocidos como una proactividad excesiva durante la ejecución de tareas y sensibilidad al historial de razonamiento preservado. La foto se aclarará cuando los pesos y el informe técnico lleguen el 27 de julio.

- Artificial Analysis Index, kimi K3 57, Claude Fable 5 60, GPT-5.6 Sol 59
- FrontierSWE (Dominance), kimi K3 47,4, Claude Fable 5 34,2, GPT-5.6 Sol 37,6
- PostTrain Bench, kimi K3 92,4, Claude Fable 5 90,1, GPT-5.6 Sol 88,3
- Arena AI Frontend Code (Elo), kimi K3 1.679, Claude Fable 5 1.631, GPT-5.6 Sol n/d
- GDPval-AA v2 (Elo), kimi K3 1.687, Claude Fable 5 1.815 (Max), GPT-5.6 Sol 1.747,8 (Max)

## Precios, capacidad Frontier a un Tercio del Coste

La economía es donde Kimi K3 presiona de verdad a los proveedores cerrados. En la API de Kimi, el precio de lista queda en una fracción de lo que cobran los modelos frontier comparables:

- 3 $ entrada / 15 $ salida por millón de tokens, frente a los 10 $ / 50 $ de Claude Fable 5, es menos de un tercio del precio de lista para un modelo en el mismo vecindario de benchmarks.
- 0,30 $ por millón de tokens de entrada cacheados, la entrada con acierto de caché se factura con un 90% de descuento, y Moonshot reporta tasas de acierto superiores al 90% en cargas de código, donde domina el contexto repetido.
- Más barato por tarea, no solo por token, estimaciones independientes sitúan a Kimi K3 en unos 0,94 $ por tarea agéntica completada, frente a 1,04 $ de GPT-5.6 Sol y 1,80 $ de Claude Opus 4.8.
- Autoalojamiento en el horizonte, cuando los pesos sean públicos, los equipos con el hardware podrán servir K3 por su cuenta, y los proveedores de inferencia competirán en precio por el mismo modelo, lo que históricamente abarata los tokens muy rápido.

## Cuánto Cuesta Realmente Autoalojar Kimi K3

Los open-weight suenan a libertad hasta que pones precio al hardware. Kimi K3 llega en MXFP4, que comprime los 2,8 billones de parámetros a aproximadamente 1,4 TB de pesos, y eso antes de la caché KV que exige un contexto de 1M de tokens. Ninguna máquina del mundo ejecuta esto en solitario, necesitas un clúster de GPUs multinodo.

La conclusión honesta. Para la inmensa mayoría de empresas, autoalojar K3 no tiene sentido financiero, y la API sigue siendo la opción racional. El autoalojamiento compensa en tres escenarios. Volumen masivo sostenido donde el clúster se amortiza, requisitos duros de residencia de datos o compliance que descartan las APIs gestionadas, y plataformas que reparten un clúster entre muchos productos. Para el resto, el valor real de los modelos open-weight es indirecto. Los proveedores de inferencia de terceros competirán por servir exactamente el mismo modelo, y esa competencia te baja el precio del token sin que llegues a tocar una GPU.

- El suelo de hardware, en torno a 1,4 TB de VRAM, un despliegue mínimo realista ronda las 16 GPUs NVIDIA B200 (192 GB cada una, dos nodos de 8) o 24 o más H200 (141 GB cada una), solo para cargar los pesos con margen para la caché KV y el batching. Por debajo de eso no estás sirviendo tráfico, estás ejecutando una demo.
- Alquilar, entre 60.000 y 100.000 $ al mes, aproximadamente, el alquiler cloud de una B200 promedia unos 6,25 $ por GPU-hora a mediados de 2026 (con un rango de 3,75 $ a más de 14 $ según el proveedor). Dieciséis B200 funcionando 24/7 son de 43.000 a 72.000 $ al mes en la parte barata del rango, y eso sin contar almacenamiento, red, egress y los ingenieros que mantienen vLLM o SGLang vivo a las 3 de la mañana.
- Comprar. Un proyecto de siete cifras, una B200 cuesta entre 40.000 y 50.000 $ por unidad, así que 16 son de 640.000 a 800.000 $ solo en GPUs. Suma servidores, red InfiniBand, almacenamiento y redundancia y el clúster supera con holgura el millón de dólares de capex, consumiendo en torno a 30 kW de potencia, más un equipo de MLOps para operarlo.
- Qué compra ese mismo dinero en APIs, pongamos 65.000 $ al mes. En la API de Kimi (15 $ por millón de tokens de salida) son más de 4.000 millones de tokens de salida mensuales; en Claude Fable 5 (50 $ por millón), unos 1.300 millones. Muy pocos productos queman tokens a un ritmo que haga más barato tener el hierro que pagar por token.
- Kimi K3, precio API 3 $ / 15 $ por 1M de tokens. Opción de autoalojar, sí, pesos el 27 de julio, clúster de unos 60.000-100.000 $/mes.
- Claude Fable 5, precio API 10 $ / 50 $ por 1M de tokens. Opción de autoalojar, no, solo API.
- GPT-5.6 Sol, precio API 5 $ / 30 $ por 1M de tokens. Opción de autoalojar, no, solo API.
- Claude Opus 4.8, precio API 5 $ / 25 $ por 1M de tokens. Opción de autoalojar, no, solo API.

## La Reacción del Mercado y el Calendario

La secuencia del lanzamiento importa para entender el ruido. El 16 de julio, TechCrunch informó de que el próximo modelo de Moonshot apuntaba a cerrar la brecha con Claude Opus 4.8. El 17 de julio, Kimi K3 se lanzó en kimi.com y la API, y las tecnológicas estadounidenses se tambalearon en una reacción que Fortune y Yahoo Finance describieron como flashbacks de DeepSeek. El 27 de julio está programada la publicación de los pesos completos, días antes de la World Artificial Intelligence Conference de Shanghái.

El patrón recuerda a enero de 2025, un laboratorio chino publicando capacidad casi frontier a precios radicalmente menores, con los modelos open-weight como estrategia de distribución. La diferencia es la escala. DeepSeek R1 era un modelo de 671B; Kimi K3 es de 2,8T, y llega con visión, contexto de 1M y enfoque agéntico desde el primer día.

## Qué Cambia Kimi K3 en la Práctica

Más allá de los titulares, tres cosas destacan para los equipos que construyen software sobre estos modelos:

- La brecha abierto-cerrado ya se mide en semanas, no en años. Un modelo open-weight a uno o dos puntos de la frontera cerrada reinicia cualquier conversación de comprar o construir. Si tu carga de trabajo tolera una pequeña brecha de capacidad, la diferencia de coste ahora es enorme.
- La presión de precios alcanza a todos. Un modelo de clase frontier a 3 $ / 15 $ obliga a los proveedores cerrados a justificar su prima. Para productos de alto volumen, enrutar el tráfico barato a un modelo como K3 y reservar los flagships cerrados para las peticiones más difíciles se está convirtiendo en la arquitectura por defecto.
- Autoalojar IA frontier pasa a ser una opción real, con pesos publicados y licencia MIT modificada, las industrias reguladas y los productos sensibles a los datos pueden ejecutar IA casi frontier dentro de su propio perímetro. El cuello de botella pasa del acceso a la infraestructura y la capacidad de MLOps.

## Cómo Evaluamos un Lanzamiento como Kimi K3 en Alher Tech

Cada lanzamiento de modelo llega envuelto en gráficas de benchmarks, y la semana del lanzamiento es el peor momento para tomar decisiones de arquitectura. Nosotros llevamos agentes de IA y automatizaciones a producción, así que nuestro trabajo es separar lo que un lanzamiento cambia de verdad de lo que solo anuncia.

Si te preguntas si Kimi K3 encaja en tu stack, podemos ejecutar esa evaluación sobre tus casos de uso reales y diseñar la arquitectura en función de la respuesta.

- Primero, evals sobre tus tareas reales. Comparamos Kimi K3 cara a cara con tus modelos actuales sobre tus prompts y flujos reales. Los benchmarks del día de lanzamiento rara vez predicen el comportamiento en producción, y menos en un modelo con rarezas de proactividad reconocidas.
- Enrutamiento antes que sustitución. El primer paso sensato rara vez es una migración. Añadimos candidatos como K3 a una capa de enrutamiento, les enviamos el tráfico donde ganan en coste y mantenemos el modelo actual para todo lo demás.
- Los open-weight necesitan un plan de operaciones, autoalojar un MoE de 2,8T no es un proyecto de fin de semana. Ayudamos a los equipos a decidir entre APIs gestionadas, proveedores de inferencia de terceros y autoalojamiento, según las restricciones de datos y el volumen real, no el hype.
- El compliance es parte del eval, la residencia de datos, el RGPD y la jurisdicción del proveedor importan tanto como los benchmarks. Un modelo abierto que puedes alojar en la UE cambia esa conversación, y lo tenemos en cuenta desde el principio.

## Conclusión

Kimi K3 es la declaración más contundente del movimiento open-weight hasta la fecha, un razonador multimodal de 2,8 billones de parámetros a un palmo de la frontera cerrada, a un tercio del precio, con los pesos llegando el 27 de julio bajo una licencia MIT modificada.

El escepticismo sano sigue aplicando. La mayoría de cifras son autorreportadas, los problemas conocidos son reales y el ciclo de evaluación independiente acaba de empezar. Pero incluso con esos matices, el tablero estratégico ha cambiado. La IA de clase frontier ya no es exclusivamente un producto cerrado alojado en EE. UU.

Si quieres ayuda para evaluar Kimi K3 frente a tu stack actual, o estás planificando un agente de IA o una automatización sobre él, es exactamente lo que hacemos para nuestros clientes.

## Artículos relacionados

- Specs, benchmarks y rankings de Kimi K3 en nuestra comparativa de modelos de IA
- GPT-5.6 Explicado, modelos Sol, Terra y Luna, Precios y Benchmarks
- GPT-5.6 vs Claude Fable 5, benchmarks, Precios y Cuál Usar
