Kimi K3 es un modelo Mixture-of-Experts nativamente multimodal con:
- 2,8 billones de parámetros totales,
- 104.000 millones de parámetros activados por token,
- 896 expertos, de los cuales se seleccionan 16,
- un contexto de 1.048.576 tokens,
- soporte para texto, imagen y, según la documentación de la API, vídeo,
- un repositorio de aproximadamente 1,56 TB.[2][3]
Moonshot AI describe Kimi K3 como un modelo open source. Sin embargo, en el sentido estricto de la Open Source Initiative, open-weight es una descripción más precisa. Se han publicado los parámetros finales, el código y la documentación, pero Kimi K3 utiliza una licencia propia con condiciones adicionales para determinados usos comerciales. La disponibilidad de los pesos tampoco proporciona por sí sola la transparencia completa del proceso y los datos de entrenamiento exigida por la Open Source AI Definition.[4][5][6]
Conclusión principal: Kimi K3 se puede descargar, modificar, ajustar y autoalojar de verdad, pero no es un modelo que una empresa media pueda ejecutar en un único servidor GPU. La publicación de los pesos abre oportunidades importantes de investigación e infraestructura, mientras que la escala del modelo y los términos de la licencia requieren un análisis detallado antes de producción.
Todos los parámetros, precios, condiciones de licencia e información de disponibilidad se verificaron el 27 de julio de 2026.
TL;DR
| Pregunta | Respuesta |
|---|---|
| ¿Qué ocurrió el 27 de julio? | Se publicaron los pesos completos, el repositorio, la licencia y el informe técnico |
| ¿Se lanzó el modelo ese día? | No, el modelo y la API ya estaban disponibles |
| ¿Kimi K3 es open source? | Moonshot usa ese término, pero open-weight con licencia propia es más preciso |
| ¿Cuántos parámetros tiene? | 2,8 billones totales, 104.000 millones activos |
| ¿Qué arquitectura utiliza? | MoE, KDA, Gated MLA, AttnRes y Stable LatentMoE |
| ¿Cuántos expertos tiene? | 896, con 16 seleccionados por token y 2 expertos compartidos |
| ¿Cuánto contexto admite? | 1.048.576 tokens |
| ¿Qué tamaño ocupan los archivos? | Aproximadamente 1,56 TB |
| ¿Cuántos shards principales hay? | 96 archivos Safetensors |
| ¿Puede ejecutarse localmente? | Técnicamente sí, pero no en un PC normal ni en una sola GPU |
| ¿Qué recomienda el fabricante? | Supernodes con al menos 64 aceleradores |
| ¿Se permite el uso comercial? | Sí, bajo la Kimi K3 License |
| ¿Cuánto cuesta la API oficial? | 0,30 USD/MTok con cache hit, 3 USD/MTok con cache miss y 15 USD/MTok de output |
| ¿Puede desactivarse el reasoning? | No |
| ¿Qué niveles admite? | low, high, max, con max por defecto |
| ¿Todos los benchmarks son independientes? | No, parte de los resultados y configuraciones procede de Moonshot AI |
1. ¿Qué se publicó exactamente?
El repositorio oficial moonshotai/Kimi-K3 en Hugging Face contiene:
- pesos completos,
- configuración del modelo,
- código para cargarlo y procesar entradas,
- tokenizer y archivos del procesador,
- ejemplos para Transformers, vLLM y SGLang,
- model card,
- Kimi K3 License.[2]
El repositorio oficial de GitHub contiene además:
- código y documentación,
- el informe
k3_tech_report.pdf, - instrucciones de despliegue,
- descripción de arquitectura y evaluación.[3][7]
El repositorio de pesos ocupa aproximadamente 1,56 TB. Los parámetros están divididos en 96 archivos Safetensors, desde:
model-00001-of-000096.safetensors
hasta:
model-00096-of-000096.safetensors
La mayoría de los shards ocupan unos 16,6–17 GB.[8]
No es un anuncio de futura disponibilidad. Los archivos ya existen y pueden descargarse.
2. ¿Open source u open-weight?
Moonshot AI usa expresiones como:
- “open model”,
- “open-source model”,
- “Open Frontier Weights”.
La model card de Hugging Face define Kimi K3 explícitamente como open-weight.[2]
¿Qué son los pesos abiertos?
Los pesos son los parámetros finales aprendidos durante el entrenamiento. Publicarlos permite:
- ejecutar el modelo fuera de la infraestructura del fabricante,
- realizar fine-tuning,
- crear cuantizaciones,
- analizar el comportamiento,
- construir servidores de inferencia propios,
- integrar el modelo sin enviar prompts a la API oficial.
No hace automáticamente reproducible todo el proceso de desarrollo.
¿Por qué OSI distingue open weights de Open Source AI?
La Open Source Initiative explica que publicar solo los pesos finales no ofrece acceso completo a:
- datos o información suficientemente detallada sobre el entrenamiento,
- todo el código de preparación de datos,
- la configuración completa de entrenamiento,
- los elementos necesarios para reproducir un sistema sustancialmente equivalente.[5][6]
La Open Source AI Definition exige libertad para:
- usar,
- estudiar,
- modificar,
- compartir,
además de acceso a la forma preferida necesaria para modificar realmente el sistema.[6]
¿La Kimi K3 License está aprobada por OSI?
El repositorio utiliza una Kimi K3 License propia, no Apache-2.0, MIT ni otra licencia estándar aprobada por OSI.
La licencia concede derechos amplios para:
- usar,
- copiar,
- modificar,
- publicar,
- distribuir,
- sublicenciar,
- vender,
- desplegar,
- fine-tunear,
- crear obras derivadas.[4]
También incorpora condiciones adicionales para algunas entidades comerciales. Por tanto, la redacción más segura es:
Kimi K3 es un modelo open-weight publicado bajo la licencia propia Kimi K3 License.
Eso no significa que sea “cerrado”, sino que la etiqueta open source requiere matices legales y técnicos.
3. Parámetros principales de Kimi K3
| Parámetro | Kimi K3 |
|---|---|
| Arquitectura | Mixture-of-Experts |
| Parámetros totales | 2,8 billones |
| Parámetros activados | 104.000 millones |
| Capas | 93 |
| Capas dense | 1 |
| Capas de atención | 69 KDA + 24 Gated MLA |
| Expertos | 896 |
| Expertos por token | 16 |
| Expertos compartidos | 2 |
| Vocabulario | 160.000 |
| Contexto | 1.048.576 tokens |
| Codificador de imagen | MoonViT-V2 |
| Parámetros del vision encoder | 401 millones |
| Pesos | MXFP4 |
| Activaciones | MXFP8 |
| Modalidades en la model card | texto e imagen |
| Modalidad adicional en la API | vídeo |
| Tamaño del repositorio | aproximadamente 1,56 TB |
| Shards Safetensors | 96 |
Los datos proceden de la model card oficial.[2]
2,8 billones no significa 2,8 billones activos
Kimi K3 es un modelo MoE. No usa todos los expertos al mismo tiempo.
El router selecciona 16 de 896 expertos y la documentación indica 104.000 millones de parámetros activados. Esto aumenta la capacidad sin reproducir exactamente el coste de un modelo dense de 2,8T.
Sin embargo, el coste de hardware no equivale al de un modelo típico de 100B. Todos los pesos deben almacenarse y repartirse entre aceleradores.
4. KDA, AttnRes y Stable LatentMoE
Kimi Delta Attention
KDA es un mecanismo híbrido de linear attention diseñado para secuencias largas.
El modelo incluye:
- 69 capas KDA,
- 24 capas Gated MLA.[2]
La linear attention puede reducir parte del coste de la full attention en contextos largos, pero no convierte un contexto de un millón de tokens en algo barato.
Attention Residuals
AttnRes modifica cómo circulan las representaciones entre capas. Según Moonshot AI, recupera información de distintas profundidades de forma selectiva en lugar de acumularla uniformemente.[1]
Stable LatentMoE
Stable LatentMoE permite escalar a 896 expertos y activar 16. Moonshot AI afirma que la combinación de arquitectura, entrenamiento y datos ofrece una mejora aproximada de 2,5× en la eficiencia general de escalado frente a Kimi K2.[1][2]
Es una afirmación del fabricante, no una promesa de 2,5× más velocidad, menor coste o calidad.
MXFP4 nativo
Kimi K3 se entrenó teniendo en cuenta la cuantización desde supervised fine-tuning:
MXFP4 para pesos
MXFP8 para activaciones
El objetivo es reducir la memoria y facilitar el despliegue.[2] Aun así, el repositorio ocupa cerca de 1,56 TB.
5. ¿Puede ejecutarse Kimi K3 localmente?
Sí, si “localmente” significa en infraestructura privada de gran escala.
La versión completa no está destinada a:
- portátiles,
- estaciones con GPU de consumo,
- un servidor con una o pocas GPU,
- pequeños homelabs.
Moonshot AI recomienda supernodes con al menos 64 aceleradores. Hay que considerar:
- pesos,
- KV cache,
- contexto de un millón de tokens,
- comunicación entre expertos,
- expert parallelism,
- ancho de banda entre dispositivos,
- prefix cache,
- reserva de memoria del runtime.[1]
Memoria real
Los pesos cuantizados ya ocupan unos 1,56 TB. Además se necesita memoria para:
- overhead del framework,
- cachés,
- activaciones,
- buffers de comunicación,
- sistema operativo,
- concurrencia.
Dividir 1,56 TB por la memoria de una tarjeta no produce una configuración de producción.
Motores recomendados
La model card menciona:
- vLLM,
- SGLang,
- TokenSpeed.[2]
También aparecen ejemplos con Transformers y Docker Model Runner. La orden:
vllm serve "moonshotai/Kimi-K3"
no garantiza que el modelo funcione en cualquier equipo.
¿Para quién tiene sentido el self-hosting?
- hyperscalers y proveedores de inferencia,
- laboratorios de investigación,
- grandes empresas con cluster de IA,
- organizaciones con datos especialmente sensibles,
- compañías que crean fine-tunes y cuantizaciones,
- servicios de inferencia a gran escala.
Para la mayoría, la API oficial será más económica.
6. ¿Qué permite la licencia?
La Kimi K3 License permite gratuitamente:
- usar,
- copiar,
- modificar,
- fusionar,
- publicar y distribuir,
- sublicenciar,
- vender copias,
- ejecutar y desplegar,
- fine-tunear,
- crear soluciones derivadas.[4]
Debe conservarse el aviso de copyright y la licencia.
Condición Model as a Service
La licencia define Model as a Service como ofrecer inferencia o fine-tuning a un tercero dándole control material sobre entradas, parámetros o datos de entrenamiento.
Si el licenciatario o sus afiliadas:
- operan un negocio Model as a Service,
- superan 20 millones USD de ingresos combinados en cualquier periodo consecutivo de 12 meses,
deben firmar un acuerdo separado con Moonshot AI antes del uso comercial.[4]
El umbral se refiere a los ingresos totales del licenciatario y sus afiliadas, no solo a los generados por Kimi K3.
Obligación de mostrar Kimi K3
Si el modelo o un derivado se usa en un producto o servicio comercial con:
- más de 100 millones de usuarios activos mensuales, o
- más de 20 millones USD de ingresos mensuales,
el nombre “Kimi K3” debe mostrarse de forma visible en la interfaz.[4]
Excepciones
Las condiciones de MaaS y atribución no se aplican:
- a uso interno sin exposición a terceros,
- a productos oficiales de Moonshot AI,
- a partners certificados de inferencia.[4]
Qué debe verificar una empresa
- uso interno o externo,
- control del cliente sobre inferencia/fine-tuning,
- ingresos consolidados,
- umbrales MAU e ingresos,
- obligación de atribución,
- necesidad de contrato separado.
Este artículo no es asesoramiento jurídico.
7. ¿Qué no se publicó?
Los materiales oficiales incluyen:
- pesos finales,
- parte del código,
- configuración de arquitectura,
- código de inferencia y procesadores,
- descripción técnica,
- resultados de evaluación.
No demuestran que se haya publicado el dataset completo ni todos los detalles para reproducir el entrenamiento desde cero.
Kimi K3 es mucho más abierto que una API cerrada, pero no ofrece reproducibilidad completa en el sentido OSI.[5][6]
8. API y precios
Identificador:
kimi-k3
La API oficial es compatible con OpenAI Chat Completions.
Precios
| Tipo de token | Precio por millón |
|---|---|
| Input con cache hit | 0,30 USD |
| Input con cache miss | 3,00 USD |
| Output | 15,00 USD |
Los precios proceden de Moonshot AI y pueden excluir impuestos.[1]
Moonshot AI afirma superar un 90 % de cache hit en workloads de programación. No es una garantía para cada cliente.[1]
Recarga mínima
El acceso se desbloquea tras una recarga mínima de 1 USD. El tier y los límites dependen de las recargas acumuladas.[9]
9. Primera llamada con Python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
max_completion_tokens=8_192,
messages=[
{
"role": "user",
"content": (
"Analiza la arquitectura del proyecto y prepara "
"un plan de migración seguro."
),
}
],
)
message = response.choices[0].message
print(message.content)
cURL
curl https://api.moonshot.ai/v1/chat/completions \
--header "Authorization: Bearer $MOONSHOT_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"reasoning_effort": "high",
"max_completion_tokens": 8192,
"messages": [
{
"role": "user",
"content": "Analiza este problema y propone una solución."
}
]
}'
10. El reasoning siempre está activo
Kimi K3 siempre funciona en modo reasoning. No existe un parámetro que lo desactive por completo.[9][10]
Niveles:
low
high
max
Por defecto:
max
Para gran parte del tráfico de producción conviene empezar con low o high.
reasoning_content
La respuesta puede contener por separado:
reasoning_content,contentfinal.
En streaming llegan como fragmentos distintos.[9][10]
No debe hacerse automáticamente:
- mostrar reasoning al usuario,
- guardarlo sin límites,
- enviarlo a logs con datos personales,
- tratarlo como auditoría fiable.
Preserved Thinking
En conversaciones multi-turn y tool calling, la siguiente petición debe incluir:
reasoning_content,content,tool_calls.
Conservar solo content no es suficiente.[10]
El reasoning histórico consume contexto y se factura.
11. Límites y diferencias de la API
Output máximo
por defecto: 131.072 tokens
máximo: 1.048.576 tokens
El máximo técnico no implica bajo coste o baja latencia.
Parámetros fijos
temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0
La documentación recomienda omitirlos.
Imagen y vídeo
Las URL públicas de imágenes no están soportadas. Hay que usar:
- base64,
ms://<file-id>.
La documentación también muestra vídeo mediante el sistema de archivos de Moonshot.[9]
Búsqueda web
La función oficial está en actualización y no se recomienda actualmente para workflows de producción.[9]
12. Contexto de un millón y cache
1.048.576 tokens
Puede ayudar con:
- repositorios grandes,
- documentación empresarial,
- muchos archivos,
- sesiones de agentes largas,
- investigación multietapa.
Cache automático
El prefix cache funciona automáticamente. No necesita ID ni TTL.
El prompt anterior debe superar 256 tokens para intentar un cache hit.[9]
Hay que mantener prefijos estables, colocar la pregunta variable al final y medir el cache real.
Un millón de tokens no garantiza memoria perfecta, retrieval exhaustivo ni resistencia a prompt injection.
13. Tool calling y agentes
Kimi K3 admite:
- herramientas personalizadas,
tool_choice,- uso forzado,
- structured output con JSON Schema,
- Partial Mode,
- definiciones dinámicas,
- herramientas Formula.[9]
Herramientas dinámicas
Una definición puede añadirse más tarde al historial para reducir longitud, errores y superficie de permisos.
El servidor no la conserva por el cliente. El mensaje debe permanecer en futuras peticiones.
Structured output
response_format = {
"type": "json_schema",
"json_schema": {
"name": "finding",
"strict": True,
"schema": {
"type": "object",
"properties": {
"severity": {
"type": "string",
"enum": ["low", "medium", "high", "critical"],
},
"summary": {"type": "string"},
},
"required": ["severity", "summary"],
"additionalProperties": False,
},
},
}
Debe parsearse message.content, no reasoning_content.[9]
14. Kimi Code y programación
Moonshot AI posiciona K3 para:
- tareas largas de coding,
- repositorios grandes,
- coordinación de terminal,
- refactoring,
- frontend desde screenshots,
- GPU kernels, compiladores, CAD y diseño de chips.[1][2]
Kimi Code puede:
- leer y editar archivos,
- ejecutar comandos,
- buscar,
- obtener páginas web,
- planificar pasos,
- trabajar con TUI,
- integrarse mediante Agent Client Protocol.[11]
Instalación
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /ruta/al/proyecto
kimi
Después:
/model
y seleccionar Kimi K3.
Las operaciones read-only pueden ser automáticas; modificar archivos o ejecutar comandos requiere confirmación en la configuración estándar.[11]
Sigue siendo necesario usar sandbox, mínimo privilegio, protección de secretos, review y bloqueo de despliegue automático.
15. Cómo leer los benchmarks
Resultados oficiales seleccionados con max:
| Benchmark | Kimi K3 |
|---|---|
| GPQA Diamond | 93,5 |
| DeepSWE | 67,5 |
| ProgramBench | 77,8 |
| Terminal-Bench 2.1 | 88,3 |
| FrontierSWE | 81,2 |
| SWE-Marathon | 42,0 |
| BrowseComp | 91,2 |
| MCPMark-Verified | 94,5 |
| OSWorld-Verified | 84,8 |
| AutomationBench | 30,8 |
No puede crearse un ranking simple porque cambian:
- harnesses,
- niveles de reasoning,
- configuraciones de agentes,
- fuentes,
- fechas de leaderboard,
- número de runs,
- gestión del contexto.
En Agents’ Last Exam, Kimi K3 utilizó Kimi Code, GPT utilizó Codex y Claude utilizó Claude Code.[2]
Moonshot AI reconoce que el rendimiento general de K3 sigue por detrás de Claude Fable 5 y GPT-5.6 Sol.[1]
Un POC empresarial debe usar 50–200 tareas propias, herramientas idénticas, varias ejecuciones y coste por tarea completada.
16. Multimodalidad
La model card confirma texto e imagen, y la API también muestra vídeo.[2][9]
Aplicaciones:
- análisis de screenshots,
- corrección de UI,
- gráficos,
- coding desde referencias visuales,
- grabaciones de pantalla,
- motion design y edición de vídeo.
Las demos no garantizan resultados. Deben probarse lectura de texto, localización de elementos, consistencia entre frames, coste y privacidad.
17. Seguridad, privacidad y governance
Ventajas del self-hosting
- datos dentro de infraestructura controlada,
- telemetría externa desactivable,
- filtros y políticas propias,
- control de versión,
- red restringida,
- tests de seguridad internos.
Responsabilidades nuevas
- proteger cluster y endpoints,
- aislar tenants,
- monitorizar abuso,
- validar código generado,
- proteger los pesos,
- actualizar runtime,
- gestionar vulnerabilidades vLLM/SGLang,
- gobernar logs y reasoning,
- establecer límites y circuit breakers.
Las fuentes utilizadas no incluyen una auditoría independiente y completa de Kimi K3. Los entornos regulados deben probar prompt injection, exfiltración, jailbreaks, código dañino, alucinaciones, documentos maliciosos y escalada de herramientas.
18. ¿Self-hosting o API?
| Criterio | Self-hosting | API oficial |
|---|---|---|
| Coste inicial | muy alto | bajo |
| Infraestructura | cluster multiacelerador | sin cluster propio |
| Control de datos | máximo | según condiciones |
| Actualizaciones | responsabilidad propia | gestionadas |
| Fine-tuning | control total | depende de la oferta |
| Escalado | responsabilidad propia | gestionado |
| Cache | implementación propia | automático |
| Tiempo de despliegue | largo | corto |
| Licencia | requiere análisis | excepciones para productos oficiales |
| Equipo pequeño | suele ser poco rentable | normalmente mejor |
La API es adecuada para POC, carga variable y despliegue rápido. Self-hosting tiene sentido con requisitos estrictos de datos, cluster existente, uso estable y experiencia en distributed inference.
19. ¿Merece la pena desplegar Kimi K3?
Sí, si:
- necesitas un modelo enorme autoalojable,
- ya existe la infraestructura,
- investigas modelos 3T,
- construyes un proveedor de inferencia,
- necesitas multimodalidad y contexto largo,
- tienes tareas agentic coding largas,
- quieres fine-tunes y cuantizaciones propias.
No necesariamente, si:
- solo dispones de un servidor GPU,
- las consultas simples requieren baja latencia,
- una API más barata ya es suficiente,
- necesitas desactivar reasoning,
- exiges Apache o MIT,
- necesitas reproducibilidad completa del entrenamiento,
- no hay equipo de distributed inference.
20. Veredicto
La publicación de los pesos completos de Kimi K3 es un acontecimiento importante.
El modelo ofrece:
- 2,8 billones de parámetros,
- 104.000 millones activos,
- multimodalidad nativa,
- contexto de un millón,
- arquitectura MoE con 896 expertos,
- foco en coding y tareas agentic largas.
Hay que separar tres hechos:
- Kimi K3 fue presentado antes.
- Los pesos y materiales técnicos se publicaron el 27 de julio.
- Es open-weight con licencia propia, no inequívocamente Open Source AI según OSI.
Para investigación y proveedores de inferencia es una publicación valiosa. Para una empresa normal, 1,56 TB y al menos 64 aceleradores lo convierten en un proyecto de infraestructura.
Estrategia recomendada:
Primero:
POC mediante la API oficial
Después:
medir calidad, coste, latencia y riesgo
Solo entonces:
analizar self-hosting, licencia y cluster
21. Checklist antes del despliegue
Terminología y licencia
- Se usa open-weight.
- Se conserva licencia y copyright.
- Legal ha revisado la licencia.
- Se ha determinado si es MaaS.
- Se ha revisado el umbral de 20 M USD en 12 meses.
- Se ha revisado el umbral de 100 M MAU.
- Se ha revisado el umbral de 20 M USD mensuales.
- Se ha determinado la atribución en UI.
- El uso interno está documentado.
Infraestructura
- Se ha confirmado 1,56 TB.
- Se ha planificado descargar 96 shards.
- Se verifica integridad.
- Se ha elegido vLLM, SGLang o TokenSpeed.
- Hay memoria suficiente.
- Hay interconexión rápida.
- Expert parallelism planificado.
- KV cache dimensionado.
- Monitorización GPU/red/memoria.
- Procedimiento de actualización runtime.
API y agente
- Modelo
kimi-k3. -
reasoning_effortapropiado. - No se intenta desactivar reasoning.
- Historial completo de
reasoning_content. -
max_completion_tokensrazonable. - No se envían parámetros sampling fijos.
- Imágenes en base64 o
ms://. - Web search no es crítico.
- Tool calls validados.
- JSON Schema validado.
Seguridad
- Sandbox.
- Mínimo privilegio.
- Sin acceso automático a producción.
- Sin secretos en prompts/logs.
- Reasoning no se registra sin necesidad.
- Prompt injection probado.
- Documentos maliciosos probados.
- Límites de coste, tiempo y herramientas.
- Human approval para acciones destructivas.
- Tests y review de código.
Evaluación
- Dataset interno.
- Al menos tres modelos.
- Harness idéntico.
- Varias ejecuciones.
- Coste total por tarea.
- Tiempo hasta resultado correcto.
- Code review y refactoring.
- Multimodalidad.
- Long context.
- Alucinaciones y citas.

