Kimi K3 je nativně multimodální model typu Mixture-of-Experts s:
- 2,8 bilionu celkových parametrů,
- 104 miliardami parametrů aktivovaných při generování tokenu,
- 896 experty, z nichž se vybírá 16,
- kontextem o délce 1 048 576 tokenů,
- podporou textu, obrazu a podle dokumentace API také videa,
- velikostí repozitáře přibližně 1,56 TB.[2][3]
Moonshot AI označuje Kimi K3 jako open-source model. V přísném významu Open Source Initiative je však přesnější výraz open-weight. Byly publikovány konečné parametry, kód a dokumentace, ale Kimi K3 používá vlastní licenci s dodatečnými podmínkami pro některá komerční použití. Samotná dostupnost vah také nezajišťuje úplnou transparentnost tréninkového procesu a dat požadovanou Open Source AI Definition.[4][5][6]
Hlavní závěr: Kimi K3 lze skutečně stáhnout, upravovat, fine-tunovat a hostovat ve vlastní infrastruktuře, ale běžná firma jej nespustí na jednom GPU serveru. Publikace vah otevírá významné možnosti pro výzkum a infrastrukturu, zatímco rozsah modelu a licence vyžadují důkladnou analýzu před produkčním nasazením.
Všechny parametry, ceny, licenční podmínky a informace o dostupnosti byly ověřeny 27. července 2026.
TL;DR
| Otázka | Odpověď |
|---|---|
| Co se stalo 27. července? | Byly zveřejněny kompletní váhy, repozitář, licence a technická zpráva |
| Byl v ten den uveden samotný model? | Ne, model a API byly dostupné dříve |
| Je Kimi K3 open source? | Moonshot tento termín používá, ale přesnější je open-weight pod vlastní licencí |
| Kolik má parametrů? | 2,8 bilionu celkem, 104 miliard aktivních |
| Jaká je architektura? | MoE, KDA, Gated MLA, AttnRes a Stable LatentMoE |
| Kolik má expertů? | 896, z nichž 16 se vybírá na token, plus 2 sdílení experti |
| Jak dlouhý je kontext? | 1 048 576 tokenů |
| Jak velké jsou soubory? | Přibližně 1,56 TB |
| Kolik je hlavních shardů? | 96 souborů Safetensors |
| Lze jej spustit lokálně? | Technicky ano, ale ne na běžném počítači nebo jednom GPU |
| Co doporučuje výrobce? | Supernode konfigurace s nejméně 64 akcelerátory |
| Je povoleno komerční použití? | Ano, podle Kimi K3 License |
| Kolik stojí oficiální API? | 0,30 USD/MTok cache hit, 3 USD/MTok cache miss, 15 USD/MTok output |
| Lze vypnout reasoning? | Ne |
| Jaké úrovně jsou dostupné? | low, high, max, výchozí max |
| Jsou benchmarky nezávislé? | Ne všechny, část pochází od Moonshot AI |
1. Co přesně bylo zveřejněno?
Oficiální repozitář moonshotai/Kimi-K3 na Hugging Face obsahuje:
- kompletní váhy,
- konfiguraci modelu,
- kód pro načítání a zpracování vstupů,
- tokenizer a soubory procesoru,
- příklady pro Transformers, vLLM a SGLang,
- model card,
- Kimi K3 License.[2]
Oficiální GitHub repozitář navíc obsahuje:
- kód a dokumentaci projektu,
- technickou zprávu
k3_tech_report.pdf, - instrukce k nasazení,
- popis architektury a evaluace.[3][7]
Repozitář vah má přibližně 1,56 TB. Hlavní parametry jsou rozděleny do 96 souborů Safetensors, od:
model-00001-of-000096.safetensors
do:
model-00096-of-000096.safetensors
Většina shardů má přibližně 16,6–17 GB.[8]
Nejde o budoucí slib. Soubory už jsou dostupné ke stažení.
2. Open source, nebo open-weight?
Moonshot AI používá označení:
- „open model“,
- „open-source model“,
- „Open Frontier Weights“.
Model card na Hugging Face označuje Kimi K3 výslovně jako open-weight.[2]
Co jsou otevřené váhy?
Váhy jsou konečné parametry naučené při tréninku. Jejich zveřejnění umožňuje:
- provoz mimo infrastrukturu výrobce,
- fine-tuning,
- tvorbu kvantizací,
- analýzu chování,
- vlastní inference servery,
- integraci bez posílání promptů do oficiálního API.
Neumožňuje automaticky reprodukovat celý proces vývoje.
Proč OSI rozlišuje open weights a Open Source AI?
Open Source Initiative uvádí, že samotné konečné váhy neposkytují úplný přístup k:
- datům nebo dostatečným informacím o tréninkových datech,
- veškerému kódu pro přípravu dat,
- plné konfiguraci tréninku,
- částem potřebným k reprodukci podstatně rovnocenného systému.[5][6]
Open Source AI Definition vyžaduje svobodu:
- používat,
- studovat,
- upravovat,
- sdílet,
a přístup k preferované formě nutné pro skutečnou modifikaci systému.[6]
Je Kimi K3 License schválená OSI?
Repozitář používá vlastní Kimi K3 License, nikoli Apache-2.0, MIT ani jinou standardní OSI licenci.
Licence uděluje široká práva:
- používat,
- kopírovat,
- upravovat,
- publikovat,
- distribuovat,
- sublicencovat,
- prodávat,
- nasazovat,
- fine-tunovat,
- vytvářet odvozená díla.[4]
Zároveň obsahuje dodatečné podmínky pro některé komerční subjekty. Nejbezpečnější formulace proto zní:
Kimi K3 je open-weight model vydaný pod vlastní Kimi K3 License.
Model není „uzavřený“, ale termín open source zde vyžaduje právní a technické upřesnění.
3. Hlavní parametry Kimi K3
| Parametr | Kimi K3 |
|---|---|
| Architektura | Mixture-of-Experts |
| Celkové parametry | 2,8 bilionu |
| Aktivované parametry | 104 miliard |
| Počet vrstev | 93 |
| Dense vrstvy | 1 |
| Attention vrstvy | 69 KDA + 24 Gated MLA |
| Experti | 896 |
| Experti na token | 16 |
| Sdílení experti | 2 |
| Slovník | 160 000 |
| Kontext | 1 048 576 tokenů |
| Obrazový enkodér | MoonViT-V2 |
| Parametry vision enkodéru | 401 milionů |
| Váhy | MXFP4 |
| Aktivace | MXFP8 |
| Modality v model card | text a obraz |
| Další modalita v API | video |
| Velikost repozitáře | přibližně 1,56 TB |
| Safetensors shardy | 96 |
Data pocházejí z oficiální model card.[2]
2,8 bilionu neznamená 2,8 bilionu aktivních parametrů
Kimi K3 je MoE model. Při generování tokenu nepoužívá všechny experty.
Router vybírá 16 z 896 expertů a dokumentace uvádí 104 miliard aktivovaných parametrů. To zvyšuje kapacitu bez stejného výpočetního nákladu jako dense model s 2,8T.
Hardware však stále není srovnatelný s běžným 100B modelem, protože všechny váhy musí být uloženy a rozděleny mezi akcelerátory.
4. KDA, AttnRes a Stable LatentMoE
Kimi Delta Attention
KDA je hybridní linear-attention mechanismus pro dlouhé sekvence.
Model obsahuje:
- 69 KDA vrstev,
- 24 Gated MLA vrstev.[2]
Linear attention může snížit část nákladů full attention u dlouhého kontextu, ale milion tokenů tím není levný.
Attention Residuals
AttnRes mění předávání reprezentací mezi vrstvami. Podle Moonshot AI selektivně získává informace z různých hloubek.[1]
Stable LatentMoE
Stable LatentMoE umožňuje škálování na 896 expertů a aktivaci 16. Moonshot AI uvádí přibližně 2,5násobné zlepšení celkové efektivity škálování oproti Kimi K2.[1][2]
Jde o tvrzení výrobce, ne záruku 2,5násobné rychlosti, nižší ceny nebo kvality.
Nativní MXFP4
Kimi K3 byl od supervised fine-tuning trénován s ohledem na kvantizaci:
MXFP4 pro váhy
MXFP8 pro aktivace
Cílem je snížit paměťové nároky a usnadnit deployment.[2] Repozitář má stále přibližně 1,56 TB.
5. Lze Kimi K3 spustit lokálně?
Ano, pokud „lokálně“ znamená velkou vlastní infrastrukturu.
Plná verze není určená pro:
- notebook,
- workstation s běžnou GPU,
- jeden server s několika GPU,
- malý homelab.
Moonshot AI doporučuje supernode s nejméně 64 akcelerátory. Potřeba je zohlednit:
- váhy,
- KV cache,
- milionový kontext,
- komunikaci mezi experty,
- expert parallelism,
- rychlé propojení zařízení,
- prefix cache,
- rezervu runtime.[1]
Reálná paměť
Kvantizované váhy zabírají přibližně 1,56 TB. Navíc je potřeba paměť pro:
- overhead frameworku,
- cache,
- aktivace,
- komunikační buffery,
- operační systém,
- souběh požadavků.
Dělení 1,56 TB pamětí jedné karty neposkytne produkční konfiguraci.
Doporučené enginy
Model card uvádí:
- vLLM,
- SGLang,
- TokenSpeed.[2]
Jsou dostupné také příklady Transformers a Docker Model Runner. Příkaz:
vllm serve "moonshotai/Kimi-K3"
neznamená, že model poběží na libovolném stroji.
Pro koho má self-hosting smysl?
- hyperscaleři a inference provideři,
- výzkumné laboratoře,
- velké podniky s AI clustery,
- organizace s velmi citlivými daty,
- firmy vytvářející fine-tunes a kvantizace,
- poskytovatelé inference ve velkém měřítku.
Pro většinu týmů je výhodnější oficiální API.
6. Co licence dovoluje?
Kimi K3 License bezplatně dovoluje:
- používat,
- kopírovat,
- upravovat,
- slučovat,
- publikovat a distribuovat,
- sublicencovat,
- prodávat kopie,
- provozovat a nasazovat,
- fine-tunovat,
- vytvářet odvozená řešení.[4]
Je nutné zachovat copyright a text licence.
Podmínka Model as a Service
Licence definuje Model as a Service jako poskytování inference nebo fine-tuningu třetí straně s významnou kontrolou nad vstupy, parametry nebo tréninkovými daty.
Pokud držitel licence nebo přidružené subjekty:
- provozují Model as a Service,
- dosahují společně více než 20 milionů USD příjmů v libovolném souvislém období 12 měsíců,
musí před komerčním použitím uzavřít samostatnou smlouvu s Moonshot AI.[4]
Práh se týká celkových příjmů držitele licence a přidružených subjektů, nikoli jen Kimi K3.
Povinnost zobrazit jméno Kimi K3
Pokud se model nebo odvozené řešení používá v komerčním produktu či službě s:
- více než 100 miliony měsíčně aktivních uživatelů, nebo
- více než 20 miliony USD měsíčních příjmů,
musí být název „Kimi K3“ viditelně zobrazen v uživatelském rozhraní.[4]
Výjimky
Podmínky MaaS a atribuce neplatí:
- pro čistě interní využití bez zpřístupnění třetím stranám,
- pro oficiální produkty Moonshot AI,
- pro certifikované inference partnery.[4]
Co musí firma prověřit?
- interní nebo externí využití,
- míru kontroly zákazníka,
- příjmy skupiny,
- MAU a příjmové prahy,
- povinnost atribuce,
- potřebu samostatné smlouvy.
Tento článek není právní poradenství.
7. Co zveřejněno nebylo?
Oficiální materiály obsahují:
- konečné váhy,
- část kódu,
- konfiguraci architektury,
- inference a processor kód,
- technický popis,
- výsledky evaluace.
Nevyplývá z nich zveřejnění kompletního datasetu ani všech detailů nutných pro reprodukci tréninku od nuly.
Kimi K3 je mnohem otevřenější než uzavřené API, ale neposkytuje úplnou reprodukovatelnost podle OSI.[5][6]
8. API a ceny
Identifikátor:
kimi-k3
Oficiální API je kompatibilní s OpenAI Chat Completions.
Ceník
| Typ tokenu | Cena za milion |
|---|---|
| Input při cache hit | 0,30 USD |
| Input při cache miss | 3,00 USD |
| Output | 15,00 USD |
Ceny pocházejí od Moonshot AI a mohou být bez daní.[1]
Moonshot AI uvádí více než 90% cache hit u coding workloadů. Nejde o záruku pro každého klienta.[1]
Minimální dobití
Přístup k API se odemkne po dobití alespoň 1 USD. Tier a limity závisí na kumulativních platbách.[9]
9. První volání v Pythonu
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
max_completion_tokens=8_192,
messages=[
{
"role": "user",
"content": (
"Analyzuj architekturu projektu a připrav "
"bezpečný plán migrace."
),
}
],
)
message = response.choices[0].message
print(message.content)
cURL
curl https://api.moonshot.ai/v1/chat/completions \
--header "Authorization: Bearer $MOONSHOT_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"reasoning_effort": "high",
"max_completion_tokens": 8192,
"messages": [
{
"role": "user",
"content": "Analyzuj tento problém a navrhni řešení."
}
]
}'
10. Reasoning je vždy zapnutý
Kimi K3 vždy používá reasoning. Není možné jej úplně vypnout.[9][10]
Úrovně:
low
high
max
Výchozí:
max
Pro běžný produkční provoz je vhodné začít s low nebo high.
reasoning_content
Odpověď může obsahovat samostatně:
reasoning_content,- konečný
content.
Při streamingu přicházejí odděleně.[9][10]
Reasoning by se neměl automaticky:
- zobrazovat uživateli,
- neomezeně ukládat,
- posílat do logů s osobními daty,
- považovat za spolehlivý audit.
Preserved Thinking
V multi-turn konverzacích a tool callingu musí další request obsahovat:
reasoning_content,content,tool_calls.
Pouze konečný content nestačí.[10]
Historický reasoning spotřebovává kontext a je účtován.
11. Limity a odlišnosti API
Maximální output
výchozí: 131 072 tokenů
maximum: 1 048 576 tokenů
Technické maximum není automaticky levné nebo rychlé.
Pevné parametry
temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0
Dokumentace doporučuje je neposílat.
Obrázky a video
Veřejné URL obrázků nejsou podporovány. Použijte:
- base64,
ms://<file-id>.
Dokumentace ukazuje také video přes souborový systém Moonshot.[9]
Web search
Oficiální web search se aktualizuje a dokumentace jej nyní nedoporučuje pro produkční workflow.[9]
12. Milionový kontext a cache
1 048 576 tokenů
Vhodné pro:
- velké repozitáře,
- podnikovou dokumentaci,
- mnoho souborů,
- dlouhé agentní relace,
- vícestupňový výzkum.
Automatická cache
Prefix cache funguje automaticky. Není potřeba ID ani TTL.
Předchozí prompt musí překročit 256 tokenů, aby se pokusil cache hit.[9]
Udržujte stabilní prefix, proměnnou otázku dejte na konec a měřte skutečné cache hits.
Milion tokenů nezaručuje perfektní paměť, úplný retrieval ani odolnost proti prompt injection.
13. Tool calling a agenti
Kimi K3 podporuje:
- custom tools,
tool_choice,- vynucené použití,
- structured output s JSON Schema,
- Partial Mode,
- dynamické definice,
- Formula tools.[9]
Dynamické nástroje
Definici lze přidat později do historie a snížit tak délku, chyby i rozsah oprávnění.
Server definici za klienta neuchovává. Zpráva musí zůstat v další historii.
Structured output
response_format = {
"type": "json_schema",
"json_schema": {
"name": "finding",
"strict": True,
"schema": {
"type": "object",
"properties": {
"severity": {
"type": "string",
"enum": ["low", "medium", "high", "critical"],
},
"summary": {"type": "string"},
},
"required": ["severity", "summary"],
"additionalProperties": False,
},
},
}
Parsujte message.content, nikoli reasoning_content.[9]
14. Kimi Code a programování
Moonshot AI cílí K3 na:
- dlouhé coding úlohy,
- velké repozitáře,
- koordinaci terminálových nástrojů,
- refactoring,
- frontend podle screenshotů,
- GPU kernels, kompilátory, CAD a návrh čipů.[1][2]
Kimi Code umí:
- číst a upravovat soubory,
- spouštět shell,
- vyhledávat,
- načítat webové stránky,
- plánovat kroky,
- pracovat přes TUI,
- integrovat se přes Agent Client Protocol.[11]
Instalace
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /cesta/k/projektu
kimi
Poté:
/model
a vybrat Kimi K3.
Read-only operace mohou běžet automaticky, zatímco změny a příkazy vyžadují ve standardním nastavení potvrzení.[11]
Sandbox, least privilege, ochrana secrets, review a blokace auto-deploymentu jsou stále nutné.
15. Jak číst benchmarky?
Vybrané oficiální výsledky při max:
| Benchmark | Kimi K3 |
|---|---|
| GPQA Diamond | 93,5 |
| DeepSWE | 67,5 |
| ProgramBench | 77,8 |
| Terminal-Bench 2.1 | 88,3 |
| FrontierSWE | 81,2 |
| SWE-Marathon | 42,0 |
| BrowseComp | 91,2 |
| MCPMark-Verified | 94,5 |
| OSWorld-Verified | 84,8 |
| AutomationBench | 30,8 |
Jednoduchý žebříček není spolehlivý, protože se liší:
- harnessy,
- reasoning,
- konfigurace agentů,
- zdroje,
- data leaderboardů,
- počty běhů,
- práce s kontextem.
V Agents’ Last Exam používal Kimi K3 Kimi Code, GPT používal Codex a Claude používal Claude Code.[2]
Moonshot AI sám uvádí, že celkový výkon K3 stále zaostává za Claude Fable 5 a GPT-5.6 Sol.[1]
Firemní POC má obsahovat 50–200 reálných úloh, stejné nástroje, více běhů a cenu za dokončený úkol.
16. Multimodalita
Model card potvrzuje text a obraz, API také video.[2][9]
Použití:
- screenshoty,
- opravy UI,
- grafy,
- coding z vizuálních referencí,
- nahrávky obrazovky,
- motion design a video editing.
Dema výrobce nejsou zárukou. Testujte čtení textu, lokalizaci prvků, konzistenci snímků, cenu a soukromí.
17. Bezpečnost, soukromí a governance
Výhody self-hostingu
- data zůstávají v kontrolované infrastruktuře,
- externí telemetrii lze vypnout,
- vlastní filtry a policy,
- kontrola verze,
- omezená síť,
- vlastní security testy.
Nové povinnosti
- zabezpečení clusteru a endpointů,
- tenant isolation,
- monitoring zneužití,
- validace generovaného kódu,
- ochrana vah,
- aktualizace runtime,
- zranitelnosti vLLM/SGLang,
- governance logů a reasoning,
- limity a circuit breakers.
Použité zdroje neobsahují nezávislý komplexní bezpečnostní audit Kimi K3. Regulované využití vyžaduje testy prompt injection, exfiltrace, jailbreaků, škodlivého kódu, halucinací, zlomyslných dokumentů a eskalace nástrojů.
18. Self-hosting, nebo API?
| Kritérium | Self-hosting | Oficiální API |
|---|---|---|
| Počáteční náklady | velmi vysoké | nízké |
| Infrastruktura | multi-accelerator cluster | bez vlastního clusteru |
| Kontrola dat | nejvyšší | podle podmínek |
| Aktualizace | vlastní odpovědnost | spravované |
| Fine-tuning | plná kontrola | podle nabídky |
| Škálování | vlastní odpovědnost | spravované |
| Cache | vlastní implementace | automatická |
| Čas nasazení | dlouhý | krátký |
| Licence | vyžaduje analýzu | výjimky pro oficiální produkty |
| Malý tým | obvykle nevýhodné | obvykle lepší |
API je vhodné pro POC, proměnlivou zátěž a rychlou integraci. Self-hosting pro přísná data, existující cluster, stabilní vysoké využití a zkušenosti s distributed inference.
19. Vyplatí se Kimi K3 nasadit?
Ano, pokud:
- potřebujete velmi velký self-hostable model,
- máte infrastrukturu,
- zkoumáte 3T modely,
- stavíte inference provider,
- potřebujete multimodalitu a dlouhý kontext,
- máte dlouhé agentic coding úlohy,
- chcete vlastní fine-tunes a kvantizace.
Ne nutně, pokud:
- máte jen jeden GPU server,
- jednoduché dotazy vyžadují nízkou latenci,
- levnější API je dostatečné,
- reasoning musí jít vypnout,
- potřebujete Apache nebo MIT,
- vyžadujete úplnou reprodukovatelnost tréninku,
- nemáte distributed-inference tým.
20. Verdikt
Publikace plných vah Kimi K3 je významná.
Model nabízí:
- 2,8 bilionu parametrů,
- 104 miliard aktivních,
- nativní multimodalitu,
- milionový kontext,
- MoE s 896 experty,
- zaměření na coding a dlouhé agentní úlohy.
Je třeba oddělit tři fakta:
- Kimi K3 byl představen dříve.
- Váhy a technické materiály vyšly 27. července.
- Je open-weight pod vlastní licencí, nikoli nesporně Open Source AI podle OSI.
Pro výzkum a inference providery je vydání cenné. Pro běžnou firmu jsou 1,56 TB a nejméně 64 akcelerátorů infrastrukturním projektem.
Doporučený postup:
Nejprve:
POC přes oficiální API
Poté:
měřit kvalitu, cenu, latenci a riziko
Až následně:
řešit self-hosting, licenci a cluster
21. Checklist před nasazením
Terminologie a licence
- Používá se open-weight.
- Licence a copyright zůstávají.
- Právní oddělení provedlo kontrolu.
- MaaS status je určen.
- Ověřen limit 20 mil. USD za 12 měsíců.
- Ověřen limit 100 mil. MAU.
- Ověřen limit 20 mil. USD měsíčně.
- Atribuce v UI je určena.
- Interní použití je dokumentováno.
Infrastruktura
- Potvrzeno 1,56 TB.
- Naplánováno 96 shardů.
- Integrita ověřena.
- Vybrán vLLM, SGLang nebo TokenSpeed.
- Dostatek paměti akcelerátorů.
- Rychlé propojení.
- Expert parallelism.
- KV cache spočítána.
- Monitoring GPU/sítě/paměti.
- Proces aktualizace runtime.
API a agent
- Používá se
kimi-k3. - Zvolen
reasoning_effort. - Reasoning se nevypíná.
- Úplná historie
reasoning_content. - Omezeno
max_completion_tokens. - Pevné sampling parametry se neposílají.
- Obrázky base64 nebo
ms://. - Web search není kritický.
- Tool calls validovány.
- JSON Schema validováno.
Bezpečnost
- Sandbox.
- Least privilege.
- Bez automatického přístupu do produkce.
- Bez secrets v promptech a logách.
- Reasoning se zbytečně neloguje.
- Prompt injection testován.
- Zlomyslné dokumenty testovány.
- Limity ceny, času a toolů.
- Human approval pro destruktivní akce.
- Testy a review kódu.
Evaluace
- Vlastní dataset úloh.
- Nejméně tři modely.
- Stejný harness.
- Více běhů.
- Celková cena úlohy.
- Čas ke správnému výsledku.
- Code review a refactoring.
- Multimodalita.
- Long context.
- Halucinace a citace.

