Kimi K3 is een native multimodaal Mixture-of-Experts-model met:
- 2,8 biljoen totale parameters,
- 104 miljard parameters die per token worden geactiveerd,
- 896 experts, waarvan er 16 worden geselecteerd,
- een contextvenster van 1.048.576 tokens,
- ondersteuning voor tekst, afbeeldingen en volgens de API-documentatie ook video,
- een repository van ongeveer 1,56 TB.[2][3]
Moonshot AI noemt Kimi K3 open source. In de strikte betekenis van de Open Source Initiative is open-weight echter nauwkeuriger. De uiteindelijke parameters, code en documentatie zijn gepubliceerd, maar Kimi K3 gebruikt een eigen licentie met extra voorwaarden voor bepaalde commerciële toepassingen. Alleen toegang tot de gewichten biedt ook niet de volledige transparantie over trainingsproces en trainingsdata die de Open Source AI Definition vereist.[4][5][6]
Belangrijkste conclusie: Kimi K3 kan werkelijk worden gedownload, aangepast, gefinetuned en zelf gehost, maar een gemiddeld bedrijf zal het model niet op één GPU-server draaien. De publicatie creëert belangrijke onderzoeks- en infrastructuurmogelijkheden, terwijl schaal en licentie vóór productie zorgvuldig moeten worden beoordeeld.
Alle parameters, prijzen, licentievoorwaarden en beschikbaarheidsinformatie zijn gecontroleerd op 27 juli 2026.
TL;DR
| Vraag | Antwoord |
|---|---|
| Wat gebeurde er op 27 juli? | Volledige gewichten, repository, licentie en technisch rapport werden gepubliceerd |
| Werd het model zelf die dag gelanceerd? | Nee, model en API waren al beschikbaar |
| Is Kimi K3 open source? | Moonshot gebruikt die term, maar open-weight onder een eigen licentie is nauwkeuriger |
| Hoeveel parameters? | 2,8 biljoen totaal, 104 miljard actief |
| Welke architectuur? | MoE, KDA, Gated MLA, AttnRes en Stable LatentMoE |
| Hoeveel experts? | 896, waarvan 16 per token, plus 2 gedeelde experts |
| Hoe lang is de context? | 1.048.576 tokens |
| Hoe groot zijn de bestanden? | Ongeveer 1,56 TB |
| Hoeveel hoofdshards? | 96 Safetensors-bestanden |
| Kan het lokaal draaien? | Technisch ja, maar niet op een normale computer of één GPU |
| Wat adviseert de leverancier? | Supernodes met minimaal 64 accelerators |
| Is commercieel gebruik toegestaan? | Ja, onder de Kimi K3 License |
| Wat kost de officiële API? | 0,30 USD/MTok cache hit, 3 USD/MTok cache miss, 15 USD/MTok output |
| Kan reasoning uit? | Nee |
| Welke niveaus zijn er? | low, high, max, standaard max |
| Zijn alle benchmarks onafhankelijk? | Nee, een deel komt van Moonshot AI |
1. Wat is precies gepubliceerd?
De officiële Hugging Face-repository moonshotai/Kimi-K3 bevat:
- volledige gewichten,
- modelconfiguratie,
- laad- en verwerkingscode,
- tokenizer en processorbestanden,
- voorbeelden voor Transformers, vLLM en SGLang,
- model card,
- Kimi K3 License.[2]
De officiële GitHub-repository bevat daarnaast:
- code en documentatie,
k3_tech_report.pdf,- deploymentinstructies,
- beschrijving van architectuur en evaluatie.[3][7]
De repository is ongeveer 1,56 TB groot. De parameters zijn verdeeld over 96 Safetensors-bestanden, van:
model-00001-of-000096.safetensors
tot:
model-00096-of-000096.safetensors
De meeste shards zijn ongeveer 16,6–17 GB.[8]
Dit is geen toekomstige belofte: de bestanden zijn aanwezig en downloadbaar.
2. Open source of open-weight?
Moonshot AI gebruikt onder andere:
- “open model”,
- “open-source model”,
- “Open Frontier Weights”.
De model card noemt Kimi K3 expliciet open-weight.[2]
Wat zijn open gewichten?
Gewichten zijn de uiteindelijke parameters die tijdens training zijn geleerd. Publicatie maakt het mogelijk om:
- buiten de infrastructuur van de leverancier te draaien,
- te finetunen,
- quantisaties te maken,
- gedrag te analyseren,
- eigen inferentieservers te bouwen,
- zonder officiële API te integreren.
Dit maakt het volledige ontwikkelproces niet automatisch reproduceerbaar.
Waarom onderscheidt OSI open weights van Open Source AI?
De Open Source Initiative stelt dat alleen de eindgewichten geen volledige toegang geven tot:
- data of voldoende informatie over trainingsdata,
- alle code voor datavoorbereiding,
- de volledige trainingsconfiguratie,
- onderdelen die nodig zijn om een wezenlijk gelijkwaardig systeem te reproduceren.[5][6]
De Open Source AI Definition vereist vrijheid om te:
- gebruiken,
- bestuderen,
- wijzigen,
- delen,
plus toegang tot de voorkeursvorm die nodig is om het systeem werkelijk aan te passen.[6]
Is de Kimi K3 License OSI-goedgekeurd?
De repository gebruikt een eigen Kimi K3 License, niet Apache-2.0, MIT of een andere standaard-OSI-licentie.
De licentie geeft brede rechten om te:
- gebruiken,
- kopiëren,
- wijzigen,
- publiceren,
- distribueren,
- sublicentiëren,
- verkopen,
- deployen,
- finetunen,
- afgeleide werken maken.[4]
Voor sommige commerciële organisaties gelden aanvullende voorwaarden. De veiligste formulering is daarom:
Kimi K3 is een open-weight-model onder de eigen Kimi K3 License.
Dat betekent niet dat het model “gesloten” is, maar de open-sourceclaim heeft juridische en technische nuances.
3. Belangrijkste parameters
| Parameter | Kimi K3 |
|---|---|
| Architectuur | Mixture-of-Experts |
| Totale parameters | 2,8 biljoen |
| Geactiveerde parameters | 104 miljard |
| Lagen | 93 |
| Dense lagen | 1 |
| Attention-lagen | 69 KDA + 24 Gated MLA |
| Experts | 896 |
| Experts per token | 16 |
| Gedeelde experts | 2 |
| Woordenschat | 160.000 |
| Context | 1.048.576 tokens |
| Beeldencoder | MoonViT-V2 |
| Vision-parameters | 401 miljoen |
| Gewichten | MXFP4 |
| Activaties | MXFP8 |
| Modaliteiten model card | tekst en afbeelding |
| Extra API-modaliteit | video |
| Repositorygrootte | ongeveer 1,56 TB |
| Safetensors-shards | 96 |
De waarden komen uit de officiële model card.[2]
2,8 biljoen betekent niet 2,8 biljoen actief
Kimi K3 is MoE. Niet alle experts worden tegelijk gebruikt.
De router kiest 16 van 896 experts en de documentatie noemt 104 miljard geactiveerde parameters. Dit verhoogt de capaciteit zonder exact dezelfde compute als een dense 2,8T-model.
De hardwarekosten zijn nog steeds niet vergelijkbaar met een normaal 100B-model, omdat alle gewichten opgeslagen en verdeeld moeten worden.
4. KDA, AttnRes en Stable LatentMoE
Kimi Delta Attention
KDA is een hybride linear-attentionmechanisme voor lange sequenties.
Het model bevat:
- 69 KDA-lagen,
- 24 Gated MLA-lagen.[2]
Linear attention kan een deel van de kosten van full attention bij lange context verminderen, maar maakt één miljoen tokens niet goedkoop.
Attention Residuals
AttnRes verandert hoe representaties tussen lagen worden doorgegeven. Volgens Moonshot AI haalt het selectief informatie uit verschillende dieptes op.[1]
Stable LatentMoE
Stable LatentMoE schaalt naar 896 experts en activeert er 16. Moonshot AI claimt een ongeveer 2,5× betere algemene schaal-efficiëntie dan Kimi K2.[1][2]
Dit is een leveranciersclaim, geen garantie op 2,5× meer snelheid, lagere kosten of kwaliteit.
Native MXFP4
Kimi K3 is vanaf supervised fine-tuning quantisatiebewust getraind:
MXFP4 voor gewichten
MXFP8 voor activaties
Doel is minder geheugen en eenvoudiger deployment.[2] De repository blijft ongeveer 1,56 TB.
5. Kan Kimi K3 lokaal draaien?
Ja, wanneer “lokaal” eigen grootschalige infrastructuur betekent.
De volledige versie is niet bedoeld voor:
- laptops,
- workstations met consument-GPU’s,
- één server met enkele GPU’s,
- kleine homelabs.
Moonshot AI adviseert supernodes met minimaal 64 accelerators. Nodig zijn onder meer:
- opslag van de gewichten,
- KV cache,
- miljoen-token-context,
- communicatie tussen experts,
- expert parallelism,
- snelle interconnect,
- prefix cache,
- runtime-reserve.[1]
Werkelijk geheugen
De quantiseerde gewichten zijn al ongeveer 1,56 TB. Daarnaast is geheugen nodig voor:
- frameworkoverhead,
- caches,
- activaties,
- communicatiebuffers,
- besturingssysteem,
- concurrency.
1,56 TB delen door het geheugen van één kaart levert geen productieconfiguratie op.
Aanbevolen engines
De model card noemt:
- vLLM,
- SGLang,
- TokenSpeed.[2]
Ook Transformers en Docker Model Runner worden getoond. Het commando:
vllm serve "moonshotai/Kimi-K3"
betekent niet dat het op iedere computer werkt.
Voor wie is self-hosting zinvol?
- hyperscalers en inferenceproviders,
- onderzoekslabs,
- grote ondernemingen met een AI-cluster,
- organisaties met zeer gevoelige data,
- bedrijven die fine-tunes en quantisaties maken,
- grootschalige inferentiediensten.
Voor de meeste teams is de officiële API goedkoper.
6. Wat staat de licentie toe?
De Kimi K3 License staat kosteloos toe:
- gebruiken,
- kopiëren,
- wijzigen,
- samenvoegen,
- publiceren en distribueren,
- sublicentiëren,
- verkopen,
- uitvoeren en deployen,
- finetunen,
- afgeleide oplossingen maken.[4]
Copyright en licentietekst moeten behouden blijven.
Model as a Service
De licentie definieert Model as a Service als inference of fine-tuning aan derden aanbieden met wezenlijke controle over inputs, parameters of trainingsdata.
Als een licentiehouder of gelieerde ondernemingen:
- een Model as a Service-bedrijf voeren,
- samen meer dan 20 miljoen USD omzet behalen in een aaneengesloten periode van 12 maanden,
is vóór commercieel gebruik een aparte overeenkomst met Moonshot AI nodig.[4]
De grens gaat over totale groepsomzet, niet alleen Kimi-K3-omzet.
Naam Kimi K3 tonen
Bij een commercieel product of dienst met:
- meer dan 100 miljoen maandelijkse actieve gebruikers, of
- meer dan 20 miljoen USD maandelijkse omzet,
moet “Kimi K3” zichtbaar in de gebruikersinterface staan.[4]
Uitzonderingen
MaaS- en attributievoorwaarden gelden niet:
- voor uitsluitend intern gebruik zonder derden,
- voor officiële Moonshot AI-producten,
- voor gecertificeerde inferencepartners.[4]
Wat moet een bedrijf bepalen?
- intern of extern gebruik,
- klantcontrole over inference/fine-tuning,
- groepsomzet,
- MAU- en omzetgrenzen,
- attributieplicht,
- aparte overeenkomst.
Dit artikel is geen juridisch advies.
7. Wat is niet gepubliceerd?
Beschikbaar zijn:
- eindgewichten,
- een deel van de code,
- architectuurconfiguratie,
- inference- en processorcode,
- technische beschrijving,
- evaluatieresultaten.
Daaruit volgt niet dat de volledige dataset en alle informatie om training vanaf nul te reproduceren beschikbaar zijn.
Kimi K3 is veel opener dan een gesloten API, maar biedt geen volledige reproduceerbaarheid volgens OSI.[5][6]
8. API en prijzen
Model-ID:
kimi-k3
De officiële API is compatibel met OpenAI Chat Completions.
Prijzen
| Tokentype | Prijs per miljoen |
|---|---|
| Input met cache hit | 0,30 USD |
| Input met cache miss | 3,00 USD |
| Output | 15,00 USD |
Prijzen komen van Moonshot AI en kunnen belastingen uitsluiten.[1]
Moonshot AI meldt meer dan 90% cache hit bij codingworkloads. Dat is geen garantie voor iedere klant.[1]
Minimale storting
Toegang wordt geactiveerd na een storting van minimaal 1 USD. Tier en limieten hangen af van cumulatieve stortingen.[9]
9. Eerste Python-aanroep
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
max_completion_tokens=8_192,
messages=[
{
"role": "user",
"content": (
"Analyseer de projectarchitectuur en maak "
"een veilig migratieplan."
),
}
],
)
message = response.choices[0].message
print(message.content)
cURL
curl https://api.moonshot.ai/v1/chat/completions \
--header "Authorization: Bearer $MOONSHOT_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"reasoning_effort": "high",
"max_completion_tokens": 8192,
"messages": [
{
"role": "user",
"content": "Analyseer dit probleem en stel een oplossing voor."
}
]
}'
10. Reasoning is altijd actief
Kimi K3 gebruikt altijd reasoning. Er is geen parameter om dit volledig uit te schakelen.[9][10]
Niveaus:
low
high
max
Standaard:
max
Voor veel productievragen is low of high een betere eerste test.
reasoning_content
Een antwoord kan apart bevatten:
reasoning_content,- definitief
content.
Bij streaming komen beide als afzonderlijke chunks.[9][10]
Reasoning moet niet automatisch:
- aan gebruikers worden getoond,
- onbeperkt worden bewaard,
- naar logs met persoonsgegevens gaan,
- als betrouwbare audit worden beschouwd.
Preserved Thinking
Bij multi-turn en tool calling moet het volgende request bevatten:
reasoning_content,content,tool_calls.
Alleen content bewaren is onvoldoende.[10]
Historisch reasoning gebruikt context en wordt gefactureerd.
11. API-limieten en verschillen
Maximale output
standaard: 131.072 tokens
maximum: 1.048.576 tokens
Het technische maximum is niet automatisch goedkoop of snel.
Vaste parameters
temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0
De documentatie adviseert ze weg te laten.
Afbeeldingen en video
Publieke afbeeldings-URL’s worden niet ondersteund. Gebruik:
- base64,
ms://<file-id>.
De documentatie toont ook video via het Moonshot-bestandssysteem.[9]
Web search
De officiële webzoekfunctie wordt bijgewerkt en wordt momenteel niet aanbevolen voor productie.[9]
12. Context van één miljoen en cache
1.048.576 tokens
Nuttig voor:
- grote repositories,
- bedrijfsdocumentatie,
- veel bestanden,
- lange agentsessies,
- meerstaps onderzoek.
Automatische cache
Prefix caching werkt automatisch. Geen cache-ID of TTL nodig.
Een eerdere prompt moet meer dan 256 tokens bevatten om een cache hit te proberen.[9]
Houd de prefix stabiel, zet variabele vragen achteraan en meet echte hits.
Eén miljoen tokens garandeert geen perfect geheugen, volledige retrieval of prompt-injectionweerstand.
13. Tool calling en agents
Kimi K3 ondersteunt:
- custom tools,
tool_choice,- geforceerd toolgebruik,
- structured output met JSON Schema,
- Partial Mode,
- dynamische tooldefinities,
- Formula tools.[9]
Dynamische tools
Een definitie kan later aan de geschiedenis worden toegevoegd om promptlengte, fouten en permission surface te beperken.
De server bewaart de definitie niet namens de client. Het bericht moet in latere requests blijven.
Structured output
response_format = {
"type": "json_schema",
"json_schema": {
"name": "finding",
"strict": True,
"schema": {
"type": "object",
"properties": {
"severity": {
"type": "string",
"enum": ["low", "medium", "high", "critical"],
},
"summary": {"type": "string"},
},
"required": ["severity", "summary"],
"additionalProperties": False,
},
},
}
Parse message.content, niet reasoning_content.[9]
14. Kimi Code en programmeren
Moonshot AI positioneert K3 voor:
- lange codingtaken,
- grote repositories,
- terminalcoördinatie,
- refactoring,
- frontend vanaf screenshots,
- GPU-kernels, compilers, CAD en chipdesign.[1][2]
Kimi Code kan:
- bestanden lezen en wijzigen,
- shellcommando’s uitvoeren,
- bestanden zoeken,
- webpagina’s ophalen,
- stappen plannen,
- via TUI werken,
- integreren via Agent Client Protocol.[11]
Installatie
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /pad/naar/project
kimi
Daarna:
/model
en Kimi K3 selecteren.
Read-onlyacties kunnen automatisch; wijzigingen en commando’s vereisen in de standaardconfiguratie bevestiging.[11]
Sandboxing, least privilege, secretbescherming, review en geblokkeerde auto-deployment blijven nodig.
15. Benchmarks interpreteren
Geselecteerde officiële resultaten met max:
| Benchmark | Kimi K3 |
|---|---|
| GPQA Diamond | 93,5 |
| DeepSWE | 67,5 |
| ProgramBench | 77,8 |
| Terminal-Bench 2.1 | 88,3 |
| FrontierSWE | 81,2 |
| SWE-Marathon | 42,0 |
| BrowseComp | 91,2 |
| MCPMark-Verified | 94,5 |
| OSWorld-Verified | 84,8 |
| AutomationBench | 30,8 |
Een eenvoudige ranking is niet betrouwbaar omdat verschillen bestaan in:
- harnesses,
- reasoningniveaus,
- agentconfiguraties,
- bronnen,
- leaderboarddata,
- aantal runs,
- contextbeheer.
In Agents’ Last Exam gebruikte Kimi K3 Kimi Code, GPT gebruikte Codex en Claude gebruikte Claude Code.[2]
Moonshot AI zegt zelf dat de algemene prestaties van K3 nog achter Claude Fable 5 en GPT-5.6 Sol liggen.[1]
Een POC moet 50–200 eigen taken, identieke tools, meerdere runs en kosten per voltooide taak gebruiken.
16. Multimodaliteit
De model card bevestigt tekst en afbeelding; de API toont ook video.[2][9]
Toepassingen:
- screenshotanalyse,
- UI-correctie,
- grafieken,
- coding vanaf visuele referenties,
- schermopnames,
- motion design en videobewerking.
Leveranciersdemo’s zijn geen garantie. Test tekstherkenning, elementlokalisatie, frameconsistentie, kosten en privacy.
17. Beveiliging, privacy en governance
Voordelen van self-hosting
- data blijft in beheerde infrastructuur,
- externe telemetry kan uit,
- eigen filters en beleid,
- versiecontrole,
- netwerkbeperking,
- eigen securitytests.
Nieuwe verantwoordelijkheden
- cluster- en endpointbeveiliging,
- tenantisolatie,
- misbruikmonitoring,
- validatie van gegenereerde code,
- bescherming van gewichten,
- runtime-updates,
- kwetsbaarheden in vLLM/SGLang,
- log- en reasoninggovernance,
- limieten en circuit breakers.
De gebruikte bronnen bevatten geen onafhankelijke, volledige Kimi-K3-securityaudit. Gereguleerde omgevingen moeten prompt injection, data-exfiltratie, jailbreaks, schadelijke code, hallucinaties, kwaadaardige documenten en tool-escalatie testen.
18. Self-hosting of API?
| Criterium | Self-hosting | Officiële API |
|---|---|---|
| Startkosten | zeer hoog | laag |
| Infrastructuur | multi-acceleratorcluster | geen eigen cluster |
| Datacontrole | maximaal | volgens voorwaarden |
| Updates | eigen verantwoordelijkheid | beheerd |
| Fine-tuning | volledige controle | afhankelijk van aanbod |
| Schalen | eigen verantwoordelijkheid | beheerd |
| Cache | eigen implementatie | automatisch |
| Implementatietijd | lang | kort |
| Licentie | analyse vereist | uitzonderingen voor officiële producten |
| Klein team | meestal onrendabel | meestal beter |
API past bij POC, variabele belasting en snelle integratie. Self-hosting past bij strikte data-eisen, een bestaand cluster, hoge stabiele belasting en distributed-inferencekennis.
19. Is Kimi K3 de moeite waard?
Ja, wanneer:
- een zeer groot self-hostbaar model nodig is,
- infrastructuur bestaat,
- onderzoek naar 3T-modellen belangrijk is,
- een inferenceprovider wordt gebouwd,
- multimodaliteit en lange context nodig zijn,
- lange agentic codingtaken domineren,
- eigen fine-tunes en quantisaties gewenst zijn.
Niet noodzakelijk, wanneer:
- slechts één GPU-server beschikbaar is,
- eenvoudige verzoeken lage latency nodig hebben,
- een goedkoper API-model voldoende is,
- reasoning uitgeschakeld moet kunnen worden,
- Apache- of MIT-licentie vereist is,
- volledige trainingsreproduceerbaarheid vereist is,
- geen distributed-inferenceteam bestaat.
20. Conclusie
De publicatie van de volledige Kimi-K3-gewichten is belangrijk.
Het model biedt:
- 2,8 biljoen parameters,
- 104 miljard actief,
- native multimodaliteit,
- context van één miljoen,
- MoE met 896 experts,
- focus op coding en lange agenttaken.
Drie feiten moeten apart blijven:
- Kimi K3 was eerder aangekondigd.
- Op 27 juli werden gewichten en technische materialen gepubliceerd.
- Het is open-weight onder een eigen licentie, niet onbetwist Open Source AI volgens OSI.
Voor onderzoek en inferenceproviders is dit waardevol. Voor een gemiddeld bedrijf maken 1,56 TB en minimaal 64 accelerators het een infrastructuurproject.
Aanpak:
Eerst:
POC via de officiële API
Daarna:
kwaliteit, kosten, latency en risico meten
Pas vervolgens:
self-hosting, licentie en cluster analyseren
21. Checklist vóór deployment
Terminologie en licentie
- Open-weight wordt gebruikt.
- Licentie en copyright blijven behouden.
- Juridische afdeling heeft beoordeeld.
- MaaS-status is vastgesteld.
- 20M USD over 12 maanden gecontroleerd.
- 100M MAU gecontroleerd.
- 20M USD maandelijkse omzet gecontroleerd.
- UI-attributie vastgesteld.
- Intern gebruik gedocumenteerd.
Infrastructuur
- 1,56 TB bevestigd.
- Download van 96 shards gepland.
- Integriteit gecontroleerd.
- vLLM, SGLang of TokenSpeed gekozen.
- Genoeg acceleratormemory.
- Snelle interconnect.
- Expert parallelism gepland.
- KV cache berekend.
- GPU/netwerk/geheugenmonitoring.
- Runtime-updateproces.
API en agent
-
kimi-k3gebruikt. - Geschikte
reasoning_effort. - Reasoning wordt niet uitgezet.
- Volledige
reasoning_content-historie. - Redelijke
max_completion_tokens. - Vaste samplingparameters niet gestuurd.
- Afbeeldingen via base64 of
ms://. - Web search niet kritisch.
- Tool calls gevalideerd.
- JSON Schema gevalideerd.
Beveiliging
- Sandbox.
- Least privilege.
- Geen automatische productieaccess.
- Geen secrets in prompts/logs.
- Reasoning niet onnodig gelogd.
- Prompt injection getest.
- Kwaadaardige documenten getest.
- Kosten-, tijd- en toollimieten.
- Human approval voor destructieve acties.
- Code door tests en review.
Evaluatie
- Eigen taskset.
- Minimaal drie modellen.
- Identieke harness.
- Meerdere runs.
- Totale kosten per taak.
- Tijd tot correct resultaat.
- Code review en refactoring.
- Multimodaliteit.
- Long context.
- Hallucinaties en citaties.

