Moonshot AI publiceert de Kimi K3-gewichten: 2,8 biljoen parameters, licentie, eisen en benchmarks Skip to content

Blog

Praktische kennis over frontend, AI-tools en softwareontwikkeling.

Moonshot AI publiceert de Kimi K3-gewichten: 2,8 biljoen parameters, licentie, eisen en benchmarks

Gepubliceerd: 21 min lezen Geschreven door: AI Tools

Op 27 juli 2026 publiceerde Moonshot AI de volledige gewichten van <strong>Kimi K3</strong>, een coderepository, een eigen licentie en een technisch rapport. Dit was niet de lanceringsdag van het model zelf. Kimi K3 was eerder in juli aangekondigd en al beschikbaar via Kimi.com, Kimi Work, Kimi Code en de API. De verandering is dat de gewichten nu kunnen worden gedownload en zelfstandig ingezet.

Kimi K3 is een native multimodaal Mixture-of-Experts-model met:

  • 2,8 biljoen totale parameters,
  • 104 miljard parameters die per token worden geactiveerd,
  • 896 experts, waarvan er 16 worden geselecteerd,
  • een contextvenster van 1.048.576 tokens,
  • ondersteuning voor tekst, afbeeldingen en volgens de API-documentatie ook video,
  • een repository van ongeveer 1,56 TB.[2][3]

Moonshot AI noemt Kimi K3 open source. In de strikte betekenis van de Open Source Initiative is open-weight echter nauwkeuriger. De uiteindelijke parameters, code en documentatie zijn gepubliceerd, maar Kimi K3 gebruikt een eigen licentie met extra voorwaarden voor bepaalde commerciële toepassingen. Alleen toegang tot de gewichten biedt ook niet de volledige transparantie over trainingsproces en trainingsdata die de Open Source AI Definition vereist.[4][5][6]

Belangrijkste conclusie: Kimi K3 kan werkelijk worden gedownload, aangepast, gefinetuned en zelf gehost, maar een gemiddeld bedrijf zal het model niet op één GPU-server draaien. De publicatie creëert belangrijke onderzoeks- en infrastructuurmogelijkheden, terwijl schaal en licentie vóór productie zorgvuldig moeten worden beoordeeld.

Alle parameters, prijzen, licentievoorwaarden en beschikbaarheidsinformatie zijn gecontroleerd op 27 juli 2026.

TL;DR

Vraag Antwoord
Wat gebeurde er op 27 juli? Volledige gewichten, repository, licentie en technisch rapport werden gepubliceerd
Werd het model zelf die dag gelanceerd? Nee, model en API waren al beschikbaar
Is Kimi K3 open source? Moonshot gebruikt die term, maar open-weight onder een eigen licentie is nauwkeuriger
Hoeveel parameters? 2,8 biljoen totaal, 104 miljard actief
Welke architectuur? MoE, KDA, Gated MLA, AttnRes en Stable LatentMoE
Hoeveel experts? 896, waarvan 16 per token, plus 2 gedeelde experts
Hoe lang is de context? 1.048.576 tokens
Hoe groot zijn de bestanden? Ongeveer 1,56 TB
Hoeveel hoofdshards? 96 Safetensors-bestanden
Kan het lokaal draaien? Technisch ja, maar niet op een normale computer of één GPU
Wat adviseert de leverancier? Supernodes met minimaal 64 accelerators
Is commercieel gebruik toegestaan? Ja, onder de Kimi K3 License
Wat kost de officiële API? 0,30 USD/MTok cache hit, 3 USD/MTok cache miss, 15 USD/MTok output
Kan reasoning uit? Nee
Welke niveaus zijn er? low, high, max, standaard max
Zijn alle benchmarks onafhankelijk? Nee, een deel komt van Moonshot AI

1. Wat is precies gepubliceerd?

De officiële Hugging Face-repository moonshotai/Kimi-K3 bevat:

  • volledige gewichten,
  • modelconfiguratie,
  • laad- en verwerkingscode,
  • tokenizer en processorbestanden,
  • voorbeelden voor Transformers, vLLM en SGLang,
  • model card,
  • Kimi K3 License.[2]

De officiële GitHub-repository bevat daarnaast:

  • code en documentatie,
  • k3_tech_report.pdf,
  • deploymentinstructies,
  • beschrijving van architectuur en evaluatie.[3][7]

De repository is ongeveer 1,56 TB groot. De parameters zijn verdeeld over 96 Safetensors-bestanden, van:

model-00001-of-000096.safetensors

tot:

model-00096-of-000096.safetensors

De meeste shards zijn ongeveer 16,6–17 GB.[8]

Dit is geen toekomstige belofte: de bestanden zijn aanwezig en downloadbaar.

2. Open source of open-weight?

Moonshot AI gebruikt onder andere:

  • “open model”,
  • “open-source model”,
  • “Open Frontier Weights”.

De model card noemt Kimi K3 expliciet open-weight.[2]

Wat zijn open gewichten?

Gewichten zijn de uiteindelijke parameters die tijdens training zijn geleerd. Publicatie maakt het mogelijk om:

  • buiten de infrastructuur van de leverancier te draaien,
  • te finetunen,
  • quantisaties te maken,
  • gedrag te analyseren,
  • eigen inferentieservers te bouwen,
  • zonder officiële API te integreren.

Dit maakt het volledige ontwikkelproces niet automatisch reproduceerbaar.

Waarom onderscheidt OSI open weights van Open Source AI?

De Open Source Initiative stelt dat alleen de eindgewichten geen volledige toegang geven tot:

  • data of voldoende informatie over trainingsdata,
  • alle code voor datavoorbereiding,
  • de volledige trainingsconfiguratie,
  • onderdelen die nodig zijn om een wezenlijk gelijkwaardig systeem te reproduceren.[5][6]

De Open Source AI Definition vereist vrijheid om te:

  1. gebruiken,
  2. bestuderen,
  3. wijzigen,
  4. delen,

plus toegang tot de voorkeursvorm die nodig is om het systeem werkelijk aan te passen.[6]

Is de Kimi K3 License OSI-goedgekeurd?

De repository gebruikt een eigen Kimi K3 License, niet Apache-2.0, MIT of een andere standaard-OSI-licentie.

De licentie geeft brede rechten om te:

  • gebruiken,
  • kopiëren,
  • wijzigen,
  • publiceren,
  • distribueren,
  • sublicentiëren,
  • verkopen,
  • deployen,
  • finetunen,
  • afgeleide werken maken.[4]

Voor sommige commerciële organisaties gelden aanvullende voorwaarden. De veiligste formulering is daarom:

Kimi K3 is een open-weight-model onder de eigen Kimi K3 License.

Dat betekent niet dat het model “gesloten” is, maar de open-sourceclaim heeft juridische en technische nuances.

3. Belangrijkste parameters

Parameter Kimi K3
Architectuur Mixture-of-Experts
Totale parameters 2,8 biljoen
Geactiveerde parameters 104 miljard
Lagen 93
Dense lagen 1
Attention-lagen 69 KDA + 24 Gated MLA
Experts 896
Experts per token 16
Gedeelde experts 2
Woordenschat 160.000
Context 1.048.576 tokens
Beeldencoder MoonViT-V2
Vision-parameters 401 miljoen
Gewichten MXFP4
Activaties MXFP8
Modaliteiten model card tekst en afbeelding
Extra API-modaliteit video
Repositorygrootte ongeveer 1,56 TB
Safetensors-shards 96

De waarden komen uit de officiële model card.[2]

2,8 biljoen betekent niet 2,8 biljoen actief

Kimi K3 is MoE. Niet alle experts worden tegelijk gebruikt.

De router kiest 16 van 896 experts en de documentatie noemt 104 miljard geactiveerde parameters. Dit verhoogt de capaciteit zonder exact dezelfde compute als een dense 2,8T-model.

De hardwarekosten zijn nog steeds niet vergelijkbaar met een normaal 100B-model, omdat alle gewichten opgeslagen en verdeeld moeten worden.

4. KDA, AttnRes en Stable LatentMoE

Kimi Delta Attention

KDA is een hybride linear-attentionmechanisme voor lange sequenties.

Het model bevat:

  • 69 KDA-lagen,
  • 24 Gated MLA-lagen.[2]

Linear attention kan een deel van de kosten van full attention bij lange context verminderen, maar maakt één miljoen tokens niet goedkoop.

Attention Residuals

AttnRes verandert hoe representaties tussen lagen worden doorgegeven. Volgens Moonshot AI haalt het selectief informatie uit verschillende dieptes op.[1]

Stable LatentMoE

Stable LatentMoE schaalt naar 896 experts en activeert er 16. Moonshot AI claimt een ongeveer 2,5× betere algemene schaal-efficiëntie dan Kimi K2.[1][2]

Dit is een leveranciersclaim, geen garantie op 2,5× meer snelheid, lagere kosten of kwaliteit.

Native MXFP4

Kimi K3 is vanaf supervised fine-tuning quantisatiebewust getraind:

MXFP4 voor gewichten
MXFP8 voor activaties

Doel is minder geheugen en eenvoudiger deployment.[2] De repository blijft ongeveer 1,56 TB.

5. Kan Kimi K3 lokaal draaien?

Ja, wanneer “lokaal” eigen grootschalige infrastructuur betekent.

De volledige versie is niet bedoeld voor:

  • laptops,
  • workstations met consument-GPU’s,
  • één server met enkele GPU’s,
  • kleine homelabs.

Moonshot AI adviseert supernodes met minimaal 64 accelerators. Nodig zijn onder meer:

  • opslag van de gewichten,
  • KV cache,
  • miljoen-token-context,
  • communicatie tussen experts,
  • expert parallelism,
  • snelle interconnect,
  • prefix cache,
  • runtime-reserve.[1]

Werkelijk geheugen

De quantiseerde gewichten zijn al ongeveer 1,56 TB. Daarnaast is geheugen nodig voor:

  • frameworkoverhead,
  • caches,
  • activaties,
  • communicatiebuffers,
  • besturingssysteem,
  • concurrency.

1,56 TB delen door het geheugen van één kaart levert geen productieconfiguratie op.

Aanbevolen engines

De model card noemt:

  • vLLM,
  • SGLang,
  • TokenSpeed.[2]

Ook Transformers en Docker Model Runner worden getoond. Het commando:

vllm serve "moonshotai/Kimi-K3"

betekent niet dat het op iedere computer werkt.

Voor wie is self-hosting zinvol?

  • hyperscalers en inferenceproviders,
  • onderzoekslabs,
  • grote ondernemingen met een AI-cluster,
  • organisaties met zeer gevoelige data,
  • bedrijven die fine-tunes en quantisaties maken,
  • grootschalige inferentiediensten.

Voor de meeste teams is de officiële API goedkoper.

6. Wat staat de licentie toe?

De Kimi K3 License staat kosteloos toe:

  • gebruiken,
  • kopiëren,
  • wijzigen,
  • samenvoegen,
  • publiceren en distribueren,
  • sublicentiëren,
  • verkopen,
  • uitvoeren en deployen,
  • finetunen,
  • afgeleide oplossingen maken.[4]

Copyright en licentietekst moeten behouden blijven.

Model as a Service

De licentie definieert Model as a Service als inference of fine-tuning aan derden aanbieden met wezenlijke controle over inputs, parameters of trainingsdata.

Als een licentiehouder of gelieerde ondernemingen:

  1. een Model as a Service-bedrijf voeren,
  2. samen meer dan 20 miljoen USD omzet behalen in een aaneengesloten periode van 12 maanden,

is vóór commercieel gebruik een aparte overeenkomst met Moonshot AI nodig.[4]

De grens gaat over totale groepsomzet, niet alleen Kimi-K3-omzet.

Naam Kimi K3 tonen

Bij een commercieel product of dienst met:

  • meer dan 100 miljoen maandelijkse actieve gebruikers, of
  • meer dan 20 miljoen USD maandelijkse omzet,

moet “Kimi K3” zichtbaar in de gebruikersinterface staan.[4]

Uitzonderingen

MaaS- en attributievoorwaarden gelden niet:

  • voor uitsluitend intern gebruik zonder derden,
  • voor officiële Moonshot AI-producten,
  • voor gecertificeerde inferencepartners.[4]

Wat moet een bedrijf bepalen?

  • intern of extern gebruik,
  • klantcontrole over inference/fine-tuning,
  • groepsomzet,
  • MAU- en omzetgrenzen,
  • attributieplicht,
  • aparte overeenkomst.

Dit artikel is geen juridisch advies.

7. Wat is niet gepubliceerd?

Beschikbaar zijn:

  • eindgewichten,
  • een deel van de code,
  • architectuurconfiguratie,
  • inference- en processorcode,
  • technische beschrijving,
  • evaluatieresultaten.

Daaruit volgt niet dat de volledige dataset en alle informatie om training vanaf nul te reproduceren beschikbaar zijn.

Kimi K3 is veel opener dan een gesloten API, maar biedt geen volledige reproduceerbaarheid volgens OSI.[5][6]

8. API en prijzen

Model-ID:

kimi-k3

De officiële API is compatibel met OpenAI Chat Completions.

Prijzen

Tokentype Prijs per miljoen
Input met cache hit 0,30 USD
Input met cache miss 3,00 USD
Output 15,00 USD

Prijzen komen van Moonshot AI en kunnen belastingen uitsluiten.[1]

Moonshot AI meldt meer dan 90% cache hit bij codingworkloads. Dat is geen garantie voor iedere klant.[1]

Minimale storting

Toegang wordt geactiveerd na een storting van minimaal 1 USD. Tier en limieten hangen af van cumulatieve stortingen.[9]

9. Eerste Python-aanroep

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="high",
    max_completion_tokens=8_192,
    messages=[
        {
            "role": "user",
            "content": (
                "Analyseer de projectarchitectuur en maak "
                "een veilig migratieplan."
            ),
        }
    ],
)

message = response.choices[0].message
print(message.content)

cURL

curl https://api.moonshot.ai/v1/chat/completions \
  --header "Authorization: Bearer $MOONSHOT_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "kimi-k3",
    "reasoning_effort": "high",
    "max_completion_tokens": 8192,
    "messages": [
      {
        "role": "user",
        "content": "Analyseer dit probleem en stel een oplossing voor."
      }
    ]
  }'

10. Reasoning is altijd actief

Kimi K3 gebruikt altijd reasoning. Er is geen parameter om dit volledig uit te schakelen.[9][10]

Niveaus:

low
high
max

Standaard:

max

Voor veel productievragen is low of high een betere eerste test.

reasoning_content

Een antwoord kan apart bevatten:

  • reasoning_content,
  • definitief content.

Bij streaming komen beide als afzonderlijke chunks.[9][10]

Reasoning moet niet automatisch:

  • aan gebruikers worden getoond,
  • onbeperkt worden bewaard,
  • naar logs met persoonsgegevens gaan,
  • als betrouwbare audit worden beschouwd.

Preserved Thinking

Bij multi-turn en tool calling moet het volgende request bevatten:

  • reasoning_content,
  • content,
  • tool_calls.

Alleen content bewaren is onvoldoende.[10]

Historisch reasoning gebruikt context en wordt gefactureerd.

11. API-limieten en verschillen

Maximale output

standaard: 131.072 tokens
maximum: 1.048.576 tokens

Het technische maximum is niet automatisch goedkoop of snel.

Vaste parameters

temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0

De documentatie adviseert ze weg te laten.

Afbeeldingen en video

Publieke afbeeldings-URL’s worden niet ondersteund. Gebruik:

  • base64,
  • ms://<file-id>.

De documentatie toont ook video via het Moonshot-bestandssysteem.[9]

Web search

De officiële webzoekfunctie wordt bijgewerkt en wordt momenteel niet aanbevolen voor productie.[9]

12. Context van één miljoen en cache

1.048.576 tokens

Nuttig voor:

  • grote repositories,
  • bedrijfsdocumentatie,
  • veel bestanden,
  • lange agentsessies,
  • meerstaps onderzoek.

Automatische cache

Prefix caching werkt automatisch. Geen cache-ID of TTL nodig.

Een eerdere prompt moet meer dan 256 tokens bevatten om een cache hit te proberen.[9]

Houd de prefix stabiel, zet variabele vragen achteraan en meet echte hits.

Eén miljoen tokens garandeert geen perfect geheugen, volledige retrieval of prompt-injectionweerstand.

13. Tool calling en agents

Kimi K3 ondersteunt:

  • custom tools,
  • tool_choice,
  • geforceerd toolgebruik,
  • structured output met JSON Schema,
  • Partial Mode,
  • dynamische tooldefinities,
  • Formula tools.[9]

Dynamische tools

Een definitie kan later aan de geschiedenis worden toegevoegd om promptlengte, fouten en permission surface te beperken.

De server bewaart de definitie niet namens de client. Het bericht moet in latere requests blijven.

Structured output

response_format = {
    "type": "json_schema",
    "json_schema": {
        "name": "finding",
        "strict": True,
        "schema": {
            "type": "object",
            "properties": {
                "severity": {
                    "type": "string",
                    "enum": ["low", "medium", "high", "critical"],
                },
                "summary": {"type": "string"},
            },
            "required": ["severity", "summary"],
            "additionalProperties": False,
        },
    },
}

Parse message.content, niet reasoning_content.[9]

14. Kimi Code en programmeren

Moonshot AI positioneert K3 voor:

  • lange codingtaken,
  • grote repositories,
  • terminalcoördinatie,
  • refactoring,
  • frontend vanaf screenshots,
  • GPU-kernels, compilers, CAD en chipdesign.[1][2]

Kimi Code kan:

  • bestanden lezen en wijzigen,
  • shellcommando’s uitvoeren,
  • bestanden zoeken,
  • webpagina’s ophalen,
  • stappen plannen,
  • via TUI werken,
  • integreren via Agent Client Protocol.[11]

Installatie

curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /pad/naar/project
kimi

Daarna:

/model

en Kimi K3 selecteren.

Read-onlyacties kunnen automatisch; wijzigingen en commando’s vereisen in de standaardconfiguratie bevestiging.[11]

Sandboxing, least privilege, secretbescherming, review en geblokkeerde auto-deployment blijven nodig.

15. Benchmarks interpreteren

Geselecteerde officiële resultaten met max:

Benchmark Kimi K3
GPQA Diamond 93,5
DeepSWE 67,5
ProgramBench 77,8
Terminal-Bench 2.1 88,3
FrontierSWE 81,2
SWE-Marathon 42,0
BrowseComp 91,2
MCPMark-Verified 94,5
OSWorld-Verified 84,8
AutomationBench 30,8

Een eenvoudige ranking is niet betrouwbaar omdat verschillen bestaan in:

  • harnesses,
  • reasoningniveaus,
  • agentconfiguraties,
  • bronnen,
  • leaderboarddata,
  • aantal runs,
  • contextbeheer.

In Agents’ Last Exam gebruikte Kimi K3 Kimi Code, GPT gebruikte Codex en Claude gebruikte Claude Code.[2]

Moonshot AI zegt zelf dat de algemene prestaties van K3 nog achter Claude Fable 5 en GPT-5.6 Sol liggen.[1]

Een POC moet 50–200 eigen taken, identieke tools, meerdere runs en kosten per voltooide taak gebruiken.

16. Multimodaliteit

De model card bevestigt tekst en afbeelding; de API toont ook video.[2][9]

Toepassingen:

  • screenshotanalyse,
  • UI-correctie,
  • grafieken,
  • coding vanaf visuele referenties,
  • schermopnames,
  • motion design en videobewerking.

Leveranciersdemo’s zijn geen garantie. Test tekstherkenning, elementlokalisatie, frameconsistentie, kosten en privacy.

17. Beveiliging, privacy en governance

Voordelen van self-hosting

  • data blijft in beheerde infrastructuur,
  • externe telemetry kan uit,
  • eigen filters en beleid,
  • versiecontrole,
  • netwerkbeperking,
  • eigen securitytests.

Nieuwe verantwoordelijkheden

  • cluster- en endpointbeveiliging,
  • tenantisolatie,
  • misbruikmonitoring,
  • validatie van gegenereerde code,
  • bescherming van gewichten,
  • runtime-updates,
  • kwetsbaarheden in vLLM/SGLang,
  • log- en reasoninggovernance,
  • limieten en circuit breakers.

De gebruikte bronnen bevatten geen onafhankelijke, volledige Kimi-K3-securityaudit. Gereguleerde omgevingen moeten prompt injection, data-exfiltratie, jailbreaks, schadelijke code, hallucinaties, kwaadaardige documenten en tool-escalatie testen.

18. Self-hosting of API?

Criterium Self-hosting Officiële API
Startkosten zeer hoog laag
Infrastructuur multi-acceleratorcluster geen eigen cluster
Datacontrole maximaal volgens voorwaarden
Updates eigen verantwoordelijkheid beheerd
Fine-tuning volledige controle afhankelijk van aanbod
Schalen eigen verantwoordelijkheid beheerd
Cache eigen implementatie automatisch
Implementatietijd lang kort
Licentie analyse vereist uitzonderingen voor officiële producten
Klein team meestal onrendabel meestal beter

API past bij POC, variabele belasting en snelle integratie. Self-hosting past bij strikte data-eisen, een bestaand cluster, hoge stabiele belasting en distributed-inferencekennis.

19. Is Kimi K3 de moeite waard?

Ja, wanneer:

  • een zeer groot self-hostbaar model nodig is,
  • infrastructuur bestaat,
  • onderzoek naar 3T-modellen belangrijk is,
  • een inferenceprovider wordt gebouwd,
  • multimodaliteit en lange context nodig zijn,
  • lange agentic codingtaken domineren,
  • eigen fine-tunes en quantisaties gewenst zijn.

Niet noodzakelijk, wanneer:

  • slechts één GPU-server beschikbaar is,
  • eenvoudige verzoeken lage latency nodig hebben,
  • een goedkoper API-model voldoende is,
  • reasoning uitgeschakeld moet kunnen worden,
  • Apache- of MIT-licentie vereist is,
  • volledige trainingsreproduceerbaarheid vereist is,
  • geen distributed-inferenceteam bestaat.

20. Conclusie

De publicatie van de volledige Kimi-K3-gewichten is belangrijk.

Het model biedt:

  • 2,8 biljoen parameters,
  • 104 miljard actief,
  • native multimodaliteit,
  • context van één miljoen,
  • MoE met 896 experts,
  • focus op coding en lange agenttaken.

Drie feiten moeten apart blijven:

  1. Kimi K3 was eerder aangekondigd.
  2. Op 27 juli werden gewichten en technische materialen gepubliceerd.
  3. Het is open-weight onder een eigen licentie, niet onbetwist Open Source AI volgens OSI.

Voor onderzoek en inferenceproviders is dit waardevol. Voor een gemiddeld bedrijf maken 1,56 TB en minimaal 64 accelerators het een infrastructuurproject.

Aanpak:

Eerst:
POC via de officiële API

Daarna:
kwaliteit, kosten, latency en risico meten

Pas vervolgens:
self-hosting, licentie en cluster analyseren

21. Checklist vóór deployment

Terminologie en licentie

  • Open-weight wordt gebruikt.
  • Licentie en copyright blijven behouden.
  • Juridische afdeling heeft beoordeeld.
  • MaaS-status is vastgesteld.
  • 20M USD over 12 maanden gecontroleerd.
  • 100M MAU gecontroleerd.
  • 20M USD maandelijkse omzet gecontroleerd.
  • UI-attributie vastgesteld.
  • Intern gebruik gedocumenteerd.

Infrastructuur

  • 1,56 TB bevestigd.
  • Download van 96 shards gepland.
  • Integriteit gecontroleerd.
  • vLLM, SGLang of TokenSpeed gekozen.
  • Genoeg acceleratormemory.
  • Snelle interconnect.
  • Expert parallelism gepland.
  • KV cache berekend.
  • GPU/netwerk/geheugenmonitoring.
  • Runtime-updateproces.

API en agent

  • kimi-k3 gebruikt.
  • Geschikte reasoning_effort.
  • Reasoning wordt niet uitgezet.
  • Volledige reasoning_content-historie.
  • Redelijke max_completion_tokens.
  • Vaste samplingparameters niet gestuurd.
  • Afbeeldingen via base64 of ms://.
  • Web search niet kritisch.
  • Tool calls gevalideerd.
  • JSON Schema gevalideerd.

Beveiliging

  • Sandbox.
  • Least privilege.
  • Geen automatische productieaccess.
  • Geen secrets in prompts/logs.
  • Reasoning niet onnodig gelogd.
  • Prompt injection getest.
  • Kwaadaardige documenten getest.
  • Kosten-, tijd- en toollimieten.
  • Human approval voor destructieve acties.
  • Code door tests en review.

Evaluatie

  • Eigen taskset.
  • Minimaal drie modellen.
  • Identieke harness.
  • Meerdere runs.
  • Totale kosten per taak.
  • Tijd tot correct resultaat.
  • Code review en refactoring.
  • Multimodaliteit.
  • Long context.
  • Hallucinaties en citaties.

22. Gerelateerde POLPROG-inhoud

Vergelijkingen van vóór 27 juli konden terecht melden dat de volledige gewichten niet beschikbaar waren. Dat is veranderd.

AI Moonshot AI Kimi K3 Open Weights LLM

Veelgestelde vragen

Werd Kimi K3 vandaag uitgebracht?

Niet volledig. Model en API bestonden al. Gewichten, code, licentie en rapport zijn op 27 juli gepubliceerd.

Is het open source?

Moonshot gebruikt de term. Open-weight onder de Kimi K3 License is nauwkeuriger. Het voldoet niet onbetwist aan alle OSI-criteria.

Zijn de gewichten echt downloadbaar?

Ja. De repository is ongeveer 1,56 TB en bevat 96 Safetensors-shards.

Hoeveel parameters?

2,8 biljoen totaal en 104 miljard actief.

Werkt het op één GPU?

Niet in de officiële volledige versie. Minimaal 64 accelerators worden aanbevolen.

Is commercieel gebruik toegestaan?

Ja, onder de licentie. Sommige grote MaaS-aanbieders hebben een aparte overeenkomst nodig en grote producten kunnen attributie moeten tonen.

Moet Kimi K3 in elk product zichtbaar zijn?

Nee. Alleen boven 100 miljoen MAU of 20 miljoen USD maandelijkse omzet, met uitzonderingen.

Wat kost de API?

0,30 USD per miljoen inputtokens met cache hit, 3 USD met cache miss en 15 USD per miljoen outputtokens.

Kan reasoning uit?

Nee. `low`, `high` en `max` veranderen alleen de inspanning.

Ondersteunt het afbeeldingen en video?

Ja. De model card bevestigt afbeeldingen en de API-documentatie video.

Garandeert één miljoen tokens foutloos lezen van een repository?

Nee. Het is capaciteit, geen garantie op perfecte retrieval.

Is het beter dan Claude Fable 5 of GPT-5.6 Sol?

Niet overal. Moonshot AI zegt zelf dat de algemene prestaties nog achterlopen.

Moet een bedrijf meteen een cluster bouwen?

Meestal niet. Begin met een API-POC.

---

Bronnen en voetnoten

  1. Moonshot AI, Kimi K3: Open Frontier Intelligence1234567
  2. Moonshot AI, Kimi K3 Model Card op Hugging Face1234567891011
  3. MoonshotAI, officiële Kimi-K3-repository12
  4. Moonshot AI, Kimi K3 License123456
  5. Open Source Initiative, Open Weights: not quite what you’ve been told123
  6. Open Source Initiative, Open Source AI Definition 1.01234
  7. MoonshotAI, Kimi K3 Technical Report
  8. Moonshot AI, Kimi-K3-bestanden op Hugging Face
  9. Kimi API Platform, Kimi K3 Quickstart123456789
  10. Kimi API Platform, Thinking Models123
  11. MoonshotAI, Kimi Code CLI12

Was dit nuttig?

Ontvang nieuwe artikelen per e-mail

Eén korte e-mail per nieuw blogartikel. Geen spam, uitschrijven in één klik.

We gebruiken je e-mail alleen om nieuwe artikelen te sturen. Geen delen met derden.

Terug naar de blog