Moonshot AI zveřejňuje váhy Kimi K3: 2,8 bilionu parametrů, licence, požadavky a benchmarky Skip to content

Znalostní báze

Praktické znalosti o frontendu, nástrojích AI a vývoji softwaru.

Moonshot AI zveřejňuje váhy Kimi K3: 2,8 bilionu parametrů, licence, požadavky a benchmarky

Publikováno: 21 min čtení Autor: AI Tools

Dne 27. července 2026 Moonshot AI zveřejnil kompletní váhy modelu <strong>Kimi K3</strong>, repozitář s kódem, vlastní licenci a technickou zprávu. Nešlo o den uvedení samotného modelu. Kimi K3 byl představen dříve v červenci a už byl dostupný přes Kimi.com, Kimi Work, Kimi Code a API. Novinkou je možnost váhy stáhnout a samostatně nasadit.

Kimi K3 je nativně multimodální model typu Mixture-of-Experts s:

  • 2,8 bilionu celkových parametrů,
  • 104 miliardami parametrů aktivovaných při generování tokenu,
  • 896 experty, z nichž se vybírá 16,
  • kontextem o délce 1 048 576 tokenů,
  • podporou textu, obrazu a podle dokumentace API také videa,
  • velikostí repozitáře přibližně 1,56 TB.[2][3]

Moonshot AI označuje Kimi K3 jako open-source model. V přísném významu Open Source Initiative je však přesnější výraz open-weight. Byly publikovány konečné parametry, kód a dokumentace, ale Kimi K3 používá vlastní licenci s dodatečnými podmínkami pro některá komerční použití. Samotná dostupnost vah také nezajišťuje úplnou transparentnost tréninkového procesu a dat požadovanou Open Source AI Definition.[4][5][6]

Hlavní závěr: Kimi K3 lze skutečně stáhnout, upravovat, fine-tunovat a hostovat ve vlastní infrastruktuře, ale běžná firma jej nespustí na jednom GPU serveru. Publikace vah otevírá významné možnosti pro výzkum a infrastrukturu, zatímco rozsah modelu a licence vyžadují důkladnou analýzu před produkčním nasazením.

Všechny parametry, ceny, licenční podmínky a informace o dostupnosti byly ověřeny 27. července 2026.

TL;DR

Otázka Odpověď
Co se stalo 27. července? Byly zveřejněny kompletní váhy, repozitář, licence a technická zpráva
Byl v ten den uveden samotný model? Ne, model a API byly dostupné dříve
Je Kimi K3 open source? Moonshot tento termín používá, ale přesnější je open-weight pod vlastní licencí
Kolik má parametrů? 2,8 bilionu celkem, 104 miliard aktivních
Jaká je architektura? MoE, KDA, Gated MLA, AttnRes a Stable LatentMoE
Kolik má expertů? 896, z nichž 16 se vybírá na token, plus 2 sdílení experti
Jak dlouhý je kontext? 1 048 576 tokenů
Jak velké jsou soubory? Přibližně 1,56 TB
Kolik je hlavních shardů? 96 souborů Safetensors
Lze jej spustit lokálně? Technicky ano, ale ne na běžném počítači nebo jednom GPU
Co doporučuje výrobce? Supernode konfigurace s nejméně 64 akcelerátory
Je povoleno komerční použití? Ano, podle Kimi K3 License
Kolik stojí oficiální API? 0,30 USD/MTok cache hit, 3 USD/MTok cache miss, 15 USD/MTok output
Lze vypnout reasoning? Ne
Jaké úrovně jsou dostupné? low, high, max, výchozí max
Jsou benchmarky nezávislé? Ne všechny, část pochází od Moonshot AI

1. Co přesně bylo zveřejněno?

Oficiální repozitář moonshotai/Kimi-K3 na Hugging Face obsahuje:

  • kompletní váhy,
  • konfiguraci modelu,
  • kód pro načítání a zpracování vstupů,
  • tokenizer a soubory procesoru,
  • příklady pro Transformers, vLLM a SGLang,
  • model card,
  • Kimi K3 License.[2]

Oficiální GitHub repozitář navíc obsahuje:

  • kód a dokumentaci projektu,
  • technickou zprávu k3_tech_report.pdf,
  • instrukce k nasazení,
  • popis architektury a evaluace.[3][7]

Repozitář vah má přibližně 1,56 TB. Hlavní parametry jsou rozděleny do 96 souborů Safetensors, od:

model-00001-of-000096.safetensors

do:

model-00096-of-000096.safetensors

Většina shardů má přibližně 16,6–17 GB.[8]

Nejde o budoucí slib. Soubory už jsou dostupné ke stažení.

2. Open source, nebo open-weight?

Moonshot AI používá označení:

  • „open model“,
  • „open-source model“,
  • „Open Frontier Weights“.

Model card na Hugging Face označuje Kimi K3 výslovně jako open-weight.[2]

Co jsou otevřené váhy?

Váhy jsou konečné parametry naučené při tréninku. Jejich zveřejnění umožňuje:

  • provoz mimo infrastrukturu výrobce,
  • fine-tuning,
  • tvorbu kvantizací,
  • analýzu chování,
  • vlastní inference servery,
  • integraci bez posílání promptů do oficiálního API.

Neumožňuje automaticky reprodukovat celý proces vývoje.

Proč OSI rozlišuje open weights a Open Source AI?

Open Source Initiative uvádí, že samotné konečné váhy neposkytují úplný přístup k:

  • datům nebo dostatečným informacím o tréninkových datech,
  • veškerému kódu pro přípravu dat,
  • plné konfiguraci tréninku,
  • částem potřebným k reprodukci podstatně rovnocenného systému.[5][6]

Open Source AI Definition vyžaduje svobodu:

  1. používat,
  2. studovat,
  3. upravovat,
  4. sdílet,

a přístup k preferované formě nutné pro skutečnou modifikaci systému.[6]

Je Kimi K3 License schválená OSI?

Repozitář používá vlastní Kimi K3 License, nikoli Apache-2.0, MIT ani jinou standardní OSI licenci.

Licence uděluje široká práva:

  • používat,
  • kopírovat,
  • upravovat,
  • publikovat,
  • distribuovat,
  • sublicencovat,
  • prodávat,
  • nasazovat,
  • fine-tunovat,
  • vytvářet odvozená díla.[4]

Zároveň obsahuje dodatečné podmínky pro některé komerční subjekty. Nejbezpečnější formulace proto zní:

Kimi K3 je open-weight model vydaný pod vlastní Kimi K3 License.

Model není „uzavřený“, ale termín open source zde vyžaduje právní a technické upřesnění.

3. Hlavní parametry Kimi K3

Parametr Kimi K3
Architektura Mixture-of-Experts
Celkové parametry 2,8 bilionu
Aktivované parametry 104 miliard
Počet vrstev 93
Dense vrstvy 1
Attention vrstvy 69 KDA + 24 Gated MLA
Experti 896
Experti na token 16
Sdílení experti 2
Slovník 160 000
Kontext 1 048 576 tokenů
Obrazový enkodér MoonViT-V2
Parametry vision enkodéru 401 milionů
Váhy MXFP4
Aktivace MXFP8
Modality v model card text a obraz
Další modalita v API video
Velikost repozitáře přibližně 1,56 TB
Safetensors shardy 96

Data pocházejí z oficiální model card.[2]

2,8 bilionu neznamená 2,8 bilionu aktivních parametrů

Kimi K3 je MoE model. Při generování tokenu nepoužívá všechny experty.

Router vybírá 16 z 896 expertů a dokumentace uvádí 104 miliard aktivovaných parametrů. To zvyšuje kapacitu bez stejného výpočetního nákladu jako dense model s 2,8T.

Hardware však stále není srovnatelný s běžným 100B modelem, protože všechny váhy musí být uloženy a rozděleny mezi akcelerátory.

4. KDA, AttnRes a Stable LatentMoE

Kimi Delta Attention

KDA je hybridní linear-attention mechanismus pro dlouhé sekvence.

Model obsahuje:

  • 69 KDA vrstev,
  • 24 Gated MLA vrstev.[2]

Linear attention může snížit část nákladů full attention u dlouhého kontextu, ale milion tokenů tím není levný.

Attention Residuals

AttnRes mění předávání reprezentací mezi vrstvami. Podle Moonshot AI selektivně získává informace z různých hloubek.[1]

Stable LatentMoE

Stable LatentMoE umožňuje škálování na 896 expertů a aktivaci 16. Moonshot AI uvádí přibližně 2,5násobné zlepšení celkové efektivity škálování oproti Kimi K2.[1][2]

Jde o tvrzení výrobce, ne záruku 2,5násobné rychlosti, nižší ceny nebo kvality.

Nativní MXFP4

Kimi K3 byl od supervised fine-tuning trénován s ohledem na kvantizaci:

MXFP4 pro váhy
MXFP8 pro aktivace

Cílem je snížit paměťové nároky a usnadnit deployment.[2] Repozitář má stále přibližně 1,56 TB.

5. Lze Kimi K3 spustit lokálně?

Ano, pokud „lokálně“ znamená velkou vlastní infrastrukturu.

Plná verze není určená pro:

  • notebook,
  • workstation s běžnou GPU,
  • jeden server s několika GPU,
  • malý homelab.

Moonshot AI doporučuje supernode s nejméně 64 akcelerátory. Potřeba je zohlednit:

  • váhy,
  • KV cache,
  • milionový kontext,
  • komunikaci mezi experty,
  • expert parallelism,
  • rychlé propojení zařízení,
  • prefix cache,
  • rezervu runtime.[1]

Reálná paměť

Kvantizované váhy zabírají přibližně 1,56 TB. Navíc je potřeba paměť pro:

  • overhead frameworku,
  • cache,
  • aktivace,
  • komunikační buffery,
  • operační systém,
  • souběh požadavků.

Dělení 1,56 TB pamětí jedné karty neposkytne produkční konfiguraci.

Doporučené enginy

Model card uvádí:

  • vLLM,
  • SGLang,
  • TokenSpeed.[2]

Jsou dostupné také příklady Transformers a Docker Model Runner. Příkaz:

vllm serve "moonshotai/Kimi-K3"

neznamená, že model poběží na libovolném stroji.

Pro koho má self-hosting smysl?

  • hyperscaleři a inference provideři,
  • výzkumné laboratoře,
  • velké podniky s AI clustery,
  • organizace s velmi citlivými daty,
  • firmy vytvářející fine-tunes a kvantizace,
  • poskytovatelé inference ve velkém měřítku.

Pro většinu týmů je výhodnější oficiální API.

6. Co licence dovoluje?

Kimi K3 License bezplatně dovoluje:

  • používat,
  • kopírovat,
  • upravovat,
  • slučovat,
  • publikovat a distribuovat,
  • sublicencovat,
  • prodávat kopie,
  • provozovat a nasazovat,
  • fine-tunovat,
  • vytvářet odvozená řešení.[4]

Je nutné zachovat copyright a text licence.

Podmínka Model as a Service

Licence definuje Model as a Service jako poskytování inference nebo fine-tuningu třetí straně s významnou kontrolou nad vstupy, parametry nebo tréninkovými daty.

Pokud držitel licence nebo přidružené subjekty:

  1. provozují Model as a Service,
  2. dosahují společně více než 20 milionů USD příjmů v libovolném souvislém období 12 měsíců,

musí před komerčním použitím uzavřít samostatnou smlouvu s Moonshot AI.[4]

Práh se týká celkových příjmů držitele licence a přidružených subjektů, nikoli jen Kimi K3.

Povinnost zobrazit jméno Kimi K3

Pokud se model nebo odvozené řešení používá v komerčním produktu či službě s:

  • více než 100 miliony měsíčně aktivních uživatelů, nebo
  • více než 20 miliony USD měsíčních příjmů,

musí být název „Kimi K3“ viditelně zobrazen v uživatelském rozhraní.[4]

Výjimky

Podmínky MaaS a atribuce neplatí:

  • pro čistě interní využití bez zpřístupnění třetím stranám,
  • pro oficiální produkty Moonshot AI,
  • pro certifikované inference partnery.[4]

Co musí firma prověřit?

  • interní nebo externí využití,
  • míru kontroly zákazníka,
  • příjmy skupiny,
  • MAU a příjmové prahy,
  • povinnost atribuce,
  • potřebu samostatné smlouvy.

Tento článek není právní poradenství.

7. Co zveřejněno nebylo?

Oficiální materiály obsahují:

  • konečné váhy,
  • část kódu,
  • konfiguraci architektury,
  • inference a processor kód,
  • technický popis,
  • výsledky evaluace.

Nevyplývá z nich zveřejnění kompletního datasetu ani všech detailů nutných pro reprodukci tréninku od nuly.

Kimi K3 je mnohem otevřenější než uzavřené API, ale neposkytuje úplnou reprodukovatelnost podle OSI.[5][6]

8. API a ceny

Identifikátor:

kimi-k3

Oficiální API je kompatibilní s OpenAI Chat Completions.

Ceník

Typ tokenu Cena za milion
Input při cache hit 0,30 USD
Input při cache miss 3,00 USD
Output 15,00 USD

Ceny pocházejí od Moonshot AI a mohou být bez daní.[1]

Moonshot AI uvádí více než 90% cache hit u coding workloadů. Nejde o záruku pro každého klienta.[1]

Minimální dobití

Přístup k API se odemkne po dobití alespoň 1 USD. Tier a limity závisí na kumulativních platbách.[9]

9. První volání v Pythonu

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="high",
    max_completion_tokens=8_192,
    messages=[
        {
            "role": "user",
            "content": (
                "Analyzuj architekturu projektu a připrav "
                "bezpečný plán migrace."
            ),
        }
    ],
)

message = response.choices[0].message
print(message.content)

cURL

curl https://api.moonshot.ai/v1/chat/completions \
  --header "Authorization: Bearer $MOONSHOT_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "kimi-k3",
    "reasoning_effort": "high",
    "max_completion_tokens": 8192,
    "messages": [
      {
        "role": "user",
        "content": "Analyzuj tento problém a navrhni řešení."
      }
    ]
  }'

10. Reasoning je vždy zapnutý

Kimi K3 vždy používá reasoning. Není možné jej úplně vypnout.[9][10]

Úrovně:

low
high
max

Výchozí:

max

Pro běžný produkční provoz je vhodné začít s low nebo high.

reasoning_content

Odpověď může obsahovat samostatně:

  • reasoning_content,
  • konečný content.

Při streamingu přicházejí odděleně.[9][10]

Reasoning by se neměl automaticky:

  • zobrazovat uživateli,
  • neomezeně ukládat,
  • posílat do logů s osobními daty,
  • považovat za spolehlivý audit.

Preserved Thinking

V multi-turn konverzacích a tool callingu musí další request obsahovat:

  • reasoning_content,
  • content,
  • tool_calls.

Pouze konečný content nestačí.[10]

Historický reasoning spotřebovává kontext a je účtován.

11. Limity a odlišnosti API

Maximální output

výchozí: 131 072 tokenů
maximum: 1 048 576 tokenů

Technické maximum není automaticky levné nebo rychlé.

Pevné parametry

temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0

Dokumentace doporučuje je neposílat.

Obrázky a video

Veřejné URL obrázků nejsou podporovány. Použijte:

  • base64,
  • ms://<file-id>.

Dokumentace ukazuje také video přes souborový systém Moonshot.[9]

Web search

Oficiální web search se aktualizuje a dokumentace jej nyní nedoporučuje pro produkční workflow.[9]

12. Milionový kontext a cache

1 048 576 tokenů

Vhodné pro:

  • velké repozitáře,
  • podnikovou dokumentaci,
  • mnoho souborů,
  • dlouhé agentní relace,
  • vícestupňový výzkum.

Automatická cache

Prefix cache funguje automaticky. Není potřeba ID ani TTL.

Předchozí prompt musí překročit 256 tokenů, aby se pokusil cache hit.[9]

Udržujte stabilní prefix, proměnnou otázku dejte na konec a měřte skutečné cache hits.

Milion tokenů nezaručuje perfektní paměť, úplný retrieval ani odolnost proti prompt injection.

13. Tool calling a agenti

Kimi K3 podporuje:

  • custom tools,
  • tool_choice,
  • vynucené použití,
  • structured output s JSON Schema,
  • Partial Mode,
  • dynamické definice,
  • Formula tools.[9]

Dynamické nástroje

Definici lze přidat později do historie a snížit tak délku, chyby i rozsah oprávnění.

Server definici za klienta neuchovává. Zpráva musí zůstat v další historii.

Structured output

response_format = {
    "type": "json_schema",
    "json_schema": {
        "name": "finding",
        "strict": True,
        "schema": {
            "type": "object",
            "properties": {
                "severity": {
                    "type": "string",
                    "enum": ["low", "medium", "high", "critical"],
                },
                "summary": {"type": "string"},
            },
            "required": ["severity", "summary"],
            "additionalProperties": False,
        },
    },
}

Parsujte message.content, nikoli reasoning_content.[9]

14. Kimi Code a programování

Moonshot AI cílí K3 na:

  • dlouhé coding úlohy,
  • velké repozitáře,
  • koordinaci terminálových nástrojů,
  • refactoring,
  • frontend podle screenshotů,
  • GPU kernels, kompilátory, CAD a návrh čipů.[1][2]

Kimi Code umí:

  • číst a upravovat soubory,
  • spouštět shell,
  • vyhledávat,
  • načítat webové stránky,
  • plánovat kroky,
  • pracovat přes TUI,
  • integrovat se přes Agent Client Protocol.[11]

Instalace

curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /cesta/k/projektu
kimi

Poté:

/model

a vybrat Kimi K3.

Read-only operace mohou běžet automaticky, zatímco změny a příkazy vyžadují ve standardním nastavení potvrzení.[11]

Sandbox, least privilege, ochrana secrets, review a blokace auto-deploymentu jsou stále nutné.

15. Jak číst benchmarky?

Vybrané oficiální výsledky při max:

Benchmark Kimi K3
GPQA Diamond 93,5
DeepSWE 67,5
ProgramBench 77,8
Terminal-Bench 2.1 88,3
FrontierSWE 81,2
SWE-Marathon 42,0
BrowseComp 91,2
MCPMark-Verified 94,5
OSWorld-Verified 84,8
AutomationBench 30,8

Jednoduchý žebříček není spolehlivý, protože se liší:

  • harnessy,
  • reasoning,
  • konfigurace agentů,
  • zdroje,
  • data leaderboardů,
  • počty běhů,
  • práce s kontextem.

V Agents’ Last Exam používal Kimi K3 Kimi Code, GPT používal Codex a Claude používal Claude Code.[2]

Moonshot AI sám uvádí, že celkový výkon K3 stále zaostává za Claude Fable 5 a GPT-5.6 Sol.[1]

Firemní POC má obsahovat 50–200 reálných úloh, stejné nástroje, více běhů a cenu za dokončený úkol.

16. Multimodalita

Model card potvrzuje text a obraz, API také video.[2][9]

Použití:

  • screenshoty,
  • opravy UI,
  • grafy,
  • coding z vizuálních referencí,
  • nahrávky obrazovky,
  • motion design a video editing.

Dema výrobce nejsou zárukou. Testujte čtení textu, lokalizaci prvků, konzistenci snímků, cenu a soukromí.

17. Bezpečnost, soukromí a governance

Výhody self-hostingu

  • data zůstávají v kontrolované infrastruktuře,
  • externí telemetrii lze vypnout,
  • vlastní filtry a policy,
  • kontrola verze,
  • omezená síť,
  • vlastní security testy.

Nové povinnosti

  • zabezpečení clusteru a endpointů,
  • tenant isolation,
  • monitoring zneužití,
  • validace generovaného kódu,
  • ochrana vah,
  • aktualizace runtime,
  • zranitelnosti vLLM/SGLang,
  • governance logů a reasoning,
  • limity a circuit breakers.

Použité zdroje neobsahují nezávislý komplexní bezpečnostní audit Kimi K3. Regulované využití vyžaduje testy prompt injection, exfiltrace, jailbreaků, škodlivého kódu, halucinací, zlomyslných dokumentů a eskalace nástrojů.

18. Self-hosting, nebo API?

Kritérium Self-hosting Oficiální API
Počáteční náklady velmi vysoké nízké
Infrastruktura multi-accelerator cluster bez vlastního clusteru
Kontrola dat nejvyšší podle podmínek
Aktualizace vlastní odpovědnost spravované
Fine-tuning plná kontrola podle nabídky
Škálování vlastní odpovědnost spravované
Cache vlastní implementace automatická
Čas nasazení dlouhý krátký
Licence vyžaduje analýzu výjimky pro oficiální produkty
Malý tým obvykle nevýhodné obvykle lepší

API je vhodné pro POC, proměnlivou zátěž a rychlou integraci. Self-hosting pro přísná data, existující cluster, stabilní vysoké využití a zkušenosti s distributed inference.

19. Vyplatí se Kimi K3 nasadit?

Ano, pokud:

  • potřebujete velmi velký self-hostable model,
  • máte infrastrukturu,
  • zkoumáte 3T modely,
  • stavíte inference provider,
  • potřebujete multimodalitu a dlouhý kontext,
  • máte dlouhé agentic coding úlohy,
  • chcete vlastní fine-tunes a kvantizace.

Ne nutně, pokud:

  • máte jen jeden GPU server,
  • jednoduché dotazy vyžadují nízkou latenci,
  • levnější API je dostatečné,
  • reasoning musí jít vypnout,
  • potřebujete Apache nebo MIT,
  • vyžadujete úplnou reprodukovatelnost tréninku,
  • nemáte distributed-inference tým.

20. Verdikt

Publikace plných vah Kimi K3 je významná.

Model nabízí:

  • 2,8 bilionu parametrů,
  • 104 miliard aktivních,
  • nativní multimodalitu,
  • milionový kontext,
  • MoE s 896 experty,
  • zaměření na coding a dlouhé agentní úlohy.

Je třeba oddělit tři fakta:

  1. Kimi K3 byl představen dříve.
  2. Váhy a technické materiály vyšly 27. července.
  3. Je open-weight pod vlastní licencí, nikoli nesporně Open Source AI podle OSI.

Pro výzkum a inference providery je vydání cenné. Pro běžnou firmu jsou 1,56 TB a nejméně 64 akcelerátorů infrastrukturním projektem.

Doporučený postup:

Nejprve:
POC přes oficiální API

Poté:
měřit kvalitu, cenu, latenci a riziko

Až následně:
řešit self-hosting, licenci a cluster

21. Checklist před nasazením

Terminologie a licence

  • Používá se open-weight.
  • Licence a copyright zůstávají.
  • Právní oddělení provedlo kontrolu.
  • MaaS status je určen.
  • Ověřen limit 20 mil. USD za 12 měsíců.
  • Ověřen limit 100 mil. MAU.
  • Ověřen limit 20 mil. USD měsíčně.
  • Atribuce v UI je určena.
  • Interní použití je dokumentováno.

Infrastruktura

  • Potvrzeno 1,56 TB.
  • Naplánováno 96 shardů.
  • Integrita ověřena.
  • Vybrán vLLM, SGLang nebo TokenSpeed.
  • Dostatek paměti akcelerátorů.
  • Rychlé propojení.
  • Expert parallelism.
  • KV cache spočítána.
  • Monitoring GPU/sítě/paměti.
  • Proces aktualizace runtime.

API a agent

  • Používá se kimi-k3.
  • Zvolen reasoning_effort.
  • Reasoning se nevypíná.
  • Úplná historie reasoning_content.
  • Omezeno max_completion_tokens.
  • Pevné sampling parametry se neposílají.
  • Obrázky base64 nebo ms://.
  • Web search není kritický.
  • Tool calls validovány.
  • JSON Schema validováno.

Bezpečnost

  • Sandbox.
  • Least privilege.
  • Bez automatického přístupu do produkce.
  • Bez secrets v promptech a logách.
  • Reasoning se zbytečně neloguje.
  • Prompt injection testován.
  • Zlomyslné dokumenty testovány.
  • Limity ceny, času a toolů.
  • Human approval pro destruktivní akce.
  • Testy a review kódu.

Evaluace

  • Vlastní dataset úloh.
  • Nejméně tři modely.
  • Stejný harness.
  • Více běhů.
  • Celková cena úlohy.
  • Čas ke správnému výsledku.
  • Code review a refactoring.
  • Multimodalita.
  • Long context.
  • Halucinace a citace.

22. Související materiály POLPROG

Starší srovnání před 27. červencem mohla správně uvádět, že plné váhy nebyly dostupné. To se změnilo.

AI Moonshot AI Kimi K3 Open Weights LLM

Často kladené otázky

Byl Kimi K3 vydán dnes?

Ne celý. Model a API existovaly dříve. Váhy, kód, licence a zpráva byly publikovány 27. července.

Je open source?

Moonshot tento termín používá. Přesnější je open-weight pod Kimi K3 License. Nesporné splnění všech kritérií OSI není potvrzeno.

Lze váhy skutečně stáhnout?

Ano. Repozitář má přibližně 1,56 TB a obsahuje 96 Safetensors shardů.

Kolik parametrů?

2,8 bilionu celkem a 104 miliard aktivních.

Poběží na jednom GPU?

Ne v oficiální plné verzi. Doporučeno je nejméně 64 akcelerátorů.

Je komerční použití povoleno?

Ano, podle licence. Někteří velcí MaaS poskytovatelé potřebují zvláštní smlouvu a velké produkty mohou mít povinnou atribuci.

Musí každý produkt ukazovat Kimi K3?

Ne. Podmínka platí nad 100 milionů MAU nebo 20 milionů USD měsíčně, s výjimkami.

Kolik stojí API?

0,30 USD za milion input tokenů při cache hit, 3 USD při cache miss a 15 USD za milion output tokenů.

Lze vypnout reasoning?

Ne. `low`, `high` a `max` mění pouze effort.

Podporuje obraz a video?

Ano. Model card potvrzuje obraz a API dokumentace také video.

Znamená milion tokenů bezchybné čtení repozitáře?

Ne. Jde o maximální kapacitu, nikoli záruku perfektního retrievalu.

Je lepší než Claude Fable 5 nebo GPT-5.6 Sol?

Ne ve všem. Moonshot AI uvádí, že celkový výkon stále zaostává.

Má firma hned stavět cluster?

Obvykle ne. Začněte API POC.

---

Zdroje a poznámky

  1. Moonshot AI, Kimi K3: Open Frontier Intelligence1234567
  2. Moonshot AI, Kimi K3 Model Card na Hugging Face1234567891011
  3. MoonshotAI, oficiální repozitář Kimi-K312
  4. Moonshot AI, Kimi K3 License123456
  5. Open Source Initiative, Open Weights: not quite what you’ve been told123
  6. Open Source Initiative, Open Source AI Definition 1.01234
  7. MoonshotAI, Kimi K3 Technical Report
  8. Moonshot AI, soubory Kimi-K3 na Hugging Face
  9. Kimi API Platform, Kimi K3 Quickstart123456789
  10. Kimi API Platform, Thinking Models123
  11. MoonshotAI, Kimi Code CLI12

Bylo to užitečné?

Odebírejte nové články e-mailem

Jeden krátký e-mail na každý nový článek znalostní báze. Žádný spam, odhlášení jedním kliknutím.

Váš e-mail používáme pouze k zasílání nových článků. Žádné sdílení s třetími stranami.

Zpět do znalostní báze