Kimi K3 — нативно мультимодальна модель Mixture-of-Experts з:
- 2,8 трлн загальних параметрів,
- 104 млрд параметрів, активованих під час генерації одного token,
- 896 experts, з яких обираються 16,
- context window у 1 048 576 tokens,
- підтримкою тексту, зображень і, згідно з API-документацією, відео,
- розміром repository приблизно 1,56 TB.[2][3]
Moonshot AI називає Kimi K3 open-source model. Однак у строгому значенні Open Source Initiative точнішим є термін open-weight. Опубліковано фінальні параметри, код і документацію, але Kimi K3 використовує власну ліцензію з додатковими умовами для окремих комерційних сценаріїв. Сам факт доступності ваг також не забезпечує повної прозорості training process і training data, якої вимагає Open Source AI Definition.[4][5][6]
Головний висновок: Kimi K3 реально можна завантажити, модифікувати, fine-tune та self-host, але середня компанія не запустить її на одному GPU server. Публікація ваг відкриває важливі можливості для досліджень та інфраструктури, тоді як масштаб моделі й умови ліцензії потребують ретельного аналізу перед production deployment.
Усі параметри, ціни, ліцензійні умови та інформацію про доступність перевірено 27 липня 2026 року.
TL;DR
| Питання | Відповідь |
|---|---|
| Що сталося 27 липня? | Опубліковано повні ваги, repository, ліцензію та технічний звіт |
| Чи запустили саму модель цього дня? | Ні, модель і API були доступні раніше |
| Чи є Kimi K3 open source? | Moonshot використовує цей термін, але точніше — open-weight під власною ліцензією |
| Скільки параметрів? | 2,8 трлн загалом, 104 млрд активних |
| Яка архітектура? | MoE, KDA, Gated MLA, AttnRes і Stable LatentMoE |
| Скільки experts? | 896, з яких 16 обираються на token, плюс 2 shared experts |
| Яка довжина context? | 1 048 576 tokens |
| Який розмір файлів? | Приблизно 1,56 TB |
| Скільки основних shards? | 96 файлів Safetensors |
| Чи можна запустити локально? | Технічно так, але не на звичайному ПК або одному GPU |
| Що рекомендує виробник? | Supernode-конфігурації щонайменше з 64 accelerators |
| Чи дозволене комерційне використання? | Так, відповідно до Kimi K3 License |
| Скільки коштує офіційне API? | 0,30 USD/MTok cache hit, 3 USD/MTok cache miss, 15 USD/MTok output |
| Чи можна вимкнути reasoning? | Ні |
| Які рівні reasoning? | low, high, max, default max |
| Чи всі бенчмарки незалежні? | Ні, частина результатів походить від Moonshot AI |
1. Що саме було опубліковано?
Офіційний repository moonshotai/Kimi-K3 на Hugging Face містить:
- повні ваги,
- конфігурацію моделі,
- код для loading і processing inputs,
- tokenizer та processor files,
- приклади для Transformers, vLLM і SGLang,
- model card,
- Kimi K3 License.[2]
Офіційний GitHub repository додатково містить:
- код і документацію,
- технічний звіт
k3_tech_report.pdf, - deployment instructions,
- опис архітектури та evaluation.[3][7]
Repository ваг має приблизно 1,56 TB. Основні параметри розділено на 96 Safetensors files, від:
model-00001-of-000096.safetensors
до:
model-00096-of-000096.safetensors
Більшість shards мають приблизно 16,6–17 GB.[8]
Це не обіцянка майбутнього релізу. Файли вже доступні для завантаження.
2. Open source чи open-weight?
Moonshot AI використовує формулювання:
- “open model”,
- “open-source model”,
- “Open Frontier Weights”.
Model card на Hugging Face прямо називає Kimi K3 open-weight.[2]
Що таке відкриті ваги?
Ваги — це фінальні параметри, отримані під час training. Їх публікація дозволяє:
- запускати модель поза інфраструктурою виробника,
- виконувати fine-tuning,
- створювати quantized variants,
- аналізувати поведінку,
- будувати власні inference servers,
- інтегрувати модель без надсилання prompt до офіційного API.
Це не робить автоматично відтворюваним увесь процес розробки.
Чому OSI розрізняє open weights та Open Source AI?
Open Source Initiative пояснює, що лише фінальні ваги не забезпечують повного доступу до:
- data або достатньої інформації про training data,
- усього коду підготовки даних,
- повної training configuration,
- компонентів, потрібних для відтворення суттєво еквівалентної системи.[5][6]
Open Source AI Definition вимагає свободи:
- використовувати,
- вивчати,
- змінювати,
- поширювати,
а також доступу до preferred form, потрібної для реального модифікування системи.[6]
Чи є Kimi K3 License схваленою OSI?
Repository використовує власну Kimi K3 License, а не Apache-2.0, MIT чи іншу стандартну OSI-approved licence.
Ліцензія надає широкі права:
- використовувати,
- копіювати,
- змінювати,
- публікувати,
- поширювати,
- sublicence,
- продавати,
- deploy,
- fine-tune,
- створювати derivative works.[4]
Водночас вона містить додаткові умови для окремих комерційних суб’єктів. Найбезпечніше формулювання:
Kimi K3 — open-weight model, опублікована під власною Kimi K3 License.
Це не означає, що модель «закрита», але термін open source у цьому випадку потребує правових і технічних уточнень.
3. Основні параметри Kimi K3
| Параметр | Kimi K3 |
|---|---|
| Архітектура | Mixture-of-Experts |
| Загальні параметри | 2,8 трлн |
| Активовані параметри | 104 млрд |
| Кількість layers | 93 |
| Dense layers | 1 |
| Attention layers | 69 KDA + 24 Gated MLA |
| Experts | 896 |
| Experts на token | 16 |
| Shared experts | 2 |
| Vocabulary | 160 000 |
| Context | 1 048 576 tokens |
| Image encoder | MoonViT-V2 |
| Vision encoder parameters | 401 млн |
| Ваги | MXFP4 |
| Activations | MXFP8 |
| Modalities у model card | текст і зображення |
| Додаткова API modality | відео |
| Розмір repository | приблизно 1,56 TB |
| Safetensors shards | 96 |
Дані походять з офіційної model card.[2]
2,8 трлн не означає 2,8 трлн активних параметрів
Kimi K3 — MoE model. Під час генерації token вона не використовує всіх experts одночасно.
Router обирає 16 з 896 experts, а документація вказує 104 млрд activated parameters. Це збільшує capacity без ідентичного compute cost dense model на 2,8T.
Однак hardware cost не стає таким самим, як у звичайної 100B model, оскільки всі ваги потрібно зберігати й розподіляти між accelerators.
4. KDA, AttnRes і Stable LatentMoE
Kimi Delta Attention
KDA — hybrid linear-attention mechanism для довгих sequences.
Модель містить:
- 69 KDA layers,
- 24 Gated MLA layers.[2]
Linear attention може зменшити частину витрат full attention на довгому context, але не робить мільйон tokens дешевим.
Attention Residuals
AttnRes змінює передачу representations між layers. За словами Moonshot AI, механізм вибірково отримує інформацію з різних depth levels.[1]
Stable LatentMoE
Stable LatentMoE дозволяє масштабуватися до 896 experts і активувати 16. Moonshot AI заявляє приблизно 2,5× покращення загальної scaling efficiency порівняно з Kimi K2.[1][2]
Це твердження виробника, а не гарантія 2,5× швидкості, нижчої ціни чи якості.
Native MXFP4
Kimi K3 тренували з урахуванням quantization від етапу supervised fine-tuning:
MXFP4 для ваг
MXFP8 для activations
Мета — зменшити memory requirements і спростити deployment.[2] Repository все одно має приблизно 1,56 TB.
5. Чи можна запустити Kimi K3 локально?
Так, якщо «локально» означає велику власну інфраструктуру.
Повна версія не призначена для:
- laptop,
- workstation зі споживчим GPU,
- одного server з кількома GPU,
- малого homelab.
Moonshot AI рекомендує supernode щонайменше з 64 accelerators. Потрібно врахувати:
- ваги,
- KV cache,
- context на один мільйон,
- communication між experts,
- expert parallelism,
- швидкий interconnect,
- prefix cache,
- runtime memory headroom.[1]
Реальна пам’ять
Quantized weights уже займають приблизно 1,56 TB. Додатково потрібна пам’ять для:
- framework overhead,
- cache,
- activations,
- communication buffers,
- операційної системи,
- concurrency.
Просте ділення 1,56 TB на memory однієї карти не дає production configuration.
Рекомендовані engines
Model card називає:
- vLLM,
- SGLang,
- TokenSpeed.[2]
Також показано Transformers і Docker Model Runner. Команда:
vllm serve "moonshotai/Kimi-K3"
не означає, що модель запуститься на будь-якому hardware.
Для кого self-hosting має сенс?
- hyperscalers та inference providers,
- research labs,
- великі enterprises з AI clusters,
- організації з дуже чутливими даними,
- компанії, що створюють fine-tunes і quantizations,
- великі inference services.
Для більшості teams офіційне API буде економічнішим.
6. Що дозволяє ліцензія?
Kimi K3 License безкоштовно дозволяє:
- використовувати,
- копіювати,
- змінювати,
- merge,
- публікувати й поширювати,
- sublicence,
- продавати копії,
- запускати й deploy,
- fine-tune,
- створювати derivative solutions.[4]
Потрібно зберегти copyright notice і текст ліцензії.
Умова Model as a Service
Ліцензія визначає Model as a Service як надання inference або fine-tuning третій стороні з істотним контролем над inputs, parameters або training data.
Якщо licensee або affiliates:
- ведуть Model as a Service business,
- мають сукупний дохід понад 20 млн USD у будь-якому послідовному 12-місячному періоді,
перед commercial use вони повинні укласти окрему угоду з Moonshot AI.[4]
Поріг стосується загального доходу licensee та affiliates, а не лише доходу від Kimi K3.
Обов’язок показувати назву Kimi K3
Якщо модель або derivative solution використовується в commercial product чи service з:
- понад 100 млн monthly active users, або
- понад 20 млн USD monthly revenue,
назва “Kimi K3” має бути помітно показана в user interface.[4]
Винятки
Умови MaaS та attribution не застосовуються:
- до суто internal use без доступу третіх сторін,
- до офіційних продуктів Moonshot AI,
- до certified inference partners.[4]
Що має перевірити компанія?
- internal чи external use,
- рівень customer control,
- group revenue,
- MAU та revenue thresholds,
- attribution requirement,
- необхідність окремої угоди.
Ця стаття не є legal advice.
7. Що не було опубліковано?
Офіційні матеріали містять:
- фінальні ваги,
- частину коду,
- architecture configuration,
- inference і processor code,
- технічний опис,
- evaluation results.
З цього не випливає, що опубліковано повний dataset або всі деталі для відтворення training з нуля.
Kimi K3 значно відкритіша за closed API, але не забезпечує повної reproducibility у значенні OSI.[5][6]
8. API та ціни
Identifier:
kimi-k3
Офіційне API сумісне з OpenAI Chat Completions.
Ціни
| Тип token | Ціна за мільйон |
|---|---|
| Input з cache hit | 0,30 USD |
| Input з cache miss | 3,00 USD |
| Output | 15,00 USD |
Ціни походять від Moonshot AI та можуть не включати податки.[1]
Moonshot AI заявляє понад 90% cache hit у coding workloads. Це не гарантія для кожного клієнта.[1]
Мінімальне поповнення
API access відкривається після поповнення щонайменше на 1 USD. Tier і limits залежать від cumulative top-ups.[9]
9. Перший виклик Python
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
max_completion_tokens=8_192,
messages=[
{
"role": "user",
"content": (
"Проаналізуй архітектуру проєкту та підготуй "
"безпечний план міграції."
),
}
],
)
message = response.choices[0].message
print(message.content)
cURL
curl https://api.moonshot.ai/v1/chat/completions \
--header "Authorization: Bearer $MOONSHOT_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "kimi-k3",
"reasoning_effort": "high",
"max_completion_tokens": 8192,
"messages": [
{
"role": "user",
"content": "Проаналізуй цю проблему та запропонуй рішення."
}
]
}'
10. Reasoning завжди активний
Kimi K3 завжди використовує reasoning. Параметра для повного вимкнення немає.[9][10]
Рівні:
low
high
max
Default:
max
Для більшої частини production traffic варто спочатку тестувати low або high.
reasoning_content
Відповідь може окремо містити:
reasoning_content,- фінальний
content.
Під час streaming вони повертаються окремими chunks.[9][10]
Не слід автоматично:
- показувати reasoning користувачу,
- зберігати його без обмежень,
- надсилати до logs з personal data,
- вважати його надійним audit trail.
Preserved Thinking
У multi-turn conversations та tool calling наступний request має містити:
reasoning_content,content,tool_calls.
Зберігати лише фінальний content недостатньо.[10]
Історичний reasoning займає context і тарифікується.
11. Ліміти та відмінності API
Максимальний output
default: 131 072 tokens
maximum: 1 048 576 tokens
Технічний максимум не означає низьку ціну чи latency.
Фіксовані parameters
temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0
Документація радить їх не надсилати.
Зображення та відео
Public image URLs не підтримуються. Потрібно використовувати:
- base64,
ms://<file-id>.
Документація також показує video через Moonshot file system.[9]
Web search
Офіційна web search feature оновлюється й наразі не рекомендується для production workflows.[9]
12. Контекст на мільйон і cache
1 048 576 tokens
Це може допомогти з:
- великими repositories,
- enterprise documentation,
- великою кількістю файлів,
- довгими agent sessions,
- багатокроковими дослідженнями.
Automatic cache
Prefix cache працює автоматично. Cache ID або TTL не потрібні.
Попередній prompt має перевищувати 256 tokens, щоб система спробувала cache hit.[9]
Потрібно зберігати стабільний prefix, змінне питання ставити наприкінці й вимірювати реальні hits.
Мільйон tokens не гарантує perfect memory, повний retrieval або resistance to prompt injection.
13. Tool calling та agents
Kimi K3 підтримує:
- custom tools,
tool_choice,- forced tool use,
- structured output з JSON Schema,
- Partial Mode,
- dynamic tool definitions,
- Formula tools.[9]
Dynamic tools
Definition можна додати пізніше в conversation history, зменшуючи prompt length, errors і permission surface.
Server не зберігає definition за client. Message має залишатися в наступній history.
Structured output
response_format = {
"type": "json_schema",
"json_schema": {
"name": "finding",
"strict": True,
"schema": {
"type": "object",
"properties": {
"severity": {
"type": "string",
"enum": ["low", "medium", "high", "critical"],
},
"summary": {"type": "string"},
},
"required": ["severity", "summary"],
"additionalProperties": False,
},
},
}
Потрібно parse message.content, а не reasoning_content.[9]
14. Kimi Code та програмування
Moonshot AI позиціонує K3 для:
- довгих coding tasks,
- великих repositories,
- terminal tool coordination,
- refactoring,
- frontend за screenshots,
- GPU kernels, compilers, CAD і chip design.[1][2]
Kimi Code може:
- читати й змінювати files,
- виконувати shell commands,
- шукати,
- завантажувати web pages,
- планувати steps,
- працювати через TUI,
- інтегруватися через Agent Client Protocol.[11]
Встановлення
curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /shliakh/do/proiektu
kimi
Потім:
/model
і обрати Kimi K3.
Read-only operations можуть виконуватися автоматично, а зміни та commands потребують confirmation у standard configuration.[11]
Sandbox, least privilege, secret protection, review і block auto-deployment усе одно необхідні.
15. Як читати бенчмарки?
Вибрані офіційні результати при max:
| Benchmark | Kimi K3 |
|---|---|
| GPQA Diamond | 93,5 |
| DeepSWE | 67,5 |
| ProgramBench | 77,8 |
| Terminal-Bench 2.1 | 88,3 |
| FrontierSWE | 81,2 |
| SWE-Marathon | 42,0 |
| BrowseComp | 91,2 |
| MCPMark-Verified | 94,5 |
| OSWorld-Verified | 84,8 |
| AutomationBench | 30,8 |
Простий рейтинг ненадійний, бо відрізняються:
- harnesses,
- reasoning levels,
- agent configurations,
- sources,
- leaderboard dates,
- number of runs,
- context management.
В Agents’ Last Exam Kimi K3 використовувала Kimi Code, GPT — Codex, Claude — Claude Code.[2]
Moonshot AI сама зазначає, що overall performance K3 все ще відстає від Claude Fable 5 і GPT-5.6 Sol.[1]
Enterprise POC має використовувати 50–200 реальних tasks, однакові tools, кілька runs і cost per completed task.
16. Мультимодальність
Model card підтверджує текст і зображення, API також відео.[2][9]
Застосування:
- screenshot analysis,
- UI correction,
- charts,
- coding з visual references,
- screen recordings,
- motion design і video editing.
Vendor demos не гарантують результат. Потрібно тестувати text reading, element localisation, frame consistency, cost і privacy.
17. Безпека, privacy та governance
Переваги self-hosting
- data залишається в контрольованій інфраструктурі,
- external telemetry можна вимкнути,
- власні filters і policies,
- version control,
- network restrictions,
- власні security tests.
Нові обов’язки
- захист cluster та endpoints,
- tenant isolation,
- abuse monitoring,
- validation generated code,
- захист ваг,
- runtime updates,
- vulnerabilities у vLLM/SGLang,
- log і reasoning governance,
- limits та circuit breakers.
Використані sources не містять незалежного комплексного safety audit Kimi K3. Regulated use вимагає тестів prompt injection, data exfiltration, jailbreaks, harmful code, hallucinations, malicious documents і privilege escalation через tools.
18. Self-hosting чи API?
| Критерій | Self-hosting | Офіційне API |
|---|---|---|
| Початкова вартість | дуже висока | низька |
| Інфраструктура | multi-accelerator cluster | без власного cluster |
| Контроль даних | максимальний | за умовами service |
| Updates | відповідальність організації | managed |
| Fine-tuning | повний контроль | залежить від пропозиції |
| Scaling | відповідальність організації | managed |
| Cache | власна реалізація | automatic |
| Deployment time | довгий | короткий |
| Ліцензія | потребує аналізу | винятки для офіційних продуктів |
| Малий team | зазвичай невигідно | зазвичай краще |
API підходить для POC, variable load та швидкого integration. Self-hosting має сенс за строгих data requirements, existing cluster, stable high usage і distributed-inference expertise.
19. Чи варто впроваджувати Kimi K3?
Так, якщо:
- потрібна дуже велика self-hostable model,
- інфраструктура вже є,
- досліджуються 3T-class models,
- будується inference provider,
- потрібні multimodality та long context,
- переважають довгі agentic coding tasks,
- потрібні власні fine-tunes і quantizations.
Не обов’язково, якщо:
- є лише один GPU server,
- простим запитам потрібна low latency,
- дешевше API уже достатнє,
- reasoning має вимикатися,
- потрібна Apache або MIT licence,
- потрібна повна reproducibility training,
- немає distributed-inference team.
20. Висновок
Публікація повних ваг Kimi K3 — важлива подія.
Модель пропонує:
- 2,8 трлн параметрів,
- 104 млрд активних,
- native multimodality,
- context на один мільйон,
- MoE з 896 experts,
- фокус на coding і довгих agent tasks.
Потрібно розділити три факти:
- Kimi K3 представили раніше.
- Ваги й технічні матеріали опублікували 27 липня.
- Це open-weight під власною ліцензією, а не беззаперечно Open Source AI за OSI.
Для research і inference providers реліз дуже цінний. Для звичайної компанії 1,56 TB і щонайменше 64 accelerators перетворюють його на infrastructure project.
Рекомендований підхід:
Спочатку:
POC через офіційне API
Потім:
виміряти quality, cost, latency і risk
Лише після цього:
аналізувати self-hosting, licence і cluster
21. Чекліст перед deployment
Термінологія та ліцензія
- Використовується open-weight.
- Licence і copyright збережені.
- Legal team перевірила ліцензію.
- MaaS status визначений.
- Перевірено поріг 20 млн USD за 12 місяців.
- Перевірено поріг 100 млн MAU.
- Перевірено поріг 20 млн USD monthly.
- Визначено UI attribution.
- Internal use задокументовано.
Інфраструктура
- Підтверджено 1,56 TB.
- Заплановано download 96 shards.
- Integrity перевірена.
- Обрано vLLM, SGLang або TokenSpeed.
- Достатньо accelerator memory.
- Є fast interconnect.
- Expert parallelism спланований.
- KV cache оцінений.
- Monitoring GPU/network/memory.
- Runtime update process.
API та agent
- Використовується
kimi-k3. - Обрано
reasoning_effort. - Reasoning не вимикається.
- Повна history
reasoning_content. - Обмежено
max_completion_tokens. - Fixed sampling parameters не надсилаються.
- Images через base64 або
ms://. - Web search не є critical.
- Tool calls валідовані.
- JSON Schema валідована.
Безпека
- Sandbox.
- Least privilege.
- Немає automatic production access.
- Немає secrets у prompts/logs.
- Reasoning не log без потреби.
- Prompt injection протестована.
- Malicious documents протестовані.
- Limits cost, time і tools.
- Human approval для destructive actions.
- Code проходить tests і review.
Оцінювання
- Власний task set.
- Щонайменше три models.
- Однаковий harness.
- Кілька runs.
- Total cost per task.
- Time to correct result.
- Code review і refactoring.
- Multimodality.
- Long context.
- Hallucinations і citations.

