Moonshot AI publikuje wagi Kimi K3: 2,8 bln parametrów, licencja, wymagania i benchmarki Skip to content

Baza wiedzy

Praktyczna wiedza o frontendzie, narzędziach AI i tworzeniu oprogramowania.

Moonshot AI publikuje wagi Kimi K3: 2,8 bln parametrów, licencja, wymagania i benchmarki

Opublikowano: 21 min czytania Autor: AI Tools

27 lipca 2026 roku Moonshot AI udostępnił pełne wagi modelu <strong>Kimi K3</strong>, repozytorium z kodem, własną licencję oraz raport techniczny. Nie jest to jednak dzień premiery samego modelu. Kimi K3 został zaprezentowany wcześniej w lipcu i był już dostępny przez Kimi.com, Kimi Work, Kimi Code oraz API. Dzisiejszą zmianą jest możliwość pobrania i samodzielnego wdrożenia wag.

Kimi K3 to natywnie multimodalny model typu Mixture-of-Experts o:

  • 2,8 bln wszystkich parametrów,
  • 104 mld parametrów aktywowanych podczas generowania tokenu,
  • 896 ekspertach, z których wybieranych jest 16,
  • kontekście o długości 1 048 576 tokenów,
  • obsłudze tekstu, obrazu i, według dokumentacji API, również materiałów wideo,
  • wadze repozytorium wynoszącej około 1,56 TB.[2][3]

Moonshot AI określa Kimi K3 jako model open source. W ścisłym znaczeniu przyjętym przez Open Source Initiative bezpieczniej jest jednak używać określenia open-weight. Opublikowano końcowe parametry, kod i dokumentację, ale Kimi K3 korzysta z własnej licencji zawierającej dodatkowe warunki dla części zastosowań komercyjnych. Sama dostępność wag nie oznacza też pełnej przejrzystości procesu treningowego i danych wymaganej przez definicję Open Source AI.[4][5][6]

Najważniejszy wniosek: Kimi K3 jest realnie dostępny do pobrania, modyfikowania, fine-tuningu i samodzielnego hostowania, ale nie jest modelem, który przeciętna firma uruchomi na pojedynczym serwerze GPU. Publikacja wag otwiera ważne możliwości badawcze i infrastrukturalne, lecz skala modelu oraz warunki licencji wymagają dokładnej analizy przed wdrożeniem produkcyjnym.

Wszystkie parametry, ceny, warunki licencji i informacje o dostępności zweryfikowano 27 lipca 2026 roku.

TL;DR

Pytanie Odpowiedź
Co wydarzyło się 27 lipca? Opublikowano pełne wagi, repozytorium, licencję i raport techniczny
Czy sam model zadebiutował dzisiaj? Nie, model i API były dostępne wcześniej
Czy Kimi K3 jest open source? Moonshot tak go określa, ale precyzyjniej: open-weight na własnej licencji
Ile ma parametrów? 2,8 bln łącznie, 104 mld aktywnych
Jaka jest architektura? MoE, KDA, Gated MLA, AttnRes i Stable LatentMoE
Ilu ma ekspertów? 896, z czego 16 wybieranych na token, plus 2 współdzielonych
Jak długi jest kontekst? 1 048 576 tokenów
Ile zajmują pliki? Około 1,56 TB
Ile jest głównych shardów wag? 96 plików Safetensors
Czy można uruchomić go lokalnie? Technicznie tak, ale nie na typowym komputerze ani pojedynczym GPU
Co rekomenduje producent? Konfiguracje supernode z co najmniej 64 akceleratorami
Czy można używać komercyjnie? Tak, z warunkami wynikającymi z Kimi K3 License
Ile kosztuje oficjalne API? 0,30 USD / MTok cache hit, 3 USD / MTok cache miss, 15 USD / MTok output
Czy można wyłączyć reasoning? Nie, K3 zawsze używa reasoning
Jakie poziomy reasoning obsługuje? low, high, max, domyślnie max
Czy benchmarki są całkowicie niezależne? Nie, część wyników i konfiguracji pochodzi od Moonshot AI

1. Co dokładnie zostało udostępnione?

Na Hugging Face pojawiło się oficjalne repozytorium moonshotai/Kimi-K3, zawierające:

  • pełne wagi,
  • konfigurację modelu,
  • kod potrzebny do ładowania i przetwarzania danych,
  • tokenizer i pliki procesora,
  • przykłady dla Transformers, vLLM i SGLang,
  • model card,
  • własną licencję Kimi K3 License.[2]

Oficjalne repozytorium GitHub zawiera dodatkowo:

  • kod i dokumentację projektu,
  • raport techniczny k3_tech_report.pdf,
  • instrukcje wdrożeniowe,
  • opis architektury i ewaluacji.[3][7]

Repozytorium wag ma około 1,56 TB. Główne parametry zostały podzielone na 96 plików Safetensors, nazywanych od:

model-00001-of-000096.safetensors

do:

model-00096-of-000096.safetensors

Większość shardów ma około 16,6–17 GB.[8]

To nie jest deklaracja przyszłego wydania. Wagi są już faktycznie obecne i możliwe do pobrania.

2. Open source czy open-weight?

To najważniejsza kwestia terminologiczna całej premiery.

Moonshot AI używa wobec Kimi K3 określeń:

  • „open model”,
  • „open-source model”,
  • „Open Frontier Weights”.

Na Hugging Face model card nazywa Kimi K3 jednoznacznie open-weight.[2]

Czym są otwarte wagi?

Wagi są końcowymi parametrami wyuczonymi podczas treningu. Ich publikacja pozwala między innymi:

  • uruchomić model poza infrastrukturą producenta,
  • przeprowadzać fine-tuning,
  • tworzyć kwantyzacje,
  • analizować zachowanie modelu,
  • budować własne serwery inferencyjne,
  • integrować model bez wysyłania promptów do oficjalnego API.

Nie pozwala natomiast automatycznie odtworzyć pełnego procesu tworzenia modelu.

Dlaczego OSI rozróżnia open weights i Open Source AI?

Open Source Initiative wskazuje, że samo udostępnienie końcowych wag nie zapewnia pełnego dostępu do:

  • danych lub szczegółowych informacji o danych treningowych,
  • całego kodu przygotowującego dane,
  • pełnej konfiguracji procesu treningowego,
  • elementów umożliwiających odtworzenie zasadniczo równoważnego systemu.[5][6]

Definicja Open Source AI wymaga swobody:

  1. używania,
  2. badania,
  3. modyfikowania,
  4. udostępniania,

oraz dostępu do preferowanej formy potrzebnej do rzeczywistego modyfikowania systemu.[6]

Czy licencja Kimi K3 jest licencją OSI?

Repozytorium korzysta z własnej licencji nazwanej Kimi K3 License, a nie ze standardowej licencji zatwierdzonej przez OSI, takiej jak Apache-2.0 lub MIT.

Licencja przyznaje szerokie uprawnienia do:

  • używania,
  • kopiowania,
  • modyfikowania,
  • publikowania,
  • dystrybucji,
  • sublicencjonowania,
  • sprzedaży,
  • wdrażania,
  • fine-tuningu,
  • tworzenia dzieł pochodnych.[4]

Jednocześnie wprowadza dodatkowe warunki dla określonych podmiotów komercyjnych. Z tego powodu w materiale produkcyjnym najbezpieczniej pisać:

Kimi K3 jest modelem z otwartymi wagami, udostępnionym na własnej licencji Kimi K3 License.

Nie oznacza to, że model jest „zamknięty”. Oznacza jedynie, że określenie open source ma w tym przypadku ważne zastrzeżenia prawne i techniczne.

3. Najważniejsze parametry Kimi K3

Parametr Kimi K3
Typ architektury Mixture-of-Experts
Wszystkie parametry 2,8 bln
Aktywowane parametry 104 mld
Liczba warstw 93
Warstwy dense 1
Warstwy uwagi 69 KDA + 24 Gated MLA
Liczba ekspertów 896
Eksperci wybierani na token 16
Eksperci współdzieleni 2
Rozmiar słownika 160 tys.
Kontekst 1 048 576 tokenów
Enkoder obrazu MoonViT-V2
Parametry vision encodera 401 mln
Wagi MXFP4
Aktywacje MXFP8
Modalności w model card tekst i obraz
Dodatkowa modalność w oficjalnym API wideo
Rozmiar repozytorium około 1,56 TB
Liczba shardów Safetensors 96

Dane architektoniczne pochodzą z oficjalnej karty modelu.[2]

2,8 bln nie oznacza 2,8 bln aktywnych parametrów

Kimi K3 jest modelem MoE. Podczas generowania pojedynczego tokenu nie wykorzystuje wszystkich ekspertów jednocześnie.

Z 896 ekspertów routing wybiera 16, a dokumentacja podaje 104 mld aktywowanych parametrów. Pozwala to uzyskać większą pojemność modelu bez kosztu obliczeniowego identycznego z gęstym modelem o 2,8 bln parametrów.

Nie oznacza to jednak, że koszty sprzętowe są porównywalne z typowym modelem 100B. Wszystkie wagi nadal muszą zostać przechowane i odpowiednio rozdzielone pomiędzy akceleratory.

4. KDA, AttnRes i Stable LatentMoE

Kimi K3 nie jest wyłącznie większą wersją Kimi K2. Moonshot AI opisuje kilka zmian architektonicznych.

Kimi Delta Attention

KDA jest hybrydowym mechanizmem linear attention zaprojektowanym z myślą o efektywniejszym skalowaniu długich sekwencji.

Model posiada:

  • 69 warstw KDA,
  • 24 warstwy Gated MLA.[2]

Linear attention ma ograniczać część kosztów klasycznej pełnej uwagi przy długim kontekście. Nie oznacza to, że obsługa miliona tokenów jest tania albo że każde zadanie powinno wykorzystywać cały dostępny kontekst.

Attention Residuals

AttnRes zmienia sposób przekazywania reprezentacji pomiędzy warstwami. Według producenta mechanizm selektywnie pobiera informacje z różnych głębokości zamiast wyłącznie jednolicie je akumulować.[1]

Stable LatentMoE

Stable LatentMoE umożliwia skalowanie liczby ekspertów i aktywowanie 16 z 896 ekspertów. Moonshot AI deklaruje, że połączenie zmian architektury, treningu i danych daje około 2,5-krotną poprawę ogólnej efektywności skalowania względem Kimi K2.[1][2]

Jest to twierdzenie producenta. Nie należy interpretować go jako 2,5-krotnie szybszego API, 2,5-krotnie niższego kosztu albo 2,5-krotnie wyższej jakości w każdym zadaniu.

Native MXFP4

Kimi K3 był trenowany z uwzględnieniem kwantyzacji od etapu supervised fine-tuning:

MXFP4 dla wag
MXFP8 dla aktywacji

Celem jest zmniejszenie wymagań pamięciowych i ułatwienie wdrożenia na wielu typach sprzętu.[2]

Mimo kwantyzacji repozytorium nadal zajmuje około 1,56 TB.

5. Czy Kimi K3 można uruchomić lokalnie?

Tak, ale określenie „lokalnie” może być mylące.

Model można hostować we własnej infrastrukturze, lecz nie jest to model przeznaczony do typowego:

  • laptopa,
  • komputera z kartą konsumencką,
  • pojedynczego serwera z jednym lub kilkoma GPU,
  • małego homelabu.

Moonshot AI rekomenduje konfiguracje supernode z co najmniej 64 akceleratorami. Powodem są nie tylko same wagi, ale również:

  • pamięć na KV cache,
  • kontekst do miliona tokenów,
  • komunikacja pomiędzy ekspertami,
  • expert parallelism,
  • przepustowość sieci pomiędzy urządzeniami,
  • buforowanie prefiksów,
  • zapas pamięci dla runtime.[1]

Teoretyczna pamięć samych wag

Repozytorium już zawiera skwantyzowane wagi i zajmuje około 1,56 TB. Do tego dochodzą:

  • narzut frameworka,
  • cache,
  • aktywacje,
  • bufory komunikacyjne,
  • system operacyjny,
  • rezerwa potrzebna przy większej współbieżności.

Dlatego proste podzielenie 1,56 TB przez pamięć jednej karty nie daje gotowej konfiguracji produkcyjnej.

Rekomendowane silniki

Oficjalna karta modelu wymienia:

  • vLLM,
  • SGLang,
  • TokenSpeed.[2]

Hugging Face pokazuje również podstawowe przykłady Transformers i Docker Model Runner. Fakt, że istnieje prosta komenda:

vllm serve "moonshotai/Kimi-K3"

nie oznacza, że model uruchomi się na dowolnym komputerze. Framework nadal musi znaleźć infrastrukturę zdolną przechować oraz wykonywać cały model.

Dla kogo self-hosting ma sens?

  • hyperscalerzy i dostawcy inferencji,
  • laboratoria badawcze,
  • duże przedsiębiorstwa z istniejącym klastrem AI,
  • organizacje przetwarzające wyjątkowo wrażliwe dane,
  • firmy chcące tworzyć własne fine-tuningi i kwantyzacje,
  • podmioty budujące usługę inferencyjną w dużej skali.

Dla większości zespołów bardziej ekonomiczne będzie oficjalne API albo certyfikowany provider.

6. Co dokładnie pozwala robić licencja?

Kimi K3 License jest licencją szeroką, ale nie bezwarunkową.

Pozwala bezpłatnie:

  • używać modelu,
  • kopiować pliki,
  • modyfikować kod i wagi,
  • scalać zmiany,
  • publikować i dystrybuować,
  • sublicencjonować,
  • sprzedawać kopie,
  • uruchamiać i wdrażać,
  • wykonywać fine-tuning,
  • tworzyć rozwiązania pochodne.[4]

Trzeba zachować informację o prawach autorskich i treść licencji oraz przestrzegać obowiązującego prawa.

Warunek dla Model as a Service

Licencja definiuje Model as a Service jako udostępnienie stronie trzeciej inferencji lub fine-tuningu w sposób dający jej istotną kontrolę nad wejściami, parametrami albo danymi treningowymi.

Jeżeli licencjobiorca lub jego podmioty powiązane:

  1. prowadzą działalność Model as a Service,
  2. osiągają łącznie ponad 20 mln USD przychodu w dowolnym kolejnym okresie 12 miesięcy,

muszą przed komercyjnym wykorzystaniem modelu lub dzieł pochodnych zawrzeć odrębną umowę z Moonshot AI.[4]

To nie jest próg przychodu wygenerowanego wyłącznie przez Kimi K3. Tekst licencji odwołuje się do łącznego przychodu licencjobiorcy i jego podmiotów powiązanych.

Obowiązek wyświetlania nazwy Kimi K3

Jeżeli model lub rozwiązanie pochodne jest używane w komercyjnym produkcie albo usłudze, która ma:

  • więcej niż 100 mln miesięcznie aktywnych użytkowników, lub
  • więcej niż 20 mln USD miesięcznego przychodu,

nazwa „Kimi K3” musi być widocznie wyświetlana w interfejsie użytkownika.[4]

Wyjątki

Warunki dotyczące Model as a Service i widocznego oznaczenia nie obowiązują:

  • przy wykorzystaniu wewnętrznym, które nie udostępnia modelu, wyników ani możliwości osobom trzecim,
  • przy korzystaniu z oficjalnych produktów Moonshot AI,
  • przy korzystaniu z certyfikowanych partnerów inferencyjnych.[4]

Co powinna zrobić firma?

Przed wykorzystaniem produkcyjnym należy udokumentować:

  • czy system jest tylko wewnętrzny,
  • czy klient uzyskuje kontrolę nad inferencją lub fine-tuningiem,
  • jaki jest łączny przychód grupy,
  • czy produkt przekracza próg MAU lub miesięcznego przychodu,
  • czy wymagane jest oznaczenie Kimi K3,
  • czy organizacja potrzebuje dodatkowej umowy.

Ten artykuł nie jest poradą prawną. W przedsiębiorstwie interpretację licencji powinien zatwierdzić dział prawny.

7. Czego nie opublikowano?

Publikacja jest znacząca, ale nie oznacza pełnego ujawnienia całego procesu tworzenia modelu.

Oficjalne materiały udostępniają:

  • końcowe wagi,
  • część kodu,
  • konfigurację architektury,
  • kod inferencyjny i procesory,
  • techniczny opis modelu,
  • wyniki ewaluacji.

Nie należy na tej podstawie twierdzić, że udostępniono pełny dataset treningowy albo wszystkie informacje pozwalające niezależnemu zespołowi odtworzyć Kimi K3 od zera.

Z tego powodu model jest znacznie bardziej otwarty niż zamknięte API, ale nie zapewnia pełnej reprodukowalności treningu w rozumieniu OSI.[5][6]

8. API Kimi K3 i ceny

Model jest dostępny pod identyfikatorem:

kimi-k3

Oficjalne API korzysta z interfejsu zgodnego z OpenAI Chat Completions.

Cennik

Rodzaj tokenów Cena za 1 mln tokenów
Input przy cache hit 0,30 USD
Input przy cache miss 3,00 USD
Output 15,00 USD

Ceny pochodzą z oficjalnego materiału Moonshot AI i nie obejmują ewentualnych podatków.[1]

Producent deklaruje, że jego infrastruktura osiąga ponad 90% cache hit rate w obciążeniach programistycznych. Jest to statystyka oficjalnego API, a nie gwarancja dla każdego promptu lub klienta.[1]

Wymóg doładowania

Dostęp do Kimi K3 w API jest odblokowywany po skutecznym doładowaniu konta kwotą co najmniej 1 USD. Poziom konta i limity zależą od łącznej wartości doładowań.[9]

9. Pierwsze wywołanie przez Python

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="high",
    max_completion_tokens=8_192,
    messages=[
        {
            "role": "user",
            "content": (
                "Przeanalizuj architekturę projektu i przygotuj "
                "plan bezpiecznej migracji."
            ),
        }
    ],
)

message = response.choices[0].message
print(message.content)

API jest zgodne z klientem OpenAI, ale nie wszystkie parametry zachowują się tak samo jak w innych modelach.

cURL

curl https://api.moonshot.ai/v1/chat/completions \
  --header "Authorization: Bearer $MOONSHOT_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "kimi-k3",
    "reasoning_effort": "high",
    "max_completion_tokens": 8192,
    "messages": [
      {
        "role": "user",
        "content": "Przeanalizuj ten problem i zaproponuj rozwiązanie."
      }
    ]
  }'

10. Reasoning jest zawsze włączony

Kimi K3 zawsze pracuje w trybie reasoning. Nie ma parametru umożliwiającego całkowite wyłączenie tego zachowania.[9][10]

Dostępne są trzy poziomy:

low
high
max

Domyślny poziom to:

max

Dla dużej części ruchu produkcyjnego warto rozpocząć od low lub high, a max pozostawić dla najtrudniejszych zadań.

reasoning_content

Odpowiedź może zawierać osobno:

  • reasoning_content,
  • końcowe content.

W streamingu oba pola są zwracane jako oddzielne fragmenty.[9][10]

Nie należy automatycznie:

  • pokazywać reasoning użytkownikowi,
  • przechowywać go bez ograniczenia,
  • wysyłać go do systemów logowania zawierających dane osobowe,
  • traktować go jako wiarygodnego audytu procesu decyzyjnego.

Preserved Thinking

W rozmowach wieloturowych oraz przy tool calling należy przekazać do następnego requestu kompletną wiadomość asystenta:

  • reasoning_content,
  • content,
  • tool_calls.

Nie wolno pozostawiać wyłącznie końcowego content.[10]

Historyczne reasoning zajmuje kontekst i jest rozliczane tokenowo. Przy długich sesjach może znacząco podnosić koszt.

11. Limity i różnice w API

Oficjalna dokumentacja podaje kilka ważnych ograniczeń.[9]

Maksymalne wyjście

domyślnie: 131 072 tokeny
maksymalnie: 1 048 576 tokenów

Maksymalna wartość techniczna nie oznacza, że tak długie generowanie będzie tanie, szybkie lub praktyczne.

Stałe parametry generowania

Kimi K3 ma stałe wartości:

temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0

Dokumentacja zaleca pominięcie ich w requestach.

Obraz i wideo

Publiczne adresy URL obrazów nie są obsługiwane w oficjalnym API K3. Należy użyć:

  • danych base64,
  • identyfikatora pliku ms://<file-id>.

Dokumentacja pokazuje również wysyłanie plików wideo przez system plików Moonshot.[9]

Wyszukiwanie internetowe

Oficjalna funkcja web search jest aktualizowana i dokumentacja nie zaleca obecnie wykorzystywania jej w produkcyjnych workflow.[9]

To ważne przy agentach researchowych: sam model nie powinien być traktowany jako źródło aktualnych danych bez niezależnego systemu wyszukiwania i cytowania.

12. Kontekst miliona tokenów i cache

Kimi K3 obsługuje kontekst długości:

1 048 576 tokenów

Może to pomóc przy:

  • dużych repozytoriach,
  • dokumentacji przedsiębiorstwa,
  • analizie wielu plików,
  • długich sesjach agentowych,
  • przetwarzaniu wieloetapowych badań.

Automatyczne cache

Cache prefiksu działa automatycznie. Nie trzeba przekazywać identyfikatora cache ani TTL.

Warunek próby trafienia w cache jest taki, że wcześniejszy prompt musi przekraczać 256 tokenów.[9]

W praktyce należy:

  1. utrzymywać długi, niezmieniony prefiks,
  2. umieszczać zmienne pytanie na końcu,
  3. mierzyć rzeczywisty cache hit,
  4. nie zakładać, że każde kolejne zapytanie skorzysta z tańszej ceny.

Milion tokenów nie oznacza doskonałej pamięci

Maksymalna pojemność kontekstu nie gwarantuje:

  • znalezienia każdej istotnej linijki,
  • poprawnego rozstrzygnięcia sprzeczności,
  • odporności na prompt injection w dokumentach,
  • właściwego priorytetyzowania treści,
  • braku degradacji przy nadmiarze nieistotnych danych.

Duży kontekst nadal wymaga:

  • selekcji źródeł,
  • indeksowania,
  • kontroli uprawnień,
  • podziału dokumentów,
  • testów retrieval accuracy.

13. Tool calling i agentowe workflow

Kimi K3 wspiera:

  • niestandardowe narzędzia,
  • tool_choice,
  • wymuszanie użycia narzędzia,
  • structured output z JSON Schema,
  • Partial Mode,
  • dynamiczne ładowanie definicji narzędzi,
  • oficjalne narzędzia Formula.[9]

Dynamiczne narzędzia

Definicję narzędzia można dołączyć w odpowiednim miejscu historii rozmowy, dzięki czemu agent nie musi otrzymywać wszystkich narzędzi na początku.

Może to zmniejszyć:

  • długość promptu,
  • liczbę błędnych wyborów,
  • powierzchnię uprawnień,
  • ryzyko wywołania niepotrzebnej operacji.

Serwer nie przechowuje jednak definicji za klienta. Należy zachować wiadomość w późniejszej historii.

Structured output

K3 może wymuszać końcową odpowiedź zgodną z JSON Schema:

response_format = {
    "type": "json_schema",
    "json_schema": {
        "name": "finding",
        "strict": True,
        "schema": {
            "type": "object",
            "properties": {
                "severity": {
                    "type": "string",
                    "enum": ["low", "medium", "high", "critical"],
                },
                "summary": {"type": "string"},
            },
            "required": ["severity", "summary"],
            "additionalProperties": False,
        },
    },
}

Parsować należy końcowe message.content, a nie reasoning_content.[9]

14. Kimi Code i zastosowania programistyczne

Moonshot AI pozycjonuje Kimi K3 przede wszystkim jako model do:

  • długich zadań programistycznych,
  • pracy z dużymi repozytoriami,
  • koordynacji narzędzi terminalowych,
  • refaktoryzacji,
  • projektowania frontendu z wykorzystaniem zrzutów ekranu,
  • pracy przy GPU kernels, compiler development, CAD i chip design.[1][2]

Oficjalnym agentem terminalowym jest Kimi Code. Narzędzie potrafi:

  • czytać i edytować pliki,
  • wykonywać polecenia shell,
  • wyszukiwać pliki,
  • pobierać strony internetowe,
  • planować kolejne kroki na podstawie wyników,
  • pracować przez TUI,
  • integrować się z edytorami przez Agent Client Protocol.[11]

Instalacja na macOS lub Linux

curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash

Następnie:

cd /sciezka/do/projektu
kimi

W sesji można użyć:

/model

i wybrać Kimi K3.

Uprawnienia

Oficjalne materiały podają, że operacje tylko do odczytu mogą być wykonywane automatycznie, natomiast modyfikowanie plików i uruchamianie poleceń wymaga potwierdzenia w standardowej konfiguracji.[11]

W środowisku produkcyjnym nadal należy:

  • używać kontenera lub sandboxa,
  • ograniczyć sieć,
  • nie udostępniać sekretów produkcyjnych,
  • wymagać review przed merge,
  • blokować automatyczny deployment,
  • rejestrować zmiany,
  • ograniczyć zakres tokenów i czasu.

15. Jak czytać benchmarki Kimi K3?

Karta modelu publikuje szeroką tabelę obejmującą reasoning, coding, agentic tasks, office work i vision.

Wybrane oficjalnie raportowane wyniki Kimi K3 przy effort max:

Benchmark Wynik Kimi K3
GPQA Diamond 93,5
DeepSWE 67,5
ProgramBench 77,8
Terminal-Bench 2.1 88,3
FrontierSWE 81,2
SWE-Marathon 42,0
BrowseComp 91,2
MCPMark-Verified 94,5
OSWorld-Verified 84,8
AutomationBench 30,8

Dlaczego nie można zbudować prostego rankingu?

Wyniki korzystają z różnych:

  • harnessów,
  • poziomów reasoning,
  • konfiguracji agentów,
  • źródeł,
  • dat leaderboardów,
  • liczby uruchomień,
  • procedur zarządzania kontekstem.

Przykładowo w Agents’ Last Exam:

  • Kimi K3 był połączony z Kimi Code,
  • modele GPT korzystały z Codex,
  • modele Claude korzystały z Claude Code.[2]

Na części benchmarków wynik innego modelu pochodzi z zewnętrznego leaderboardu, a Kimi K3 z ewaluacji producenta. Nie jest to idealnie kontrolowane porównanie model-do-modelu.

Producent sam przyznaje, że K3 nie prowadzi wszędzie

Moonshot AI napisał, że ogólna wydajność Kimi K3 nadal ustępuje najmocniejszym modelom własnościowym Claude Fable 5 oraz GPT-5.6 Sol.[1]

W tabeli widać również, że K3:

  • wygrywa w części testów,
  • jest blisko liderów w innych,
  • przegrywa w wybranych zadaniach,
  • może mieć korzystną relację możliwości do kosztu, ale nie jest bezwarunkowo najlepszy.

Jak testować model we własnej firmie?

Zamiast kopiować jeden benchmark:

  1. przygotuj 50–200 rzeczywistych zadań,
  2. ukryj odpowiedzi wzorcowe,
  3. użyj identycznych narzędzi i limitów,
  4. porównaj kilka poziomów reasoning,
  5. mierz koszt całego ukończonego zadania,
  6. wykonaj każde zadanie kilka razy,
  7. oceniaj testy, diff i rezultat, nie styl wypowiedzi.

16. Multimodalność: tekst, obraz i wideo

Model card wymienia tekst i obraz, a dokumentacja oficjalnego API pokazuje również wejście wideo.[2][9]

Zastosowania obejmują:

  • analizę screenshotów,
  • poprawianie interfejsów,
  • interpretowanie wykresów,
  • kodowanie na podstawie referencji wizualnej,
  • analizę nagrań ekranu,
  • motion design i video editing.

Moonshot AI prezentuje przykłady, w których K3 wykorzystuje wizję do:

  • game development,
  • frontendu,
  • CAD,
  • montażu materiałów wideo.[1]

Są to demonstracje producenta, a nie gwarantowany wynik dla każdego projektu. W procesie produkcyjnym trzeba sprawdzić:

  • odczyt tekstu z UI,
  • precyzję lokalizacji elementów,
  • utrzymywanie spójności pomiędzy klatkami,
  • format wejściowy,
  • koszt dużych materiałów,
  • prywatność obrazów i nagrań.

17. Bezpieczeństwo, prywatność i governance

Otwarte wagi zmieniają model ryzyka, ale go nie usuwają.

Zalety self-hostingu

  • dane mogą pozostać w kontrolowanej infrastrukturze,
  • można wyłączyć zewnętrzną telemetrię,
  • możliwe są własne filtry i polityki,
  • organizacja kontroluje wersję modelu,
  • można ograniczyć dostęp sieciowy,
  • można prowadzić własne testy bezpieczeństwa.

Nowe obowiązki

  • zabezpieczenie klastra i endpointów,
  • izolacja tenantów,
  • monitoring nadużyć,
  • kontrola generowanego kodu,
  • ochrona wag przed nieautoryzowanym kopiowaniem,
  • aktualizacje runtime,
  • obsługa podatności w vLLM, SGLang i zależnościach,
  • zarządzanie logami i reasoning,
  • wdrożenie limitów oraz circuit breakers.

Nie ma niezależnego dowodu pełnego bezpieczeństwa

W dniu publikacji oficjalne źródła zawierają opis architektury, zastosowań i benchmarków. Nie znaleźliśmy w wykorzystanych materiałach niezależnego, kompleksowego audytu bezpieczeństwa Kimi K3 porównywalnego z pełną kartą systemową producenta albo zewnętrznym red-teamingiem.

Nie oznacza to, że model jest niebezpieczny. Oznacza, że przed wykorzystaniem w obszarach regulowanych należy wykonać własne testy:

  • prompt injection,
  • data exfiltration,
  • jailbreaks,
  • generowanie szkodliwego kodu,
  • halucynacje,
  • odporność na złośliwe dokumenty,
  • działania narzędziowe,
  • eskalacja uprawnień.

18. Self-hosting czy oficjalne API?

Kryterium Self-hosting Oficjalne API
Koszt początkowy bardzo wysoki niski
Minimalna infrastruktura klaster wielu akceleratorów brak własnego klastra
Kontrola danych najwyższa zależna od warunków usługi
Aktualizacje odpowiedzialność organizacji po stronie dostawcy
Fine-tuning pełna kontrola zależny od oferty
Skalowanie własna odpowiedzialność zarządzane
Cache własna implementacja automatyczne
Czas wdrożenia długi krótki
Licencja wymaga analizy Kimi K3 License część warunków licencyjnych wyłączona dla oficjalnych produktów
Opłacalność dla małego zespołu zwykle niska zwykle wyższa

Wybierz API, gdy:

  • dopiero testujesz model,
  • obciążenie jest zmienne,
  • nie posiadasz klastra AI,
  • potrzebujesz szybkiego wdrożenia,
  • nie planujesz modyfikowania wag,
  • dane mogą być przetwarzane zgodnie z warunkami dostawcy.

Rozważ self-hosting, gdy:

  • dane nie mogą opuszczać infrastruktury,
  • masz istniejący klaster z szybką siecią,
  • wykorzystanie jest wystarczająco duże i stałe,
  • potrzebujesz fine-tuningu,
  • musisz kontrolować wersję i polityki,
  • zespół ma doświadczenie w distributed inference.

19. Czy warto wdrożyć Kimi K3?

Tak, jeśli:

  • potrzebujesz bardzo dużego, samodzielnie hostowalnego modelu,
  • posiadasz odpowiednią infrastrukturę,
  • chcesz prowadzić badania nad modelami 3T-class,
  • budujesz provider inferencji,
  • potrzebujesz natywnej multimodalności i długiego kontekstu,
  • korzystasz z długich agentowych zadań programistycznych,
  • chcesz tworzyć własne fine-tuningi i kwantyzacje.

Niekoniecznie, jeśli:

  • zespół ma tylko pojedynczy serwer GPU,
  • potrzebujesz niskiego opóźnienia dla prostych zapytań,
  • API tańszego modelu daje wystarczającą jakość,
  • chcesz wyłączyć reasoning,
  • wymagasz całkowicie standardowej licencji Apache lub MIT,
  • potrzebujesz pełnej reprodukowalności procesu treningowego,
  • nie masz zespołu do utrzymania distributed inference.

20. Werdykt

Publikacja pełnych wag Kimi K3 jest ważnym wydarzeniem dla rynku modeli otwartych.

Moonshot AI udostępnił model o:

  • 2,8 bln parametrów,
  • 104 mld parametrów aktywnych,
  • natywnej multimodalności,
  • kontekście miliona tokenów,
  • architekturze MoE z 896 ekspertami,
  • możliwościach ukierunkowanych na coding i długie zadania agentowe.

Jednocześnie trzeba oddzielić trzy różne fakty:

  1. Kimi K3 został zaprezentowany wcześniej.
  2. 27 lipca opublikowano pełne wagi i materiały techniczne.
  3. Model jest open-weight na własnej licencji, a nie bezspornie Open Source AI według definicji OSI.

Dla społeczności badawczej i dostawców inferencji publikacja jest bardzo wartościowa. Dla typowej firmy możliwość pobrania wag nie oznacza jeszcze opłacalnego wdrożenia. Rozmiar 1,56 TB i zalecenie co najmniej 64 akceleratorów sprawiają, że Kimi K3 jest projektem infrastrukturalnym, a nie modelem instalowanym jednym poleceniem na zwykłym serwerze.

Najbardziej rozsądna strategia wygląda następująco:

Najpierw:
POC przez oficjalne API

Następnie:
pomiar jakości, kosztu, opóźnienia i ryzyka

Dopiero później:
analiza self-hostingu, licencji i klastra

Kimi K3 nie jest automatycznie najlepszym modelem dla każdej firmy. Jest jednak jednym z najważniejszych publicznie dostępnych modeli z otwartymi wagami pod względem skali i może znacząco przyspieszyć rozwój niezależnej inferencji, kwantyzacji i badań nad modelami MoE.

21. Checklista przed wdrożeniem

Terminologia i licencja

  • W dokumentacji użyto określenia open-weight.
  • Zachowano treść licencji i copyright.
  • Dział prawny przeanalizował Kimi K3 License.
  • Ustalono, czy system jest Model as a Service.
  • Sprawdzono próg 20 mln USD przychodu w 12 miesięcy.
  • Sprawdzono próg 100 mln MAU.
  • Sprawdzono próg 20 mln USD miesięcznego przychodu.
  • Ustalono, czy nazwa Kimi K3 musi być widoczna w UI.
  • Udokumentowano, czy zastosowanie jest wyłącznie wewnętrzne.

Infrastruktura

  • Zweryfikowano rozmiar około 1,56 TB.
  • Zaplanowano pobranie 96 shardów.
  • Sprawdzono integralność pobranych plików.
  • Wybrano vLLM, SGLang albo TokenSpeed.
  • Przygotowano wystarczającą pamięć akceleratorów.
  • Zapewniono szybkie połączenia pomiędzy urządzeniami.
  • Zaplanowano expert parallelism.
  • Oszacowano KV cache dla wymaganej długości kontekstu.
  • Dodano monitoring GPU, sieci i pamięci.
  • Przygotowano procedurę aktualizacji runtime.

API i agent

  • Użyto modelu kimi-k3.
  • Wybrano właściwy reasoning_effort.
  • Nie próbuje się wyłączać reasoning.
  • Przekazywana jest pełna historia reasoning_content.
  • Ustawiono rozsądny max_completion_tokens.
  • Nie wysyła się stałych parametrów sampling.
  • Obrazy są wysyłane jako base64 albo ms://.
  • Web search nie jest używany jako krytyczna funkcja produkcyjna.
  • Tool calls są walidowane przed wykonaniem.
  • Structured output jest sprawdzany schematem.

Bezpieczeństwo

  • Model działa w sandboxie.
  • Narzędzia mają minimalne uprawnienia.
  • Zablokowano automatyczny dostęp do produkcji.
  • Sekrety nie trafiają do promptów i logów.
  • Reasoning nie jest niepotrzebnie logowany.
  • Przetestowano prompt injection.
  • Przetestowano złośliwe dokumenty i obrazy.
  • Dodano limity kosztu, czasu i liczby wywołań.
  • Zdefiniowano human approval dla działań destrukcyjnych.
  • Wyniki generowanego kodu przechodzą testy i review.

Ewaluacja

  • Przygotowano własny zestaw zadań.
  • Porównano co najmniej trzy modele.
  • Użyto identycznego harnessa.
  • Wykonano kilka prób na zadanie.
  • Mierzony jest koszt całego zadania.
  • Mierzony jest czas do poprawnego rezultatu.
  • Sprawdzono code review i refaktoryzację.
  • Sprawdzono multimodalność.
  • Sprawdzono długi kontekst.
  • Zweryfikowano halucynacje i cytowania.

22. Powiązane materiały POLPROG

Wcześniejsze porównania Kimi K3 publikowane przed 27 lipca mogły poprawnie informować, że pełne wagi nie były jeszcze dostępne. Od dzisiaj ten stan się zmienił.

AI Moonshot AI Kimi K3 Open Weights LLM

Najczęściej zadawane pytania

Czy Kimi K3 został dzisiaj wydany?

Nie w całości. Sam model, produkty i API były dostępne wcześniej. 27 lipca 2026 roku opublikowano pełne wagi, kod, licencję i raport techniczny.

Czy Kimi K3 jest open source?

Moonshot AI używa tego określenia. Precyzyjniej jest nazywać go modelem open-weight udostępnionym na własnej licencji Kimi K3 License. Nie spełnia bezspornie wszystkich kryteriów Open Source AI przyjętych przez OSI.

Czy wagi naprawdę można już pobrać?

Tak. Oficjalne repozytorium Hugging Face ma około 1,56 TB i zawiera 96 głównych shardów Safetensors.

Ile parametrów ma Kimi K3?

2,8 bln parametrów łącznie i 104 mld aktywowanych parametrów.

Czy model uruchomi się na jednym GPU?

Nie w oficjalnej pełnej wersji. Producent zaleca konfiguracje supernode z co najmniej 64 akceleratorami.

Czy można używać Kimi K3 komercyjnie?

Tak, ale należy przestrzegać Kimi K3 License. Niektóre duże firmy oferujące Model as a Service muszą zawrzeć osobną umowę, a duże produkty mogą mieć obowiązek widocznego oznaczenia Kimi K3.

Czy licencja wymaga nazwy Kimi K3 w każdym produkcie?

Nie. Obowiązek dotyczy komercyjnych produktów lub usług przekraczających 100 mln MAU albo 20 mln USD miesięcznego przychodu, z wyjątkami opisanymi w licencji.

Ile kosztuje API?

0,30 USD za milion tokenów wejściowych przy trafieniu w cache, 3 USD przy braku trafienia oraz 15 USD za milion tokenów wyjściowych.

Czy można wyłączyć reasoning?

Nie. Można zmienić effort na `low`, `high` lub `max`, ale thinking pozostaje aktywny.

Czy Kimi K3 obsługuje obraz i wideo?

Tak. Karta modelu potwierdza obraz, a oficjalna dokumentacja API zawiera również wejście wideo.

Czy milion tokenów oznacza, że model przeczyta całe repozytorium bez błędów?

Nie. Jest to maksymalna pojemność kontekstu, a nie gwarancja idealnego odnajdywania i interpretowania każdej informacji.

Czy Kimi K3 jest lepszy od Claude Fable 5 i GPT-5.6 Sol?

Nie we wszystkich zadaniach. Moonshot AI sam wskazuje, że ogólna wydajność K3 nadal ustępuje tym najmocniejszym modelom własnościowym, mimo bardzo mocnych wyników w części benchmarków.

Czy warto od razu budować własny klaster?

Zwykle nie. Najpierw warto wykonać POC przez API i policzyć jakość, koszt oraz rzeczywiste obciążenie.

---

Źródła i przypisy

  1. Moonshot AI, Kimi K3: Open Frontier Intelligence12345678
  2. Moonshot AI, Kimi K3 Model Card na Hugging Face1234567891011
  3. MoonshotAI, oficjalne repozytorium Kimi-K312
  4. Moonshot AI, Kimi K3 License123456
  5. Open Source Initiative, Open Weights: not quite what you’ve been told123
  6. Open Source Initiative, Open Source AI Definition 1.01234
  7. MoonshotAI, Kimi K3 Technical Report
  8. Moonshot AI, pliki modelu Kimi-K3 na Hugging Face
  9. Kimi API Platform, Kimi K3 Quickstart12345678910
  10. Kimi API Platform, Thinking Models123
  11. MoonshotAI, Kimi Code CLI12

Czy ten artykuł był pomocny?

Nowe artykuły na e-mail

Jeden krótki e-mail przy każdym nowym artykule. Bez spamu, wypisujesz się jednym kliknięciem.

Wykorzystujemy e-mail wyłącznie do wysyłki nowych artykułów. Bez udostępniania stronom trzecim.

Wróć do bazy wiedzy