Moonshot AI publie les poids de Kimi K3: 2,8 billions de paramètres, licence, exigences et benchmarks Skip to content

Apprentissage

Un savoir-faire pratique sur le frontend, les outils d'IA et le développement logiciel.

Moonshot AI publie les poids de Kimi K3: 2,8 billions de paramètres, licence, exigences et benchmarks

Publié: 21 min de lecture Rédigé par: AI Tools

Le 27 juillet 2026, Moonshot AI a publié les poids complets de <strong>Kimi K3</strong>, un dépôt de code, sa propre licence et un rapport technique. Il ne s’agit pas du jour de lancement du modèle lui-même. Kimi K3 avait été présenté plus tôt en juillet et était déjà disponible via Kimi.com, Kimi Work, Kimi Code et l’API. La nouveauté est la possibilité de télécharger et de déployer soi-même les poids.

Kimi K3 est un modèle Mixture-of-Experts nativement multimodal avec :

  • 2,8 billions de paramètres au total,
  • 104 milliards de paramètres activés pour chaque token,
  • 896 experts, dont 16 sont sélectionnés,
  • un contexte de 1 048 576 tokens,
  • la prise en charge du texte, des images et, selon la documentation API, de la vidéo,
  • un dépôt d’environ 1,56 To.[2][3]

Moonshot AI qualifie Kimi K3 de modèle open source. Au sens strict de l’Open Source Initiative, open-weight est toutefois plus précis. Les paramètres finaux, le code et la documentation sont publiés, mais Kimi K3 utilise une licence spécifique comportant des conditions supplémentaires pour certains usages commerciaux. La disponibilité des poids ne garantit pas non plus la transparence complète du processus et des données d’entraînement exigée par l’Open Source AI Definition.[4][5][6]

Conclusion principale : Kimi K3 peut réellement être téléchargé, modifié, fine-tuné et auto-hébergé, mais une entreprise moyenne ne le fera pas fonctionner sur un seul serveur GPU. La publication ouvre des possibilités importantes pour la recherche et l’infrastructure, tandis que l’échelle du modèle et sa licence nécessitent une analyse approfondie avant la production.

Tous les paramètres, tarifs, termes de licence et informations de disponibilité ont été vérifiés le 27 juillet 2026.

TL;DR

Question Réponse
Que s’est-il passé le 27 juillet ? Publication des poids complets, du dépôt, de la licence et du rapport technique
Le modèle a-t-il été lancé ce jour-là ? Non, le modèle et l’API existaient déjà
Kimi K3 est-il open source ? Moonshot emploie ce terme, mais open-weight sous licence spécifique est plus précis
Combien de paramètres ? 2,8 billions au total, 104 milliards actifs
Quelle architecture ? MoE, KDA, Gated MLA, AttnRes et Stable LatentMoE
Combien d’experts ? 896, dont 16 par token, plus 2 experts partagés
Quelle longueur de contexte ? 1 048 576 tokens
Quelle taille de fichiers ? Environ 1,56 To
Combien de shards principaux ? 96 fichiers Safetensors
Peut-on l’exécuter localement ? Techniquement oui, mais pas sur un PC ordinaire ou un seul GPU
Que recommande le fournisseur ? Des supernodes avec au moins 64 accélérateurs
L’usage commercial est-il permis ? Oui, sous réserve de la Kimi K3 License
Prix de l’API officielle ? 0,30 USD/MTok avec cache hit, 3 USD/MTok avec cache miss, 15 USD/MTok output
Peut-on désactiver le reasoning ? Non
Niveaux de reasoning ? low, high, max, avec max par défaut
Les benchmarks sont-ils indépendants ? Non, une partie vient de Moonshot AI

1. Qu’a publié Moonshot AI ?

Le dépôt officiel moonshotai/Kimi-K3 sur Hugging Face contient :

  • les poids complets,
  • la configuration du modèle,
  • le code de chargement et de traitement des entrées,
  • le tokenizer et les fichiers de processeur,
  • des exemples Transformers, vLLM et SGLang,
  • la model card,
  • la Kimi K3 License.[2]

Le dépôt GitHub officiel comprend également :

  • le code et la documentation,
  • le rapport k3_tech_report.pdf,
  • les instructions de déploiement,
  • la description de l’architecture et des évaluations.[3][7]

Le dépôt de poids mesure environ 1,56 To. Les paramètres sont répartis dans 96 fichiers Safetensors, de :

model-00001-of-000096.safetensors

à :

model-00096-of-000096.safetensors

La plupart des shards pèsent environ 16,6 à 17 Go.[8]

Il ne s’agit pas d’une promesse future : les fichiers sont présents et téléchargeables.

2. Open source ou open-weight ?

Moonshot AI emploie les expressions :

  • « open model »,
  • « open-source model »,
  • « Open Frontier Weights ».

La model card Hugging Face parle explicitement d’un modèle open-weight.[2]

Que sont les poids ouverts ?

Les poids sont les paramètres finaux appris pendant l’entraînement. Leur publication permet de :

  • exécuter le modèle hors de l’infrastructure du fournisseur,
  • le fine-tuner,
  • créer des quantifications,
  • analyser son comportement,
  • construire des serveurs d’inférence,
  • l’intégrer sans envoyer les prompts à l’API officielle.

Elle ne rend pas automatiquement reproductible tout le processus de création.

Pourquoi l’OSI distingue-t-elle open weights et Open Source AI ?

L’Open Source Initiative explique que les poids seuls ne donnent pas un accès complet :

  • aux données ou informations suffisamment détaillées sur les données,
  • au code complet de préparation,
  • à la configuration d’entraînement,
  • aux éléments nécessaires pour reproduire un système substantiellement équivalent.[5][6]

L’Open Source AI Definition exige la liberté de :

  1. utiliser,
  2. étudier,
  3. modifier,
  4. partager,

ainsi que l’accès à la forme privilégiée nécessaire pour modifier réellement le système.[6]

La Kimi K3 License est-elle approuvée par l’OSI ?

Le dépôt utilise une Kimi K3 License spécifique, et non Apache-2.0, MIT ou une autre licence standard approuvée par l’OSI.

Elle accorde des droits étendus pour :

  • utiliser,
  • copier,
  • modifier,
  • publier,
  • distribuer,
  • sous-licencier,
  • vendre,
  • déployer,
  • fine-tuner,
  • créer des œuvres dérivées.[4]

Elle impose toutefois des conditions supplémentaires à certaines entités commerciales. La formulation la plus sûre est donc :

Kimi K3 est un modèle open-weight publié sous la Kimi K3 License.

Cela ne signifie pas qu’il est « fermé », mais le terme open source nécessite ici des réserves juridiques et techniques.

3. Paramètres techniques principaux

Paramètre Kimi K3
Architecture Mixture-of-Experts
Paramètres totaux 2,8 billions
Paramètres activés 104 milliards
Couches 93
Couches dense 1
Couches d’attention 69 KDA + 24 Gated MLA
Experts 896
Experts sélectionnés par token 16
Experts partagés 2
Vocabulaire 160 000
Contexte 1 048 576 tokens
Encodeur d’image MoonViT-V2
Paramètres vision 401 millions
Poids MXFP4
Activations MXFP8
Modalités de la model card texte et image
Modalité API supplémentaire vidéo
Taille du dépôt environ 1,56 To
Shards Safetensors 96

Ces données viennent de la model card officielle.[2]

2,8 billions ne signifie pas 2,8 billions actifs

Kimi K3 est un modèle MoE. Il n’utilise pas tous les experts pour chaque token.

Le routeur choisit 16 experts sur 896 et la documentation indique 104 milliards de paramètres activés. Cela augmente la capacité sans reproduire exactement le coût de calcul d’un modèle dense de 2,8T.

Les coûts matériels ne deviennent pas ceux d’un modèle 100B classique : tous les poids doivent encore être stockés et distribués.

4. KDA, AttnRes et Stable LatentMoE

Kimi Delta Attention

KDA est un mécanisme hybride de linear attention destiné aux longues séquences.

Le modèle comprend :

  • 69 couches KDA,
  • 24 couches Gated MLA.[2]

La linear attention peut réduire une partie du coût de la full attention sur de longs contextes. Elle ne rend pas un contexte d’un million de tokens bon marché.

Attention Residuals

AttnRes modifie la circulation des représentations entre les couches. Selon Moonshot AI, le mécanisme récupère sélectivement des informations à différentes profondeurs plutôt que de les accumuler uniformément.[1]

Stable LatentMoE

Stable LatentMoE permet d’augmenter le nombre d’experts et d’en activer 16 sur 896. Moonshot AI affirme que l’ensemble architecture, entraînement et données apporte une amélioration d’environ 2,5× de l’efficacité générale de scaling par rapport à Kimi K2.[1][2]

Il s’agit d’une affirmation du fournisseur, pas d’une promesse d’API 2,5× plus rapide ou moins chère.

MXFP4 natif

Kimi K3 a été entraîné en tenant compte de la quantification dès la phase de supervised fine-tuning :

MXFP4 pour les poids
MXFP8 pour les activations

L’objectif est de réduire la mémoire et de faciliter le déploiement.[2] Le dépôt reste néanmoins proche de 1,56 To.

5. Peut-on exécuter Kimi K3 localement ?

Oui, si « localement » signifie dans une infrastructure privée adaptée.

La version complète n’est pas destinée à :

  • un ordinateur portable,
  • une workstation avec GPU grand public,
  • un serveur unique avec quelques GPU,
  • un petit homelab.

Moonshot AI recommande des supernodes d’au moins 64 accélérateurs. Il faut prendre en compte :

  • les poids,
  • le KV cache,
  • le contexte d’un million de tokens,
  • les communications entre experts,
  • l’expert parallelism,
  • la bande passante réseau,
  • le prefix cache,
  • la réserve mémoire.[1]

Mémoire réelle

Les poids quantifiés occupent déjà environ 1,56 To. S’ajoutent :

  • overhead du framework,
  • caches,
  • activations,
  • buffers de communication,
  • système d’exploitation,
  • marge de concurrence.

Diviser 1,56 To par la mémoire d’une carte ne donne pas une architecture de production complète.

Moteurs recommandés

La model card cite :

  • vLLM,
  • SGLang,
  • TokenSpeed.[2]

Hugging Face montre également Transformers et Docker Model Runner. La commande :

vllm serve "moonshotai/Kimi-K3"

ne garantit pas un fonctionnement sur n’importe quel matériel.

Public concerné

  • hyperscalers,
  • fournisseurs d’inférence,
  • laboratoires,
  • grandes entreprises disposant déjà d’un cluster,
  • organisations traitant des données extrêmement sensibles,
  • acteurs créant fine-tunes et quantifications,
  • fournisseurs de services d’inférence à grande échelle.

Pour la majorité des équipes, l’API officielle sera plus économique.

6. Que permet la licence ?

La Kimi K3 License permet gratuitement de :

  • utiliser,
  • copier,
  • modifier,
  • fusionner,
  • publier et distribuer,
  • sous-licencier,
  • vendre des copies,
  • exécuter et déployer,
  • fine-tuner,
  • créer des solutions dérivées.[4]

La notice de copyright et la licence doivent être conservées.

Condition Model as a Service

La licence définit Model as a Service comme une fourniture d’inférence ou de fine-tuning à un tiers lui donnant un contrôle important sur les entrées, paramètres ou données d’entraînement.

Si le licencié ou ses entités affiliées :

  1. exploite une activité Model as a Service,
  2. dépasse 20 millions USD de chiffre d’affaires cumulé sur toute période consécutive de 12 mois,

un accord distinct avec Moonshot AI est nécessaire avant l’usage commercial.[4]

Le seuil concerne le chiffre d’affaires total du licencié et de ses affiliés, pas seulement celui généré par Kimi K3.

Affichage du nom Kimi K3

Si le modèle ou un dérivé est utilisé dans un produit ou service commercial comptant :

  • plus de 100 millions d’utilisateurs actifs mensuels, ou
  • plus de 20 millions USD de chiffre d’affaires mensuel,

le nom « Kimi K3 » doit être affiché de façon visible dans l’interface.[4]

Exceptions

Les conditions MaaS et d’attribution ne s’appliquent pas :

  • à un usage interne sans exposition à des tiers,
  • aux produits officiels Moonshot AI,
  • aux partenaires d’inférence certifiés.[4]

Vérification entreprise

Il faut documenter :

  • usage interne ou externe,
  • contrôle donné au client,
  • chiffre d’affaires du groupe,
  • seuils MAU et revenus,
  • obligation d’attribution,
  • besoin d’un accord séparé.

Cet article n’est pas un conseil juridique.

7. Qu’est-ce qui n’a pas été publié ?

Les éléments publiés comprennent :

  • les poids finaux,
  • une partie du code,
  • la configuration de l’architecture,
  • le code d’inférence et de traitement,
  • une description technique,
  • les résultats d’évaluation.

Ils ne démontrent pas que le dataset complet et tous les détails nécessaires à une reproduction indépendante de l’entraînement sont disponibles.

Kimi K3 est beaucoup plus ouvert qu’une API fermée, mais ne fournit pas une reproductibilité complète au sens de l’OSI.[5][6]

8. API et prix

Identifiant :

kimi-k3

L’API officielle est compatible avec OpenAI Chat Completions.

Tarifs

Type de token Prix par million
Input avec cache hit 0,30 USD
Input avec cache miss 3,00 USD
Output 15,00 USD

Les prix viennent de Moonshot AI et peuvent exclure les taxes.[1]

Moonshot AI indique plus de 90 % de cache hit sur des workloads de programmation. Ce n’est pas une garantie pour chaque client.[1]

Recharge minimale

L’accès API est ouvert après une recharge réussie d’au moins 1 USD. Le niveau et les limites dépendent du total rechargé.[9]

9. Premier appel Python

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="high",
    max_completion_tokens=8_192,
    messages=[
        {
            "role": "user",
            "content": (
                "Analyse l’architecture du projet et prépare "
                "un plan de migration sécurisé."
            ),
        }
    ],
)

message = response.choices[0].message
print(message.content)

cURL

curl https://api.moonshot.ai/v1/chat/completions \
  --header "Authorization: Bearer $MOONSHOT_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "model": "kimi-k3",
    "reasoning_effort": "high",
    "max_completion_tokens": 8192,
    "messages": [
      {
        "role": "user",
        "content": "Analyse ce problème et propose une solution."
      }
    ]
  }'

10. Le reasoning est toujours actif

Kimi K3 fonctionne toujours en mode reasoning. Aucun paramètre ne permet de le désactiver totalement.[9][10]

Niveaux :

low
high
max

Par défaut :

max

Pour beaucoup de trafic de production, il faut d’abord tester low ou high.

reasoning_content

La réponse peut contenir séparément :

  • reasoning_content,
  • le content final.

En streaming, les deux arrivent dans des fragments distincts.[9][10]

Il ne faut pas automatiquement :

  • afficher le reasoning à l’utilisateur,
  • le conserver sans limite,
  • l’envoyer vers des logs contenant des données personnelles,
  • le considérer comme un audit fiable.

Preserved Thinking

Dans les conversations multi-tours et le tool calling, la requête suivante doit conserver :

  • reasoning_content,
  • content,
  • tool_calls.

Garder seulement le content final est insuffisant.[10]

Le reasoning historique consomme du contexte et des tokens facturés.

11. Limites et différences API

Output maximal

par défaut : 131 072 tokens
maximum : 1 048 576 tokens

La limite technique ne garantit ni faible coût ni faible latence.

Paramètres fixes

temperature = 1.0
top_p = 0.95
n = 1
presence_penalty = 0
frequency_penalty = 0

La documentation recommande de les omettre.

Image et vidéo

Les URL publiques d’images ne sont pas prises en charge. Il faut utiliser :

  • base64,
  • ms://<file-id>.

La documentation montre aussi l’envoi de vidéos via le système de fichiers Moonshot.[9]

Recherche web

La fonction officielle est en cours de mise à jour et n’est pas recommandée actuellement pour les workflows de production.[9]

12. Contexte d’un million de tokens et cache

1 048 576 tokens

Cela peut aider pour :

  • grands dépôts,
  • documentation d’entreprise,
  • nombreux fichiers,
  • agents de longue durée,
  • recherche en plusieurs étapes.

Cache automatique

Le prefix cache fonctionne automatiquement. Aucun identifiant ou TTL n’est nécessaire.

Le prompt précédent doit dépasser 256 tokens pour qu’un cache hit puisse être tenté.[9]

Il faut maintenir un préfixe stable, placer la question variable à la fin et mesurer le cache réel.

Un million de tokens ne garantit pas une mémoire parfaite, une récupération exhaustive ou une résistance aux prompt injections.

13. Tool calling et agents

Kimi K3 prend en charge :

  • outils personnalisés,
  • tool_choice,
  • usage forcé,
  • structured output avec JSON Schema,
  • Partial Mode,
  • définition dynamique des outils,
  • outils Formula.[9]

Outils dynamiques

Une définition peut être insérée plus tard dans l’historique afin de réduire la longueur, les erreurs de sélection et la surface de permissions.

Le serveur ne la conserve pas pour le client. Le message doit rester dans l’historique futur.

Structured output

response_format = {
    "type": "json_schema",
    "json_schema": {
        "name": "finding",
        "strict": True,
        "schema": {
            "type": "object",
            "properties": {
                "severity": {
                    "type": "string",
                    "enum": ["low", "medium", "high", "critical"],
                },
                "summary": {"type": "string"},
            },
            "required": ["severity", "summary"],
            "additionalProperties": False,
        },
    },
}

Il faut parser message.content, pas reasoning_content.[9]

14. Kimi Code et développement

Moonshot AI positionne K3 pour :

  • longues tâches de programmation,
  • grands dépôts,
  • coordination d’outils terminal,
  • refactoring,
  • frontend à partir de captures,
  • GPU kernels, compilateurs, CAD et conception de puces.[1][2]

Kimi Code peut :

  • lire et modifier des fichiers,
  • exécuter des commandes,
  • rechercher,
  • récupérer des pages web,
  • planifier,
  • fonctionner dans un TUI,
  • s’intégrer aux éditeurs via Agent Client Protocol.[11]

Installation

curl -fsSL https://code.kimi.com/kimi-code/install.sh | bash
cd /chemin/du/projet
kimi

Puis :

/model

et sélectionner Kimi K3.

Les opérations read-only peuvent être automatiques, alors que les modifications et commandes nécessitent une confirmation dans la configuration standard.[11]

Sandbox, moindre privilège, protection des secrets, review et interdiction de déploiement automatique restent nécessaires.

15. Comment lire les benchmarks ?

Résultats officiels sélectionnés avec effort max :

Benchmark Kimi K3
GPQA Diamond 93,5
DeepSWE 67,5
ProgramBench 77,8
Terminal-Bench 2.1 88,3
FrontierSWE 81,2
SWE-Marathon 42,0
BrowseComp 91,2
MCPMark-Verified 94,5
OSWorld-Verified 84,8
AutomationBench 30,8

On ne peut pas créer un classement simple, car diffèrent :

  • harnesses,
  • niveaux de reasoning,
  • agents,
  • sources,
  • dates des leaderboards,
  • nombre de runs,
  • gestion du contexte.

Dans Agents’ Last Exam, Kimi K3 utilisait Kimi Code, GPT utilisait Codex et Claude utilisait Claude Code.[2]

Moonshot AI reconnaît que la performance générale de K3 reste inférieure à Claude Fable 5 et GPT-5.6 Sol.[1]

Un POC doit utiliser 50 à 200 tâches internes, des outils identiques, plusieurs exécutions et mesurer le coût par tâche réussie.

16. Multimodalité

La model card confirme texte et image. L’API montre aussi la vidéo.[2][9]

Cas d’usage :

  • analyse de screenshots,
  • correction UI,
  • graphiques,
  • code depuis une référence visuelle,
  • enregistrements d’écran,
  • motion design et montage.

Les démonstrations fournisseur ne garantissent pas les résultats. Il faut tester lecture de texte, localisation, cohérence entre frames, coût et confidentialité.

17. Sécurité, confidentialité et gouvernance

Avantages de l’auto-hébergement

  • données dans l’infrastructure contrôlée,
  • télémétrie externe désactivable,
  • filtres et politiques internes,
  • contrôle de version,
  • restriction réseau,
  • tests de sécurité propres.

Responsabilités

  • sécuriser cluster et endpoints,
  • isoler les tenants,
  • surveiller les abus,
  • valider le code généré,
  • protéger les poids,
  • maintenir le runtime,
  • gérer les vulnérabilités vLLM/SGLang,
  • gouverner logs et reasoning,
  • limiter charge et coûts.

Les sources utilisées ne contiennent pas d’audit indépendant et complet de Kimi K3. Les environnements régulés doivent tester prompt injection, exfiltration, jailbreaks, code malveillant, hallucinations, documents piégés et escalade d’outils.

18. Auto-hébergement ou API ?

Critère Auto-hébergement API officielle
Coût initial très élevé faible
Infrastructure cluster multi-accélérateurs aucun cluster
Contrôle des données maximal selon les conditions
Mises à jour responsabilité interne gérées
Fine-tuning contrôle total selon l’offre
Scaling responsabilité interne géré
Cache implémentation interne automatique
Délai long court
Licence analyse requise exceptions pour produits officiels
Petite équipe souvent peu rentable généralement plus rentable

Choisir l’API pour le POC, la charge variable et le déploiement rapide. Envisager l’auto-hébergement pour des données strictement internes, un cluster existant, un usage stable et une équipe d’inférence distribuée.

19. Faut-il déployer Kimi K3 ?

Oui, si :

  • un très grand modèle auto-hébergeable est nécessaire,
  • l’infrastructure existe,
  • la recherche sur les modèles 3T est un objectif,
  • vous construisez un fournisseur d’inférence,
  • la multimodalité et le long contexte sont importants,
  • les tâches agentiques longues dominent,
  • vous voulez créer fine-tunes et quantifications.

Pas forcément, si :

  • l’équipe ne possède qu’un serveur GPU,
  • les requêtes simples exigent une faible latence,
  • une API moins chère suffit,
  • il faut désactiver le reasoning,
  • une licence Apache ou MIT est obligatoire,
  • la reproductibilité complète de l’entraînement est exigée,
  • aucune équipe distributed inference n’existe.

20. Verdict

La publication des poids complets de Kimi K3 est importante pour le marché des modèles ouverts.

Le modèle propose :

  • 2,8 billions de paramètres,
  • 104 milliards actifs,
  • multimodalité native,
  • contexte d’un million de tokens,
  • architecture MoE à 896 experts,
  • orientation coding et tâches agentiques longues.

Trois faits doivent rester distincts :

  1. Kimi K3 avait été présenté auparavant.
  2. Les poids et documents techniques ont été publiés le 27 juillet.
  3. Il s’agit d’un modèle open-weight sous licence spécifique, pas indiscutablement Open Source AI selon l’OSI.

Pour la recherche et les fournisseurs d’inférence, la publication est très précieuse. Pour une entreprise ordinaire, 1,56 To et au moins 64 accélérateurs en font un projet d’infrastructure.

Approche recommandée :

D’abord :
POC via l’API officielle

Ensuite :
mesurer qualité, coût, latence et risque

Puis seulement :
étudier auto-hébergement, licence et cluster

21. Checklist avant déploiement

Terminologie et licence

  • Le terme open-weight est utilisé.
  • Licence et copyright sont conservés.
  • Le service juridique a validé la licence.
  • Le statut MaaS est déterminé.
  • Le seuil de 20 M USD sur 12 mois est vérifié.
  • Le seuil de 100 M MAU est vérifié.
  • Le seuil de 20 M USD mensuels est vérifié.
  • L’obligation d’affichage est déterminée.
  • L’usage interne est documenté.

Infrastructure

  • Taille de 1,56 To confirmée.
  • Téléchargement de 96 shards planifié.
  • Intégrité vérifiée.
  • vLLM, SGLang ou TokenSpeed choisi.
  • Mémoire accélérateurs suffisante.
  • Interconnexions rapides.
  • Expert parallelism planifié.
  • KV cache dimensionné.
  • Monitoring GPU/réseau/mémoire.
  • Procédure de mise à jour runtime.

API et agent

  • Modèle kimi-k3.
  • reasoning_effort adapté.
  • Pas de tentative de désactivation.
  • Historique reasoning_content complet.
  • Limite max_completion_tokens.
  • Paramètres sampling fixes non envoyés.
  • Images en base64 ou ms://.
  • Web search non critique.
  • Tool calls validés.
  • JSON Schema validé.

Sécurité

  • Sandbox.
  • Moindre privilège.
  • Pas d’accès production automatique.
  • Aucun secret dans prompts/logs.
  • Reasoning non journalisé inutilement.
  • Prompt injection testé.
  • Documents malveillants testés.
  • Limites de coût, temps et outils.
  • Human approval pour actions destructrices.
  • Tests et review du code.

Évaluation

  • Dataset interne.
  • Au moins trois modèles.
  • Harness identique.
  • Plusieurs runs.
  • Coût total par tâche.
  • Temps jusqu’au résultat correct.
  • Code review et refactoring.
  • Multimodalité.
  • Long contexte.
  • Hallucinations et citations.

22. Contenus POLPROG associés

Les comparatifs antérieurs au 27 juillet pouvaient correctement indiquer que les poids complets n’étaient pas disponibles. La situation a changé.

AI Moonshot AI Kimi K3 Open Weights LLM

Questions fréquentes

Kimi K3 a-t-il été publié aujourd’hui ?

Pas entièrement. Le modèle et l’API existaient déjà. Les poids, le code, la licence et le rapport ont été publiés le 27 juillet.

Est-il open source ?

Moonshot emploie ce terme. Open-weight sous Kimi K3 License est plus précis. Le modèle ne satisfait pas indiscutablement tous les critères OSI.

Les poids sont-ils vraiment téléchargeables ?

Oui. Le dépôt mesure environ 1,56 To et contient 96 shards Safetensors.

Combien de paramètres ?

2,8 billions au total et 104 milliards activés.

Fonctionne-t-il sur un GPU ?

Pas dans sa version complète officielle. Le fournisseur recommande au moins 64 accélérateurs.

L’usage commercial est-il autorisé ?

Oui, sous réserve de la licence. Certains grands fournisseurs MaaS doivent signer un accord séparé et de grands produits peuvent devoir afficher Kimi K3.

Faut-il afficher Kimi K3 partout ?

Non. L’obligation concerne les produits au-dessus de 100 millions de MAU ou 20 millions USD mensuels, sous réserve des exceptions.

Prix API ?

0,30 USD par million de tokens input avec cache hit, 3 USD avec cache miss, 15 USD par million de tokens output.

Peut-on désactiver le reasoning ?

Non. `low`, `high` et `max` changent l’effort.

Images et vidéo ?

Oui. La model card confirme l’image et la documentation API montre la vidéo.

Un million de tokens garantit-il la lecture parfaite d’un dépôt ?

Non. C’est une capacité maximale, pas une garantie de retrieval parfait.

Est-il meilleur que Claude Fable 5 ou GPT-5.6 Sol ?

Pas dans tous les cas. Moonshot AI indique que la performance générale reste derrière ces modèles propriétaires.

Faut-il construire un cluster immédiatement ?

Généralement non. Commencez par un POC API.

---

Sources et notes

  1. Moonshot AI, Kimi K3: Open Frontier Intelligence1234567
  2. Moonshot AI, Kimi K3 Model Card sur Hugging Face1234567891011
  3. MoonshotAI, dépôt officiel Kimi-K312
  4. Moonshot AI, Kimi K3 License123456
  5. Open Source Initiative, Open Weights: not quite what you’ve been told123
  6. Open Source Initiative, Open Source AI Definition 1.01234
  7. MoonshotAI, Kimi K3 Technical Report
  8. Moonshot AI, fichiers Kimi-K3 sur Hugging Face
  9. Kimi API Platform, Kimi K3 Quickstart123456789
  10. Kimi API Platform, Thinking Models123
  11. MoonshotAI, Kimi Code CLI12

Cela vous a-t-il été utile ?

Recevez les nouveaux articles par e-mail

Un court e-mail par nouvel article d'apprentissage. Pas de spam, désinscription en un clic.

Nous utilisons uniquement votre e-mail pour envoyer de nouveaux articles. Aucun partage avec des tiers.

Retour à l'apprentissage