Open source · Modèles

Kimi K3 : le plus gros modèle open source du monde sort aujourd'hui (2 800 milliards de paramètres)

27 juillet 2026 · 6 min de lecture

Le robot-astronaute violet de saisir.ai, coiffé de son casque à cerveau lumineux, plante un drapeau menthe au sommet d'une tour de livres ouverts, entouré d'un pinceau, un engrenage, un disque et une plante, sur fond creme aquarelle.

Kimi K3, le modèle de la startup chinoise Moonshot AI, devient aujourd'hui le plus grand modèle open source téléchargeable au monde avec 2 800 milliards de paramètres. Ses poids sont publiés le 27 juillet 2026, onze jours après l'annonce de ses spécifications. Sur les benchmarks indépendants, il talonne les modèles fermés les plus chers pour une fraction de leur prix.

Ce qu'est Kimi K3

Kimi K3 est un modèle de langage multimodal (texte et images en entrée, texte en sortie) développé par Moonshot AI, une startup chinoise fondée par Yang Zhilin (ancien chercheur chez Google et Meta). La société est surtout connue pour Kimi, son assistant IA grand public populaire en Chine.

Le modèle a été annoncé le 16 juillet 2026, mais ses poids (les fichiers qui permettent de le faire tourner soi-même) ne sont disponibles qu'aujourd'hui, 27 juillet. Jusque-là, seules les spécifications et les scores annoncés par Moonshot étaient publics. Aujourd'hui, n'importe qui peut télécharger le modèle, le tester et vérifier les chiffres.

Les chiffres-clés

CaractéristiqueValeur
Paramètres totaux2 800 milliards
Paramètres actifs par token~50 milliards
ArchitectureMoE (16 experts sur 896)
Contexte1 million de tokens
ModalitésTexte + images en entrée, texte en sortie
Prix (API)3 $ / million de tokens d'entrée, 15 $ / million de sortie
Prix (cache)0,30 $ / million de tokens en cache
LicenceMIT modifiée (à confirmer)

L'architecture Mixture-of-Experts (MoE) signifie que sur les 2 800 milliards de paramètres, seuls 50 milliards s'activent pour chaque token généré. C'est ce qui rend un modèle de cette taille utilisable : il a la puissance d'un géant, mais consomme comme un modèle moyen.

Où il se place dans la course

Sur l'Intelligence Index d'Artificial Analysis (un composite de 9 évaluations sur des tâches utiles), Kimi K3 en mode raisonnement maximal obtient 57 points. À titre de comparaison :

ModèleScoreType
Claude Fable 5 (max reasoning + fallback)60Fermé
GPT-5.6 Sol (max reasoning)59Fermé
Kimi K3 (max reasoning)57Open
GLM-5.2 (max reasoning)51Open

Kimi K3 est donc le meilleur modèle open source, derrière deux modèles fermés, avec un écart de 2 à 3 points. Il bat GLM-5.2 (sorti il y a trois semaines) de 6 points.

Le coût par tâche sur ce même index est révélateur : Kimi K3 coûte 0,95 $ par tâche, contre 1,04 $ pour GPT-5.6 Sol et 2,75 $ pour Claude Fable 5. Le modèle le plus proche en performance coûte 2,9 fois plus cher.

Sur Arena.ai, le leaderboard de code web où les développeurs comparent les sorties à l'aveugle, Kimi K3 arrive premier devant tous les modèles, fermés inclus. Il gagne 6 domaines sur 7 en développement web front-end.

Deux innovations d'architecture

Kimi K3 introduit deux mécanismes que Moonshot a publiés séparément en articles de recherche :

Kimi Delta Attention. Dans un transformer classique, chaque nouveau token compare sa position à tous les tokens précédents. Sur un contexte d'un million de tokens, ça devient coûteux. Kimi Delta Attention remplace cette comparaison exhaustive par une mémoire de taille fixe qui se met à jour au fil de la lecture. Moonshot annonce une vitesse de décodage 6,3 fois plus rapide sur des entrées d'un million de tokens.

Attention Residuals. Dans un transformer standard, chaque couche ajoute sa sortie à une somme cumulée, avec un poids égal pour toutes les couches. Plus le modèle est profond, plus la contribution de chaque couche se dilue. Les Attention Residuals remplacent cette somme par un mécanisme d'attention : chaque couche apprend à piocher sélectivement dans les sorties des couches précédentes plutôt qu'à tout additionner. Moonshot rapporte 20% de calcul d'entraînement en moins pour la même performance.

Ces deux techniques sont publiées avec code, donc réutilisables par d'autres labs. C'est l'intérêt secondaire de Kimi K3 pour la communauté : pas seulement un gros modèle, mais aussi un terrain de test pour des idées d'architecture que d'autres peuvent adopter.

Le contexte géopolitique

Kimi K3 arrive dans un marché de l'open source saturé. En un mois : Inkling (975B, Thinking Machines Lab, américain), GLM-5.2 (Z.ai), DeepSeek V4-Pro (1,6T), Qwen3.8-Max-Preview (2,4T, Alibaba). Moonshot double le plus gros concurrent open source existant.

La lecture géopolitique est directe : un lab chinois sort le plus gros modèle librement disponible, à un prix bien inférieur aux labs américains fermés, malgré les restrictions américaines d'export de puces. C'est exactement le scénario que les export controls étaient censés empêcher. Les labs chinois contournent les contraintes de matériel par l'efficacité d'architecture, pas par la puissance brute.

Moonshot prépare par ailleurs son introduction en bourse à Hong Kong, en démantelant sa structure VIE (Variable Interest Entity). Le timing de la sortie de Kimi K3 sert aussi de vitrine technique pour les investisseurs.

Un exemple chez Maisons&Mobilia

Pierre, DAF de Maisons&Mobilia (M&M, enseigne de meubles fictive), veut déployer un assistant IA pour analyser les contrats fournisseurs. Ces documents font parfois 200 à 300 pages, avec des annexes, des conditions générales et des avenants. Pierre a besoin d'un modèle qui gère un long contexte sans perdre le fil.

Avec Kimi K3 :

  1. Un seul modèle suffit pour ingérer un contrat complet (1 million de tokens, soit environ 750 000 mots, largement assez pour un contrat de 300 pages).
  2. Le coût est maîtrisé : analyser un contrat de 300 000 tokens en entrée coûte 0,90 $ sur l'API, contre 2,70 $ minimum chez un fournisseur américain fermé pour la même performance.
  3. Les poids sont ouverts, donc si M&M veut héberger le modèle en interne pour des raisons de confidentialité, ils peuvent le faire. La version complète demande une infrastructure conséquente (plusieurs centaines de GPU), mais la possibilité existe, contrairement aux modèles fermés.
  4. Les refus de contenu que Pierre rencontre parfois avec les modèles américains (sur des clauses financières sensibles, par exemple) ne se posent pas de la même façon avec un modèle chinois dont la politique de filtrage est différente. C'est un avantage opérationnel, mais aussi une question à poser : qui définit ce que le modèle refuse ou accepte ?

Ce qu'il faut savoir avant de te lancer

  • Taille : la version BF16 demande environ 5,6 To de VRAM. La quantification réduira ce chiffre, mais tu ne fais pas tourner Kimi K3 sur ton laptop.
  • Licence : Moonshot prévoit une licence MIT modifiée. Attends de lire les conditions exactes avant un usage commercial, car le wording peut inclure des clauses spécifiques.
  • Indépendance : les benchmarks annoncés viennent de Moonshot. Les scores indépendants (Artificial Analysis, Arena.ai) confirment les performances, mais la reproductibilité complète ne sera possible qu'après aujourd'hui, quand les chercheurs auront pu tester les poids.
  • Concurrent immédiat : Alibaba a annoncé Qwen3.8-Max-Preview (2,4T) trois jours après Kimi K3, avec des poids ouverts promis. La cadence d'open source est devenue hebdomadaire.

Aller plus loin

Pour comprendre pourquoi l'architecture MoE permet à un modèle géant de consommer peu, notre article sur comment fonctionne un LLM pose les bases. Pour comparer avec l'open source américain, lis notre analyse d'Inkling de Thinking Machines. Et pour t'entraîner à comprendre ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs en français, sans coder.

Sources

Questions fréquentes

Qu'est-ce que Kimi K3 ?
Kimi K3 est un modèle d'IA open source de 2 800 milliards de paramètres, développé par Moonshot AI (startup chinoise). Ses poids sont publiés le 27 juillet 2026, ce qui en fait le plus grand modèle open source téléchargeable au monde. Il est multimodal : texte et images en entrée, texte en sortie, avec un contexte d'un million de tokens.
Kimi K3 est-il vraiment open source ?
Moonshot prévoit une licence MIT modifiée. Les poids sont disponibles au téléchargement à partir du 27 juillet 2026, ce qui permet un usage commercial et de la recherche. Attends de lire les conditions exactes de la licence, car le wording peut inclure des clauses spécifiques avant un déploiement commercial.
Comment Kimi K3 se compare-t-il à GPT-5.6 et Claude Fable 5 ?
Sur l'Intelligence Index d'Artificial Analysis, Kimi K3 obtient 57 points en mode raisonnement maximal, contre 60 pour Claude Fable 5 et 59 pour GPT-5.6 Sol. L'écart est de 2 à 3 points avec les modèles fermés les plus performants. Son coût par tâche est de 0,95 $, contre 1,04 $ pour GPT-5.6 et 2,75 $ pour Claude Fable 5.
Combien de GPU faut-il pour faire tourner Kimi K3 ?
La version BF16 demande environ 5,6 To de VRAM, soit l'équivalent de plusieurs dizaines de GPU haut de gamme. La quantification réduira ce chiffre, mais Kimi K3 n'est pas conçu pour tourner sur un laptop. Pour un usage sans infrastructure, l'API de Moonshot est disponible à 3 $ par million de tokens d'entrée.
C'est quoi Kimi Delta Attention ?
C'est un mécanisme d'attention linéaire qui remplace la comparaison exhaustive entre tous les tokens par une mémoire de taille fixe mise à jour au fil de la lecture. Moonshot annonce une vitesse de décodage 6,3 fois plus rapide sur des entrées d'un million de tokens. Le mécanisme est publié avec code, donc réutilisable par d'autres labs.

Termes du glossaire