Open source

Inkling : le premier modèle open source de Thinking Machines arrive avec 1000 milliards de paramètres

26 juillet 2026 · 5 min de lecture

Illustration aquarelle du robot-astronaute violet de saisir.ai debout sur une pile de livres ouverts, peignant des fleches colores qui coulent vers un cerveau translucide, avec un pinceau, un engrenage, un disque et une plante, relies par des fils menthe, palette violette et menthe sur fond creme

Ce qu'il faut retenir

Thinking Machines Lab, la startup fondée par Mira Murati (ancienne CTO d'OpenAI), a publié son premier modèle de langage le 15 juillet 2026. Il s'appelle Inkling, il est open source sous licence Apache 2.0, et il pèse 975 milliards de paramètres. C'est le plus gros modèle ouvert jamais sorti par un lab américain.

Concrètement, Inkling est un modèle multimodal : il comprend le texte, les images et l'audio en natif. Il gère un contexte d'un million de tokens. Et il est conçu pour que tu le fine-tunes toi-même, sur la plateforme Tinker de Thinking Machines ou en local sur ta propre infrastructure.

Pourquoi c'est important

Jusqu'ici, si tu voulais un modèle open source frontier-class, tu regardais presque exclusivement côté chinois : DeepSeek V4, GLM 5.2, Kimi K2.6. Les labs américains (OpenAI, Anthropic, Google) gardent leurs poids fermés. Nvidia avait sorti Nemotron 3 Ultra (550B), mais c'était le seul vrai poids lourd américain en open weights.

Inkling change ça. Pas en battant tout le monde sur tous les benchmarks (on y revient juste), mais en proposant un socle ouvert, américain, multimodal, et pensé pour la customisation dès le départ.

Les chiffres clés

CaractéristiqueValeur
Paramètres totaux975 milliards
Paramètres actifs par token41 milliards
ArchitectureMoE (256 experts routés + 2 partagés)
Contexte1 million de tokens
Données d'entraînement45 trillions de tokens (texte, images, audio, vidéo)
LicenceApache 2.0
ModalityTexte + image + audio (natif)

L'architecture Mixture-of-Experts signifie que seul un sous-ensemble du modèle "s'active" à chaque token. Résultat : tu as la puissance d'un modèle de 1000 milliards de paramètres, mais qui consomme comme un modèle de 41 milliards. C'est ce qui rend l'open source frontier-class viable économiquement.

Où il se place dans le paysage

Sur les benchmarks, Inkling est solide mais ne domine pas. Quelques repères :

  • Coding (SWE-bench Verified) : 77,6% (Nemotron 3 Ultra : 71,9%, DeepSeek V4 Pro : 80,6%)
  • Agentic web dev (Design Arena) : 1257, classé parmi les meilleurs modèles ouverts
  • Audio (MMAU) : 77,2% (Gemini 3.1 Pro : 82,5%)
  • Vision (MMMU Pro) : 73,3% (Claude Fable 5 : 84,2%)
  • Maths (AIME 2026) : 97,1% (bat Nemotron 3 Ultra à 94,2% et DeepSeek V4 Pro à 96,7%)

Le positionnement de Thinking Machines est clair : Inkling n'est pas le meilleur sur tout. C'est un généraliste équilibré, conçu pour être fine-tuné sur tes cas d'usage spécifiques. La multimodalité native (texte + image + audio dans le même modèle, sans encodeurs séparés) est sa vraie différence.

La fonctionnalité qui compte vraiment : le "controllable thinking effort"

Inkling intègre un mécanisme appelé controllable thinking effort. En pratique, tu peux régler l'intensité du raisonnement du modèle entre 0.2 et 0.99. À 0.2, il répond vite et cheap. À 0.99, il réfléchit longtemps.

Pourquoi c'est utile ? Parce que tu ne payes pas le même prix selon la tâche. Une question simple ne mérite pas 2000 tokens de raisonnement. Une tâche de code complexe, si. Thinking Machines affirme qu'Inkling atteint le score de Nemotron 3 Ultra sur Terminal Bench 2.1 en utilisant trois fois moins de tokens.

C'est un argument cost-to-performance, pas un argument de pointe. Mais pour quelqu'un qui déploie un modèle en production, c'est souvent le cost qui décide.

Exemple concret : Maisons&Mobilia

Maisons&Mobilia (enseigne fictive de mobilier design) veut déployer un assistant IA qui répond aux questions clients sur les produits, traite les photos envoyées par les clients pour identifier un modèle de canapé, et gère les appels vocaux pour le SAV.

Avec Inkling, ils peuvent :

  1. Un seul modèle pour les trois canaux (texte chat, analyse d'image, audio vocal), au lieu d'empiler trois modèles spécialisés.
  2. Fine-tuner sur leur catalogue produits et leur historique SAV via Tinker, sans dépendre d'une API fermée.
  3. Régler le thinking effort : bas pour le routing de questions simples, haut pour les cas de SAV complexes.
  4. Héberger en local (la version NVFP4 demande 600 GB de VRAM, soit ~8 GPU B300) et garder leurs données chez eux.

C'est le pitch d'Inkling en une phrase : un modèle ouvert, multimodal, que tu façones pour ton métier.

Ce qu'il faut savoir avant de te lancer

  • Taille : la version BF16 demande 2 To de VRAM. La version NVFP4 (quantifiée) demande 600 GB. C'est pas pour ton laptop.
  • Inkling-Small (276B, 12B actifs) arrive en preview pour ceux qui privilégient la latence.
  • Disponibilité : Hugging Face, Tinker, et bientôt Together AI, Fireworks, Modal, Databricks, Baseten.
  • Inference : supporté dans transformers (5.14.0+), vLLM, SGLang, llama.cpp.
  • Licence : Apache 2.0, donc usage commercial OK, modification OK, redistribution OK.

Aller plus loin

Tu veux apprendre à fine-tuner un modèle ouvert ou comprendre comment fonctionne l'architecture MoE ? Dans saisir.ai, le parcours "Modèles open source" te pose les bases en 5 minutes par jour, sans coder.

Si tu découvres le sujet, notre article sur GPT-5.6 et le mode ultra te montre à quoi ressemble le haut du panier côté modèles fermés, pour comparer avec l'open source.

Sources

Questions fréquentes

Qu'est-ce que Thinking Machines Lab ?
Une startup américaine fondée en 2025 par Mira Murati, ancienne CTO d'OpenAI. Inkling est son premier modèle public, sorti le 15 juillet 2026.
Inkling est-il vraiment open source ?
Oui, sous licence Apache 2.0. Tu peux l'utiliser commercialement, le modifier, le redistribuer. Les poids sont disponibles sur Hugging Face.
Quelle est la différence entre Inkling et GLM 5.2 ?
GLM 5.2 est plus performant sur le code et le raisonnement pur. Inkling est multimodal natif (texte + image + audio) et propose un thinking effort ajustable, ce que GLM ne fait pas.
Combien de GPU faut-il pour faire tourner Inkling ?
La version BF16 demande 2 To de VRAM (environ 16 GPU H200). La version quantifiée NVFP4 demande 600 GB (environ 8 GPU B300). Inkling-Small (276B) sera plus accessible.
C'est quoi le controllable thinking effort ?
Un réglage qui te permet d'ajuster l'intensité de raisonnement du modèle entre 0.2 et 0.99. Plus c'est bas, plus c'est rapide et économique. Plus c'est haut, plus le modèle réfléchit longtemps.

Termes du glossaire