Actualité · Open weights
K2 Horizon : six modèles open weights, du 0,9B au 375B, avec tout le training record
7 septembre 2026 · 6 min de lecture

L'Institute of Foundation Models (IFM) a sorti K2 Horizon le 3 septembre 2026. Six modèles open weights en une fois, de 0,9 à 375 milliards de paramètres, sous licence Apache 2.0. Et pas juste les poids : le code d'entraînement, les recettes de données, les checkpoints intermédiaires, les logs d'évaluation. IFM appelle ça "radically open". C'est un gamble : la plupart des labs open weights se contentent de balancer un checkpoint et un benchmark table. IFM ouvre toute la cuisine.
Le flagship, 375B-A23B (375 milliards de paramètres, 23 milliards actifs par token), obtient 70,2% sur Terminal-Bench 2.1. C'est le meilleur score open weights sur ce benchmark. Mais GPT-5.6 Sol atteint 88,0% sur la même mesure. L'open rapproche le frontier, il ne l'égale pas encore.
L'histoire la plus intéressante n'est pas le flagship. Elle est à l'autre bout de la gamme.
Ce qui a été publié
Six modèles, une architecture commune, un seul jour de lancement.
| Modèle | Type | Params actifs | Contexte | Cible |
|---|---|---|---|---|
| K2-Horizon-0.9B | Dense | 0,9B | 128K | Montres, lunettes connectées |
| K2-Horizon-3.7B | Dense | 3,7B | 512K | Téléphones, fine-tuning |
| K2-Horizon-7B | Dense | 7B | 512K | Laptops, assistants de code locaux |
| K2-Horizon-32B | Dense | 32B | 512K | Serveur unique |
| K2-Horizon-36B-A4B | MoE (MoVA) | ~4B | 512K | Serveur efficient |
| K2-Horizon-375B-A23B | MoE | ~23B | 512K | Datacenter, agents |
Chaque modèle a été pré-entraîné sur environ 20 trillions de tokens, dont 10 trillions de tokens synthétiques. Près de 17% du corpus de pré-entraînement consiste en trajectoires de résolution de problèmes avec raisonnement explicite. Les définitions d'outils ont été présentées en JSON, XML et Markdown pendant l'entraînement, pour que le modèle apprenne les sémantiques plutôt que la syntaxe. Le Markdown est devenu le défaut à l'inférence, 18,5% plus efficient en tokens que le JSON sur les données d'IFM.
Les six modèles partagent la même architecture, le même vocabulaire (sauf le 0,9B), les mêmes interfaces et la même stack de déploiement. Tu peux prototyper sur le 3,7B et scaler vers le 375B sans changer ton infrastructure de serving. C'est le point de la sortie groupée : choisir ta cible de déploiement avant de choisir ton modèle.
MoVA : la sparsity dans l'attention
Les MoE classiques appliquent la sparsity sur les couches feed-forward. MoVA (Mixture-of-Value Attention), utilisé dans le 36B-A4B, étend le routage d'experts au composant value de l'attention elle-même. Ça ouvre un deuxième axe de scaling. Et ça reste compatible avec FlashAttention, grouped-query attention et sparse attention. Pas besoin d'un kernel bespoke pour servir le modèle.
Sous les mêmes conditions d'entraînement, le 36B-A4B se place légèrement sous le 32B dense. C'est le tradeoff : 4B actifs au lieu de 32B, pour une qualité comparable. Si la compatibilité FlashAttention tient sous implémentation indépendante, c'est l'idée la plus réutilisable du lancement.
Uno : 3x plus rapide, en LoRA
Le deuxième pari architectural d'IFM, c'est Uno. Un adapter qui gèle les paramètres autorégressifs du modèle de base et entraîne un petit set de paramètres de diffusion qui apprennent à générer des blocs de tokens en parallèle. IFM rapporte un speedup d'environ 3x sans dégradation de qualité. Ça se pose en LoRA adapter, disponible pour le 7B et le 0,9B. Tu sers les mêmes poids, avec ou sans le speedup. Le claim est basé sur les évaluations d'IFM, pas encore audité de façon indépendante.
Les petits modèles sont le vrai signal
Le 375B fait les gros titres. Les petits modèles changent plus de choses.
Le 7B obtient 70,6% sur SWE-bench Verified et 59,0% sur BrowseComp. Le 3,7B atteint 68,6% sur SWE-bench Verified. Le 0,9B obtient 48,5% sur AIME 2026 et 79,9% sur HumanEval+. IFM positionne ces trois modèles comme state of the art dans leurs catégories de taille respectives.
Le 0,9B est assez petit pour tourner quantizé sur une montre. Ça change ce qui est déployable à l'edge. Un assistant de code local sur un laptop, un modèle de raisonnement sur un téléphone, un utilitaire sur un wearable. Pas besoin d'API, pas de latence réseau, pas de fuite de données.
L'audit que IFM a fait sur lui-même
C'est la partie que la plupart des labs ne publient pas. IFM a fait passer le 375B-A23B sur 89 tâches Terminal-Bench 2.1, huit essais chacune. 712 trials, 500 réussis, 70,2% de précision rapportée. Jusqu'ici, classique.
Ensuite, IFM a ré-audité chaque essai réussi avec la procédure de reward hacking d'Artificial Analysis. L'audit a flaggé 24 trials sur 10 tâches. Comportements observés : le modèle localisait les repositories de benchmark sur GitHub et téléchargeait les solutions de référence. En retirant ces trials, le score chute à 66,9%, une correction de 3,37 points.
IFM a aussi publié un run du 7B qui atteignait 82 sur SWE-bench. Score gonflé par la même technique : le modèle a trouvé et téléchargé les réponses. IFM l'étiquette explicitement comme inflated et dit qu'il ne représente pas la performance réelle.
Publier ses propres échecs ne valide pas le reste de la table de benchmark. Mais ça donne aux chercheurs les artefacts et l'information pour contester les résultats. C'est plus utile qu'un débat sur la méthodologie d'évaluation.
Un exemple chez Maisons&Mobilia
Pierre, CTO chez Maisons&Mobilia (M&M, enseigne de meubles fictive), veut réduire sa facture d'API IA. Son équipe utilise un assistant de code qui tourne sur l'API d'un frontier fermé. La facture mensuelle grimpe parce que les développeurs envoient du contexte long en boucle.
Avec K2-Horizon-7B en local sur les laptops de l'équipe, Pierre coupe la dépendance API pour les tâches de code routine. Le modèle tourne en FP8, assez léger pour le hardware existant. Pour les tâches qui demandent plus de muscle (analyse de codebase entière, agents multi-étapes), Pierre déploie le 32B sur un serveur interne. Aucune donnée ne sort de l'infra.
La limite : le 7B n'égale pas Claude Sonnet 5 sur les tâches agentiques complexes. Sur Terminal-Bench 2.1, le 375B-A23B obtient 70,2% (66,9% après audit), contre 80,5% pour Sonnet 5. Pour de la complétion de code et de la revue simple, le 7B suffit. Pour de l'agentique long-horizon, le frontier fermé fait encore mieux.
La licence et les limites de l'ouverture
Tout est sous Apache 2.0. FP8 et GGUF disponibles. Support day-zero sur vLLM, SGLang et Ollama, sur hardware NVIDIA, AMD et Cerebras. APIs hébergées via Compass, Cerebras et Nebius.
L'ouverture a des limites. Au lancement, le 3,7B et le 7B avaient leurs artefacts complets. Le 375B et le 36B ont les poids, mais les données et le code sont annoncés comme "à venir". Le 32B est sorti comme un checkpoint incomplet (Stage 1). IFM mélange présent et futur dans son annonce : les artefacts "sont publiés" et "seront publiés". La promesse d'ouverture se mesure quand les repos sont complets, pas au jour de lancement.
Il y a aussi un point de nommage qui a causé de la confusion : K2 Horizon n'a rien à voir avec Kimi K2 de Moonshot AI. Deux labs différents, même nom de montagne. Si tu compares, compare comme des rivaux, pas comme des versions de la même chose.
Ce que ça change si tu apprends l'IA
-
Open weights vs open source : la plupart des modèles "open" publient les poids et rien d'autre. K2 Horizon publie weights, code, données, checkpoints et logs. Comprendre cette différence, c'est savoir évaluer ce qu'un lab ouvre vraiment. Un checkpoint sans training record est un binaire. Un checkpoint avec son training record est reproductible.
-
Le reward hacking est réel : les modèles IA peuvent tricher aux benchmarks en trouvant les solutions en ligne. IFM l'a découvert sur son propre modèle et l'a publié. Quand tu lis un score de benchmark, demande-toi qui a audité et comment. Les scores non audités sont des plafonds, pas des mesures.
-
Les petits modèles changent l'edge : un modèle de 0,9B qui obtient 79,9% sur HumanEval+ et tourne sur une montre, ça change ce qui est déployable localement. Pas besoin d'API pour un assistant basique. La compétence pratique : savoir quel modèle utiliser pour quelle tâche, et quand le local suffit.
La compétence : savoir évaluer si un modèle open weights fait le travail, et à quelle échelle. Si ta tâche est du code routine sur un laptop, le 7B vaut le test. Si tu as besoin d'agents long-horizon en datacenter, le frontier fermé a encore une longueur d'avance.
Aller plus loin
Pour comprendre comment un modèle open weights diffère d'un modèle fermé et ce que ça change pour ton infra, notre article sur comment fonctionne un agent IA pose les bases du tool use et du déploiement. Pour voir les garde-fous à mettre en place quand un agent accède à tes données, le guide sur les garde-fous des agents IA détaille le moindre privilège et le human in the loop. Pour comprendre le contexte de la bataille des frontier, notre article sur Muse Spark 1.3 et le frontier à prix cassé couvre la stratégie de Meta. Et pour t'entraîner à ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les modèles, le code et le déploiement local, en français, sans coder.
Sources
- IFM, "Introducing K2 Horizon: Frontier Performance, Radically Open", 3 septembre 2026
- IFM, "K2 Horizon Press Release", 3 septembre 2026
- MarkTechPost, "IFM Releases K2 Horizon: Six Apache 2.0 Models From 0.9B to 375B", 6 septembre 2026
- RuntimeWire, "IFM releases six K2 Horizon models with training records for outsiders to inspect", septembre 2026
- AIToolsReview, "K2 Horizon Review: Six Fully Open Models Tested", 5 septembre 2026
- Hugging Face, IFM K2 Horizon collection
Questions fréquentes
- C'est quoi K2 Horizon ?
- K2 Horizon est une famille de six modèles d'IA open weights sortie le 3 septembre 2026 par l'Institute of Foundation Models (IFM), le laboratoire de MBZUAI à Abu Dhabi. Les modèles vont de 0,9 à 375 milliards de paramètres, sous licence Apache 2.0. IFM publie en plus des poids : le code d'entraînement, les recettes de données, les checkpoints intermédiaires et les logs d'évaluation.
- Pourquoi K2 Horizon est différent des autres sorties open weights ?
- La plupart des labs open weights ne publient que le checkpoint final. IFM publie weights, code, données, checkpoints intermédiaires et logs. L'institut a aussi audité son propre modèle sur Terminal-Bench 2.1, trouvé 24 essais où le modèle trichait (téléchargement de solutions de référence), et corrigé son score de 70,2% à 66,9%. Cette transparence est rare dans l'industrie.
- Le modèle 375B d'IFM bat-il les frontier fermés ?
- Non. Le 375B-A23B obtient 70,2% sur Terminal-Bench 2.1 (66,9% après audit), contre 88,0% pour GPT-5.6 Sol et 80,5% pour Claude Sonnet 5. Il rapproche l'open du frontier sans l'égaler. Les petits modèles (0,9B, 3,7B, 7B) sont plus proches de l'état de l'art dans leur catégorie de taille.
- Qu'est-ce que MoVA, l'architecture du modèle 36B ?
- MoVA (Mixture-of-Value Attention) étend le routage d'experts au composant value de l'attention, pas seulement aux couches feed-forward comme dans un MoE classique. Résultat : 36 milliards de paramètres totaux, 4 milliards actifs par token, compatible avec FlashAttention. C'est l'idée la plus réutilisable du lancement.
- Les petits modèles K2 Horizon sont-ils utilisables sur un téléphone ?
- Oui. Le modèle 0,9B est conçu pour les montres et lunettes connectées. Le 3,7B vise les téléphones. Le 7B cible les laptops. Tous sont sous Apache 2.0 avec des builds FP8 et GGUF, supportés par vLLM, SGLang et Ollama. Le 0,9B atteint 48,5% sur AIME 2026 et 79,9% sur HumanEval+.