Actualité · Agents IA
Un agent IA qui tourne sur ton téléphone, sans cloud ni facture : Liquid AI change la donne
5 août 2026 · 5 min de lecture

Liquid AI a publié LFM2.5-2.6B le 4 août 2026. C'est un modèle d'IA de 2,6 milliards de paramètres conçu pour faire tourner des agents sur ton téléphone, ton laptop ou ton serveur, sans passer par un cloud. Il prend 2,5 Go de mémoire et génère 30 tokens par seconde sur un téléphone. Pour comparer, ChatGPT sur ton téléphone envoie chaque requête vers les serveurs d'OpenAI. LFM2.5-2.6B fait le travail sur l'appareil lui-même.
La différence est simple à comprendre. Quand un agent IA tourne chez OpenAI ou Anthropic, tu paies au token. Chaque mot généré coûte de l'argent. Quand l'agent tourne sur ta machine, le coût marginal est zéro. Tu peux faire tourner un agent en boucle, toute la journée, sans voir de facture arriver. Liquid AI a entraîné ce modèle spécifiquement pour ça : planifier, appeler des outils, enchaîner des étapes, le tout en local.
Ce que LFM2.5-2.6B fait concrètement
Le modèle supporte le tool calling natif. C'est-à-dire qu'il peut appeler des fonctions externes : chercher une info sur le web, exécuter un bout de code, interroger une base de données, écrire un fichier. C'est la brique de base d'un agent IA. La plupart des petits modèles (moins de 5 milliards de paramètres) sont bons pour générer du texte, mauvais pour utiliser des outils. LFM2.5-2.6B a été entraîné pour ça.
Son contexte est de 128 000 tokens. C'est l'espace de travail du modèle, la quantité de texte qu'il peut garder en mémoire pendant une tâche. 128K, c'est ce que proposent les grands modèles commerciaux. Pour un modèle qui tient dans 2,5 Go, c'est beaucoup.
Les benchmarks publiés par Liquid AI le comparent à des modèles 4 fois plus gros : Gemma-4-E2B (5,1B), Gemma-4-E4B (8B), Qwen3.5-4B (4,7B), Qwen3.5-9B (9,7B). Sur le tool use (capacité à appeler des outils correctement), LFM2.5-2.6B bat tous les Gemma et arrive juste derrière Qwen3.5-9B sur un seul benchmark (BFCLv4). Sur l'instruction following (suivre des consignes précises), il est premier sur tous les benchmarks. Sur le code, les modèles plus gros gardent l'avantage.
Pourquoi l'agent local change la donne
Un agent IA qui tourne sur ta machine a trois avantages pratiques que le cloud ne peut pas égaler.
Le coût d'abord. Un agent qui enchaîne 50 étapes pour traiter une tâche complexe peut consommer des centaines de milliers de tokens. Sur l'API d'OpenAI, ça se chiffre en dollars par tâche. En local, c'est gratuit. Tu peux lancer 100 agents en parallèle sur un serveur, les faire tourner 24 heures sur 24, et le seul coût est l'électricité.
La confidentialité ensuite. Quand l'agent tourne sur ta machine, tes données ne sortent pas. Tu peux lui confier des documents professionnels, des emails, des fichiers clients sans les envoyer vers un serveur aux États-Unis. Pour une PME française qui veut tester un agent sur des données sensibles, c'est la différence entre "on peut essayer" et "on ne peut pas".
La latence enfin. Un appel d'API traverse internet, attend dans une file, revient. Sur un M5 Max, LFM2.5-2.6B génère 220 tokens par seconde. Sur un AMD Ryzen CPU, 113 tokens par seconde. Un agent local réagit en temps réel, sans attendre le réseau.
Un exemple chez Maisons&Mobilia
Sophie, responsable e-commerce chez Maisons&Mobilia (M&M, enseigne de meubles fictive), veut tester un agent qui répond aux questions des clients sur les produits du catalogue. L'agent doit pouvoir chercher une info dans la fiche produit, comparer deux modèles, vérifier la disponibilité. C'est un cas typique d'agent avec tool use.
Avec une API cloud, Sophie paie chaque interaction. Si 200 clients posent des questions par jour, avec une moyenne de 5 échanges par conversation, le coût par mois peut vite grimper. Avec LFM2.5-2.6B en local sur un serveur que M&M possède déjà, le coût est nul. Sophie peut lancer l'agent, le tester en conditions réelles, le laisser tourner sans surveiller la facture.
Les limites existent. Le modèle est petit, 2,6 milliards de paramètres. Sur des questions complexes qui demandent un raisonnement profond ou du code, il sera moins bon qu'un GPT-5.6 ou un Qwen3.8-Max. Sophie garde un modèle cloud pour les cas difficiles et utilise le modèle local pour le volume. C'est l'arbitrage que beaucoup d'équipes vont faire : local pour le volume et le test, cloud pour la qualité quand elle compte.
Comment l'utiliser
Le modèle est disponible sur Hugging Face en open weights. Tu peux le télécharger, le faire tourner, le modifier. Liquid AI fournit des versions au format GGUF pour llama.cpp (inference efficace sur CPU), MLX pour Apple Silicon, vLLM et SGLang pour le serving sur GPU, et ONNX.
Pour brancher le modèle dans un harness d'agent (OpenClaw, Hermes Agent), Liquid AI documente la procédure sur son site. L'entraînement du modèle a été fait directement dans ces harnesses, ce qui veut dire que le modèle connaît déjà les formats d'interaction de ces outils.
Il y a aussi une démo en ligne dans le navigateur via WebGPU, sans installation. Tu peux tester le modèle sans rien télécharger.
Ce qu'il faut savoir avant de se lancer
Le modèle fait 2,6 milliards de paramètres, mais le fine-tuning ou l'entraînement d'un agent dessus demande du travail. Liquid AI a entraîné le modèle avec un pipeline en quatre étapes (SFT, spécialisation des teachers, distillation, RL agentique) que tu ne vas pas reproduire chez toi. Tu utilises le modèle tel quel, ou tu le fine-tunes sur tes données avec des outils standards.
Les benchmarks sont communiqués par Liquid AI. Ils sont cohérents avec la taille du modèle et les techniques utilisées, mais avant de baser une décision d'architecture dessus, fais tourner le modèle sur tes propres tâches. C'est vrai pour tous les modèles, pas seulement celui-ci.
Le code reste le point faible des petits modèles. Si ton agent doit écrire du code complexe, LFM2.5-2.6B ne remplacera pas un modèle de code spécialisé. Pour le tool use, l'instruction following et les tâches multi-étapes, il est dans la course avec des modèles beaucoup plus gros.
Le contexte du moment
LFM2.5-2.6B arrive dans une semaine où l'open weights domine l'actualité. Qwen3.8-Max (2,4T paramètres) a montré que l'open source pouvait battre les modèles fermés sur les tâches longues et autonomes. DeepSeek V4-Flash a montré la même chose à un tiers du prix. L'angle de Liquid AI est différent : pas la performance brute, mais l'efficacité par watt et par euro. Un modèle qui tourne sur un téléphone à 30 tokens par seconde, c'est l'agent IA qui devient aussi banal qu'une app locale.
La tendance est claire. Les modèles open weights couvrent maintenant tous les segments : du flagship trillion-parameters au modèle de poche. Pour toi qui veux comprendre comment marche un agent IA, c'est l'occasion d'en faire tourner un sans compte, sans clé API, sans facture. Télécharge le modèle, branche-le dans un harness, et expérimente.
Aller plus loin
Pour comprendre comment un agent IA est structuré (et pourquoi le tool use est la brique centrale), notre article sur comment fonctionne un agent IA pose les bases. Pour voir comment les modèles open weights se comparent aux modèles fermés sur les tâches agentiques, lis notre analyse sur Qwen3.8-Max et l'open source. Et pour t'entraîner à comprendre ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les agents, le tool use et le déploiement local, en français, sans coder.
Sources
Questions fréquentes
- C'est quoi LFM2.5-2.6B ?
- Un modèle d'IA de 2,6 milliards de paramètres publié par Liquid AI le 4 août 2026, conçu pour faire tourner des agents IA sur ton téléphone ou ton laptop sans passer par le cloud. Il prend 2,5 Go de mémoire et génère 30 tokens par seconde sur un téléphone, 220 sur un Apple M5 Max.
- Comment un agent IA local fonctionne sans cloud ?
- Le modèle est téléchargé sur ton appareil. Quand l'agent doit réfléchir, planifier ou appeler un outil, le calcul se fait sur ton processeur, pas sur un serveur distant. Les données ne sortent pas de ton appareil. Le coût marginal par tâche est zéro, tu ne paies que l'électricité.
- LFM2.5-2.6B est-il open source ?
- Oui, les poids du modèle sont disponibles sur Hugging Face. Tu peux le télécharger, le faire tourner, le modifier. Liquid AI fournit des versions au format GGUF, MLX, vLLM, SGLang et ONNX pour l'inference sur CPU, GPU et Apple Silicon.
- Quelles sont les limites d'un modèle de 2,6 milliards de paramètres ?
- Le modèle est bon pour le tool use, l'instruction following et les tâches multi-étapes. Il est moins performant que les modèles plus gros sur le code complexe et le raisonnement profond. Pour les cas difficiles, tu peux garder un modèle cloud en complément.
- Comment tester LFM2.5-2.6B ?
- Liquid AI propose une démo en ligne dans le navigateur via WebGPU, sans installation. Pour aller plus loin, tu peux télécharger le modèle sur Hugging Face et le brancher dans un harness d'agent comme OpenClaw ou Hermes Agent. La procédure est documentée sur le site de Liquid AI.