Actualité · Outils IA
Mistral Agentic Search : quand l'IA ouvre vraiment tes documents au lieu de deviner
29 août 2026 · 5 min de lecture

Tu demandes a une IA : "Quel etait le taux d'imposition effectif de cette entreprise au troisieme trimestre ?" Un RAG classique recupere les bouts de texte qui ressemblent a la question, les passe au modele, et croise les doigts. Si le chiffre est dans une note de bas de page page 87, le modele ne le trouve pas. Le 20 aout 2026, Mistral a lance Agentic Search : un systeme ou le modele peut ouvrir le document, aller a la page 87, lire le tableau, et verifier le chiffre avant de repondre.
Le probleme du RAG one-shot
Le RAG (Retrieval-Augmented Generation) est la technique standard pour faire repondre une IA a partir de tes documents. Ca marche en deux temps : un moteur de recherche recupere des fragments de texte (chunks), puis le modele genere une reponse a partir de ces fragments.
Ca marche quand la reponse est dans les premiers resultats. Ca casse quand l'information est repartie sur plusieurs documents, cachee dans un tableau, ou dissimulee dans une clause contractuelle. Le modele recoit des fragments incomplets et ne peut pas demander "je veux voir la page 87". Il repond avec ce qu'il a, ou hallucine.
Mistral identifie trois limites structurelles du RAG one-shot :
- Recuperation sans raisonnement : le modele doit repondre avec les chunks choisis au depart, meme s'ils sont incomplets. Il ne peut pas decider qu'il a besoin d'un autre document.
- Limite du chunk : un index peut trouver le bon document, mais ne peut pas l'ouvrir, naviguer vers un tableau, ou lire le contexte autour. Le chunk isole coupe l'information de sa structure.
- Pas d'iteration : beaucoup de questions ont besoin de plus d'une passe de recherche. Le modele peut avoir besoin de reformuler sa requete, suivre une reference, comparer plusieurs sources. Le RAG one-shot ne permet aucune de ces etapes.
Comment marche Agentic Search
Agentic Search donne au modele cinq outils qui ressemblent a des operations sur fichiers :
- search : cherche des documents pertinents dans le corpus via l'index existant.
- open : ouvre un document specifique.
- navigate : deplace vers une page, section ou region du document.
- read : lit le contenu a un endroit precis.
- grep : cherche un terme exact dans un document ouvert.
Le modele peut inspecter un resultat, aller plus loin dans le document, lire le contexte autour, relancer une recherche en excluant ce qu'il a deja vu (parametre exclude_ids), et continuer jusqu'a avoir assez d'elements pour repondre. C'est une boucle de retrieval, pas une seule passe.
L'index reste le meme. Tu n'as pas besoin de re-entrainer le modele ou de reconfigurer ton infrastructure. Agentic Search se branche sur ton index existant et ajoute une couche d'orchestration. Mistral precise que la qualite de la recherche s'ameliorera avec les modeles futurs, sans changement d'infrastructure.
Les benchmarks que Mistral publie
Mistral a teste Agentic Search sur deux benchmarks avec ses parametres par defaut, sans optimisation specifique. Les chiffres sont des planchers, pas des plafonds.
FinanceBench : 368 documents SEC, 150 questions
FinanceBench teste les questions-reponses sur des documents financiers de la SEC americaine : 368 fichiers (10-K, 10-Q, 8-K), environ 147 pages chacun, 53 900 pages au total. Les reponses sont evaluees par un juge LLM calibre sur des labels humains.
| Configuration | Mistral Medium 3.5 | GLM-5.2 (Z.ai) |
|---|---|---|
| RAG one-shot | 26,7% | 33,4% |
| Boucle agentic (search seulement) | 74,0% (+47,3) | 86,0% (+52,6) |
| Boucle agentic + navigation | 82,6% (+55,9) | 86,0% (+52,6) |
Le gain le plus important vient de la boucle de recherche elle-meme : le modele peut chercher, evaluer, reformuler et chercher a nouveau. La navigation (open, navigate, read, grep) ajoute de la precision sur les documents complexes. La consommation de tokens baisse de 24% (MM 3.5) a 34% (GLM-5.2) quand on ajoute la navigation, parce que le modele fait moins de recherches larges et plus de consultations ciblees. La latence au 90e percentile passe de 255 secondes a 154 secondes.
OfficeQA Pro : 696 bulletins du Tresor, 133 questions
OfficeQA Pro est un benchmark numerique sur des bulletins du Tresor americain : 696 documents, 89 000 pages, des PDF scans denses en tableaux. Les reponses sont des nombres verifies.
| Configuration | Mistral Medium 3.5 | GLM-5.2 (Z.ai) |
|---|---|---|
| RAG one-shot | 6,3% | 6,3% |
| Boucle agentic + navigation | 33,4% (+27,1) | 51,9% (+45,6) |
Le RAG one-shot rate presque tout sur ce benchmark : les reponses sont des chiffres caches dans des tableaux scans. La boucle agentic permet au modele de chercher, d'ouvrir le bon document, de naviguer vers le bon tableau et de lire la valeur. Mistral signale aussi que GLM-5.2 score 41,4% sur OfficeQA Pro avec le harness de Claude Code, contre 51,9% avec le harness de Mistral. Le harness compte : sur le meme modele, l'outil de retrieval fait une difference de 10 points.
Mistral precise que les deux modeles testes (Mistral Medium 3.5, un petit modele, et GLM-5.2, un plus gros) beneficient de la meme amelioration. Le systeme est agnostique au modele.
Un exemple chez Maisons&Mobilia
Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), doit analyser 50 contrats fournisseurs pour verifier les clauses de remboursement en cas de defect. Chaque contrat fait 30 a 80 pages. Les clauses sont reparties entre annexes, notes de bas de page et tableaux.
Avec un RAG classique, Sophie pose sa question et le systeme recupere 10 fragments qui contiennent le mot "remboursement". Le modele repond a partir de ces fragments. Le probleme : la clause qui s'applique vraiment est dans l'annexe C du contrat 23, page 47, dans un tableau. Le RAG a peut-etre recupere le bon document, mais pas le bon fragment.
Avec Agentic Search, le modele cherche "remboursement defect produit" dans le corpus. Il trouve plusieurs contrats. Il ouvre le contrat 23, navigue vers l'annexe C, lit le tableau a la page 47, et verifie que la clause s'applique au cas de Sophie. Si le tableau ne suffit pas, il fait un grep sur "defaut" dans le meme document pour voir s'il y a une definition ailleurs. Puis il reformule sa recherche en excluant le contrat 23 pour verifier si d'autres contrats ont des clauses similaires.
Le gain pour Sophie : le modele trouve la clause au lieu de deviner. La limite : ca prend plus de temps qu'un RAG one-shot (plusieurs etapes de recherche), et il faut un index correctement configure. Si tes documents ne sont pas bien indexes au depart, Agentic Search ne les trouvera pas mieux que le RAG.
Ou on l'utilise et ou on n'en a pas besoin
Agentic Search est utile pour :
- Les documents longs et denses : rapports financiers, contrats, specifications techniques, ou la reponse est sur une page ou un tableau precis.
- Les questions multi-sources : verifier une information en croisant plusieurs documents.
- Les reponses qui doivent etre verifiees : chiffres financiers, clauses juridiques, ou tu peux pointer vers l'emplacement exact dans le document.
Le RAG one-shot reste suffisant pour :
- Les documents courts et simples ou la reponse est dans les premiers resultats.
- Les recherches en grand volume (mots-cles ou semantique) qui n'ont pas besoin de raisonnement.
- Les questions simples ou la source de la reponse est connue a l'avance.
Le RAG n'est pas mort. Il est le point de depart. Agentic Search s'ajoute quand le RAG ne suffit plus.
Ce que ça change si tu apprends l'IA
Trois notions concretes ressortent de cette annonce :
- RAG vs recherche agentique : le RAG recupere, le modele repond. La recherche agentique recupere, le modele decide s'il a assez d'elements, cherche plus si besoin, et verifie. Comprendre la difference, c'est comprendre pourquoi une IA peut rater une information qui est dans tes documents.
- Tool use applique a la recherche : les cinq outils (search, open, navigate, read, grep) sont les memes que ceux qu'un agent IA utilise pour interagir avec un systeme de fichiers. La recherche documentaire devient un cas particulier de tool use.
- Le harness compte autant que le modele : GLM-5.2 score 10 points de plus sur OfficeQA Pro avec le harness de Mistral qu'avec celui de Claude Code. Le modele est important, mais l'outillage autour change les resultats.
La competence pratique : savoir quand le RAG suffit et quand il faut passer a une recherche plus structuree. Pas tout le monde a besoin d'Agentic Search. Mais si tu poses des questions sur des documents longs et complexes, savoir que le RAG one-shot a des limites structurelles t'evite d'en conclure que "l'IA ne marche pas" quand c'est le retrieval qui casse.
Aller plus loin
Pour comprendre comment un agent IA utilise des outils pour realiser des taches en plusieurs etapes, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous a mettre en place quand un agent accede a tes donnees, le guide sur les garde-fous des agents IA detaille le moindre privilege et le human in the loop. Et pour t'entrainer a ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur le RAG, les agents et le tool use, en francais, sans coder.
Sources
Questions fréquentes
- C'est quoi Mistral Agentic Search ?
- Agentic Search est un systeme de recherche documentaire IA lance par Mistral le 20 aout 2026. Au lieu de recuperer des fragments de texte en une seule passe (RAG classique), le modele peut ouvrir un document, naviguer vers une page ou un tableau precis, chercher un terme exact avec grep, et relancer une recherche en excluant ce qu'il a deja vu. C'est disponible dans Mistral Search Toolkit, Le Chat et Studio.
- Quelle est la difference entre RAG et Agentic Search ?
- Le RAG classique recupere un nombre fixe de fragments de texte et demande au modele de repondre en une seule passe. Si la reponse n'est pas dans ces fragments, le modele ne peut pas chercher ailleurs. Agentic Search donne au modele cinq outils (search, open, navigate, read, grep) pour explorer les documents en plusieurs etapes, jusqu'a trouver et verifier l'information.
- Quels sont les resultats de Mistral Agentic Search sur les benchmarks ?
- Sur FinanceBench (150 questions sur 368 documents SEC, environ 53 900 pages), la precision passe de 26,7% en RAG one-shot a 86% avec Agentic Search. Sur OfficeQA Pro (133 questions sur 696 bulletins du Tresor americain, 89 000 pages), le score passe de 6,3% a 51,9%. Les chiffres sont publiés par Mistral avec ses parametres par defaut, sans optimisation specifique.
- Agentic Search est-il reserve aux modeles de Mistral ?
- Non. Mistral a teste Agentic Search avec son propre modele Mistral Medium 3.5 et avec GLM-5.2 de Z.ai. Les deux modeles beneficient de la meme amelioration, ce qui suggere que le systeme est agnostique au modele. La qualite de la recherche devrait s'ameliorer avec les modeles futurs sans changer l'infrastructure.
- Est-ce que Agentic Search coute plus cher en tokens ?
- Non, selon Mistral. La navigation ciblee remplace les recherches repetitives. Sur FinanceBench, l'usage de tokens baisse de 24% a 34% selon le modele, et la latence au 90e percentile diminue jusqu'a 39,6%. Le modele fait moins de recherches larges et plus de consultations precisees.