Actualité · Modèles IA

Gemini agentic video : l'IA qui ne se contente plus de regarder, elle fouille

2 septembre 2026 · 5 min de lecture

Google a sorti l'agentic video understanding le 1er septembre 2026, dans Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. La fonction existe aussi sous le nom "agentic video" dans la documentation. Elle change la facon dont un modele IA traite une video : au lieu de la regarder a vitesse fixe, il navigue dedans, choisit les moments pertinents, les modalites (images, audio, transcript) et la vitesse de lecture. Resultat : 88% de tokens en moins, 66% de cout en moins, et 7% de precision en plus sur les benchmarks standards.

Le probleme du traitement statique

Avant cette mise a jour, Gemini traitait une video en l'avalant a un taux d'images fixe. Une image par seconde par defaut, ajustable via l'API. Une video de 90 minutes a 1 FPS, c'est 5 400 frames. Chaque frame est encodee en tokens. Sur une longue video, le cout explose et le modele a du mal a trouver l'information pertinente noyee dans le bruit.

Les developpeurs qui voulaient faire mieux devaient bricoler : extraire des keyframes, decouper la video en segments, faire du pre-traitement. Ca marchait mais c'est lourd, et ca demande du code custom pour chaque cas d'usage.

L'agentic video understanding supprime ce bricolage. Le modele utilise un outil interne pour charger les segments pertinents de la video, au moment ou il en a besoin, dans la modalite qui convient. Il peut scanner les frames visuelles, ecouter l'audio, ou lire le transcript. C'est le modele qui decide, pas le developpeur.

Comment ca marche

Le modele prend une requete en entree ("quels sont les 3 annonces les plus importantes de cette keynote ?") et entre dans une boucle agentique. Il charge un premier segment de la video, l'analyse, decide s'il a besoin d'en voir plus, et navigue vers les segments suivants ou precedents. Il peut re-echantillonner une fenetre interessante a plus haute frequence pour examiner un mouvement rapide ou un changement subtil.

L'analogie : un humain qui regarde une video de 2 heures pour trouver un moment precis ne la regarde pas a 1x de bout en bout. Il avance rapide, il revient en arriere, il regarde l'audio quand l'image ne suffit pas, il s'arrete sur les passages cles. L'agentic video understanding fait la meme chose.

Google ne detaille pas l'architecture exacte de la boucle agentique, mais la documentation mentionne des "native video tools" que le modele appelle pour charger les segments. C'est le meme principe que l'agentic vision lance precedemment sur les images : le modele raisonne, appelle un outil, obtient un resultat, raisonne a nouveau.

Les chiffres

Google publie les resultats sur ses benchmarks video standards. Les gains sont mesures sur Gemini 3.7 Flash, qui offre la meilleure combinaison qualite-cout.

MetriqueTraitement statiqueTraitement agentiqueGain
Tokens consommesreference-88% maximum8x moins
Cout d'analysereference-66% maximum3x moins cher
Precisionreference+7% maximummeilleure qualite

Les gains sont surtout prononces sur les videos longues, de 10 minutes a plusieurs heures. Sur une video courte, l'ecart est plus faible parce que le traitement statique est deja abordable et que l'information est concentree.

Les cas d'usage concrets

Google liste quatre cas ou l'agentic video understanding change la donne.

La recuperation d'un moment precis au sous-second pres. Sur une video a 1 FPS, un changement d'etat qui dure moins d'une seconde peut etre manque. Le modele agentique peut re-echantillonner la fenetre interessante a plus haute frequence et capturer le moment. Utile pour du montage automatise ou pour verifier un evenement precis dans une video de surveillance.

La recherche dans des videos longues. Une requete comme "a quel moment le presentateur mentionne le nouveau modele graphique ?" sur une keynote de 90 minutes. En traitement statique, le modele doit ingere toute la video pour repondre. En traitement agentique, il navigue vers les segments pertinents en utilisant le transcript et l'audio comme indices, puis verifie visuellement. Le cout d'une telle requete tombe de plusieurs millions de tokens a une fraction.

La detection d'anomalies. Sur une video de processus industriel, le modele peut scanner rapidement la majorite de la video et re-echantillonner les fenetres ou un mouvement anormal est detecte. Le gain de cout rend possible l'analyse de videos de plusieurs heures qui etaient trop cheres a traiter en statique.

Le comptage d'objets ou d'actions. Compter combien de fois un geste est repete dans une video de formation, ou combien de produits defectueux passent sur une chaine d'assemblage. La precision augmente parce que le modele peut suivre un objet specifique sur les frames pertinentes au lieu d'essayer de tout garder en contexte.

Un exemple chez Maisons&Mobilia

Sophie, PM chez Maisons&Mobilia (M&M, enseigne de meubles fictive), gere un catalogue de 3 000 produits. Chaque produit a une video de presentation de 30 a 60 secondes. L'equipe support reçoit des questions specifiques sur les videos : "a quelle hauteur est le tiroir du modele Lyon ?", "le canape se decompose-t-il en trois parties comme sur la photo ?".

Avant l'agentic video, Sophie aurait eu besoin d'extraire les keyframes de chaque video, de les annoter manuellement, et de construire une base de donnees d'images pour repondre a ces questions. Trois mois de travail, un dev a temps plein.

Avec l'agentic video understanding, Sophie peut envoyer la video et la question directement a l'API Gemini. Le modele navigue dans la video, trouve le moment ou le tiroir est ouvert, lit la dimension sur l'image, et repond. Pas de pre-traitement, pas de base de donnees. Le cout d'une requete sur une video de 60 secondes est negligeable avec la reduction de 88% des tokens.

La limite : si la dimension est dite a l'oral mais pas affichee a l'ecran, le modele doit combiner l'audio et l'image. Google ne precise pas la fiabilite de cette combinaison sur des cas concrets. Sophie devrait tester sur un echantillon de ses videos avant de deployer en production.

Comment l'utiliser

La fonction est disponible aujourd'hui dans Google AI Studio et le Gemini Enterprise Agent Platform. Pour l'activer, un seul parametre dans l'appel API : processing: "agentic" sur l'input video. La tarification est celle des tokens Gemini standard, sans supplement pour la fonctionnalite.

from google import genai

client = genai.Client()
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {"type": "video", "uri": "https://youtu.be/...", "processing": "agentic"},
        {"type": "text", "text": "Quels sont les 3 points les plus importants ?"},
    ],
)
print(interaction.output_text)

Google a annonce que la fonction arrivera dans l'app Gemini pour tous les utilisateurs dans les prochains mois, et qu'elle alimentera la fonction Ask YouTube sur les pages de video. Au lieu de repondre a partir des metadonnees et du transcript, YouTube pourra repondre a partir du contenu visuel de la video.

Ce que ca change si tu apprends l'IA

Trois notions a retenir de cette sortie.

  1. Agent vs modele statique : un modele statique traite l'entree qu'on lui donne, a la vitesse qu'on a configuree. Un modele agentique decide lui-meme comment traiter l'entree, en appellant des outils pour aller chercher ce dont il a besoin. C'est la difference entre lire un livre de bout en bout et le feuilleter pour trouver un passage. L'agentic video understanding est un exemple concret de cette difference, sur un type de donnees que tout le monde connait : la video.

  2. Tokens et cout : une video de 90 minutes a 1 FPS, c'est des milliers de frames, chacune encodee en tokens. Le cout d'un traitement statique sur une video longue est prohibitif. L'approche agentique reduit ce cout en ne chargeant que les segments pertinents. C'est le meme principe que le cache de contexte pour un agent textuel : tu ne paies que pour ce que tu utilises.

  3. Modalites croisees : l'agentic video understanding combine les frames visuelles, l'audio et le transcript dans la meme boucle de raisonnement. Le modele decide de lire le transcript pour trouver un passage, puis de regarder l'image pour verifier un detail, puis d'ecouter l'audio pour confirmer. C'est le multi-modalite appliquee a un seul type d'entree (la video), avec un agent qui orchestre les modalites.

La competence pratique : savoir quand utiliser un traitement agentique vs statique. Si ta video fait 30 secondes et que tu as une seule question, le traitement statique suffit. Si ta video fait 2 heures et que tu veux faire de la recherche, du comptage ou de la detection d'anomalies, l'agentique divise ton cout par 3 a 8. Le bon choix depend de la longueur de la video et de la complexite de la requete.

Aller plus loin

Pour comprendre comment un agent IA utilise des outils et enchaene des etapes, notre article sur comment fonctionne un agent IA pose les bases du tool use et de l'orchestration. Pour voir les garde-fous a mettre en place quand un agent accede a tes donnees, le guide sur les garde-fous des agents IA detaille le moindre privilege et le human in the loop. Et pour t'entraener a ces notions en 5 minutes par jour, l'app saisir.ai propose des modules interactifs sur les agents, le tool use et le multi-modal, en francais, sans coder.

Sources

Questions fréquentes

C'est quoi l'agentic video understanding de Gemini ?
C'est une capacite lancee par Google le 1er septembre 2026 dans Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite. Au lieu d'ingrer une video a une vitesse fixe, le modele utilise des outils internes pour chercher, scanner et inspecter les segments pertinents de la video, dans la modalite qui convient (images, audio ou transcript). Ca reduit la consommation de tokens jusqu'a 88%, le cout jusqu'a 66%, et ameliore la precision jusqu'a 7%.
Comment activer l'agentic video understanding dans l'API Gemini ?
Il suffit de mettre le parametre processing a 'agentic' dans la configuration de l'API Gemini quand tu envoies une video. La fonction est disponible dans Google AI Studio et le Gemini Enterprise Agent Platform, avec la tarification standard des tokens Gemini, sans supplement.
Quels cas d'usage l'agentic video understanding permet-il ?
Quatre cas principaux : la recuperation d'un moment precis au sous-second pres (pour du montage automatise), la recherche d'information dans des videos de plusieurs heures, la detection d'anomalies en re-echantillonnant les fenetres interessantes a plus haute frequence, et le comptage precis d'objets ou d'actions repetees.
Est-ce que l'agentic video understanding est disponible pour les utilisateurs grand public ?
Oui, progressivement. Google a annonce que la fonction arrivera dans l'app Gemini pour tous les utilisateurs sur les modeles Flash et Flash-Lite dans les prochains mois. Elle alimentera aussi la fonction Ask YouTube sur les pages de video, avec des reponses basees sur le contenu visuel et non plus seulement sur les metadonnees.
Quelle est la difference entre le traitement statique et le traitement agentique d'une video par une IA ?
En traitement statique, le modele ingere la video a un taux d'images fixe (par defaut 1 image par seconde), quoi qu'il arrive. En traitement agentique, le modele decide lui-meme quelles parties regarder, a quelle vitesse, et dans quelle modalite (images, audio ou transcript). Il ne lit que ce dont il a besoin pour repondre, ce qui reduit le cout et ameliore la precision sur les videos longues.

Termes du glossaire