Glossaire

Multimodal, c'est quoi ?

Capacité d'un modèle à traiter autre chose que du texte : image, audio, PDF. Un LLM multimodal « voit » une image et la décrit.

Mis à jour le 26 juillet 2026

Ce que c'est

La capacité d'un modèle à traiter autre chose que du texte : image, audio, PDF. Un LLM multimodal « voit » une image et peut la décrire ou en extraire de l'info.

Pourquoi c'est important

Ça élargit beaucoup les usages : analyser une photo de produit, lire un document scanné, comprendre un schéma. Une grande part de l'information réelle n'est pas du texte propre.

Exemples concrets

  • Tu photographies une facture, le modèle en sort les montants.
  • Décrire une photo de meuble Maisons&Mobilia pour générer sa fiche produit.

Questions fréquentes

Multimodal, c'est quoi ?
La capacité d'un modèle à traiter autre chose que du texte : image, audio, PDF. Un LLM multimodal « voit » une image et peut la décrire ou en extraire de l'info.
À quoi ça sert ?
Ça élargit beaucoup les usages : analyser une photo de produit, lire un document scanné, comprendre un schéma. Une grande part de l'information réelle n'est pas du texte propre.
Un exemple concret ?
Tu photographies une facture, le modèle en sort les montants.