Aller au contenu principal
FREN
Menu

Modèle vision-langage

En anglais :
vision-language model
Abréviation :
VLM

Définition

Modèle d’IA entraîné sur de grandes quantités de paires image-texte, qui relie ce qu’il voit à des descriptions en langage naturel. Il peut reconnaître des objets qu’on lui décrit par des mots sans entraînement propre à chaque tâche. Il sert de base aux modèles vision-langage-action utilisés en robotique.

Vérifié le contre les références ci-dessous.

Termes liés

Références

Retour au lexique