Modèle vision-langage
- En anglais :
- vision-language model
- Abréviation :
- VLM
Définition
Modèle d’IA entraîné sur de grandes quantités de paires image-texte, qui relie ce qu’il voit à des descriptions en langage naturel. Il peut reconnaître des objets qu’on lui décrit par des mots sans entraînement propre à chaque tâche. Il sert de base aux modèles vision-langage-action utilisés en robotique.
Vérifié le contre les références ci-dessous.