Aller au contenu principal
FREN
Menu

VLA (modèle vision-langage-action)

En anglais :
vision-language-action model
Abréviation :
VLA

Définition

Modèle qui prend en entrée des images et une consigne en langage naturel et produit directement les actions d’un robot. Il part d’un modèle vision-langage préentraîné sur des données du web, puis il est entraîné sur des trajectoires de robots, pour profiter des connaissances générales acquises en ligne. Le terme a été introduit en 2023 avec le modèle RT-2.

Vérifié le contre les références ci-dessous.

Termes liés

Références

Retour au lexique