VLA (modèle vision-langage-action)
- En anglais :
- vision-language-action model
- Abréviation :
- VLA
Définition
Modèle qui prend en entrée des images et une consigne en langage naturel et produit directement les actions d’un robot. Il part d’un modèle vision-langage préentraîné sur des données du web, puis il est entraîné sur des trajectoires de robots, pour profiter des connaissances générales acquises en ligne. Le terme a été introduit en 2023 avec le modèle RT-2.
Vérifié le contre les références ci-dessous.