Agents multimodaux : vision, texte et action
Un agent textuel peut raisonner et appeler des API, mais il ne peut pas voir. Un agent multimodal ajoute une couche de perception visuelle : il peut consulter une capture d'écran, un diagramme, une image de produit ou un flux de caméra en direct, et utiliser ces informations pour décider de sa prochaine action. C’est le fondement des agents informatiques, des systèmes de compréhension de documents et des robots qui naviguent dans les environnements physiques.