Мультимодальные агенты: видение, текст и действие
Текстовый агент может рассуждать и вызывать API, но не может видеть. Мультимодальный агент добавляет уровень визуального восприятия: он может смотреть на снимок экрана, диаграмму, изображение продукта или прямую трансляцию с камеры и использовать эту информацию для принятия решения о своем следующем действии. Это основа агентов, использующих компьютеры, систем понимания документов и роботов, перемещающихся в физической среде.