Agentes multimodales: visión, texto y acción
Un agente de solo texto puede razonar y llamar a las API, pero no puede ver. Un agente multimodal agrega una capa de percepción visual: puede mirar una captura de pantalla, un diagrama, una imagen de producto o una cámara en vivo y usar esa información para decidir su próxima acción. Esta es la base de los agentes que utilizan computadoras, los sistemas de comprensión de documentos y los robots que navegan por entornos físicos.