Agentes multimodales: visión, texto y acción

Un agente de solo texto puede razonar y llamar a las API, pero no puede ver. Un agente multimodal agrega una capa de percepción visual: puede mirar una captura de pantalla, un diagrama, una imagen de producto o una cámara en vivo y usar esa información para decidir su próxima acción. Esta es la base de los agentes que utilizan computadoras, los sistemas de comprensión de documentos y los robots que navegan por entornos físicos.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.