Audio y voz: Whisper, TTS y MusicGen

El audio es simplemente otra secuencia: una señal 1D muestreada a 16.000 o 44.100 veces por segundo. Los modelos de audio modernos convierten formas de onda sin procesar en una representación de tiempo-frecuencia llamada espectrograma y luego aplican las mismas arquitecturas de transformadores que alimentan los LLM y los modelos de imágenes. Esta lección cubre los tres paradigmas dominantes de generación de audio: reconocimiento automático de voz (Whisper), texto a voz (TTS) y generación de música (MusicGen).

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.