Audio y voz: Whisper, TTS y MusicGen
El audio es simplemente otra secuencia: una señal 1D muestreada a 16.000 o 44.100 veces por segundo. Los modelos de audio modernos convierten formas de onda sin procesar en una representación de tiempo-frecuencia llamada espectrograma y luego aplican las mismas arquitecturas de transformadores que alimentan los LLM y los modelos de imágenes. Esta lección cubre los tres paradigmas dominantes de generación de audio: reconocimiento automático de voz (Whisper), texto a voz (TTS) y generación de música (MusicGen).