Audio et parole : Whisper, TTS et MusicGen
L'audio n'est qu'une autre séquence : un signal 1D échantillonné à 16 000 ou 44 100 fois par seconde. Les modèles audio modernes convertissent les formes d'onde brutes en une représentation temps-fréquence appelée spectrogramme, puis appliquent les mêmes architectures de transformateur qui alimentent les LLM et les modèles d'images. Cette leçon couvre les trois paradigmes dominants de génération audio : la reconnaissance automatique de la parole (Whisper), la synthèse vocale (TTS) et la génération de musique (MusicGen).