Audio et parole : Whisper, TTS et MusicGen

L'audio n'est qu'une autre séquence : un signal 1D échantillonné à 16 000 ou 44 100 fois par seconde. Les modèles audio modernes convertissent les formes d'onde brutes en une représentation temps-fréquence appelée spectrogramme, puis appliquent les mêmes architectures de transformateur qui alimentent les LLM et les modèles d'images. Cette leçon couvre les trois paradigmes dominants de génération audio : la reconnaissance automatique de la parole (Whisper), la synthèse vocale (TTS) et la génération de musique (MusicGen).

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.