Аудио и речь: Whisper, TTS и MusicGen.
Аудио — это просто еще одна последовательность: одномерный сигнал, дискретизируемый с частотой 16 000 или 44 100 раз в секунду. Современные аудиомодели преобразуют необработанные сигналы в частотно-временное представление, называемое спектрограммой, а затем применяют ту же архитектуру преобразователя, которая используется в LLM и моделях изображений. В этом уроке рассматриваются три доминирующие парадигмы генерации звука: автоматическое распознавание речи (Whisper), преобразование текста в речь (TTS) и генерация музыки (MusicGen).