Speech & Audio AI: Speech & Audio Processing
Comprehensive AI for Speech & Audio course — from audio signal processing, Speech Recognition (ASR) with Whisper, Text-to-Speech (TTS) with VITS, Voice Cloning, Speaker Verification, to Music AI. Practice with Python, PyTorch, Hugging Face, librosa, and state-of-the-art models.
Part 1: Audio & Signal Processing Foundations
Part 2: Speech Recognition (ASR) — Speech Recognition
Part 3: Text-to-Speech & Voice Technologies
Part 4: Advanced Audio AI & Production
Lesson 10: Speech Enhancement & Source Separation120 minLesson 11: Music AI — Generation, Analysis & Transcription150 minLesson 12: Emotion Recognition & Sentiment from Speech120 minLesson 13: Vietnamese Speech AI — ASR & TTS Vietnamese180 minLesson 14: Deploy Speech AI — Production Pipeline150 minLesson 15: Capstone — Voice Assistant End-to-End240 min