notes2026. 09. 13목표: 지식 습득
음성 합성(音聲合成) 학습 로드맵: 음향학 기초부터 최신 생성 모델까지
소리의 물리적 본질에서 딥러닝 패러다임 시프트, 그리고 대규모 오디오 생성 모델까지
#Speech Synthesis#TTS#Audio DSP#Deep Learning#Generative AI
음성 합성(音聲合成, speech synthesis)을 배워 봅시다.
음향 신호 처리(DSP)와 음성학 기초부터 HMM, Tacotron, FastSpeech, HiFi-GAN, VITS, 그리고 LLM/Diffusion 기반 최신 음성 합성까지 단계별로 체계화한 공부 로드맵입니다.
공부 로드맵 (Learning Roadmap)
STEP 01
1. 음성학 및 음향학 기초
[1] 인간의 음성[2] 음성의 물리적 구조[3] 파형, 주파수, 스펙트럼[4] Mel-spectrogram
핵심 내용:소리의 물리적 성질과 디지털 신호 처리(DSP) 기초
STEP 02
2. 전통적 TTS와 딥러닝의 도입
[5] 초기 TTS[6] Neural TTS
핵심 내용:HMM에서 딥러닝(Tacotron)으로의 패러다임 시프트
STEP 03
3. 현대적 TTS 구조의 확립
[7] Transformer 기반 TTS & Vocoder
핵심 내용:FastSpeech 계열과 GAN 기반 Vocoder (HiFi-GAN 등)
STEP 04
4. 고도화 및 다채로움 표현
[8] Voice Cloning & 감정, 운율
핵심 내용:임베딩 기술, 제로샷(Zero-shot) 학습, 스타일 전이
STEP 05
5. 최신 생성 모델 및 End-to-End
[9] Diffusion/Flow[10] LLM 기반 생성
핵심 내용:VITS, 코덱(Codec) 기반 음성 토큰화, 대규모 오디오 생성 모델
STEP 06
6. 철학적 고찰
[11] AI와 목소리의 본질
핵심 내용:표현형을 넘어선 의미론적(Semantic) 이해에 대한 탐구
💡
학습 조언 (Advice)
/
음향 신호 처리(DSP)는 수학적으로 매우 깊고 어렵습니다. 수식을 외우려 하기보다 '왜 파형을 그대로 쓰지 않는 걸까?' 같은 직관적인 이유와 이해를 바탕으로 학습하길 권장합니다.
/
논문 구현(Code)과 함께 하세요. Tacotron2나 VITS 같은 오픈소스 코드를 다운로드하고 직접 오디오를 들어보며 공부하는 것이 이론만 보는 것보다 더 많은 지식을 얻어갈 수 있는 길입니다.
ℹ안내 사항
향후 로드맵은 수정될 수 있습니다. 또한 오탈자나 잘못된 부분을 발견하시면 연락해주시면 감사드리겠습니다.
DOCUMENT LOGGED // 2026. 09. 13← Thoughts 목록으로