THOUGHTS // BACK TO INDEX
notes2026. 09. 13목표: 지식 습득

음성 합성(音聲合成) 학습 로드맵: 음향학 기초부터 최신 생성 모델까지

소리의 물리적 본질에서 딥러닝 패러다임 시프트, 그리고 대규모 오디오 생성 모델까지

#Speech Synthesis#TTS#Audio DSP#Deep Learning#Generative AI
음성 합성(音聲合成, speech synthesis)을 배워 봅시다.
음향 신호 처리(DSP)와 음성학 기초부터 HMM, Tacotron, FastSpeech, HiFi-GAN, VITS, 그리고 LLM/Diffusion 기반 최신 음성 합성까지 단계별로 체계화한 공부 로드맵입니다.

공부 로드맵 (Learning Roadmap)

STEP 01

1. 음성학 및 음향학 기초

[1] 인간의 음성[2] 음성의 물리적 구조[3] 파형, 주파수, 스펙트럼[4] Mel-spectrogram
핵심 내용:소리의 물리적 성질과 디지털 신호 처리(DSP) 기초
STEP 02

2. 전통적 TTS와 딥러닝의 도입

[5] 초기 TTS[6] Neural TTS
핵심 내용:HMM에서 딥러닝(Tacotron)으로의 패러다임 시프트
STEP 03

3. 현대적 TTS 구조의 확립

[7] Transformer 기반 TTS & Vocoder
핵심 내용:FastSpeech 계열과 GAN 기반 Vocoder (HiFi-GAN 등)
STEP 04

4. 고도화 및 다채로움 표현

[8] Voice Cloning & 감정, 운율
핵심 내용:임베딩 기술, 제로샷(Zero-shot) 학습, 스타일 전이
STEP 05

5. 최신 생성 모델 및 End-to-End

[9] Diffusion/Flow[10] LLM 기반 생성
핵심 내용:VITS, 코덱(Codec) 기반 음성 토큰화, 대규모 오디오 생성 모델
STEP 06

6. 철학적 고찰

[11] AI와 목소리의 본질
핵심 내용:표현형을 넘어선 의미론적(Semantic) 이해에 대한 탐구
💡

학습 조언 (Advice)

/
음향 신호 처리(DSP)는 수학적으로 매우 깊고 어렵습니다. 수식을 외우려 하기보다 '왜 파형을 그대로 쓰지 않는 걸까?' 같은 직관적인 이유와 이해를 바탕으로 학습하길 권장합니다.
/
논문 구현(Code)과 함께 하세요. Tacotron2나 VITS 같은 오픈소스 코드를 다운로드하고 직접 오디오를 들어보며 공부하는 것이 이론만 보는 것보다 더 많은 지식을 얻어갈 수 있는 길입니다.
안내 사항
향후 로드맵은 수정될 수 있습니다. 또한 오탈자나 잘못된 부분을 발견하시면 연락해주시면 감사드리겠습니다.
DOCUMENT LOGGED // 2026. 09. 13← Thoughts 목록으로