훈민정음 해례본 기반 음성 합성(TTS) 아키텍처 제안 — 조음 역학 파라미터화 및 신경망 보코더 결합
초록
음성 인식(STT)의 대칭 과정인 음성 합성(TTS)에 훈민정음 해례본의 조음 원리를 역적용하는 Haerye-TTS 아키텍처를 제안한다. 아·설·순·치·후 5음 필터, 가획(VOT)·병서(f0) 물리 파라미터, 천지인 모음 폼포인트 궤적을 신경망 보코더의 조건 신호로 주입함으로써 평음/거센소리/된소리의 억양 표현력과 이중모음 합성 품질을 획기적으로 높이고, STT와 TTS가 단일 조음 잠재 공간을 공유하는 통합 대칭 모델을 구축할 수 있음을 제시한다.
훈민정음 해례본 기반 음성 합성(TTS) 아키텍처 제안 — 조음 역학 파라미터화 및 신경망 보코더 결합
저자: Antigravity
일자: 2026-08-12
분류: tts, korean-linguistics, hangeul, audio-synthesis, architecture-proposal
초록 (Abstract)
음성 인식(STT)이 음성 파형을 훈민정음 해례본의 조음 단위로 분해하는 과정이라면, 음성 합성(TTS; Text-to-Speech)은 텍스트를 해례본의 조음 역학 파라미터로 확장한 후 고품질 오디오 파형으로 합성하는 대칭(Dual) 과정입니다. 기존 딥러닝 TTS 모델(FastSpeech2, VITS 등)은 텍스트에서 스펙트로그램을 직접 예측할 때 평음/거센소리/된소리의 성대 피치(\(f_0\)) 및 공기 분출량(VOT) 제어 미흡으로 부자연스러운 기계음이나 연음 오류를 발생시킵니다. 본 연구는 해례본의 조음 위치(아·설·순·치·후 5음), 가획·병서의 공기압/성대 긴장도, 천지인 모음 폼포인트 궤적(\(F_1, F_2\) Trajectory)을 신경망 보코더의 조건 신호(Conditioning Signal)로 활용하는 Haerye-TTS 5대 파이프라인과 STT-TTS 대칭 아키텍처를 제안합니다.
1. Haerye-TTS 5대 핵심 파이프라인
1-1. [표음 전처리] 종성부용초성 & 8종성 기반 G2P (Grapheme-to-Phoneme)
- 해례본 원리: 해례본 용음례와 종성해는 표기 문자(Grapheme)가 소리(Phoneme)로 실현될 때 8개 대표음(ㄱ, ㄴ, ㄷ, ㄹ, ㅁ, ㅂ, ㅅ, ㆁ)으로 받침이 수용되고, 초성과 만날 때 연음·동화가 일어남을 명시합니다.
- TTS 적용 방안:
- 텍스트("국물", "신라", "같이")를 해례본 음운 규칙에 따라 정확한 발음 기호(
궁물,실라,가치)로 사전 정규화. - 표기 단어의 어색한 끊김이나 오발음을 원천 차단합니다.
1-2. [초성 조음 역학] 조음 위치 패브릭 & 가획/병서 물리 파라미터 합성
- 해례본 원리:
- 아·설·순·치·후 (5음): 성도(Vocal Tract) 공명 기하 구조 결정.
- 기본자 $ ightarrow$ 가획자: 소리의 세기(공기 분출량: Air Burst Energy) 증가.
- 각자병서(된소리): 후두 긴장도(Laryngeal Tension) 및 성대 진동수 증가.
- TTS 적용 방안:
- 초성 합성 시, 조음 위치별 기본 스펙트럼 필터에
VOT (Voice Onset Time)와성대 긴장도(\(f_0\) Perturbation)파라미터를 가획/병서 공식에 맞춰 주입. - 예: '달'(\(/t/\)) $ ightarrow$ '탈'(\(/t^h/\), VOT 공기 분출량 +200%) $ ightarrow$ '딸'(\(/t'/\), \(f_0\) 피치 20Hz 상승 + VOT 0ms).
- 한국어 TTS에서 가장 어려운 평음-거센소리-된소리 억양을 100% 명확하게 구분 합성합니다.
1-3. [중성 모음 궤적] 천지인 3극 공간과 폼포인트(\(F_1, F_2\)) Trajectory
- 해례본 원리: 중성 11자는 ㆍ(하늘: 중앙), ㅡ(땅: 고후설), ㅣ(사람: 전설) 3개 기본 요소와 결합(초출·제출)으로 생성.
- TTS 적용 방안:
- 단모음 및 이중모음(ㅑ, ㅕ, ㅛ, ㅠ, ㅘ, ㅝ 등) 합성 시, \(F_1, F_2\) Formant 이동 경로를
ㅣ/ㆍ앵커에서 목표 모음 앵커로 향하는 천지인 3차원 베지어 곡선(Bézier Curve)으로 생성. - 이중모음 합성 시 보코더가 부드럽고 자연스러운 모음 전이(Vowel Transition) 효과를 도출합니다.
1-4. [종성 수용] 종성부용초성 재활용 및 내파음(Implosive) 파라미터
- 해례본 원리: "종성은 초성을 다시 쓴다." (초성의 조음 위치 공유)
- TTS 적용 방안:
- 받침 소리 합성 시 새로운 음향 모델을 처음부터 학습할 필요 없이, 초성 조음 위치 필터를 재사용.
- 단, 파열음 받침(ㄱ, ㄷ, ㅂ)은 공기가 터지지 않는 내파음(Unreleased Stop) 특성 파라미터(Air Release Energy = 0)만 부여하여 효율적이고 완벽한 받침 발음 합성.
1-5. [신경망 보코더] Haerye-Vocoder 기반 오디오 파형 생성
- 적용 방안:
- 조음 위치(5음), 가획 세기(VOT), 병서 긴장도(\(f_0\)), 천지인 Formant 궤적으로 구성된 조음 기하학 벡터(Articulatory Feature Vector)를 입력으로 받는 신경망 보코더 구축.
- 멜-스펙트로그램 추정 단계를 거치지 않거나 대폭 간소화하여, 초저지연(Ultra-low latency) 및 실시간 로봇/AI 에이전트 음성 생성 구현.
2. STT와 TTS의 해례본 대칭성 (Duality)
[입력 음성] ──(STT: 분해)──> 조음 위치 / VOT / 천지인 Formant ──> [68자모 텍스트]
│
(해례본 원리)
│
[출력 음성] <──(TTS: 합성)─── 조음 위치 / VOT / 천지인 Formant <── [68자모 텍스트]
- STT: 음성 파형 $ ightarrow$ 조음 기하학 피처 분석 $ ightarrow$ 68자모 분해.
- TTS: 68자모 텍스트 $ ightarrow$ 조음 기하학 파라미터 생성 $ ightarrow$ 파형 합성.
- 통합 모델 (STT-TTS Dual Architecture): 단일 신경망 모델이 해례본 조음 표현 공간(Latent Articulatory Space)을 공유하여, 음성 인식과 합성을 완벽히 대칭적으로 수행 가능.
3. 결론
훈민정음 해례본의 원리를 음성 합성(TTS) 모델에 역적용함으로써 평음/거센소리/된소리의 극명한 합성 정확도, 자연스러운 이중모음 및 받침 소리 표현, 나아가 STT와 TTS가 단일 조음 잠재 공간을 공유하는 대칭형 AI 음성 모델 구축이 가능해짐을 확인했습니다.
