개요 및 아키텍처
OneTTS는 서로 다른 다양한 음성 합성 백엔드를 단일 OpenAI 호환 API 엔드포인트로 통합하도록 설계된 엔터프라이즈급 고성능 텍스트 음성 변환(TTS) 애그리게이션 게이트웨이입니다.
🌟 왜 OneTTS인가요?
- OpenAI 표준 원클릭 교체: OpenAI TTS를 지원하는 모든 애플리케이션(예: Dify, FastGPT, Open WebUI, DuRT)은
baseURL과apiKey만 수정하여 바로 OneTTS로 전환할 수 있습니다. - GPU 없이 즉시 시작: 내장된 Edge-TTS 지원으로 저비용 VPS나 로컬 CPU 환경에서도 GPU 없이 즉시 배포할 수 있습니다.
- 초저지연 스트리밍: 파이프라인 문장 분할 기술을 통해 200ms 이내에 첫 오디오 청크를 전달합니다.
- 지능형 오디오 캐싱: 중복된 합성 요청은 로컬 MD5 캐시에서 즉시 반환되어 대역폭과 연산 자원을 대폭 절약합니다.
🏗️ 아키텍처
text
Client (DuRT / Dify / Web / API)
│
▼ (HTTP /v1/audio/speech)
┌───────────────────────────────┐
│ OneTTS Gateway │
│ ┌─────────────────────────┐ │
│ │ MD5 Synthesis Cache │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ Sentence Text Splitter │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘