Skip to content

개요 및 아키텍처 ​

OneTTS는 서로 다른 다양한 음성 합성 백엔드를 단일 OpenAI 호환 API 엔드포인트로 통합하도록 설계된 엔터프라이즈급 고성능 텍스트 음성 변환(TTS) 애그리게이션 게이트웨이입니다.


🌟 왜 OneTTS인가요? ​

  • OpenAI 표준 원클릭 교체: OpenAI TTS를 지원하는 모든 애플리케이션(예: Dify, FastGPT, Open WebUI, DuRT)은 baseURL과 apiKey만 수정하여 바로 OneTTS로 전환할 수 있습니다.
  • GPU 없이 즉시 시작: 내장된 Edge-TTS 지원으로 저비용 VPS나 로컬 CPU 환경에서도 GPU 없이 즉시 배포할 수 있습니다.
  • 초저지연 스트리밍: 파이프라인 문장 분할 기술을 통해 200ms 이내에 첫 오디오 청크를 전달합니다.
  • 지능형 오디오 캐싱: 중복된 합성 요청은 로컬 MD5 캐시에서 즉시 반환되어 대역폭과 연산 자원을 대폭 절약합니다.

🏗️ 아키텍처 ​

text
 Client (DuRT / Dify / Web / API)
                │
                ▼ (HTTP /v1/audio/speech)
   ┌───────────────────────────────┐
   │        OneTTS Gateway         │
   │  ┌─────────────────────────┐  │
   │  │  MD5 Synthesis Cache    │  │
   │  └─────────────────────────┘  │
   │  ┌─────────────────────────┐  │
   │  │ Sentence Text Splitter  │  │
   │  └─────────────────────────┘  │
   └──────────────┬────────────────┘
                  │
     ┌────────────┼────────────┐
     ▼            ▼            ▼
 ┌─────────┐ ┌─────────┐ ┌───────────┐
 │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
 └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.