Skip to content

服務概觀與架構 ​

OneTTS 是一個隨開即用、企業級高效能的語音合成 (Text-to-Speech) 聚合閘道,旨在將異構的語音合成後端統一為標準 OpenAI 協定介面。


🌟 核心價值 ​

  • 無縫替代 OpenAI 語音介面:任何支援 OpenAI TTS 的第三方用戶端(如 Dify、FastGPT、DuRT、Open WebUI)只需修改 baseURL 與 apiKey 即可即刻接入。
  • 零顯示卡門檻冷啟動:內建 Edge-TTS 微軟神經語音,零顯示卡要求,極速在低成本 VPS 或個人電腦上執行。
  • 極低延遲串流回應:智慧句子分塊與串流輸出,首字音訊延遲(TTFT)$< \mathbf{200ms}$。
  • 智慧 MD5 快取:相同文字與參數直接秒級命中本地快取,節省算力與頻寬。

🏗️ 架構拓撲 ​

text
 用戶端 (DuRT / Dify / FastGPT / Web)
                │
                ▼ (HTTP POST /v1/audio/speech)
   ┌───────────────────────────────┐
   │        OneTTS 閘道服務        │
   │  ┌─────────────────────────┐  │
   │  │   MD5 音訊合成快取      │  │
   │  └─────────────────────────┘  │
   │  ┌─────────────────────────┐  │
   │  │   長文字智慧斷句器      │  │
   │  └─────────────────────────┘  │
   └──────────────┬────────────────┘
                  │
     ┌────────────┼────────────┐
     ▼            ▼            ▼
 ┌─────────┐ ┌─────────┐ ┌───────────┐
 │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
 └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.