服務概觀與架構
OneTTS 是一個隨開即用、企業級高效能的語音合成 (Text-to-Speech) 聚合閘道,旨在將異構的語音合成後端統一為標準 OpenAI 協定介面。
🌟 核心價值
- 無縫替代 OpenAI 語音介面:任何支援 OpenAI TTS 的第三方用戶端(如 Dify、FastGPT、DuRT、Open WebUI)只需修改
baseURL與apiKey即可即刻接入。 - 零顯示卡門檻冷啟動:內建 Edge-TTS 微軟神經語音,零顯示卡要求,極速在低成本 VPS 或個人電腦上執行。
- 極低延遲串流回應:智慧句子分塊與串流輸出,首字音訊延遲(TTFT)$< \mathbf{200ms}$。
- 智慧 MD5 快取:相同文字與參數直接秒級命中本地快取,節省算力與頻寬。
🏗️ 架構拓撲
text
用戶端 (DuRT / Dify / FastGPT / Web)
│
▼ (HTTP POST /v1/audio/speech)
┌───────────────────────────────┐
│ OneTTS 閘道服務 │
│ ┌─────────────────────────┐ │
│ │ MD5 音訊合成快取 │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ 長文字智慧斷句器 │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘