Skip to content

服务概览与架构 ​

OneTTS 是一个开箱即用、企业级高性能的语音合成 (Text-to-Speech) 聚合网关,旨在将异构的语音合成后端统一为标准 OpenAI 协议接口。


🌟 核心价值 ​

  • 无缝替代 OpenAI 语音接口:任何支持 OpenAI TTS 的第三方客户端(如 Dify、FastGPT、DuRT、Open WebUI)只需修改 baseURL 与 apiKey 即可即刻接入。
  • 零显卡门槛冷启动:内置 Edge-TTS 微软神经语音,零显卡要求,极速在低成本 VPS 或个人电脑上运行。
  • 极低延迟流式响应:智能句子分块与流式输出,首字音频延迟(TTFT)$< \mathbf{200ms}$。
  • 智能 MD5 缓存:相同文本与参数直接秒级命中本地缓存,节省算力与带宽。

🏗️ 架构拓扑 ​

text
 客户端 (DuRT / Dify / FastGPT / Web)
                │
                ▼ (HTTP POST /v1/audio/speech)
   ┌───────────────────────────────┐
   │        OneTTS 网关服务        │
   │  ┌─────────────────────────┐  │
   │  │   MD5 音频合成缓存      │  │
   │  └─────────────────────────┘  │
   │  ┌─────────────────────────┐  │
   │  │   长文本智能分句器      │  │
   │  └─────────────────────────┘  │
   └──────────────┬────────────────┘
                  │
     ┌────────────┼────────────┐
     ▼            ▼            ▼
 ┌─────────┐ ┌─────────┐ ┌───────────┐
 │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
 └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.