服务概览与架构
OneTTS 是一个开箱即用、企业级高性能的语音合成 (Text-to-Speech) 聚合网关,旨在将异构的语音合成后端统一为标准 OpenAI 协议接口。
🌟 核心价值
- 无缝替代 OpenAI 语音接口:任何支持 OpenAI TTS 的第三方客户端(如 Dify、FastGPT、DuRT、Open WebUI)只需修改
baseURL与apiKey即可即刻接入。 - 零显卡门槛冷启动:内置 Edge-TTS 微软神经语音,零显卡要求,极速在低成本 VPS 或个人电脑上运行。
- 极低延迟流式响应:智能句子分块与流式输出,首字音频延迟(TTFT)$< \mathbf{200ms}$。
- 智能 MD5 缓存:相同文本与参数直接秒级命中本地缓存,节省算力与带宽。
🏗️ 架构拓扑
text
客户端 (DuRT / Dify / FastGPT / Web)
│
▼ (HTTP POST /v1/audio/speech)
┌───────────────────────────────┐
│ OneTTS 网关服务 │
│ ┌─────────────────────────┐ │
│ │ MD5 音频合成缓存 │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ 长文本智能分句器 │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘