聚合 Edge-TTS、Kokoro、CosyVoice 与 OpenAI,提供完全兼容 OpenAI 协议的私有化低延迟语音合成服务。
高并发、200ms 内流式首包延迟与极简的客户端兼容性。
无缝替换 OpenAI /v1/audio/speech、/v1/models 与 /v1/audio/voices 接口,已有代码 0 修改迁移。
基于句级分块流水线与 HTTP Chunked 流式传输,无需等待整段合成即可秒级出声。
统一接入微软 Edge-TTS、Kokoro-82M ONNX、CosyVoice 与 OpenAI 上游代理,支持 400+ 丰富音色。
自动对合成文本与音色参数进行 MD5 校验缓存,重复请求实现 10ms 极速响应并极大降低算力消耗。
单端口 Docker 或 uv 一键私有化部署,语音数据不出局域网,满足企业级隐私与合规要求。
全面支持语速、音调、音量自定义调节,支持 MP3, WAV, AAC, OPUS, FLAC 等主流音频格式。
根据应用场景、算力条件与音色偏好,灵活选择最适合的 TTS 引擎。
| 引擎名称 | 类型 | 音色 / 支持语言 | 首包延迟 | 硬件需求 | 推荐场景 |
|---|---|---|---|---|---|
| Edge-TTS首选推荐 | 云端免费 | 400+ 音色 / 40+ 语言 | 150 - 300ms | 轻量 CPU / 内存 | 通用朗读、多语种阅读、长文本有声书制作 |
| Kokoro-82M超低延迟 | 本地 ONNX | 英语 / 日语 / 中文 | < 150ms | CPU 或 CUDA GPU | 实时语音交互智能体、游戏 NPC 对话、边缘设备 |
| CosyVoice | 本地大模型 | Zero-shot 声音克隆 | 250 - 450ms | NVIDIA GPU (CUDA) | 高质量个性化声音克隆、富有情感表现力的角色配音 |
| OpenAI Relay | 云端上游 | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | 仅需 API Key | OpenAI 官方服务回退兜底与多模型统一代理 |
从请求接收到流式音频直出,四步精简高效处理流。
校验 Bearer Token 或 X-API-Key,解析 model、voice、input、speed 及 response_format 参数。
计算请求参数哈希值匹配本地缓存,未命中则执行句法规则分块并预热流水线。
调度指定引擎(EdgeTTS、Kokoro、CosyVoice)并发生成音频分块,保障低首包延迟。
将音频流式打包回传至客户端(同时写入本地磁盘持久化缓存),实现即播即放。
仅需修改 base_url,即可直接使用现有 OpenAI SDK 无缝调用 OneTTS。
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")