Skip to content
OneTTS 网关 · 高性能语音合成 API 基座

新一代高性能统一自托管语音合成网关

聚合 Edge-TTS、Kokoro、CosyVoice 与 OpenAI,提供完全兼容 OpenAI 协议的私有化低延迟语音合成服务。

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

为现代语音 AI 智能体而生

高并发、200ms 内流式首包延迟与极简的客户端兼容性。

🎙️标准接口

完全兼容 OpenAI Speech

无缝替换 OpenAI /v1/audio/speech、/v1/models 与 /v1/audio/voices 接口,已有代码 0 修改迁移。

⚡< 200ms

低至 200ms 流式分块

基于句级分块流水线与 HTTP Chunked 流式传输,无需等待整段合成即可秒级出声。

🧩多引擎

多引擎聚合与音色库

统一接入微软 Edge-TTS、Kokoro-82M ONNX、CosyVoice 与 OpenAI 上游代理,支持 400+ 丰富音色。

💾磁盘缓存

智能 MD5 音频缓存

自动对合成文本与音色参数进行 MD5 校验缓存,重复请求实现 10ms 极速响应并极大降低算力消耗。

🛡️私有部署

100% 私有化与安全

单端口 Docker 或 uv 一键私有化部署,语音数据不出局域网,满足企业级隐私与合规要求。

🎛️精细调节

精细化语速与多格式

全面支持语速、音调、音量自定义调节,支持 MP3, WAV, AAC, OPUS, FLAC 等主流音频格式。

多引擎能力矩阵

根据应用场景、算力条件与音色偏好,灵活选择最适合的 TTS 引擎。

引擎名称类型音色 / 支持语言首包延迟硬件需求推荐场景
Edge-TTS首选推荐云端免费400+ 音色 / 40+ 语言150 - 300ms轻量 CPU / 内存通用朗读、多语种阅读、长文本有声书制作
Kokoro-82M超低延迟本地 ONNX英语 / 日语 / 中文< 150msCPU 或 CUDA GPU实时语音交互智能体、游戏 NPC 对话、边缘设备
CosyVoice本地大模型Zero-shot 声音克隆250 - 450msNVIDIA GPU (CUDA)高质量个性化声音克隆、富有情感表现力的角色配音
OpenAI Relay云端上游alloy, echo, fable, onyx, nova, shimmer300 - 600ms仅需 API KeyOpenAI 官方服务回退兜底与多模型统一代理

语音合成处理流水线

从请求接收到流式音频直出,四步精简高效处理流。

Step 01

接口鉴权与参数解析

校验 Bearer Token 或 X-API-Key,解析 model、voice、input、speed 及 response_format 参数。

Step 02

文本分块与 MD5 缓存检索

计算请求参数哈希值匹配本地缓存,未命中则执行句法规则分块并预热流水线。

Step 03

引擎分发与并发合成

调度指定引擎(EdgeTTS、Kokoro、CosyVoice)并发生成音频分块,保障低首包延迟。

Step 04

音频编码与 Chunked 流直出

将音频流式打包回传至客户端(同时写入本地磁盘持久化缓存),实现即播即放。

代码零修改即可接入

仅需修改 base_url,即可直接使用现有 OpenAI SDK 无缝调用 OneTTS。

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.