Skip to content
OneTTS 閘道 · 高效能語音合成 API 基座

新一代高效能統一自託管語音合成閘道

聚合 Edge-TTS、Kokoro、CosyVoice 與 OpenAI,提供完全相容 OpenAI 協定的私有化低延遲語音合成服務。

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

為現代語音 AI 智慧體而生

高並行、200ms 內串流首包延遲與極簡的客戶端相容性。

🎙️標準介面

完全相容 OpenAI Speech

無縫替換 OpenAI /v1/audio/speech、/v1/models 與 /v1/audio/voices 介面,現有程式碼 0 修改遷移。

⚡< 200ms

低至 200ms 串流分塊

基於句級分塊管線與 HTTP Chunked 串流傳輸,無需等待整段合成即可秒級發聲。

🧩多引擎

多引擎聚合與音色庫

統一接入微軟 Edge-TTS、Kokoro-82M ONNX、CosyVoice 與 OpenAI 上游代理,支援 400+ 豐富音色。

💾磁碟快取

智慧 MD5 音訊快取

自動對合成文字與音色參數進行 MD5 校驗快取,重複請求實現 10ms 極速回應並極大降低算力消耗。

🛡️私有部署

100% 私有化與安全

單埠 Docker 或 uv 一鍵私有化部署,語音資料不出區域網路,滿足企業級隱私與法規遵循要求。

🎛️精細調節

精細化語速與多格式

全面支援語速、音調、音量自訂調節,支援 MP3, WAV, AAC, OPUS, FLAC 等主流音訊格式。

多引擎能力矩陣

根據應用場景、算力條件與音色偏好,靈活選擇最適合的 TTS 引擎。

引擎名稱類型音色 / 支援語言首包延遲硬體需求推薦場景
Edge-TTS首選推薦雲端免費400+ 音色 / 40+ 語言150 - 300ms輕量 CPU / 記憶體通用朗讀、多語種閱讀、長文字有聲書製作
Kokoro-82M超低延遲本機 ONNX英語 / 日語 / 中文< 150msCPU 或 CUDA GPU即時語音互動智慧體、遊戲 NPC 對話、邊緣裝置
CosyVoice本機大模型Zero-shot 聲音複製250 - 450msNVIDIA GPU (CUDA)高品質個人化聲音複製、富有情感表現力的角色配音
OpenAI Relay雲端上游alloy, echo, fable, onyx, nova, shimmer300 - 600ms僅需 API KeyOpenAI 官方服務回退備援與多模型統一代理

語音合成處理管線

從請求接收到串流音訊直出,四步精簡高效處理流。

Step 01

介面鑑權與參數解析

校驗 Bearer Token 或 X-API-Key,解析 model、voice、input、speed 及 response_format 參數。

Step 02

文字分塊與 MD5 快取檢索

計算請求參數雜湊值比對本機快取,未命中則執行句法規則分塊並預熱管線。

Step 03

引擎分發與並行合成

調度指定引擎(EdgeTTS、Kokoro、CosyVoice)並行生成音訊分塊,保障低首包延遲。

Step 04

音訊編碼與 Chunked 串流直出

將音訊串流打包回傳至客戶端(同時寫入本機磁碟持久化快取),實現即播即放。

程式碼零修改即可接入

僅需修改 base_url,即可直接使用現有 OpenAI SDK 無縫呼叫 OneTTS。

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.