聚合 Edge-TTS、Kokoro、CosyVoice 與 OpenAI,提供完全相容 OpenAI 協定的私有化低延遲語音合成服務。
高並行、200ms 內串流首包延遲與極簡的客戶端相容性。
無縫替換 OpenAI /v1/audio/speech、/v1/models 與 /v1/audio/voices 介面,現有程式碼 0 修改遷移。
基於句級分塊管線與 HTTP Chunked 串流傳輸,無需等待整段合成即可秒級發聲。
統一接入微軟 Edge-TTS、Kokoro-82M ONNX、CosyVoice 與 OpenAI 上游代理,支援 400+ 豐富音色。
自動對合成文字與音色參數進行 MD5 校驗快取,重複請求實現 10ms 極速回應並極大降低算力消耗。
單埠 Docker 或 uv 一鍵私有化部署,語音資料不出區域網路,滿足企業級隱私與法規遵循要求。
全面支援語速、音調、音量自訂調節,支援 MP3, WAV, AAC, OPUS, FLAC 等主流音訊格式。
根據應用場景、算力條件與音色偏好,靈活選擇最適合的 TTS 引擎。
| 引擎名稱 | 類型 | 音色 / 支援語言 | 首包延遲 | 硬體需求 | 推薦場景 |
|---|---|---|---|---|---|
| Edge-TTS首選推薦 | 雲端免費 | 400+ 音色 / 40+ 語言 | 150 - 300ms | 輕量 CPU / 記憶體 | 通用朗讀、多語種閱讀、長文字有聲書製作 |
| Kokoro-82M超低延遲 | 本機 ONNX | 英語 / 日語 / 中文 | < 150ms | CPU 或 CUDA GPU | 即時語音互動智慧體、遊戲 NPC 對話、邊緣裝置 |
| CosyVoice | 本機大模型 | Zero-shot 聲音複製 | 250 - 450ms | NVIDIA GPU (CUDA) | 高品質個人化聲音複製、富有情感表現力的角色配音 |
| OpenAI Relay | 雲端上游 | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | 僅需 API Key | OpenAI 官方服務回退備援與多模型統一代理 |
從請求接收到串流音訊直出,四步精簡高效處理流。
校驗 Bearer Token 或 X-API-Key,解析 model、voice、input、speed 及 response_format 參數。
計算請求參數雜湊值比對本機快取,未命中則執行句法規則分塊並預熱管線。
調度指定引擎(EdgeTTS、Kokoro、CosyVoice)並行生成音訊分塊,保障低首包延遲。
將音訊串流打包回傳至客戶端(同時寫入本機磁碟持久化快取),實現即播即放。
僅需修改 base_url,即可直接使用現有 OpenAI SDK 無縫呼叫 OneTTS。
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")