Skip to content
OneTTS ゲートウェイ · 高性能音声合成 API 基盤

次世代の統一された高性能セルフホスト音声合成ゲートウェイ

Edge-TTS、Kokoro、CosyVoice、OpenAI を統合。OpenAI 完全互換のプライベート・低レイテンシ音声合成サービス。

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

リアルタイム音声 AI エージェントのための設計

高スループット、200ms 未満のストリーミングレイテンシ、OpenAI 互換性。

🎙️標準 API

OpenAI Speech 完全互換

OpenAI の /v1/audio/speech、/v1/models、/v1/audio/voices と互換。既存コードを変更なしでそのまま移行可能。

⚡< 200ms

200ms 未満のチャンク配信

文単位のパイプライン分割と HTTP Chunked 配信により、全体生成を待たずに即座に音声を再生可能。

🧩マルチエンジン

マルチエンジン統合 & 音声ライブラリ

Microsoft Edge-TTS、Kokoro-82M ONNX、CosyVoice、OpenAI を集約し、400 種類以上の音声を提供。

💾ディスクキャッシュ

スマート MD5 音声キャッシュ

合成テキストと設定から MD5 を自動生成してキャッシュ。同一リクエストには 10ms 以下の超高速応答を実現。

🛡️プライベート

100% セルフホスト & プライベート

Docker または uv で自社サーバーに簡単構築。社外への音声データ流出ゼロでセキュアに運用。

🎛️詳細設定

きめ細かな話速調整とマルチフォーマット

話速、音高、音量の微調整に対応し、MP3、WAV、AAC、OPUS、FLAC など主要フォーマットを出力可能。

対応合成エンジン比較

レイテンシ、ハードウェア要件、音声の自然さに応じて最適なエンジンを選択できます。

エンジンタイプ音声 / 対応言語レイテンシハードウェア最適な用途
Edge-TTSおすすめクラウド無料400+ 音声 / 40+ 言語150 - 300ms軽量 CPU / メモリ一般的な朗読、多言語テキスト読み上げ、オーディオブック制作
Kokoro-82M超高速ローカル ONNX英語 / 日本語 / 中国語< 150msCPU または CUDA GPUリアルタイム対話 AI エージェント、ゲーム NPC 音声
CosyVoiceローカル大規模Zero-shot 音声クローン250 - 450msNVIDIA GPU (CUDA)高精度なパーソナル音声クローン、感情豊かなキャラクター演出
OpenAI Relayクラウド上流alloy, echo, fable, onyx, nova, shimmer300 - 600msAPI キーのみ公式 OpenAI バックアップおよび複数モデル統合プロキシ

音声合成処理パイプライン

リクエスト受信からストリーミング音声出力まで、4 つの高効率ステップ。

Step 01

API 認証とパラメータ解析

Bearer トークンまたは X-API-Key を検証し、model、voice、input、speed、フォーマットをパース。

Step 02

テキスト正規化と MD5 キャッシュ検索

クエリハッシュでローカルキャッシュを照合。未ヒット時は自然な文単位に分割してパイプライン準備。

Step 03

エンジン振り分けと並列合成

指定されたエンジン(EdgeTTS、Kokoro、CosyVoice)へ振り分け、並列で音声チャンクを生成。

Step 04

音声エンコードと Chunked 配信

指定フォーマットでエンコードしながらクライアントへ即時ストリーム配信(同時にキャッシュ保存)。

SDK コード変更不要で導入可能

base_url を変更するだけで、既存の OpenAI SDK から OneTTS を即座に利用可能。

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.