Edge-TTS、Kokoro、CosyVoice、OpenAI を統合。OpenAI 完全互換のプライベート・低レイテンシ音声合成サービス。
高スループット、200ms 未満のストリーミングレイテンシ、OpenAI 互換性。
OpenAI の /v1/audio/speech、/v1/models、/v1/audio/voices と互換。既存コードを変更なしでそのまま移行可能。
文単位のパイプライン分割と HTTP Chunked 配信により、全体生成を待たずに即座に音声を再生可能。
Microsoft Edge-TTS、Kokoro-82M ONNX、CosyVoice、OpenAI を集約し、400 種類以上の音声を提供。
合成テキストと設定から MD5 を自動生成してキャッシュ。同一リクエストには 10ms 以下の超高速応答を実現。
Docker または uv で自社サーバーに簡単構築。社外への音声データ流出ゼロでセキュアに運用。
話速、音高、音量の微調整に対応し、MP3、WAV、AAC、OPUS、FLAC など主要フォーマットを出力可能。
レイテンシ、ハードウェア要件、音声の自然さに応じて最適なエンジンを選択できます。
| エンジン | タイプ | 音声 / 対応言語 | レイテンシ | ハードウェア | 最適な用途 |
|---|---|---|---|---|---|
| Edge-TTSおすすめ | クラウド無料 | 400+ 音声 / 40+ 言語 | 150 - 300ms | 軽量 CPU / メモリ | 一般的な朗読、多言語テキスト読み上げ、オーディオブック制作 |
| Kokoro-82M超高速 | ローカル ONNX | 英語 / 日本語 / 中国語 | < 150ms | CPU または CUDA GPU | リアルタイム対話 AI エージェント、ゲーム NPC 音声 |
| CosyVoice | ローカル大規模 | Zero-shot 音声クローン | 250 - 450ms | NVIDIA GPU (CUDA) | 高精度なパーソナル音声クローン、感情豊かなキャラクター演出 |
| OpenAI Relay | クラウド上流 | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | API キーのみ | 公式 OpenAI バックアップおよび複数モデル統合プロキシ |
リクエスト受信からストリーミング音声出力まで、4 つの高効率ステップ。
Bearer トークンまたは X-API-Key を検証し、model、voice、input、speed、フォーマットをパース。
クエリハッシュでローカルキャッシュを照合。未ヒット時は自然な文単位に分割してパイプライン準備。
指定されたエンジン(EdgeTTS、Kokoro、CosyVoice)へ振り分け、並列で音声チャンクを生成。
指定フォーマットでエンコードしながらクライアントへ即時ストリーム配信(同時にキャッシュ保存)。
base_url を変更するだけで、既存の OpenAI SDK から OneTTS を即座に利用可能。
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")