概要 & アーキテクチャ
OneTTS は、異種音声合成(Text-to-Speech)バックエンドを標準の OpenAI プロトコルインターフェースへと統合する、エンタープライズグレードの高性能 TTS ゲートウェイです。
🌟 コアバリュー
- OpenAI 音声 API のシームレスな代替:OpenAI TTS をサポートするあらゆるサードパーティクライアント(Dify、FastGPT、DuRT、Open WebUI など)において、
baseURLとapiKeyを変更するだけで即座に導入できます。 - GPU 不要のクイック起動:Microsoft Edge-TTS ニューラル音声を標準搭載。専用 GPU が不要なため、低コストな VPS やローカル PC 上でも高速に動作します。
- 超低遅延ストリーミング応答:インテリジェントな文単位分割とストリーミング配信により、ファーストオーディオ遅延(TTFT)$< \mathbf{200ms}$ を達成。
- スマート MD5 キャッシュ:同一テキストおよびパラメータでのリクエストはローカルキャッシュから即座に返却され、計算リソースと帯域幅を節約します。
🏗️ アーキテクチャ構成
text
クライアント (DuRT / Dify / FastGPT / Web)
│
▼ (HTTP POST /v1/audio/speech)
┌───────────────────────────────┐
│ OneTTS ゲートウェイ │
│ ┌─────────────────────────┐ │
│ │ MD5 音声合成キャッシュ │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ 長文テキスト分割器 │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘