Skip to content

概要 & アーキテクチャ ​

OneTTS は、異種音声合成(Text-to-Speech)バックエンドを標準の OpenAI プロトコルインターフェースへと統合する、エンタープライズグレードの高性能 TTS ゲートウェイです。


🌟 コアバリュー ​

  • OpenAI 音声 API のシームレスな代替:OpenAI TTS をサポートするあらゆるサードパーティクライアント(Dify、FastGPT、DuRT、Open WebUI など)において、baseURL と apiKey を変更するだけで即座に導入できます。
  • GPU 不要のクイック起動:Microsoft Edge-TTS ニューラル音声を標準搭載。専用 GPU が不要なため、低コストな VPS やローカル PC 上でも高速に動作します。
  • 超低遅延ストリーミング応答:インテリジェントな文単位分割とストリーミング配信により、ファーストオーディオ遅延(TTFT)$< \mathbf{200ms}$ を達成。
  • スマート MD5 キャッシュ:同一テキストおよびパラメータでのリクエストはローカルキャッシュから即座に返却され、計算リソースと帯域幅を節約します。

🏗️ アーキテクチャ構成 ​

text
 クライアント (DuRT / Dify / FastGPT / Web)
                │
                ▼ (HTTP POST /v1/audio/speech)
   ┌───────────────────────────────┐
   │        OneTTS ゲートウェイ     │
   │  ┌─────────────────────────┐  │
   │  │   MD5 音声合成キャッシュ  │  │
   │  └─────────────────────────┘  │
   │  ┌─────────────────────────┐  │
   │  │   長文テキスト分割器     │  │
   │  └─────────────────────────┘  │
   └──────────────┬────────────────┘
                  │
     ┌────────────┼────────────┐
     ▼            ▼            ▼
 ┌─────────┐ ┌─────────┐ ┌───────────┐
 │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
 └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.