Skip to content

Übersicht & Architektur ​

OneTTS ist ein hochperformantes Text-to-Speech (TTS) Aggregations-Gateway für Unternehmen, das verschiedene Sprachsynthese-Backends unter einem einzigen, OpenAI-kompatiblen API-Endpunkt vereint.


🌟 Warum OneTTS? ​

  • Direkter OpenAI-Standard-Ersatz: Jede Anwendung, die OpenAI TTS unterstützt (z. B. Dify, FastGPT, Open WebUI, DuRT), kann einfach durch Aktualisieren von baseURL und apiKey zu OneTTS wechseln.
  • Start ohne GPU: Dank der integrierten Unterstützung für Edge-TTS sofort auf kostengünstigen VPS oder lokalen CPUs ohne GPU-Anforderungen lauffähig.
  • Streaming mit minimaler Latenz: Die Pipeline-Satzsegmentierung liefert den ersten Audio-Chunk in unter 200 ms.
  • Intelligentes Audio-Caching: Identische Syntheseanfragen nutzen sofort den lokalen MD5-Cache, was Bandbreite und Rechenressourcen spart.

🏗️ Architektur ​

text
 Client (DuRT / Dify / Web / API)
                │
                ▼ (HTTP /v1/audio/speech)
   ┌───────────────────────────────┐
   │        OneTTS Gateway         │
   │  ┌─────────────────────────┐  │
   │  │  MD5 Synthesis Cache    │  │
   │  └─────────────────────────┘  │
   │  ┌─────────────────────────┐  │
   │  │ Sentence Text Splitter  │  │
   │  └─────────────────────────┘  │
   └──────────────┬────────────────┘
                  │
     ┌────────────┼────────────┐
     ▼            ▼            ▼
 ┌─────────┐ ┌─────────┐ ┌───────────┐
 │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
 └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.