Übersicht & Architektur
OneTTS ist ein hochperformantes Text-to-Speech (TTS) Aggregations-Gateway für Unternehmen, das verschiedene Sprachsynthese-Backends unter einem einzigen, OpenAI-kompatiblen API-Endpunkt vereint.
🌟 Warum OneTTS?
- Direkter OpenAI-Standard-Ersatz: Jede Anwendung, die OpenAI TTS unterstützt (z. B. Dify, FastGPT, Open WebUI, DuRT), kann einfach durch Aktualisieren von
baseURLundapiKeyzu OneTTS wechseln. - Start ohne GPU: Dank der integrierten Unterstützung für Edge-TTS sofort auf kostengünstigen VPS oder lokalen CPUs ohne GPU-Anforderungen lauffähig.
- Streaming mit minimaler Latenz: Die Pipeline-Satzsegmentierung liefert den ersten Audio-Chunk in unter 200 ms.
- Intelligentes Audio-Caching: Identische Syntheseanfragen nutzen sofort den lokalen MD5-Cache, was Bandbreite und Rechenressourcen spart.
🏗️ Architektur
text
Client (DuRT / Dify / Web / API)
│
▼ (HTTP /v1/audio/speech)
┌───────────────────────────────┐
│ OneTTS Gateway │
│ ┌─────────────────────────┐ │
│ │ MD5 Synthesis Cache │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ Sentence Text Splitter │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘