Skip to content
OneTTS Gateway · Leistungsstarke Sprachsynthese

Einheitliche moderneSelf-Hosted TTS-Gateway

Bündelt Edge-TTS, Kokoro, CosyVoice und OpenAI in einem extrem schnellen, OpenAI-kompatiblen Sprachsynthese-Dienst.

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

Entwickelt für moderne Voice-AI

Hoher Durchsatz, unter 200 ms Streaming-Latenz und universelle Client-Kompatibilität.

🎙️Standard-API

OpenAI Speech Kompatibel

Direkter Ersatz für /v1/audio/speech, /v1/models und /v1/audio/voices ohne Codeänderung.

⚡< 200ms

Streaming unter 200 ms

Satzweises Chunking und HTTP-Chunked-Streaming für sofortige Audiowiedergabe.

🧩Multi-Engine

Multi-Engine Aggregation

Vereint Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice und OpenAI mit über 400 Stimmen.

💾Disk-Cache

Intelligenter MD5-Cache

Automatischer Disk-Cache für Anfragen liefert Antwortzeiten unter 10 ms für wiederkehrende Sätze.

🛡️Privat

100% Self-Hosted & Sicher

Betrieb auf eigener Infrastruktur via Docker oder uv. Keine Audiodaten verlassen Ihr Netzwerk.

🎛️Feinabstimmung

Feinabstimmung & Formate

Unterstützung für Geschwindigkeit, Tonhöhe, Lautstärke und Formate wie MP3, WAV, AAC, OPUS.

Verfügbare Synthese-Engines

Wählen Sie die ideale Engine passend zu Ihren Latenz-, Hardware- und Qualitätsanforderungen.

EngineTypStimmen / SprachenLatenzHardwareIdeal für
Edge-TTSEmpfohlenCloud / Kostenlos400+ Stimmen / 40+ Sprachen150 - 300msGeringe CPU / RAMVorlesen, mehrsprachige Texte, Hörbuchproduktion
Kokoro-82MUltra-schnellLokales ONNXEnglisch / Japanisch / Chinesisch< 150msCPU oder CUDA GPUEchtzeit-Sprachagenten, Dialogsysteme, Gaming-NPCs
CosyVoiceLokales ModellZero-Shot Voice Cloning250 - 450msNVIDIA GPU (CUDA)Hochpräzises Stimmenklonen und ausdrucksstarke Stimmen
OpenAI RelayCloud Upstreamalloy, echo, fable, onyx, nova, shimmer300 - 600msNur API-KeyOffizielles OpenAI-Fallback und Multi-Modell-Proxy

Sprachsynthese-Pipeline

In vier schlanken Schritten von der Textanfrage zum kontinuierlichen Audiostream.

Step 01

API-Authentifizierung & Parsing

Validiert Token (Bearer/X-API-Key) und extrahiert Modell, Stimme, Text und Format.

Step 02

Textnormalisierung & MD5-Cache

Gleicht MD5-Hash mit Cache ab oder segmentiert Text in natürliche Phrasen.

Step 03

Engine-Dispatching & Synthese

Verteilt Segmente parallel an die Zielengine (EdgeTTS, Kokoro, CosyVoice).

Step 04

Audio-Streaming & Caching

Kodiert das Audioformat und streamt Pakete direkt zum Client während der Cache befüllt wird.

Keine SDK-Änderungen nötig

Wechseln Sie zu OneTTS, indem Sie lediglich die base_url in Ihrem OpenAI SDK anpassen.

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.