Bündelt Edge-TTS, Kokoro, CosyVoice und OpenAI in einem extrem schnellen, OpenAI-kompatiblen Sprachsynthese-Dienst.
Hoher Durchsatz, unter 200 ms Streaming-Latenz und universelle Client-Kompatibilität.
Direkter Ersatz für /v1/audio/speech, /v1/models und /v1/audio/voices ohne Codeänderung.
Satzweises Chunking und HTTP-Chunked-Streaming für sofortige Audiowiedergabe.
Vereint Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice und OpenAI mit über 400 Stimmen.
Automatischer Disk-Cache für Anfragen liefert Antwortzeiten unter 10 ms für wiederkehrende Sätze.
Betrieb auf eigener Infrastruktur via Docker oder uv. Keine Audiodaten verlassen Ihr Netzwerk.
Unterstützung für Geschwindigkeit, Tonhöhe, Lautstärke und Formate wie MP3, WAV, AAC, OPUS.
Wählen Sie die ideale Engine passend zu Ihren Latenz-, Hardware- und Qualitätsanforderungen.
| Engine | Typ | Stimmen / Sprachen | Latenz | Hardware | Ideal für |
|---|---|---|---|---|---|
| Edge-TTSEmpfohlen | Cloud / Kostenlos | 400+ Stimmen / 40+ Sprachen | 150 - 300ms | Geringe CPU / RAM | Vorlesen, mehrsprachige Texte, Hörbuchproduktion |
| Kokoro-82MUltra-schnell | Lokales ONNX | Englisch / Japanisch / Chinesisch | < 150ms | CPU oder CUDA GPU | Echtzeit-Sprachagenten, Dialogsysteme, Gaming-NPCs |
| CosyVoice | Lokales Modell | Zero-Shot Voice Cloning | 250 - 450ms | NVIDIA GPU (CUDA) | Hochpräzises Stimmenklonen und ausdrucksstarke Stimmen |
| OpenAI Relay | Cloud Upstream | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | Nur API-Key | Offizielles OpenAI-Fallback und Multi-Modell-Proxy |
In vier schlanken Schritten von der Textanfrage zum kontinuierlichen Audiostream.
Validiert Token (Bearer/X-API-Key) und extrahiert Modell, Stimme, Text und Format.
Gleicht MD5-Hash mit Cache ab oder segmentiert Text in natürliche Phrasen.
Verteilt Segmente parallel an die Zielengine (EdgeTTS, Kokoro, CosyVoice).
Kodiert das Audioformat und streamt Pakete direkt zum Client während der Cache befüllt wird.
Wechseln Sie zu OneTTS, indem Sie lediglich die base_url in Ihrem OpenAI SDK anpassen.
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")