Agrège Edge-TTS, Kokoro, CosyVoice et OpenAI en une passerelle de synthèse vocale ultra-rapide et 100% compatible OpenAI.
Haut débit, latence de streaming inférieure à 200 ms et compatibilité client universelle.
Remplacement direct pour /v1/audio/speech, /v1/models et /v1/audio/voices sans modification de code.
Découpage par phrases et streaming HTTP Chunked pour une lecture audio instantanée.
Intègre Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice et OpenAI avec plus de 400 voix.
Mise en cache automatique des requêtes pour des réponses en moins de 10 ms sur les phrases récurrentes.
Déploiement local avec Docker ou uv. Aucune fuite de données vocales vers des tiers.
Ajustement fin du débit, de la hauteur et prise en charge des formats MP3, WAV, AAC, OPUS, FLAC.
Sélectionnez le moteur idéal selon vos besoins de latence, de matériel et de fidélité vocale.
| Moteur | Type | Voix / Langues | Latence | Matériel | Idéal pour |
|---|---|---|---|---|---|
| Edge-TTSRecommandé | Cloud / Gratuit | 400+ Voix / 40+ Langues | 150 - 300ms | CPU / RAM faible | Lecture générale, textes multilingues, production de livres audio |
| Kokoro-82MUltra Rapide | ONNX Local | Anglais / Japonais / Chinois | < 150ms | CPU ou GPU CUDA | Agents vocaux conversationnels temps réel, PNJ de jeux vidéo |
| CosyVoice | Modèle Neuronal Local | Clonage de Voix Zero-Shot | 250 - 450ms | GPU NVIDIA (CUDA) | Clonage vocal personnalisé haute fidélité et voix expressives |
| OpenAI Relay | Cloud Upstream | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | Clé API uniquement | Secours officiel OpenAI et proxy multi-modèles |
De la requête textuelle au flux audio en quatre étapes optimisées.
Validation des jetons et analyse du modèle, de la voix, du texte et du format.
Recherche dans le cache disque ou découpage du texte en segments phonétiques.
Distribution parallèle des segments au moteur cible (EdgeTTS, Kokoro, CosyVoice).
Diffusion en flux continu vers le client tout en enregistrant le résultat dans le cache.
Modifiez simplement base_url dans votre SDK OpenAI pour utiliser OneTTS.
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")