Agrega Edge-TTS, Kokoro, CosyVoice y OpenAI en una pasarela de síntesis de voz ultrarrápida y 100% compatible con OpenAI.
Alto rendimiento, latencia de streaming inferior a 200 ms y compatibilidad universal.
Reemplazo directo para /v1/audio/speech, /v1/models y /v1/audio/voices sin cambios de código.
Fragmentación por oraciones y transferencia HTTP Chunked para reproducción inmediata.
Integra Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice y OpenAI con más de 400 voces.
Almacena en disco consultas recurrentes logrando respuestas en menos de 10 ms.
Despliegue local con Docker o uv. Privacidad total sin fugas de datos hacia la nube.
Ajuste de velocidad, tono, volumen y compatibilidad con MP3, WAV, AAC, OPUS y FLAC.
Elija el motor ideal según sus requerimientos de velocidad, hardware y calidad de voz.
| Motor | Tipo | Voces / Idiomas | Latencia | Hardware | Ideal para |
|---|---|---|---|---|---|
| Edge-TTSRecomendado | Nube / Gratuito | 400+ Voces / 40+ Idiomas | 150 - 300ms | CPU / RAM baja | Lectura general, textos multilingües, producción de audiolibros |
| Kokoro-82MUltra Rápido | ONNX Local | Inglés / Japonés / Chino | < 150ms | CPU o GPU CUDA | Agentes conversacionales en tiempo real, NPCs de videojuegos |
| CosyVoice | Red Neuronal Local | Clonación Zero-Shot | 250 - 450ms | GPU NVIDIA (CUDA) | Clonación de voz personalizada de alta fidelidad y locución emotiva |
| OpenAI Relay | Nube Upstream | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | Solo clave API | Respaldo oficial de OpenAI y proxy multi-modelo |
De la petición de texto al flujo de audio en cuatro pasos optimizados.
Valida tokens y analiza modelo, voz, texto, velocidad y formato solicitado.
Compara hash con caché local o divide el texto en fragmentos naturales.
Distribuye los fragmentos al motor correspondiente para síntesis paralela.
Codifica y transmite audio directamente al cliente mientras actualiza la caché.
Cambie únicamente la base_url en su SDK de OpenAI para usar OneTTS.
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")