Skip to content
OneTTS Gateway · Síntesis de Voz de Alto Rendimiento

Nueva Generación UnificadaPasarela TTS Autoalojada

Agrega Edge-TTS, Kokoro, CosyVoice y OpenAI en una pasarela de síntesis de voz ultrarrápida y 100% compatible con OpenAI.

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

Diseñado para Agentes de Voz en Tiempo Real

Alto rendimiento, latencia de streaming inferior a 200 ms y compatibilidad universal.

🎙️API Estándar

Compatible con OpenAI Speech

Reemplazo directo para /v1/audio/speech, /v1/models y /v1/audio/voices sin cambios de código.

⚡< 200ms

Streaming en Fragmentos < 200 ms

Fragmentación por oraciones y transferencia HTTP Chunked para reproducción inmediata.

🧩Multi-Motor

Agregación Multi-Motor

Integra Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice y OpenAI con más de 400 voces.

💾Caché

Caché Inteligente MD5

Almacena en disco consultas recurrentes logrando respuestas en menos de 10 ms.

🛡️Privado

100% Autoalojado y Privado

Despliegue local con Docker o uv. Privacidad total sin fugas de datos hacia la nube.

🎛️Control Fino

Control Fino y Formatos Múltiples

Ajuste de velocidad, tono, volumen y compatibilidad con MP3, WAV, AAC, OPUS y FLAC.

Motores de Síntesis Compatibles

Elija el motor ideal según sus requerimientos de velocidad, hardware y calidad de voz.

MotorTipoVoces / IdiomasLatenciaHardwareIdeal para
Edge-TTSRecomendadoNube / Gratuito400+ Voces / 40+ Idiomas150 - 300msCPU / RAM bajaLectura general, textos multilingües, producción de audiolibros
Kokoro-82MUltra RápidoONNX LocalInglés / Japonés / Chino< 150msCPU o GPU CUDAAgentes conversacionales en tiempo real, NPCs de videojuegos
CosyVoiceRed Neuronal LocalClonación Zero-Shot250 - 450msGPU NVIDIA (CUDA)Clonación de voz personalizada de alta fidelidad y locución emotiva
OpenAI RelayNube Upstreamalloy, echo, fable, onyx, nova, shimmer300 - 600msSolo clave APIRespaldo oficial de OpenAI y proxy multi-modelo

Flujo de Procesamiento TTS

De la petición de texto al flujo de audio en cuatro pasos optimizados.

Step 01

Autenticación y Análisis de API

Valida tokens y analiza modelo, voz, texto, velocidad y formato solicitado.

Step 02

Normalización y Búsqueda en Caché MD5

Compara hash con caché local o divide el texto en fragmentos naturales.

Step 03

Despacho al Motor y Síntesis

Distribuye los fragmentos al motor correspondiente para síntesis paralela.

Step 04

Codificación y Streaming Chunked

Codifica y transmite audio directamente al cliente mientras actualiza la caché.

Integración sin Modificar el SDK

Cambie únicamente la base_url en su SDK de OpenAI para usar OneTTS.

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.