Descripción General y Arquitectura
OneTTS es una pasarela de agregación de Texto a Voz (TTS) de nivel empresarial y alto rendimiento, diseñada para unificar diversos backends de síntesis de voz en un único endpoint de API compatible con OpenAI.
🌟 ¿Por qué OneTTS?
- Reemplazo Directo del Estándar OpenAI: Cualquier aplicación compatible con OpenAI TTS (por ejemplo, Dify, FastGPT, Open WebUI, DuRT) puede migrar a OneTTS simplemente actualizando
baseURLyapiKey. - Inicio sin GPU: Con soporte integrado de Edge-TTS, despliegue de inmediato en servidores VPS económicos o máquinas CPU locales sin requerir GPU.
- Transmisión de Baja Latencia: La fragmentación de oraciones en pipeline entrega el primer fragmento de audio en menos de 200 ms.
- Caché Inteligente de Audio: Las solicitudes de síntesis duplicadas acceden instantáneamente a la caché MD5 local, ahorrando ancho de banda y procesamiento.
🏗️ Arquitectura
text
Cliente (DuRT / Dify / Web / API)
│
▼ (HTTP /v1/audio/speech)
┌───────────────────────────────┐
│ Pasarela OneTTS │
│ ┌─────────────────────────┐ │
│ │ Caché de Síntesis MD5 │ │
│ └─────────────────────────┘ │
│ ┌─────────────────────────┐ │
│ │ Divisor de Texto/Frases │ │
│ └─────────────────────────┘ │
└──────────────┬────────────────┘
│
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌─────────┐ ┌───────────┐
│ EdgeTTS │ │ Kokoro │ │ CosyVoice │
└─────────┘ └─────────┘ └───────────┘