Skip to content

Descripción General y Arquitectura ​

OneTTS es una pasarela de agregación de Texto a Voz (TTS) de nivel empresarial y alto rendimiento, diseñada para unificar diversos backends de síntesis de voz en un único endpoint de API compatible con OpenAI.


🌟 ¿Por qué OneTTS? ​

  • Reemplazo Directo del Estándar OpenAI: Cualquier aplicación compatible con OpenAI TTS (por ejemplo, Dify, FastGPT, Open WebUI, DuRT) puede migrar a OneTTS simplemente actualizando baseURL y apiKey.
  • Inicio sin GPU: Con soporte integrado de Edge-TTS, despliegue de inmediato en servidores VPS económicos o máquinas CPU locales sin requerir GPU.
  • Transmisión de Baja Latencia: La fragmentación de oraciones en pipeline entrega el primer fragmento de audio en menos de 200 ms.
  • Caché Inteligente de Audio: Las solicitudes de síntesis duplicadas acceden instantáneamente a la caché MD5 local, ahorrando ancho de banda y procesamiento.

🏗️ Arquitectura ​

text
 Cliente (DuRT / Dify / Web / API)
                │
                ▼ (HTTP /v1/audio/speech)
    ┌───────────────────────────────┐
    │        Pasarela OneTTS        │
    │  ┌─────────────────────────┐  │
    │  │   Caché de Síntesis MD5 │  │
    │  └─────────────────────────┘  │
    │  ┌─────────────────────────┐  │
    │  │ Divisor de Texto/Frases │  │
    │  └─────────────────────────┘  │
    └──────────────┬────────────────┘
                   │
      ┌────────────┼────────────┐
      ▼            ▼            ▼
  ┌─────────┐ ┌─────────┐ ┌───────────┐
  │ EdgeTTS │ │ Kokoro  │ │ CosyVoice │
  └─────────┘ └─────────┘ └───────────┘

Released under the Apache-2.0 License.