Skip to content
OneTTS 게이트웨이 · 고성능 음성 합성 API 기반

차세대 고성능 통합셀프 호스팅 음성 합성 게이트웨이

Edge-TTS, Kokoro, CosyVoice, OpenAI를 통합하여 OpenAI 프로토콜과 100% 호환되는 저지연 프라이빗 음성 합성 서비스를 제공합니다.

# 1. Pull and run OneTTS Gateway Service
$ docker run -d -p 8030:8030 --name onetts codeandxv/onetts:latest
INFO: Registering TTS Engines: [edgetts, kokoro, openai]
INFO: Application startup complete. Uvicorn running on http://0.0.0.0:8030
OpenAI Speech API ready at /v1/audio/speech

실시간 보이스 AI 에이전트를 위한 설계

높은 처리량, 200ms 미만의 스트리밍 지연 시간, 완벽한 클라이언트 호환성.

🎙️표준 API

OpenAI Speech 완벽 호환

OpenAI /v1/audio/speech, /v1/models, /v1/audio/voices 엔드포인트를 0 코드 수정으로 바로 교체 가능.

⚡< 200ms

200ms 미만 청크 스트리밍

문장 단위 파이프라인 청킹과 HTTP Chunked 스트리밍으로 전체 생성을 기다리지 않고 즉각 오디오 출력.

🧩멀티 엔진

멀티 엔진 통합 및 보이스 라이브러리

Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice 및 OpenAI 릴레이를 통합하여 400개 이상의 음성 지원.

💾디스크 캐시

스마트 MD5 오디오 캐싱

요청 텍스트 및 파라미터를 자동 MD5 캐싱하여 반복 요청 시 10ms 이내 초고속 응답을 제공.

🛡️프라이빗

100% 프라이빗 셀프 호스팅

단일 포트 Docker 또는 uv로 자체 인프라에 배포. 외부 클라우드로 음성 데이터 유출 없음.

🎛️세밀한 제어

세밀한 음성 제어 및 다양한 포맷

속도, 음조, 음량 세부 조절 및 MP3, WAV, AAC, OPUS, FLAC 포맷 완벽 지원.

지원 합성 엔진 비교

속도, 하드웨어 사양, 음질 요구사항에 맞는 최적의 엔진을 선택하세요.

엔진유형음성 / 지원 언어지연 시간하드웨어추천 용도
Edge-TTS추천클라우드 무료400+ 음성 / 40+ 언어150 - 300ms저사양 CPU / 메모리일반 낭독, 다국어 문서 읽기, 오디오북 제작
Kokoro-82M초고속로컬 ONNX영어 / 일본어 / 중국어< 150msCPU 또는 CUDA GPU실시간 대화형 AI 에이전트, 게임 NPC 대화
CosyVoice로컬 대형 모델Zero-shot 음성 복제250 - 450msNVIDIA GPU (CUDA)고품질 맞춤형 음성 클로닝, 감정 표현 대사
OpenAI Relay클라우드 업스트림alloy, echo, fable, onyx, nova, shimmer300 - 600msAPI 키 전용OpenAI 공식 백업 및 다중 모델 통합 프록시

음성 합성 처리 파이프라인

요청 수신부터 스트리밍 오디오 전송까지 4단계의 효율적인 처리 흐름.

Step 01

API 인증 및 파라미터 파싱

Bearer 토큰 또는 X-API-Key 검증 후 모델, 음성, 입력 텍스트, 속도, 포맷을 파싱합니다.

Step 02

텍스트 정규화 및 MD5 캐시 확인

요청 해시로 디스크 캐시를 조회하며, 미적중 시 자연스러운 문장 단위로 분할합니다.

Step 03

엔진 디스패치 및 병렬 합성

지정된 엔진(EdgeTTS, Kokoro, CosyVoice)으로 청크를 분배하여 병렬 합성합니다.

Step 04

오디오 인코딩 및 Chunked 전송

오디오를 실시간 인코딩하여 클라이언트에 스트리밍 전송하고 캐시에 저장합니다.

SDK 코드 수정 없는 간편 연동

OpenAI SDK의 base_url만 수정하여 OneTTS 서비스를 즉시 이용할 수 있습니다.

from openai import OpenAI

# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
    base_url="http://localhost:8030/v1",
    api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)

# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
    model="edgetts",
    voice="zh-CN-YunxiNeural",
    input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
    response_format="mp3",
    speed=1.0
)

# Stream or save audio directly
response.stream_to_file("output.mp3")

Released under the Apache-2.0 License.