Edge-TTS, Kokoro, CosyVoice, OpenAI를 통합하여 OpenAI 프로토콜과 100% 호환되는 저지연 프라이빗 음성 합성 서비스를 제공합니다.
높은 처리량, 200ms 미만의 스트리밍 지연 시간, 완벽한 클라이언트 호환성.
OpenAI /v1/audio/speech, /v1/models, /v1/audio/voices 엔드포인트를 0 코드 수정으로 바로 교체 가능.
문장 단위 파이프라인 청킹과 HTTP Chunked 스트리밍으로 전체 생성을 기다리지 않고 즉각 오디오 출력.
Microsoft Edge-TTS, Kokoro-82M ONNX, CosyVoice 및 OpenAI 릴레이를 통합하여 400개 이상의 음성 지원.
요청 텍스트 및 파라미터를 자동 MD5 캐싱하여 반복 요청 시 10ms 이내 초고속 응답을 제공.
단일 포트 Docker 또는 uv로 자체 인프라에 배포. 외부 클라우드로 음성 데이터 유출 없음.
속도, 음조, 음량 세부 조절 및 MP3, WAV, AAC, OPUS, FLAC 포맷 완벽 지원.
속도, 하드웨어 사양, 음질 요구사항에 맞는 최적의 엔진을 선택하세요.
| 엔진 | 유형 | 음성 / 지원 언어 | 지연 시간 | 하드웨어 | 추천 용도 |
|---|---|---|---|---|---|
| Edge-TTS추천 | 클라우드 무료 | 400+ 음성 / 40+ 언어 | 150 - 300ms | 저사양 CPU / 메모리 | 일반 낭독, 다국어 문서 읽기, 오디오북 제작 |
| Kokoro-82M초고속 | 로컬 ONNX | 영어 / 일본어 / 중국어 | < 150ms | CPU 또는 CUDA GPU | 실시간 대화형 AI 에이전트, 게임 NPC 대화 |
| CosyVoice | 로컬 대형 모델 | Zero-shot 음성 복제 | 250 - 450ms | NVIDIA GPU (CUDA) | 고품질 맞춤형 음성 클로닝, 감정 표현 대사 |
| OpenAI Relay | 클라우드 업스트림 | alloy, echo, fable, onyx, nova, shimmer | 300 - 600ms | API 키 전용 | OpenAI 공식 백업 및 다중 모델 통합 프록시 |
요청 수신부터 스트리밍 오디오 전송까지 4단계의 효율적인 처리 흐름.
Bearer 토큰 또는 X-API-Key 검증 후 모델, 음성, 입력 텍스트, 속도, 포맷을 파싱합니다.
요청 해시로 디스크 캐시를 조회하며, 미적중 시 자연스러운 문장 단위로 분할합니다.
지정된 엔진(EdgeTTS, Kokoro, CosyVoice)으로 청크를 분배하여 병렬 합성합니다.
오디오를 실시간 인코딩하여 클라이언트에 스트리밍 전송하고 캐시에 저장합니다.
OpenAI SDK의 base_url만 수정하여 OneTTS 서비스를 즉시 이용할 수 있습니다.
from openai import OpenAI
# Initialize client pointing to your local OneTTS gateway
client = OpenAI(
base_url="http://localhost:8030/v1",
api_key="sk-onetts-v1-k_8LxQm9Z2sTwE7rY1u"
)
# Synthesize speech stream using Edge-TTS or Kokoro
response = client.audio.speech.create(
model="edgetts",
voice="zh-CN-YunxiNeural",
input="你好,这是通过 OneTTS 高性能语音合成网关生成的高保真音频流!",
response_format="mp3",
speed=1.0
)
# Stream or save audio directly
response.stream_to_file("output.mp3")