메뉴
HN
Hacker News • 39일 전

Speko (YC S26) 출시 – 음성 AI를 위한 '오픈라우터'

IMP
6/10
핵심 요약

YC S26 배경 스타트업 Speko가 OpenRouter의 음성 AI 버전을 출시했습니다. 모든 음성 모델(STT·LLM·TTS·음성간 변환)을 언어별·목적별 벤치마크 데이터에 기반해 하나의 API로 라우팅해줍니다. OpenAI 호환 API를 제공해 LiveKit, Pipecat 등 기존 프레임워크에서 호스트명만 바꾸면 바로 사용할 수 있다는 점이 핵심입니다.

번역된 본문

YC(Y Combinator) 투자 · Y Combinator 지원

음성 AI를 위한 라우터 모든 음성 모델을 언어별로 벤치마킹하고, 하나의 API로 연결합니다. API 키 발급 | 모델 비교

라우터 언어와 목적에 따라 어떤 모델을 호출할지, 벤더의 영어 중심 리더보드가 아닌 공개된 측정 데이터를 기반으로 결정합니다. 언어별 벤치마크 커버리지: 음성-텍스트 변환(STT), 텍스트-음성 변환(TTS) 제공. 지원 언어: 영어(EN), 아랍어(AR), 프랑스어(FR), 독일어(DE), 힌디어(HI), 노르웨이어(NB), 스페인어(ES), 타밀어(TA), 텔루구어(TE). 모델: Nova-3, stt-rt-v5, GPT-4o Transcribe, GPT-4o-mini Transcribe, Qwen3-ASR, Chirp 3, Ink-Whisper, Pulse Pro, Whisper-1, Nova-2, Gradium ASR, Grok STT, Ink-2, Pulse, Realtime STT-1, Scribe v2, Realtime, Solaria-1, Universal-3.5 Pro, Velma 2, Flux, GPT Live Transcribe 등 전체 21개 모델 표시 가능.

단계별 비용 대비 점수 STT, LLM, TTS, 음성-음성(Speech-to-Speech) 각 단계별로 정확도(WER)와 비용을 비교합니다. STT 비용은 분당 $0.0010~$0.0160, WER 2.0%~11.0% 범위.

주요 STT 모델 순위 (WER 오름차순, 배치 기준):

  1. Universal-3.5 Pro (assemblyai) – WER 2.0%, 분당 $0.0075
  2. GPT-4o Transcribe (openai) – 2.3%, $0.0060
  3. GPT-4o-mini Transcribe (openai) – 2.7%, $0.0030
  4. Qwen3-ASR (alibaba) – 2.8%, $0.0054
  5. Realtime STT-1 (inworld) – 3.3%, $0.0025
  6. Chirp 3 (google) – 3.9%, $0.0160
  7. Velma 2 (modulate) – 4.4%, $0.0010
  8. Grok STT (xai) – 4.8%, $0.0033
  9. Solaria-1 (gladia) – 5.0%, $0.0125
  10. Pulse (smallest) – 5.1%, 약 $0.0050
  11. stt-rt-v5 (soniox) – 7.5%, $0.0020
  12. Gradium ASR – 8.4%, $0.0104
  13. Nova-3 (deepgram) – 9.8%, $0.0048
  14. Ink-2 (cartesia) – 11.0%, $0.0090 그 외: Flux (deepgram, $0.0065), Scribe v2 Realtime (elevenlabs, $0.0065), GPT Live Transcribe (openai, $0.0170). 전체 17개 모델 표시 가능.

게이트웨이 모든 프로바이더 앞단에 하나의 baseURL과 하나의 키를 두고, 여러분의 프레임워크가 이미 호출하는 API 방식을 그대로 사용합니다.

음성 워커 실행 및 관찰 Speko는 OpenAI API 방식을 그대로 사용하므로, 기존에 쓰던 프레임워크에서 호스트명과 모델 문자열만 바꾸면 됩니다.

LiveKit (TypeScript): OpenAI 플러그인을 게이트웨이로指向하면 에이전트 코드는 변경할 필요가 없습니다. apiKey를 SPEKO_API_KEY로, baseURL을 https://api.speko.ai/v1로 설정하고, STT/LLM/TTS 모두 model: 'auto'로 지정합니다.

Pipecat (Python) 지원.

Claude / Cursor MCP 연동: claude mcp add --transport http speko https://mcp.speko.ai/mcp 명령으로 Speko MCP를 추가할 수 있습니다.

문서 보기 · API 키 발급

원문 보기
원문 보기 (영어)
Backed by Y Combinator Backed by Y Combinator Backed by Y Combinator → The Router for Voice AI Every speech model, benchmarked language by language, wired into one API. Get API key Compare models Router Which model to call, per language and per objective, decided from published measurements instead of a vendor's English leaderboard. Benchmark coverage by language Speech-to-text Speech-to-text Text-to-speech Text-to-speech Model EN AR FR DE HI NB ES TA TE Nova-3 stt-rt-v5 GPT-4o Transcribe GPT-4o-mini Transcribe Qwen3-ASR Chirp 3 Ink-Whisper Pulse Pro Whisper-1 Nova-2 Gradium ASR Grok STT Ink-2 Pulse Realtime STT-1 bench Scribe v2 Realtime Solaria-1 Universal-3.5 Pro Velma 2 Flux GPT Live Transcribe Show all 21 models ↓ Score against cost, per stage Speech-to-text Speech-to-text LLM LLM Text-to-speech Text-to-speech Speech-to-speech Speech-to-speech Accuracy (WER) $0.0010 $0.0160 2.0% 11.0% Realtime STT-1 3.3% · $0.0025 Universal-3.5 Pro 2.0% · $0.0075 Velma 2 4.4% · $0.0010 GPT-4o Transcribe 2.3% · $0.0060 GPT-4o-mini Transcribe 2.7% · $0.0030 Cost ($/min) # Model WER ▲ batch Cost ▼ / min 1 Universal-3.5 Pro assemblyai:universal-3-5-pro 2.0% $0.0075 2 GPT-4o Transcribe openai:gpt-4o-transcribe 2.3% $0.0060 3 GPT-4o-mini Transcribe openai:gpt-4o-mini-transcribe 2.7% $0.0030 4 Qwen3-ASR alibaba:qwen3-asr-flash 2.8% $0.0054 5 Realtime STT-1 inworld:inworld-stt-1 3.3% $0.0025 6 Chirp 3 google:chirp_3 3.9% $0.0160 7 Velma 2 modulate:velma-2-stt-streaming-english-v2 4.4% $0.0010 8 Grok STT xai:stt 4.8% $0.0033 9 Solaria-1 gladia:solaria-1 5.0% $0.0125 10 Pulse smallest:pulse 5.1% ~$0.0050 11 stt-rt-v5 soniox:stt-rt-v5 7.5% $0.0020 12 Gradium ASR gradium:default 8.4% $0.0104 13 Nova-3 deepgram:nova-3 9.8% $0.0048 14 Ink-2 cartesia:ink-2 11.0% $0.0090 — Flux deepgram:flux-general-en — $0.0065 — Scribe v2 Realtime elevenlabs:scribe_v2_realtime — $0.0065 — GPT Live Transcribe openai:gpt-live-transcribe — $0.0170 Show all 17 models ↓ Gateway One base URL and one key in front of every provider, speaking the API your framework already calls. Run and observe your voice workers Speko speaks the OpenAI API, so the frameworks you already use need a hostname and a model string. LiveKit TypeScript Point the OpenAI plugin at the gateway. The agent code is unchanged. Pipecat Python Claude / Cursor MCP copy import { defineAgent, voice } from '@livekit/agents' ; import * as openai from '@livekit/agents-plugin-openai' ; const key = process .env.SPEKO_API_KEY!; const baseURL = 'https://api.speko.ai/v1' ; export default defineAgent({ entry: async (ctx) => { const session = new voice.AgentSession({ stt: new openai.STT({ apiKey: key, baseURL, model: 'auto' }), llm: new openai.LLM({ apiKey: key, baseURL, model: 'auto' }), tts: new openai.TTS({ apiKey: key, baseURL, model: 'auto' }), }); await session.start({ agent: new voice.Agent({ ... }) }); }, }); Point your agent at Speko MCP MCP curl curl $ claude mcp add --transport http speko https://mcp.speko.ai/mcp Read the docs Get API key