OmniVoice Studio — ทางเลือก ElevenLabs แบบโอเพนซอร์สที่รันบนเครื่องคุณเอง
โดย Nokka (นก-กา) | 11 กรกฎาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4-pro) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์ — Nokka (นก-กา)
ElevenLabs คิดเงิน $5–$330 ต่อเดือน [1] แถมทุกไฟล์เสียงที่คุณอัปโหลด — ผ่านเซิร์ฟเวอร์ของเขาหมด
ถ้าคุณทำพอดแคสต์, พากย์วิดีโอ, หรือสร้างเสียง AI เป็นประจำ — ค่าใช้จ่ายบานปลายเร็ว และที่สำคัญ — เสียงของคุณไม่ใช่ของคุณอีกต่อไป
OmniVoice Studio คือคำตอบสำหรับคนที่อยากได้ความสามารถระดับ ElevenLabs — แต่รันบนเครื่องตัวเอง 100% ไม่มี API key ไม่มีคลาวด์ ไม่มีค่าสมาชิก
ในมุมมองของผม — นี่คือโปรเจกต์โอเพนซอร์สด้านเสียง AI ที่น่าจับตามองที่สุดในปี 2026 — ไม่ใช่เพราะฟีเจอร์เยอะ (ซึ่งก็เยอะจริง) — แต่เพราะ philosophy ของมัน: “เสียงของคุณควรอยู่บนเครื่องคุณ”
OmniVoice Studio คืออะไร
OmniVoice Studio เป็นเดสก์ท็อปแอปโอเพนซอร์ส (AGPL-3.0) ที่รวมทุกอย่างเกี่ยวกับเสียง AI ไว้ในที่เดียว — จาก debpalash นักพัฒนาที่สร้างโปรเจกต์นี้ด้วย Claude Code และ AI agents [2] — MarkTechPost เรียกมันว่า “ทางเลือก ElevenLabs แบบ local ที่น่าสนใจ” [4]
ตัวเลขที่น่าสนใจ:
ตัวเลข ค่า GitHub Stars 8,300+ Forks 1,300+ Commits 809+ Last commit 1 ชั่วโมงที่แล้ว (active มาก) ภาษา TTS 646 ภาษา ภาษา ASR ~100 ภาษา TTS Engines 14 engines ASR Engines 10 engines8 ฟีเจอร์หลัก
1. 🎙️ Voice Cloning — โคลนเสียงจากคลิป 3 วินาที
อัดเสียง 3 วินาที → ได้เสียงที่เหมือนคุณ — zero-shot (ไม่ต้องเทรนเพิ่ม) — รองรับ 646 ภาษา
2. 🎨 Voice Design — ออกแบบเสียงใหม่จากศูนย์
ปรับพารามิเตอร์: เพศ, อายุ, สำเนียง, ระดับเสียง, ความเร็ว, อารมณ์, ภาษาถิ่น — โดยไม่ต้องโคลนเสียงใคร
3. 🎬 Video Dubbing — พากย์วิดีโอทั้งคลิป
ใส่ YouTube URL หรือไฟล์วิดีโอ → ถอดเสียงด้วย WhisperX → แปล → สังเคราะห์เสียงใหม่ → ส่งออก MP4 — ทั้ง pipeline รันบนเครื่องคุณ
4. 📖 Audiobook Editor — ทำหนังสือเสียง
Import text, EPUB, หรือ PDF → แบ่งบทอัตโนมัติ → ปรับความดัง (loudnorm) → ใส่ metadata → ส่งออก .m4b
5. 🎭 Stories — เรื่องเล่าหลายเสียง
กำหนดเสียงให้แต่ละตัวละคร — preview — ส่งออกทั้งเรื่องแบบ full cast
6. ⌨️ Dictation Widget — พิมพ์ด้วยเสียงจากทุกแอป
กด ⌘+⇧+Space จากแอปไหนก็ได้ — ถอดเสียงผ่าน WebSocket — วางข้อความอัตโนมัติ — widget ลอยเหนือทุกหน้าต่าง
7. 🤖 MCP Server — ใช้จาก Claude, Cursor, หรือ agent ไหนก็ได้
OmniVoice Studio มี MCP Server ในตัว — Claude Code, Cursor, หรือ MCP client ไหนก็เรียกใช้ TTS/STT ได้
8. 🔐 100% Local — ไม่มีอะไรออกจากเครื่องคุณ
ไม่ต้องใช้ API key — ไม่ต้องสมัคร — ไม่มีคลาวด์ — ทุกอย่างรันบนฮาร์ดแวร์คุณ
14 TTS Engines — เลือกได้ตามต้องการ
OmniVoice Studio ไม่ได้ผูกติดกับ engine เดียว — มีให้เลือก 14 ตัว — engine หลักคือ OmniVoice จาก k2-fsa [5] ที่รองรับ 600+ ภาษา:
Engine ภาษา Clone Instruct macOS Windows Linux OmniVoice (default) 600+ ✅ ✅ ✅ MPS ✅ CUDA ✅ CUDA CosyVoice 3 9 + 18 dialects ✅ ✅ ✅ MPS ✅ CUDA ✅ CUDA GPT-SoVITS 5 ✅ — — ✅ CUDA ✅ CUDA VoxCPM2 30 ✅ ✅ ✅ MPS ✅ CUDA ✅ CUDA MOSS-TTS-Nano 20 ✅ — ✅ CPU ✅ CUDA ✅ CUDA KittenTTS English — — ✅ CPU ✅ CPU ✅ CPU MLX-Audio Multi Varies Varies ✅ Native ❌ ❌ Sherpa-ONNX 20+ — — ✅ CPU ✅ CUDA ✅ CUDA IndexTTS 2 Multi ✅ — — ✅ CUDA ✅ CUDA OmniVoice GGUF 600+ ✅ ✅ ✅ CPU ✅ CPU ✅ CPU Supertonic 3 31 — — ✅ CPU ✅ CPU ✅ CPU MOSS-TTS-v1.5 (8B) 31 ✅ — ✅ CPU ✅ CUDA ✅ CUDA dots.tts (2B) 24 ✅ — ✅ CPU ❌ ✅ CUDA Confucius4-TTS 14 ✅ — ✅ CPU ✅ CUDA ✅ CUDAEngine ที่มี ⚡ คือ lazy-registered — ติดตั้งเมื่อใช้ครั้งแรก
10 ASR Engines — ถอดเสียงได้ทุกสถานการณ์
Engine ภาษา จุดเด่น WhisperX (default) ~100 Word-level timing — เหมาะกับ dubbing Faster-Whisper ~100 เร็ว — CTranslate2 MLX Whisper ~100 Native Apple Silicon PyTorch Whisper ~100 CUDA/CPU fallback Parakeet TDT EN + 25 EU SOTA accuracy — ~10× realtime Moonshine English Edge / low-latency FunASR 50+ VAD + diarization ในตัว sherpa-onnx 25 EU + 90+ Live dictation — เร็วกว่า realtime Faster-Whisper (isolated) ~100 Crash-isolated ใน subprocess OpenAI-compatible ตาม server ต่อ Qwen3-ASR หรือ server ไหนก็ได้Architecture — หลังบ้านทำงานยังไง
┌─────────────────────────────────────────────┐
│ Frontend (React) │
│ DubTab · VoiceConsole · Stories · Gallery │
│ Dictation · BatchQueue · MCP Client │
├─────────────────────────────────────────────┤
│ Backend (FastAPI) │
│ 100+ API endpoints · SSE+WSS · SQLite │
├────────┬────────┬────────┬──────────────────┤
│WhisperX│ Demucs │OmniVoice│ Engine Routing │
│(+9 ASR)│Source │(+13 TTS)│ ↳ GPU preflight │
│ │ Sep. │ │ ↳ No silent CPU │
└────────┴────────┴────────┴──────────────────┘
CUDA / MPS / ROCm / CPU (auto-detect)
Enter fullscreen mode Exit fullscreen mode
- Frontend: React + Tauri (เดสก์ท็อปแอป)
- Backend: FastAPI — 100+ endpoints — SSE/WebSocket streaming
- Database: SQLite
- GPU: Auto-detect — CUDA, Apple Silicon MPS, AMD ROCm (Linux), CPU fallback
-
API: OpenAI-compatible —
/v1/audio/speechและ/v1/audio/transcriptions
ติดตั้งบน macOS (Apple Silicon)
# ดาวน์โหลด DMG จาก GitHub Releases
# https://github.com/debpalash/OmniVoice-Studio/releases/latest
# หรือรันจาก source
git clone https://github.com/debpalash/OmniVoice-Studio
cd OmniVoice-Studio
uv run python backend/main.py
Enter fullscreen mode Exit fullscreen mode
Requirements:
ขั้นต่ำ แนะนำ OS macOS 12+ (Apple Silicon) macOS 15+ RAM 8 GB 16 GB+ VRAM 4 GB (auto-offload) 8 GB+ Disk 10 GB 20 GB+ SSD⚠️ Intel Mac ไม่ support — PyTorch เลิก support Intel Mac (x86_64) แล้ว — ใช้ได้เฉพาะ Apple Silicon
เทียบกับ ElevenLabs
ElevenLabs OmniVoice Studio ราคา $5–$330/เดือน ฟรี (AGPL-3.0) Voice Cloning ✅ 3s clip ✅ 3s clip, zero-shot Voice Design ✅ เพศ, อายุ ✅ เพศ, อายุ, สำเนียง, อารมณ์, ภาษาถิ่น ภาษา 32 646 Video Dubbing ✅ Cloud-only ✅ Local Audiobook ❌ ✅ EPUB/PDF → .m4b ความเป็นส่วนตัว เสียงไปคลาวด์ ไม่มีอะไรออกจากเครื่อง API Keys ต้องใช้ ไม่ต้อง TTS Engines 1 14 ASR Engines 1 10 MCP Server ❌ ✅ Desktop App ❌ ✅ macOS · Windows · Linuxภาษาไทย — ทำได้แค่ไหน
OmniVoice Studio รองรับภาษาไทยในทางเทคนิค — แต่ต้องบอกตามตรงว่า ยังไม่มี benchmark หรือรีวิวคุณภาพภาษาไทย
ฟีเจอร์ รองรับไทย? มี Benchmark? หมายเหตุ TTS ✅ ผ่าน OmniVoice (600+ ภาษา) ❌ มี community fine-tunehotdogs/omnivoice-thai — แต่เทรนด้วยข้อมูลแค่ 12.6 ชม., 2 speakers
ASR
✅ ผ่าน WhisperX (~100 ภาษา)
❌
Whisper ภาษาไทยใช้ได้ — แต่ไม่มี WER benchmark
Voice Cloning
✅ ในทางทฤษฎี
❌
ไม่มีตัวอย่าง clone เสียงไทย
Video Dubbing
✅ ในทางทฤษฎี
❌
ไม่มีตัวอย่าง dubbing ไทย
Community fine-tune ภาษาไทย:
มีคนทำ hotdogs/omnivoice-thai [3] — fine-tune จาก OmniVoice (Qwen3-0.6B) ด้วยข้อมูล 12.6 ชั่วโมง, 2 speakers — เทรนบน RTX 3090 — ใช้เวลา ~1.5 ชั่วโมง — Apache 2.0
from omnivoice import OmniVoice
model = OmniVoice.from_pretrained("hotdogs/omnivoice-thai")
audio = model.generate(
text="สวัสดีครับ วันนี้อากาศดีมากเลย",
instruct="male, low pitch",
)
Enter fullscreen mode Exit fullscreen mode
แต่ 12.6 ชั่วโมงกับ 2 speakers — น้อยมากเมื่อเทียบกับ ElevenLabs ที่เทรนด้วยข้อมูลระดับหมื่นชั่วโมง — คุณภาพน่าจะยังห่าง
ข้อจำกัดที่ควรรู้
- ยังเป็น Beta — ของอาจพังระหว่างเวอร์ชัน — แนะนำรันจาก source แทน installer
- Intel Mac ไม่ support — PyTorch เลิก support x86_64 macOS แล้ว
- AMD GPU บน Windows ไม่ได้ — ROCm support เฉพาะ Linux — Windows ใช้ NVIDIA เท่านั้น
- ต้องการ VRAM — ขั้นต่ำ 4 GB — ถ้าน้อยกว่านี้ auto-offload ไป CPU (ช้าลง)
- ภาษาไทยยังไม่มี benchmark — ถ้าจะใช้จริงจัง ต้องทดสอบเอง
ใครควรใช้
- คนทำคอนเทนต์ — พากย์วิดีโอ, ทำหนังสือเสียง, สร้างเสียง AI — โดยไม่ต้องจ่ายรายเดือน
- นักพัฒนา — ต้องการ TTS/STT API บนเครื่องตัวเอง — OpenAI-compatible endpoint
- คนที่ห่วงความเป็นส่วนตัว — ไฟล์เสียงไม่เคยออกจากเครื่อง
- สายโอเพนซอร์ส — อยาก fork, extend, หรือ contribute
ไม่เหมาะสำหรับ:
- คนที่ต้องการคุณภาพเสียงระดับ ElevenLabs ทันที — OmniVoice ยังเป็น Beta
- คนใช้ Intel Mac — ไม่ support
- คนที่ต้องการภาษาไทยคุณภาพสูง — ยังไม่มี benchmark ยืนยัน
สรุป
OmniVoice Studio คือ ElevenLabs alternative ที่น่าสนใจที่สุดในฝั่งโอเพนซอร์สตอนนี้ — 8,300+ stars, 809 commits, อัปเดตทุกวัน — รองรับ 646 ภาษา, 14 TTS engines, 10 ASR engines — และทุกอย่างรันบนเครื่องคุณ
ภาษาไทยยังเป็นจุดอ่อน — รองรับในทางเทคนิคแต่ยังไม่มีใครทดสอบคุณภาพ — ถ้าคุณเป็นคนแรกที่ลอง — มาแชร์ผลกันได้
ดาวน์โหลด: github.com/debpalash/OmniVoice-Studio
อ้างอิง
[1] ElevenLabs Pricing — elevenlabs.io/pricing — ราคา $5–$330/เดือน ณ กรกฎาคม 2026
[2] OmniVoice Studio GitHub Repository — github.com/debpalash/OmniVoice-Studio — 8,300+ stars, 809 commits, AGPL-3.0, 2026
[3] hotdogs/omnivoice-thai — huggingface.co/hotdogs/omnivoice-thai — Community fine-tune ภาษาไทย, Apache 2.0, 2026
[4] MarkTechPost — “Meet OmniVoice Studio: A Local, Open-Source Alternative to ElevenLabs” — marktechpost.com — 26 พฤษภาคม 2026
[5] k2-fsa/OmniVoice — github.com/k2-fsa/OmniVoice — TTS engine หลัก รองรับ 600+ ภาษา, 8,200+ stars, 2026
บทความนี้เป็นส่วนหนึ่งของซีรีส์ “เครื่องมือ AI โอเพนซอร์สที่น่าสนใจ” — ติดตามตอนต่อไปได้ที่ Nokka on dev.to
답글 남기기