Posted on Sep 6 AI-assisted
OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี
ทีม k2-fsa เปิดตัว OmniVoice โมเดลแปลงข้อความเป็นเสียงพูด (text-to-speech) แบบ zero-shot ที่รองรับมากกว่า 600 ภาษา ซึ่งเป็นความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ที่มีอยู่ในปัจจุบัน โดยใช้สถาปัตยกรรม diffusion language model แบบใหม่ และรองรับทั้งการโคลนเสียง (voice cloning) และการออกแบบเสียง (voice design) [1]
สถาปัตยกรรมและจุดเด่น
OmniVoice สร้างบนสถาปัตยกรรม diffusion language model ซึ่งต่างจากโมเดล TTS แบบ autoregressive ทั่วไป โดยให้คุณภาพเสียงสูงพร้อมความเร็วในการประมวลผลที่เหนือกว่า
จุดเด่นหลักของโมเดลประกอบด้วย:
- 600+ ภาษา: ความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ครอบคลุมทั้งภาษาหลักและภาษาท้องถิ่นจำนวนมาก
- การโคลนเสียง: โคลนเสียงจากคลิปอ้างอิงสั้น ๆ เพียง 3-15 วินาที
- การออกแบบเสียง: สร้างเสียงตามคำสั่ง เช่น “เสียงผู้ชาย สำเนียงอังกฤษ”
- Zero-shot: ไม่ต้องเทรนเพิ่มต่อภาษา ใช้ได้ทันที
วิธีใช้งาน
OmniVoice ใช้งานได้ผ่าน Python API และ command-line tools โดยรองรับทั้ง CUDA, Apple Silicon (MPS) และ Intel Arc GPU (XPU)
ตัวอย่างการโคลนเสียงด้วย Python:
from omnivoice import OmniVoice
import soundfile as sf
import torch
model = OmniVoice.from_pretrained(
"k2-fsa/OmniVoice",
device_map="cuda:0",
dtype=torch.float16
)
audio = model.generate(
text="Hello, this is a test of zero-shot voice cloning.",
ref_audio="ref.wav",
ref_text="Transcription of the reference audio.",
)
sf.write("out.wav", audio[0], 24000)
Enter fullscreen mode Exit fullscreen mode
สำหรับการออกแบบเสียงโดยไม่ต้องมีคลิปอ้างอิง ใช้คำสั่ง instruct แทน:
omnivoice-infer --model k2-fsa/OmniVoice \
--text "This is a test for text to speech." \
--instruct "male, British accent" \
--output hello.wav
Enter fullscreen mode Exit fullscreen mode
การเข้าถึงและระบบนิเวศ
OmniVoice เผยแพร่เป็นโอเพนซอร์สบน GitHub และ Hugging Face [2] โดยมีงานวิจัยรองรับใน arXiv (arXiv:2604.00688) [3] ทีมผู้พัฒนาประกอบด้วยนักวิจัยจาก k2-fsa ซึ่งเป็นกลุ่มเดียวกับผู้พัฒนา k2 และ icefall ที่เป็นเครื่องมือรู้จำเสียงยอดนิยม
นอกจาก Python API แล้ว ยังมีผู้พัฒนาชุมชนสร้างส่วนขยายให้ใช้งานในระบบนิเวศต่าง ๆ เช่น ComfyUI (ผ่าน ComfyUI-OmniVoice-TTS) และ Home Assistant สำหรับผู้ที่ต้องการรัน TTS บนเครื่องตัวเอง
ผลกระทบต่อคนไทย
สำหรับผู้ใช้และนักพัฒนาไทย OmniVoice มีความน่าสนใจหลายจุด
ประการแรกคือการรองรับภาษาไทยในกลุ่ม 600+ ภาษา ซึ่งเปิดทางให้สร้างเสียงพูดภาษาไทยคุณภาพสูงบนเครื่องตัวเองโดยไม่ต้องพึ่งบริการคลาวด์
ประการที่สองคือการโคลนเสียงจากคลิปสั้น 3-15 วินาที ซึ่งต่ำพอสำหรับการสร้างเสียงพากย์หรือเสียงอ่านบทความโดยใช้เสียงอ้างอิงเพียงเล็กน้อย
ประการที่สามคือการเป็นโอเพนซอร์ส ทำให้ผู้พัฒนาสามารถรันบนเครื่องตัวเองได้โดยไม่ต้องจ่ายค่า API และควบคุมข้อมูลได้เต็มที่ ซึ่งสอดคล้องกับแนวโน้ม local AI ที่กำลังเติบโต
แต่ควรระลึกว่าการโคลนเสียงมีประเด็นด้านจริยธรรมและการยินยอม ผู้ใช้ควรตรวจสอบสิทธิ์ในการใช้เสียงอ้างอิงก่อนนำไปใช้จริง
แหล่งอ้างอิง
[1] k2-fsa/OmniVoice, GitHub (2026), https://github.com/k2-fsa/OmniVoice
[2] k2-fsa/OmniVoice, Hugging Face (2026), https://huggingface.co/k2-fsa/OmniVoice
[3] Zhu et al., “OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models” (arXiv:2604.00688, 2026), https://arxiv.org/abs/2604.00688