OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี

작성자

카테고리:

← 피드로
DEV Community · Nokka · 2026-09-06 개발(SW)

Nokka

Nokka

Posted on Sep 6 AI-assisted

OmniVoice โมเดล TTS 600+ ภาษา โคลนเสียงจากคลิป 3 วินาที เปิดซอร์สฟรี

ทีม k2-fsa เปิดตัว OmniVoice โมเดลแปลงข้อความเป็นเสียงพูด (text-to-speech) แบบ zero-shot ที่รองรับมากกว่า 600 ภาษา ซึ่งเป็นความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ที่มีอยู่ในปัจจุบัน โดยใช้สถาปัตยกรรม diffusion language model แบบใหม่ และรองรับทั้งการโคลนเสียง (voice cloning) และการออกแบบเสียง (voice design) [1]

สถาปัตยกรรมและจุดเด่น

OmniVoice สร้างบนสถาปัตยกรรม diffusion language model ซึ่งต่างจากโมเดล TTS แบบ autoregressive ทั่วไป โดยให้คุณภาพเสียงสูงพร้อมความเร็วในการประมวลผลที่เหนือกว่า

จุดเด่นหลักของโมเดลประกอบด้วย:

  • 600+ ภาษา: ความครอบคลุมภาษาที่กว้างที่สุดในบรรดาโมเดล TTS แบบ zero-shot ครอบคลุมทั้งภาษาหลักและภาษาท้องถิ่นจำนวนมาก
  • การโคลนเสียง: โคลนเสียงจากคลิปอ้างอิงสั้น ๆ เพียง 3-15 วินาที
  • การออกแบบเสียง: สร้างเสียงตามคำสั่ง เช่น “เสียงผู้ชาย สำเนียงอังกฤษ”
  • Zero-shot: ไม่ต้องเทรนเพิ่มต่อภาษา ใช้ได้ทันที

วิธีใช้งาน

OmniVoice ใช้งานได้ผ่าน Python API และ command-line tools โดยรองรับทั้ง CUDA, Apple Silicon (MPS) และ Intel Arc GPU (XPU)

ตัวอย่างการโคลนเสียงด้วย Python:

from omnivoice import OmniVoice
import soundfile as sf
import torch

model = OmniVoice.from_pretrained(
    "k2-fsa/OmniVoice",
    device_map="cuda:0",
    dtype=torch.float16
)

audio = model.generate(
    text="Hello, this is a test of zero-shot voice cloning.",
    ref_audio="ref.wav",
    ref_text="Transcription of the reference audio.",
)

sf.write("out.wav", audio[0], 24000)

Enter fullscreen mode Exit fullscreen mode

สำหรับการออกแบบเสียงโดยไม่ต้องมีคลิปอ้างอิง ใช้คำสั่ง instruct แทน:

omnivoice-infer --model k2-fsa/OmniVoice \
    --text "This is a test for text to speech." \
    --instruct "male, British accent" \
    --output hello.wav

Enter fullscreen mode Exit fullscreen mode

การเข้าถึงและระบบนิเวศ

OmniVoice เผยแพร่เป็นโอเพนซอร์สบน GitHub และ Hugging Face [2] โดยมีงานวิจัยรองรับใน arXiv (arXiv:2604.00688) [3] ทีมผู้พัฒนาประกอบด้วยนักวิจัยจาก k2-fsa ซึ่งเป็นกลุ่มเดียวกับผู้พัฒนา k2 และ icefall ที่เป็นเครื่องมือรู้จำเสียงยอดนิยม

นอกจาก Python API แล้ว ยังมีผู้พัฒนาชุมชนสร้างส่วนขยายให้ใช้งานในระบบนิเวศต่าง ๆ เช่น ComfyUI (ผ่าน ComfyUI-OmniVoice-TTS) และ Home Assistant สำหรับผู้ที่ต้องการรัน TTS บนเครื่องตัวเอง

ผลกระทบต่อคนไทย

สำหรับผู้ใช้และนักพัฒนาไทย OmniVoice มีความน่าสนใจหลายจุด

ประการแรกคือการรองรับภาษาไทยในกลุ่ม 600+ ภาษา ซึ่งเปิดทางให้สร้างเสียงพูดภาษาไทยคุณภาพสูงบนเครื่องตัวเองโดยไม่ต้องพึ่งบริการคลาวด์

ประการที่สองคือการโคลนเสียงจากคลิปสั้น 3-15 วินาที ซึ่งต่ำพอสำหรับการสร้างเสียงพากย์หรือเสียงอ่านบทความโดยใช้เสียงอ้างอิงเพียงเล็กน้อย

ประการที่สามคือการเป็นโอเพนซอร์ส ทำให้ผู้พัฒนาสามารถรันบนเครื่องตัวเองได้โดยไม่ต้องจ่ายค่า API และควบคุมข้อมูลได้เต็มที่ ซึ่งสอดคล้องกับแนวโน้ม local AI ที่กำลังเติบโต

แต่ควรระลึกว่าการโคลนเสียงมีประเด็นด้านจริยธรรมและการยินยอม ผู้ใช้ควรตรวจสอบสิทธิ์ในการใช้เสียงอ้างอิงก่อนนำไปใช้จริง

แหล่งอ้างอิง

[1] k2-fsa/OmniVoice, GitHub (2026), https://github.com/k2-fsa/OmniVoice

[2] k2-fsa/OmniVoice, Hugging Face (2026), https://huggingface.co/k2-fsa/OmniVoice

[3] Zhu et al., “OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models” (arXiv:2604.00688, 2026), https://arxiv.org/abs/2604.00688

원문에서 계속 ↗