Microsoft เปิดตัว MAI-Transcribe-2 ถอดเสียง 60 ภาษา ภาษาไทยแม่นสุด ราคาถูกสุดในตลาด

작성자

카테고리:

← 피드로
DEV Community · Nokka · 2026-09-06 개발(SW)

Nokka

Nokka

Posted on Sep 6 AI-assisted

Microsoft เปิดตัว MAI-Transcribe-2 ถอดเสียง 60 ภาษา ภาษาไทยแม่นสุด ราคาถูกสุดในตลาด

Microsoft AI เปิดตัว MAI-Transcribe-2 โมเดลถอดเสียงพูดเป็นข้อความรุ่นล่าสุดเมื่อวันที่ 3 กันยายน 2026 โดยระบุว่าเป็นโมเดลถอดเสียงที่เร็วที่สุด แม่นยำที่สุด และถูกที่สุดในตลาดขณะนี้ รองรับ 60 ภาษา รวมถึงภาษาไทย และทำคะแนนอันดับหนึ่งบนมาตรฐาน FLEURS ด้วยอัตราความผิดพลาดของคำเฉลี่ย 5.2% ทั่วทั้ง 60 ภาษา [1]

สเปกและฟีเจอร์ใหม่

MAI-Transcribe-2 เป็นโมเดลถอดเสียงรุ่นที่สามในรอบห้าเดือนของ Microsoft AI โดยขยายการรองรับภาษาจาก 43 ภาษาในรุ่น 1.5 (มิถุนายน) และ 25 ภาษาในรุ่นแรก (เมษายน) มาเป็น 60 ภาษาในรุ่นนี้

ฟีเจอร์ที่เพิ่มเข้ามาในรุ่นนี้ประกอบด้วย:

  • **การแยกผู้พูด (speaker diarization): ระบุว่าใครพูดอะไรในไฟล์เสียงที่มีหลายคน ซึ่งเป็นความแตกต่างระหว่าง “ข้อความก้อนเดียว” กับ “บันทึกการประชุมที่ใช้ได้จริง”
  • **เวลากำกับรายคำ (word-level timestamps): ระบุเวลาที่แน่นอนของทุกคำ รองรับการค้นหา แก้ไข และซิงก์กับวิดีโอ
  • **การปรับคำเฉพาะทาง (keyword biasing): ให้ผู้พัฒนาป้อนรายชื่อยา รหัสสินค้า หรือชื่อพนักงาน เพื่อให้โมเดลไม่เพี้ยนศัพท์เฉพาะ
  • **การสลับภาษา (code switching): รองรับบทสนทนาที่สลับภาษากลางประโยค เช่น ฮิงลิช (ฮินดีผสมอังกฤษ) และสแปงลิช (สเปนผสมอังกฤษ)
  • โหมดถอดเสียงสองแบบ: แบบ “verbatim” เก็บคำอุทานและเสียงติดขัดครบถ้วนสำหรับงานกฎหมายและตรวจสอบ และแบบ “clean” ตัดคำฟุ่มเฟือยเพื่อให้ได้คำบรรยายที่อ่านง่าย

ผลการทดสอบมาตรฐาน

Microsoft อ้างผลการทดสอบสามด้าน โดยแต่ละด้านใช้มาตรวัดต่างกัน

ด้านแรกคือ FLEURS ซึ่งเป็นมาตรฐานที่นักวิจัยของ Google เผยแพร่ในปี 2022 สร้างจากเจ้าของภาษาที่อ่านประโยคประมาณ 2,000 ประโยคใน 102 ภาษา MAI-Transcribe-2 ทำอันดับหนึ่งด้วยอัตราความผิดพลาดของคำเฉลี่ย 5.2% ทั่ว 60 ภาษา

สำหรับภาษาไทยโดยเฉพาะ MAI-Transcribe-2 ทำอัตราความผิดพลาดของคำที่ 3.4% ซึ่งดีที่สุดในตารางเปรียบเทียบ เหนือกว่า Gemini 3.5 Transcribe (3.8%), Gemini 3.1 Pro (4.7%), GPT-transcribe (5.4%), Scribe v2 (6.1%) และ Whisper v3-large (8.7%)

ด้านที่สองคือ Artificial Analysis ซึ่งเป็นผู้ทดสอบอิสระที่วัดผ่าน API สาธารณะ MAI-Transcribe-2 ขึ้นมาอยู่อันดับสองบนกระดานอัตราความผิดพลาดของคำ และเป็นโมเดลที่กำหนด “Pareto frontier” ด้านความแม่นยำกับความหน่วง หมายความว่าไม่มีคู่แข่งรายใดแม่นกว่าโดยไม่ช้ากว่า หรือเร็วกว่าโดยไม่แม่นน้อยกว่า

ด้านที่สามคือความเร็วล้วน ๆ โดย Microsoft อ้างว่า MAI-Transcribe-2 เร็วกว่า GPT-Transcribe ของ OpenAI 10 เท่า เร็วกว่า Scribe v2 ของ ElevenLabs 7 เท่า และเร็วกว่า Gemini 3.5 Transcribe ของ Google 5 เท่า ตามการประเมินของ Artificial Analysis

ราคาและความเร็ว

MAI-Transcribe-2 เปิดตัวที่ราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง ซึ่งเป็นราคาโปรโมชันถึงสิ้นปี ลดลงประมาณ 72% จากราคา 0.36 ดอลลาร์ของรุ่นแรกเมื่อห้าเดือนก่อน

VentureBeat ชี้ให้เห็นนัยของราคานี้ว่า สำหรับองค์กรที่ประมวลผลเสียงคอลเซ็นเตอร์ 100,000 ชั่วโมงต่อปี ซึ่งเป็นปริมาณปกติของธนาคารหรือผู้ให้บริการโทรคมนาคมขนาดใหญ่ ค่าใช้จ่ายจะลดลงจาก 36,000 ดอลลาร์เหลือ 10,000 ดอลลาร์ จนการถอดเสียงไม่ใช่รายการที่ต้องถกเถียงกันอีกต่อไป [2]

ความเร็วที่สูงยังช่วยลดต้นทุนการประมวลผล เพราะโมเดลที่ทำงานเร็วกว่าใช้ชั่วโมง GPU น้อยกว่า ซึ่งเป็นเหตุผลที่ Microsoft ตั้งราคาได้ต่ำและยังมีกำไร

บริบทเชิงกลยุทธ์

การเปิดตัวครั้งนี้เป็นส่วนหนึ่งของกลยุทธ์ที่ Microsoft ใช้สร้างโมเดลระดับแนวหน้าของตัวเองทีละรูปแบบ แล้วค่อย ๆ สลับเข้าไปแทนที่เทคโนโลยีของ OpenAI ในผลิตภัณฑ์ต่าง ๆ โดยการถอดเสียงเป็นรูปแบบที่เดินหน้าเร็วที่สุด

Mustafa Suleyman ประธานเจ้าหน้าที่บริหารของ Microsoft AI เคยให้สัมภาษณ์กับ The Verge ว่าโมเดลรุ่นแรกมาจาก “ทีมเล็ก ๆ ที่มุ่งเน้นเพียง 10 คน” ที่ “ปลอดจากระบบราชการ” และโมเดลทำงานด้วย “ต้นทุน GPU ครึ่งหนึ่งของโมเดลระดับแนวหน้าตัวอื่น”

ผลกระทบต่อคนไทย

สำหรับผู้ใช้และนักพัฒนาในไทย MAI-Transcribe-2 มีความน่าสนใจหลายจุด

ประการแรกคือความแม่นยำภาษาไทยที่ 3.4% ซึ่งดีที่สุดในตารางเปรียบเทียบ เหนือกว่า Whisper v3-large ที่เป็นโมเดลโอเพนซอร์สยอดนิยมอย่างชัดเจน (8.7%) สำหรับงานที่ต้องการความแม่นยำสูง เช่น การถอดเสียงประชุม การทำคำบรรยายวิดีโอ หรือการแปลงเสียงสัมภาษณ์เป็นข้อความ นี่เป็นตัวเลือกที่น่าสนใจ

ประการที่สองคือราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง หรือประมาณ 3 บาทต่อชั่วโมงเสียง ซึ่งต่ำพอที่ธุรกิจขนาดเล็กและผู้สร้างคอนเทนต์จะเริ่มใช้ได้โดยไม่ต้องกังวลเรื่องงบประมาณ

ประการที่สามคือการเข้าถึง โมเดลนี้ใช้งานได้ผ่าน Microsoft Foundry, MAI Playground และ OpenRouter ซึ่งนักพัฒนาไทยที่ใช้ API อยู่แล้วสามารถเริ่มทดสอบได้ทันที [3]

แต่ควรระลึกว่าผลการทดสอบดังกล่าวเป็นข้อมูลจากผู้พัฒนา และประสิทธิภาพจริงอาจแตกต่างกันตามระบบทดสอบและวิธีติดตั้ง โดยเฉพาะ FLEURS ที่ใช้เสียงอ่านจากเจ้าของภาษา ไม่ใช่บทสนทนาจริงที่มีเสียงรบกวนและพูดซ้อนกัน

แหล่งอ้างอิง

[1] Microsoft AI, “MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world” (3 ก.ย. 2026), https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/

[2] VentureBeat, “Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed” (3 ก.ย. 2026), https://venturebeat.com/infrastructure/microsoft-ais-mai-transcribe-2-undercuts-openai-google-and-elevenlabs-on-price-and-speed

[3] Microsoft Learn, “MAI-Transcribe in Azure Speech (preview)” (2026), https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe

원문에서 계속 ↗