ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น

작성자

카테고리:

← 피드로
DEV Community · Nokka · 2026-09-05 개발(SW)

Nokka

ช่องว่าง 0.3% แต่ราคาต่าง 2 เท่า, อ่านตาราง Terminal-Bench 4.0 ให้เป็น

โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 5 กันยายน 2026

บทความนี้เขียนโดย AI (glm-5.3 via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจากตาราง leaderboard จริงของ Terminal-Bench 4.0 และข้อมูลราคาจาก TokenCost

Terminal-Bench economics

สัปดาห์นี้ตาราง Terminal-Bench 4.0 มีโมเดลใหม่สองตัวขึ้นครองสองอันดับแรกพร้อมกัน: GPT-6 Astra ผ่าน Codex อยู่ที่ 58.2% และ Claude Fable 5.1 ผ่าน Claude Code ตามติดที่ 57.9% [1] พาดหัวข่าวส่วนใหญ่เล่าเรื่องความเก่ง แต่ผมอยากชวนอ่านตารางนี้ให้ลึกกว่านั้น เพราะคอลัมน์ที่อยู่ขวาสุดของตารางคือสิ่งที่นักพัฒนาตัวจริงควรจ้อง: ต้นทุนต่อรันเต็ม

ทั้งสองตัวต่างกันแค่ 0.3 จุดในคะแนน แต่ต่างกันเกือบสองเท่าในเงิน: รันเต็มชุดของ Astra ใช้ประมาณ 3,300 ดอลลาร์ ขณะที่ Fable 5.1 ใช้ราว 6,200 ดอลลาร์ [1] บทความนี้เล่าว่าภาพนี้บอกอะไรเกี่ยวกับตลาดโมเดลปี 2026 และจะอ่านตาราง benchmark แบบนี้ให้เป็นยังไง

ก่อนอื่น, ทำความเข้าใจศัพท์

  • Terminal-Bench: benchmark ที่วัดโมเดลผ่านงานจริงใน terminal ลีนุกซ์ เช่น ตั้งเครื่อง แก้ไฟไฟล์ config รันโค้ด จัดการ process เกินกว่าการตอบคำถาม
  • รันเต็ม (full run): การวิ่งโมเดลผ่านทุกโจทย์ในชุดหนึ่งรอบ เงินที่เห็นคือค่า API รวมของรอบนั้น
  • ค่าความไม่แน่นอน (± ): ตัวเลขหลังคะแนนบอกว่าถ้ารันใหม่ผลอาจลอยไปเท่าไหร่ เช่น 58.2% ± 2.8% หมายถึงอยู่ระหว่างราว 55-61%

ถ้าให้อุปมา: ตารางนี้เหมือนตารางแข่งรถที่ป้ายบอกแค่เวลาเข้าเส้นชัย แต่สิ่งที่ลืมดูคือราคาน้ำมันที่แต่ละคันกินต่างกันเท่าตัว เวลาเข้าเส้นชัยต่างกัน 0.3 วินาทีไม่ได้แปลว่าคุ้มกันเสมอ ถ้าคันหนึ่งกินน้ำมันแพงกว่าสองเท่า

ตารางจริง 14 อันดับ, อ่านคู่คะแนนกับราคา

จากตารางทางการ ณ ต้นเดือน ก.ย. [1]

อันดับ โมเดล (ผ่าน harness ไหน) คะแนน ราคาต่อรันเต็ม 1 GPT-6 Astra (Codex) 58.2% ± 2.8% $3.3k 2 Fable 5.1 (Claude Code) 57.9% ± 3.8% $6.2k 3 Opus 5 (Claude Code) 51.8% ± 3.4% $6.0k 4 Fable 5 (Claude Code) 44.5% ± 3.8% $7.3k 5 GLM-5.3 (Claude Code) 41.8% ± 3.2% $2.7k 6 GPT-5.6 Sol (Codex) 37.3% ± 3.8% $2.5k 7 Opus 4.8 (Claude Code) 23.6% ± 3.6% $6.5k 9 Grok 4.6 (Grok Build) 20.3% ± 3.1% $3.6k 10 Gemini 3.8 Flash (mini-SWE-agent) 19.1% ± 3.4% $1.8k 12 Sonnet 5 (Claude Code) 12.4% ± 3.1% $9.6k

สามข้อค้นพบเมื่ออ่านคู่กัน

ผมเลือกแถวที่น่าสนใจทิ้งไว้ให้ครบโดยเจตนา สิ่งที่โดดออกมาเมื่ออ่านคู่กัน:

หนึ่ง อันดับหนึ่งไม่ได้แพงสุด แถมถูกกว่ารองลำดับเกือบครึ่ง Astra ชนะด้วยเงิน 3.3 พันดอลลาร์ ขณะที่ตัวรองคือ Fable 5.1 ใช้ 6.2 พัน ผมเคยเขียนเรื่องราคาโมเดลจีนที่ถูกกว่าเท่าตัวมาแล้วหลายครั้ง ครั้งนี้ฝั่งอเมริกันเองก็เริ่มแสดงแพทเทิร์นเดียวกัน (ทั้งหมดนี้สอดคล้องกับสิ่งที่ OpenAI อ้างถึงเรื่องประสิทธิภาพ token ของ Astra ในหน้าประกาศเปิดตัว [3]): ความเก่งแพ็กมากับการใช้ทรัพยากรอย่างคุ้มค่า ไม่ใช่กับการกิน token มากกว่า

สอง Sonnet 5 คือบทเรียนแพงที่สุดในตาราง คะแนน 12.4% ในราคา 9.6 พันดอลลาร์ คือแพงเกือบสามเท่าของอันดับหนึ่งเพื่อคะแนนที่ต่ำกว่าเกือบห้าเท่า แถวนี้เตือนว่าราคาไม่ได้สัมพันธ์กับคะแนนอัตโนมัติเลย ยิ่งชื่อดังยิ่งไม่ประกัน

สาม Gemini 3.8 Flash เป็นสายประหยัดที่น่าจับตา คะแนน 19.1% ไม่เด่นเท่าไหร่ แต่ทำด้วยงบ 1.8 พันเท่านั้น ประสิทธิภาพต่อดอลลาร์ของแถวนี้อยู่ในกลุ่มดีของตาราง สอดคล้องกับการวิเคราะห์ GLM-5 ในงานวิจัย ProMax ที่ผมเขียนคู่กันในวันเดียวกัน

อ่านตารางแบบนี้ให้เป็นด้วยสามคำถาม

จากประสบการณ์ติดตาม benchmark มาทั้งปี ผมสรุปสามคำถามที่ควรถามทุกครั้งเจอตารางใหม่

คำถามที่หนึ่ง: คะแนนซ้อนกันไหม

หนึ่ง: คะแนนซ้อนกันไหม 58.2% ± 2.8% กับ 57.9% ± 3.8% คือช่วงที่เหลื่อมกันเกือบทั้งหมด แปลว่าถ้ารันใหม่วันพรุ่งนี้ Astra อาจแพ้ Fable ได้ง่ายๆ ความต่าง 0.3 จุดไม่ใช่ชัยชนะ มันคือสถิติเสมอกัน แต่พาดหัวข่าวไม่เคยบอกคุณตรงนี้ (การวิเคราะห์ต้นทุนต่อโจทย์ที่แก้ได้จาก TokenCost ช่วยยืนยันมุมมองนี้ [2])

สอง: เงินซื้ออะไรได้จริง เมื่อเทียบเป็นเงินต่อคะแนนที่เพิ่มขึ้นหนึ่งจุด Astra ใช้ราว 57 ดอลลาร์ ขณะที่ Fable 5.1 ใช้ราว 107 ดอลลาร์ ในระดับองค์กรที่รันหลายพันครั้งต่อเดือน สองเท่าของส่วนต่างนี้คืองบที่แตกต่างกันหลักล้านบาทต่อปี

สาม: โจทย์เหมาะกับงานเราไหม Terminal-Bench วัดงาน terminal ล้วน ถ้างานหลักของทีมคุณคือ refactor ฐานโค้ดใหญ่ ตาราง SWE-Bench ProMax ที่ผมเขียนคู่กันเหมาะกว่า ถ้าเป็นงานเอกสารหรือวิเคราะห์ ทั้งสองตารางก็ยังไม่ใช่คำตอบ ตารางเดียวไม่มีทางบอกอะไรได้ครบ

ข้อควรระวังในการอ่าน

เพื่อความสมดุล สิ่งที่ควรรู้ก่อนสรุปอะไรจากตารางนี้: หนึ่ง ตัวเลขราคาคือค่าใช้จ่ายตอนวิ่ง benchmark เท่านั้น ไม่รวมค่าเขียนโค้ดจริงประจำวันซึ่งรูปแบบงานต่างกัน สอง แต่ละแถววิ่งผ่าน harness คนละตัว (Codex, Claude Code, Grok Build) ดังนั้นคะแนนผสมทั้งโมเดลและเครื่องมือคู่ข้าง ไม่ใช่โมเดลเปล่าๆ การเปลี่ยน harness เพียงอย่างเดียวก็เปลี่ยนผลได้ สาม ค่าความไม่แน่นอนที่บอกไปแล้วทำให้อันดับ 1-2 และหลายคู่ในตารางไม่สามารถจัดลำดับชี้ขาดได้จริง

สรุปมุมมองของผม

สิ่งที่ตารางสัปดาห์นี้บอกผมไม่ใช่ว่าใครชนะใคร แต่คือทิศทางตลาดที่ชัดขึ้นปีละหนึ่งครั้ง: ความเก่งกำลังกลายเป็นสินค้าที่มีใครต่อใครเสนอได้ใกล้กัน ส่วนประสิทธิภาพต่อดอลลาร์คือสมรภูมิจริง เมื่อตัวท็อปสองอันดับต่างกัน 0.3 จุด การเลือกโมเดลขององค์กรจึงควรย้ายจากคำถาม “อันดับหนึ่งคือใคร” ไปเป็น “จุดคุ้มค่าของงานเราอยู่ตรงไหน”

สำหรับทีมไทยที่กำลังจะวางระบบ agent ปีหน้า คำแนะนำปฏิบัติคืออย่าเพิ่งผูกมัดกับโมเดลเจ้าเดียว วาง routing ให้ส่งงานง่ายๆ ให้โมเดลถูกและเก็บงานยากไว้ให้ตัวแพงกว่าแบบมีเงื่อนไข เพราะตารางนี้พิสูจน์แล้วว่าความต่างของราคาโตเร็วกว่าความต่างของความเก่งหลายเท่า

คำถามชวนคุย: ถ้าให้เลือกวันนี้ ระหว่างจ่ายเท่าตัวเพื่อการันตีอันดับหนึ่ง (แบบที่อาจสลับกันรอบหน้า) กับใช้ตัวรองที่ประหยัดกว่าครึ่ง ทีมของคุณเลือกแบบไหนและเพราะเกณฑ์อะไร คอมเมนต์แลกเปลี่ยนกันได้ครับ

ถ้าชอบบทความแนวอ่านตัวเลขให้ทะลุปรุโปร่ง ติดตาม Nokka ได้ที่ dev.to/sarantoon

📚 อ่านคู่กัน: บทที่เขียนไปพร้อมกันเรื่อง SWE-Bench ProMax คืออีกด้านของเหรียญเดียวกัน: ทำไมคะแนน benchmark เดิมเชื่อไม่ได้เท่าที่คิด และเมื่อวัดงาน refactor จริง คะแนนลดเหลือ 41%

แหล่งอ้างอิง

[1] Terminal-Bench. “Terminal-Bench 4.0 Leaderboard”. 2026. https://www.tbench.ai/

[2] TokenCost (Aglawe, Ankit). “Terminal-Bench 3.0 Cost: $6 to $200 a Solved Task”. 2026. https://tokencost.app/blog/terminal-bench-3-cost-per-solved-task

[3] OpenAI. “GPT-6 Astra: A new generation of intelligence”. 2026. https://openai.com/index/gpt-6-astra/

บทความนี้วิเคราะห์จากตาราง leaderboard ทางการของ Terminal-Bench 4.0 (ดึงข้อมูลจริง ณ 5 ก.ย. 2026) และข้อมูลราคาจาก TokenCost ข้อมูล ณ 5 กันยายน 2026 Nokka

원문에서 계속 ↗