GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/งานวิจัย CometAPI

Claude Fable 5.1 เบนช์มาร์ก: คะแนนบอกอะไรให้ฉันรู้

สำรวจผลการทดสอบ Benchmark ของ Claude Fable 5.1, ความก้าวหน้าที่สำคัญ, ข้อจำกัด และการเปรียบเทียบกับ Fable 5, Opus 5, GPT-5.6 Sol และ GPT-6 Astra

CometAPI
Mia Marenทีมวิจัยโมเดล AI และ API
อัปเดตแล้ว Sep 17, 2026 7 นาทีในการอ่าน
Claude Fable 5.1 เบนช์มาร์ก: คะแนนบอกอะไรให้ฉันรู้
ใช้รูปแบบนี้

เรียกใช้ API ครั้งแรก

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 เป็นการอัปเกรดด้านการดำเนินการเชิงเอเจนต์เป็นหลัก โดยให้ผลลัพธ์ที่ดีขึ้นมากในงานวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ การโค้ดผ่านเทอร์มินัล และเวิร์กโฟลว์อื่นๆ ที่ต้องอาศัยการวางแผน การใช้เครื่องมือ การตรวจสอบ และการกู้คืนหลายขั้นตอน ส่วนการปรับปรุงบนงานให้เหตุผลแบบคำตอบปิด และงานโค้ดสั้นสไตล์ IDE มีขนาดเล็กกว่า ดังนั้นการเลือกใช้งานที่ดีที่สุดขึ้นกับลักษณะงาน มากกว่าคะแนนพาดหัวเพียงค่าเดียว

สาระสำคัญ

  • Fable 5.1 ทำคะแนน 52.6% บน Terminal-Bench-Science 0.1 มากกว่าสองเท่าของ Fable 5 ที่ 24.7% ในการประเมินของ Anthropic
  • AutomationBench เพิ่มจาก 17.1% เป็น 31.4% แสดงถึงการพัฒนามากในเวิร์กโฟลว์ธุรกิจแบบ End-to-end
  • กำไรมีขนาดเล็กกว่าบน CursorBench และ Humanity's Last Exam แบบใช้เครื่องมือ สะท้อนว่ารุ่นนี้พัฒนาด้านการดำเนินการต่อเนื่องมากกว่าการให้เหตุผลทุกรูปแบบอย่างเท่าเทียม
  • Fable 5.1 คงราคามาตรฐานต่อโทเคนเท่า Fable 5 แต่ราคาการอ่านแคชที่ต่ำลงช่วยลดต้นทุนที่มีประสิทธิภาพสำหรับเวิร์กโฟลว์เอเจนต์ที่พึ่งพาคอนเท็กซ์
  • GPT-6 Astra เป็นตัวเทียบจาก OpenAI ที่ใหม่กว่า แต่ไม่ได้ถูกรวมในตาราง Benchmark วันที่ 1 กันยายนของ Anthropic การอ้างอิงประสิทธิภาพโดยตรงต้องใช้การประเมินภายใต้ฮาร์เนสเดียวกัน

Anthropic เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 สำหรับงานให้เหตุผลที่ต้องการสูง เอเจนต์ระยะยาว วิศวกรรมซอฟต์แวร์ งานวิจัย และงานความรู้ระดับมืออาชีพ Claude Fable 5.1 มีให้ใช้งานผ่าน CometAPI สำหรับนักพัฒนาที่ต้องการประเมินร่วมกับโมเดลแนวหน้ารายอื่นผ่านเอ็นด์พอยต์เดียว

ผลลัพธ์พาดหัวแข็งแกร่ง แต่การกระจายของการพัฒนาให้ข้อมูลเชิงลึกมากกว่าค่าเฉลี่ย Fable 5.1 ได้ประโยชน์มากที่สุดเมื่อเอเจนต์ต้องคงเป้าหมาย ใช้เครื่องมือ กู้คืนจากความผิดพลาด และตรวจสอบสภาพสุดท้าย บทความนี้เน้นความหมายของผล Benchmark จุดที่โมเดลยังขาด และวิธีประเมินเทียบกับทางเลือกใหม่กว่า

Claude Fable 5.1 ในมุมมองรวดเร็ว

เอกสารโมเดลของ Anthropic ระบุหน้าต่างคอนเท็กซ์ 1 ล้านโทเคน เอาต์พุตสูงสุด 128K อินพุตข้อความและภาพ การคิดแบบปรับตัวเปิดตลอดเวลา และจุดตัดความรู้เดือนมิถุนายน 2026 รหัสโมเดลใน Claude API คือ claude-fable-5-1

สเปกทางการClaude Fable 5.1
ผู้ให้บริการAnthropic
วันที่เปิดตัวSeptember 1, 2026
รหัสโมเดลclaude-fable-5-1
หน้าต่างคอนเท็กซ์1,000,000 tokens
เอาต์พุตสูงสุด128,000 tokens
อินพุต / เอาต์พุตText and images → text
การคิดAdaptive, always on
ความพยายามเริ่มต้นHigh
จุดตัดความรู้June 2026
ราคาอินพุตของ Anthropic$10 / MTok
ราคาเอาต์พุตของ Anthropic$50 / MTok
การอ่านแคช$0.25 / MTok
ความหน่วงเปรียบเทียบSlower
การวางตำแหน่งหลักDemanding reasoning and long-horizon agentic work

ราคามาตรฐานอินพุตและเอาต์พุตคงเดิมเท่า Fable 5 ขณะที่การอ่านแคชลดลงเหลือ $0.25 ต่อหนึ่งล้านโทเคน Fable 5.1 ไม่ได้มีราคาต่อโทเคนอินพุต/เอาต์พุตที่ต่ำลงโดยพาดหัว ต้นทุนที่มีประสิทธิภาพลดลงหลักๆ จากการลดราคาอ่านแคช 75% Anthropic ประมาณว่าต้นทุนลดลงราว 25% สำหรับเวิร์กโหลดทั่วไป และสูงสุดประมาณ 45% สำหรับเวิร์กโหลดที่เป็นเอเจนต์มาก

เรื่องนี้สำคัญเพราะเอเจนต์ที่ทำงานยาวจะนำคอนเท็กซ์ของรีโพซิทอรี คำสั่ง คำอธิบายเครื่องมือ และสถานะก่อนหน้า กลับมาใช้ซ้ำบ่อย ต้นทุนต่อภารกิจที่สำเร็จจึงดีขึ้นได้แม้ราคาต่อโทเคนอินพุตและเอาต์พุตโดยพาดหัวจะไม่เปลี่ยน

Anthropic ยังรายงาน 60.9% สำหรับ Claude Mythos 5.1 บน Terminal-Bench 4.0 Mythos 5.1 เป็นรุ่นที่เปิดใช้แยกต่างหากพร้อมมาตรการคุ้มครองที่ต่างกัน และไม่ควรถือเป็นคะแนนของ Fable 5.1 ที่เปิดให้ใช้งานทั่วไป

ผล Benchmark ของ Claude Fable 5.1 บอกอะไร?

ค่าต่อไปนี้มาจาก การประเมินของ Anthropic เดือนกันยายน 2026 พวกมันอธิบายการกำหนดค่าร่วมระหว่างโมเดลและฮาร์เนส ไม่ใช่คุณสมบัติที่เปลี่ยนแปลงไม่ได้ของโมเดล

BenchmarkวัดอะไรFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1งานวิจัยเชิงเอเจนต์ทางวิทยาศาสตร์52.6%24.7%29.0%22.4%
Terminal-Bench 4.0การเขียนโค้ดในเทอร์มินัลแบบเอเจนต์55.8%42.0%52.3%37.3%
GDPval-AA v2งานความรู้ระดับมืออาชีพ, Elo1853172318241711
OSWorld 2.0, partialการใช้งานคอมพิวเตอร์ระยะยาว77.9%72.9%75.4%
OSWorld 2.0, strictงานคอมพิวเตอร์ที่เสร็จสมบูรณ์41.7%36.1%39.6%
Humanity’s Last Exam, no toolsการให้เหตุผลสหสาขาระดับผู้เชี่ยวชาญ60.9%57.8%56.6%
Humanity’s Last Exam, with toolsการให้เหตุผลระดับผู้เชี่ยวชาญพร้อมเครื่องมือ65.0%63.8%63.6%
AutomationBenchเวิร์กโฟลว์ธุรกิจแบบ End-to-end31.4%17.1%26.9%19.6%
CursorBench 3.2.0การโค้ดใน IDE แบบเอเจนต์73.4%70.5%70.0%67.2%

Fable 5.1 นำหน้า Fable 5 และ Opus 5 ในทั้งเก้าบรรทัดที่รายงาน ช่องว่างรุ่นที่ใหญ่ที่สุดอยู่ในการวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ และการโค้ดผ่านเทอร์มินัล ความแตกต่างที่เล็กกว่าบน Humanity's Last Exam และ CursorBench ก็สำคัญเช่นกัน เพราะชี้ให้เห็นว่าการปรับปรุงไม่ได้สม่ำเสมอในทุกเวิร์กโหลด

Fable 5.1 พัฒนามากที่สุดที่ไหน?

Terminal-Bench-Science 0.1: ผลลัพธ์เด่น

Fable 5.1 ทำได้ 52.6% เทียบกับ 24.7% สำหรับ Claude Fable 5, 29.0% สำหรับ Claude Opus 5 และ 22.4% สำหรับ GPT-5.6 Sol ในการรันของ Anthropic ช่องว่างรุ่นใหญ่ 27.9 คะแนนใหญ่กว่าความคลาดมาตรฐานต่อโมเดลที่รายงานมาก ขณะที่ช่องว่างเล็กกว่า เช่น 3.5 คะแนนระหว่าง Fable 5.1 กับ Opus 5 บน Terminal-Bench 4.0 ควรตีความด้วยความระมัดระวังมากกว่า

Terminal-Bench-Science ประเมินเวิร์กโฟลว์วิจัยที่สมบูรณ์ครอบคลุมโดเมนวิทยาศาสตร์และวิศวกรรม เอเจนต์ต้องผลิตโค้ด การวิเคราะห์ พิสูจน์ จำลอง หรือผลลัพธ์ข้อมูล แทนการตอบคำถามโดดๆ Anthropic รายงานความคลาดมาตรฐานประมาณ ±3.5–4.5 คะแนนต่อโมเดล ดังนั้นช่องว่างเล็กๆ ไม่ควรถูกตีความอัตโนมัติว่าเป็นความแตกต่างด้านความสามารถที่มีนัยสำคัญ

Terminal-Bench 4.0: การโค้ดอัตโนมัติที่แข็งแกร่งขึ้น

Fable 5.1 ไปถึง 55.8% นำหน้า Fable 5 ที่ 42.0% Opus 5 ที่ 52.3% และ GPT-5.6 Sol ที่ 37.3% การเพิ่มขึ้น 13.8 คะแนนเหนือ Fable 5 ถือว่าสำคัญ ขณะที่ความนำ 3.5 คะแนนเหนือ Opus 5 ถือว่าแคบกว่า

Benchmark นี้วางเอเจนต์ไว้ในสภาพแวดล้อมการดำเนินการ ความสำเร็จขึ้นอยู่กับการนำทางสภาพแวดล้อม เปลี่ยนโค้ด และตรวจสอบผลลัพธ์ เนื่องจาก Terminal-Bench 4.0 ใช้ชุดภารกิจที่ต่างจากรุ่นก่อน คะแนนควรเปรียบเทียบภายในเวอร์ชันของ Benchmark เดียวกันเท่านั้น

AutomationBench: การเพิ่มขึ้นมาก พร้อมช่องว่างอีกมาก

AutomationBench เพิ่มจาก 17.1% บน Fable 5 เป็น 31.4% บน Fable 5.1 นั่นคือเพิ่มขึ้น 14.3 คะแนน หรือประมาณ 84% แบบสัมพัทธ์

Benchmark นี้ประเมินเวิร์กโฟลว์ครอบคลุมฝ่ายขาย การตลาด ปฏิบัติการ สนับสนุน การเงิน และ HR โดยตรวจสอบสภาพแวดล้อมสุดท้าย ซึ่งเป็นตัวทดสอบว่ามีการทำเวิร์กโฟลว์เสร็จจริง ไม่ใช่แค่เสนอการกระทำที่ถูกต้อง คะแนนยังเผยข้อจำกัดที่เหลือ: ราวสองในสามของภารกิจยังไม่เสร็จในกำหนดการรันของ Anthropic

CursorBench 3.2.0: การเพิ่มขึ้นด้านโค้ดที่เล็กกว่า

Fable 5.1 ไปถึง 73.4% เทียบกับ 70.5% สำหรับ Fable 5, 70.0% สำหรับ Opus 5 และ 67.2% สำหรับ GPT-5.6 Sol กำไรเหนือ Fable 5 มีเพียง 2.9 คะแนน

จึงดูว่ารุ่นนี้เปลี่ยนแปลงน้อยกว่าในงานโค้ดสั้นสไตล์ IDE เมื่อเทียบกับเวิร์กโฟลว์ยาวที่เกี่ยวกับการวางแผน ดำเนินการ ตรวจสอบ และกู้คืน ชุดประเมินควรรวมการเปลี่ยนแปลงระดับรีโพซิทอรีและการกู้คืนจากเทสต์ที่ล้มเหลว แทนที่จะมีเพียงคุณภาพการสร้างโค้ด

OSWorld 2.0: การใช้งานคอมพิวเตอร์ยังคงท้าทาย

Fable 5.1 ทำได้ 77.9% แบบเครดิตบางส่วน และ 41.7% แบบเสร็จสมบูรณ์เข้มงวด Opus 5 ทำได้ 75.4% และ 39.6% ขณะที่ Fable 5 ทำได้ 72.9% และ 36.1%

คะแนนแบบเข้มงวดสะท้อนการใช้งานจริงมากกว่า น้อยกว่าครึ่งของภารกิจที่เสร็จสมบูรณ์ แสดงให้เห็นว่าความก้าวหน้าด้านการใช้งานคอมพิวเตอร์ไม่ได้ตัดความจำเป็นของจุดตรวจ สิทธิ์ การเฝ้าระวัง และตรรกะการกู้คืน

CursorBench และ Humanity's Last Exam: การเพิ่มขึ้นเล็กกว่า

Fable 5.1 ไปถึง 73.4% บน CursorBench 3.2.0 เพียง 2.9 คะแนนเหนือ Fable 5 บน Humanity's Last Exam เพิ่ม 3.1 คะแนนโดยไม่มีเครื่องมือ และ 1.2 คะแนนเมื่อมีเครื่องมือ

ช่องว่างที่แคบเหล่านี้สนับสนุนการตีความหลัก: Fable 5.1 เปลี่ยนแปลงมากกว่าบนเวิร์กโฟลว์ยาวที่ต้องวางแผน ดำเนินการ ตรวจสอบ และกู้คืน มากกว่างาน IDE ระยะสั้นหรือการให้เหตุผลเชิงวิชาการแบบปิด

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

คำตอบสั้น: Fable 5.1 เป็นตัวเลือกที่แข็งแกร่งที่สุดในตาราง Benchmark ระยะยาวที่เผยแพร่โดย Anthropic; Opus 5 เป็นจุดเริ่มต้นที่ประหยัดกว่าเมื่อช่องว่างประสิทธิภาพที่เล็กกว่ารับได้; Fable 5 ยังเป็นเส้นฐานแบบเดิม; GPT-6 Astra ต้องประเมินในฮาร์เนสเดียวกันก่อนอ้างอิงจัดอันดับโดยตรง

Fable 5.1 เป็นการอัปเกรดรุ่นชัดเจนเหนือ Fable 5 ใน Benchmark เอเจนต์ระยะยาวที่รายงานโดย Anthropic GPT-6 Astra เป็นตัวเปรียบเทียบจาก OpenAI ที่ใหม่กว่า แต่เปิดตัวหลังการประเมินวันที่ 1 กันยายนของ Anthropic และไม่ถูกรวมในฮาร์เนสเดียวกัน

มิติClaude Fable 5.1Claude Fable 5GPT-6 Astra
หน้าต่างคอนเท็กซ์1M tokens1M tokens1.05M tokens
เอาต์พุตสูงสุด128K128K128K
อินพุต / เอาต์พุตมาตรฐาน$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
การอ่านแคช$0.25 / MTok$1 / MTokตรวจสอบเงื่อนไขผู้ให้บริการปัจจุบัน
Terminal-Bench-Science 0.152.6%24.7%ไม่รวมในตารางเปิดตัวของ Anthropic
Terminal-Bench 4.055.8%42.0%ไม่รวมในตารางเปิดตัวของ Anthropic
AutomationBench31.4%17.1%ไม่รวมในตารางเปิดตัวของ Anthropic
การวางตำแหน่งหลักงานให้เหตุผลระดับสูงและเอเจนต์ระยะยาวเส้นฐานรุ่น Fable เดิมงานมืออาชีพแบบ End-to-end ที่ยาก

เมื่อเทียบกับ Fable 5, Fable 5.1 แสดงกำไรที่วัดได้มากที่สุดในวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ และการโค้ดเทอร์มินัล โดยยังคงราคามาตรฐานต่อโทเคนเดิม ราคาการอ่านแคชที่ต่ำลงช่วยยกระดับเศรษฐศาสตร์ของเอเจนต์ที่ใช้คอนเท็กซ์ซ้ำ

กฎการเลือก: เริ่มจาก Opus 5 เมื่อให้ความสำคัญกับต้นทุน เลื่อนขึ้นไป Fable 5.1 เมื่อความสำเร็จระยะยาวและการกู้คืนสำคัญที่สุด คง Fable 5 ไว้เฉพาะเวิร์กโหลดที่อ่อนไหวต่อความเข้ากันได้ และประเมิน GPT-6 Astra ในฮาร์เนสเดียวกันก่อนใช้งานจริง

ประสิทธิภาพ Benchmark แยกตามงานเป็นอย่างไร?

ความสามารถผลลัพธ์ Fable 5.1เปลี่ยนแปลงเทียบกับ Fable 5การตีความ
วิจัยเชิงเอเจนต์ทางวิทยาศาสตร์52.6%+27.9 คะแนนเพิ่มขึ้นมากมาก
อัตโนมัติเวิร์กโฟลว์ธุรกิจ31.4%+14.3 คะแนนเพิ่มขึ้นมาก
โค้ดผ่านเทอร์มินัล55.8%+13.8 คะแนนเพิ่มขึ้นมาก
ใช้คอมพิวเตอร์แบบเข้มงวด41.7%+5.6 คะแนนเพิ่มขึ้นปานกลาง
ใช้คอมพิวเตอร์แบบเครดิตบางส่วน77.9%+5.0 คะแนนเพิ่มขึ้นปานกลาง
ให้เหตุผลระดับผู้เชี่ยวชาญ, ไม่มีเครื่องมือ60.9%+3.1 คะแนนเพิ่มขึ้นเล็กน้อย
โค้ดใน IDE แบบเอเจนต์73.4%+2.9 คะแนนเพิ่มขึ้นเล็กน้อย
ให้เหตุผลระดับผู้เชี่ยวชาญ, มีเครื่องมือ65.0%+1.2 คะแนนเพิ่มขึ้นเล็กน้อย
งานความรู้ระดับมืออาชีพ1853 Elo+130 Eloแข็งแกร่ง แต่อ่อนไหวต่อการตั้งค่า

รูปแบบสอดคล้องกัน: การปรับปรุงที่ใหญ่ที่สุดปรากฏเมื่อความสำเร็จขึ้นกับความเพียร การวางแผน ปฏิสัมพันธ์กับสภาพแวดล้อม การใช้เครื่องมือ และการกู้คืนตลอดเวลา

สิ่งที่ Benchmark ไม่ได้บอกคุณ

ตาราง Benchmark บีบพฤติกรรมให้เป็นตัวเลขเดียว พวกมันไม่ได้พิสูจน์ว่าเอเจนต์อัตโนมัติถูกแก้ปัญหาแล้ว และไม่ได้ทำนายทุกเวิร์กโหลดการใช้งานจริง

  • ตารางเปรียบเทียบหลักดำเนินการโดยผู้ขาย
  • การตั้งค่าความพยายามส่งผลต่อคุณภาพ ความหน่วง และต้นทุน
  • Benchmark เอเจนต์วัดผลรวมของโมเดล ฮาร์เนส เครื่องมือ และสิทธิ์
  • มาตรการคุ้มครองในโปรดักชันถูกเปิดบน Fable 5.1 และส่งผลต่อบางผลลัพธ์
  • เวอร์ชันของ Benchmark เปลี่ยนแปลงได้ ดังนั้นค่างานต่างเวอร์ชันอาจเทียบกันไม่ได้
  • AutomationBench ยังอยู่ที่ 31.4% และ OSWorld แบบเข้มงวดอยู่ที่ 41.7% อัตราความล้มเหลวยังคงมีนัยสำคัญ

การประเมินเชิงปฏิบัติควรใช้คะแนนสาธารณะเพื่อคัดเลือกเบื้องต้น ทำซ้ำการเปรียบเทียบขนาดเล็กด้วยการตั้งค่าเหมือนกัน และทดสอบเวิร์กโฟลว์ใช้งานจริง

Claude Fable 5.1 คือโมเดล Claude ที่ดีที่สุดหรือไม่?

สำหรับความสามารถสูงสุดในงานยากที่รันยาว หลักฐาน Benchmark สนับสนุน Claude Fable 5.1 อย่างเข้มแข็ง สำหรับทุกเวิร์กโหลด ไม่ใช่

Anthropic ตั้งราคา $10 ต่อหนึ่งล้านโทเคนอินพุต และ $50 ต่อหนึ่งล้านโทเคนเอาต์พุต เทียบกับ $5 และ $25 สำหรับ Opus 5 ราคาพรีเมียมคุ้มค่าเมื่อ Fable 5.1 ให้สัดส่วนความสำเร็จสูงขึ้น รีทรายน้อยลง โทเคนต่อภารกิจที่ยอมรับได้น้อยลง หรือการลดเวลาตรวจทานของมนุษย์ได้พอ

ราคาการอ่านแคชที่ต่ำลงช่วยลดช่องว่างต้นทุนที่มีประสิทธิภาพสำหรับเอเจนต์ ต้นทุนต่อผลลัพธ์ที่ยอมรับจึงมีประโยชน์กว่าการดูราคาโทเคนเพียงอย่างเดียว

ควร Benchmark Claude Fable 5.1 อย่างไร?

การประเมินควรคล้ายเวิร์กโหลดการใช้งานจริงที่ตั้งใจ

  • Coding: ทดสอบภารกิจครบถ้วนและบันทึกการยอมรับแพตช์ จำนวนเทสต์ผ่าน การรีทราย การเรียกเครื่องมือ เวลาโดยรวม และเวลาที่มนุษย์แก้ไข
  • Research: ประเมินคุณภาพแหล่งข้อมูล ความถูกต้องข้อเท็จจริง ความครอบคลุมหลักฐาน การทำซับทาสก์ และการคงเป้าหมายในรันยาว
  • Business agents: ให้คะแนนสภาพแวดล้อมสุดท้ายแทนการนับการกระทำที่ถูกต้องรายชิ้น
  • Computer use: วัดการกู้คืนจากป๊อปอัป หน้าเว็บช้า เซสชันสะดุด และสภาพแอปพลิเคชันไม่สอดคล้อง
  • Model comparison: คงพรอมป์ต์ ฮาร์เนส เครื่องมือ สิทธิ์ การตั้งค่าความพยายาม และกฎการให้คะแนนให้เหมือนกัน
  • Economics: วัดต้นทุนต่อภารกิจที่ยอมรับ ไม่ใช่แค่ราคาต่อโทเคน

สรุป

หลักฐาน Benchmark ชี้ว่า Fable 5.1 มีค่าสูงสุดเมื่อภารกิจต้องการการดำเนินการต่อเนื่อง มากกว่าคำตอบเดี่ยว เคสใช้งานที่แข็งแกร่งที่สุดรวมถึงงานวิจัยวิทยาศาสตร์ การโค้ดอัตโนมัติ อัตโนมัติทางธุรกิจที่ซับซ้อน และเวิร์กโฟลว์ที่ต้องตรวจสอบและกู้ซ้ำ

หลักฐานไม่ได้สนับสนุนความเหนือกว่าทั่วไป ช่องว่างเล็กบนหลาย Benchmark อัตราความล้มเหลวที่มีนัยบนงานใช้คอมพิวเตอร์แบบเข้มงวด และการที่ GPT-6 Astra ไม่อยู่ในตารางเปิดตัวของ Anthropic ตอกย้ำความจำเป็นของการทดสอบตามเวิร์กโหลด

สำหรับผู้ใช้ CometAPI กฎการนำไปใช้งานที่เป็นรูปธรรมคือ ทดสอบ Fable 5.1 ในงานที่ความสำเร็จระยะยาวคุ้มค่าการคำนวณพรีเมียม แล้วเปรียบเทียบกับ Opus 5, GPT-5.6 Sol และ GPT-6 Astra บนภารกิจตัวแทนเดียวกันก่อนเลือกเส้นทางโปรดักชัน

คำถามที่พบบ่อย

Benchmark สูงสุดของ Claude Fable 5.1 คืออะไร?

ในบรรดาตัวชี้วัดแบบเปอร์เซ็นต์ที่ Anthropic รายงาน Fable 5.1 ไปถึง 77.9% แบบเครดิตบางส่วนบน OSWorld 2.0 และ 73.4% บน CursorBench 3.2.0 การพัฒนารุ่นที่ใหญ่ที่สุดคือ Terminal-Bench-Science ที่ 52.6% เทียบกับ 24.7% สำหรับ Fable 5

Claude Fable 5.1 ดีกว่า Fable 5 แค่ไหน?

กำไรต่างกันมากตามเวิร์กโหลด: 27.9 คะแนนบน Terminal-Bench-Science, 14.3 บน AutomationBench และ 13.8 บน Terminal-Bench 4.0 แต่เพียง 2.9 บน CursorBench และ 1.2 บน Humanity’s Last Exam แบบใช้เครื่องมือ

Claude Fable 5.1 ดีกว่า Claude Opus 5 หรือไม่?

มันทำคะแนนสูงกว่าทั้งตารางที่ Anthropic รายงาน แต่หลายช่องว่างมีขนาดเล็ก Anthropic แนะนำให้เริ่มจาก Opus 5 และเลื่อนเมื่อจำเป็นต้องใช้ความสามารถระยะยาวเพิ่มเติม

Claude Fable 5.1 ชนะ GPT-5.6 Sol หรือไม่?

Anthropic รายงานว่า Fable 5.1 ทำคะแนนสูงกว่าบนห้าตัวชี้วัดร่วม เนื่องจากนี่คือการประเมินคู่แข่งโดยผู้ขายและการกำหนดค่าแตกต่างกัน บทสรุปที่ปลอดภัยคือ Fable 5.1 มีความสามารถแข่งขันสูง มากกว่าการเหนือกว่าทุกด้าน

ผลลัพธ์ได้รับการยืนยันอิสระหรือไม่?

เพียงบางส่วน Benchmark หลายรายการมีลีดเดอร์บอร์ดสาธารณะ แต่ความพยายาม ฮาร์เนส พฤติกรรมสำรอง และเวอร์ชันภารกิจต้องสอดคล้องกันก่อนที่จะเทียบค่ากับการรันเปิดตัวของ Anthropic ได้โดยตรง

Claude Fable 5.1 เหมาะที่สุดกับอะไร?

โปรไฟล์ Benchmark แข็งแกร่งที่สุดสำหรับงานวิจัยวิทยาศาสตร์ที่รันยาว การโค้ดอัตโนมัติ เวิร์กโฟลว์เอเจนต์ที่ซับซ้อน อัตโนมัติทางธุรกิจ และงานที่ต้องวางแผน ใช้เครื่องมือ ตรวจสอบ และกู้คืน

จะเข้าถึง Claude Fable 5.1 ได้อย่างไร?

Claude Fable 5.1 มีรายชื่อบน CometAPI ด้วยรหัสโมเดล claude-fable-5-1 เอ็นด์พอยต์แบบรวมทำให้สามารถรันเวิร์กโหลดการประเมินชุดเดียวกันข้ามหลายโมเดลได้อย่างสะดวกก่อนเลือกเส้นทางโปรดักชัน

เรียนรู้ต่อ

เชื่อมโยงบทความนี้กับการตัดสินใจถัดไป

ดูทุกหัวข้อ
เผยแพร่เมื่อ Sep 17, 2026
อัปเดตล่าสุด Sep 17, 2026
0 ครั้งที่ดู
ตรวจสอบความชัดเจน การอ้างอิงแหล่งที่มา และคำศัพท์ API ปัจจุบันแล้ว

พร้อมลดต้นทุนการพัฒนา AI ลง 20% แล้วหรือยัง?

เริ่มต้นฟรีภายในไม่กี่นาที มีเครดิตทดลองใช้ฟรี ไม่ต้องใช้บัตรเครดิต

อ่านเพิ่มเติม