TLDR Claude Fable 5.1 เป็นการอัปเกรดด้านการดำเนินการเชิงเอเจนต์เป็นหลัก โดยให้ผลลัพธ์ที่ดีขึ้นมากในงานวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ การโค้ดผ่านเทอร์มินัล และเวิร์กโฟลว์อื่นๆ ที่ต้องอาศัยการวางแผน การใช้เครื่องมือ การตรวจสอบ และการกู้คืนหลายขั้นตอน ส่วนการปรับปรุงบนงานให้เหตุผลแบบคำตอบปิด และงานโค้ดสั้นสไตล์ IDE มีขนาดเล็กกว่า ดังนั้นการเลือกใช้งานที่ดีที่สุดขึ้นกับลักษณะงาน มากกว่าคะแนนพาดหัวเพียงค่าเดียว
สาระสำคัญ
- Fable 5.1 ทำคะแนน 52.6% บน Terminal-Bench-Science 0.1 มากกว่าสองเท่าของ Fable 5 ที่ 24.7% ในการประเมินของ Anthropic
- AutomationBench เพิ่มจาก 17.1% เป็น 31.4% แสดงถึงการพัฒนามากในเวิร์กโฟลว์ธุรกิจแบบ End-to-end
- กำไรมีขนาดเล็กกว่าบน CursorBench และ Humanity's Last Exam แบบใช้เครื่องมือ สะท้อนว่ารุ่นนี้พัฒนาด้านการดำเนินการต่อเนื่องมากกว่าการให้เหตุผลทุกรูปแบบอย่างเท่าเทียม
- Fable 5.1 คงราคามาตรฐานต่อโทเคนเท่า Fable 5 แต่ราคาการอ่านแคชที่ต่ำลงช่วยลดต้นทุนที่มีประสิทธิภาพสำหรับเวิร์กโฟลว์เอเจนต์ที่พึ่งพาคอนเท็กซ์
- GPT-6 Astra เป็นตัวเทียบจาก OpenAI ที่ใหม่กว่า แต่ไม่ได้ถูกรวมในตาราง Benchmark วันที่ 1 กันยายนของ Anthropic การอ้างอิงประสิทธิภาพโดยตรงต้องใช้การประเมินภายใต้ฮาร์เนสเดียวกัน
Anthropic เปิดตัว Claude Fable 5.1 เมื่อวันที่ 1 กันยายน 2026 สำหรับงานให้เหตุผลที่ต้องการสูง เอเจนต์ระยะยาว วิศวกรรมซอฟต์แวร์ งานวิจัย และงานความรู้ระดับมืออาชีพ Claude Fable 5.1 มีให้ใช้งานผ่าน CometAPI สำหรับนักพัฒนาที่ต้องการประเมินร่วมกับโมเดลแนวหน้ารายอื่นผ่านเอ็นด์พอยต์เดียว
ผลลัพธ์พาดหัวแข็งแกร่ง แต่การกระจายของการพัฒนาให้ข้อมูลเชิงลึกมากกว่าค่าเฉลี่ย Fable 5.1 ได้ประโยชน์มากที่สุดเมื่อเอเจนต์ต้องคงเป้าหมาย ใช้เครื่องมือ กู้คืนจากความผิดพลาด และตรวจสอบสภาพสุดท้าย บทความนี้เน้นความหมายของผล Benchmark จุดที่โมเดลยังขาด และวิธีประเมินเทียบกับทางเลือกใหม่กว่า
Claude Fable 5.1 ในมุมมองรวดเร็ว
เอกสารโมเดลของ Anthropic ระบุหน้าต่างคอนเท็กซ์ 1 ล้านโทเคน เอาต์พุตสูงสุด 128K อินพุตข้อความและภาพ การคิดแบบปรับตัวเปิดตลอดเวลา และจุดตัดความรู้เดือนมิถุนายน 2026 รหัสโมเดลใน Claude API คือ claude-fable-5-1
| สเปกทางการ | Claude Fable 5.1 |
|---|---|
| ผู้ให้บริการ | Anthropic |
| วันที่เปิดตัว | September 1, 2026 |
| รหัสโมเดล | claude-fable-5-1 |
| หน้าต่างคอนเท็กซ์ | 1,000,000 tokens |
| เอาต์พุตสูงสุด | 128,000 tokens |
| อินพุต / เอาต์พุต | Text and images → text |
| การคิด | Adaptive, always on |
| ความพยายามเริ่มต้น | High |
| จุดตัดความรู้ | June 2026 |
| ราคาอินพุตของ Anthropic | $10 / MTok |
| ราคาเอาต์พุตของ Anthropic | $50 / MTok |
| การอ่านแคช | $0.25 / MTok |
| ความหน่วงเปรียบเทียบ | Slower |
| การวางตำแหน่งหลัก | Demanding reasoning and long-horizon agentic work |
ราคามาตรฐานอินพุตและเอาต์พุตคงเดิมเท่า Fable 5 ขณะที่การอ่านแคชลดลงเหลือ $0.25 ต่อหนึ่งล้านโทเคน Fable 5.1 ไม่ได้มีราคาต่อโทเคนอินพุต/เอาต์พุตที่ต่ำลงโดยพาดหัว ต้นทุนที่มีประสิทธิภาพลดลงหลักๆ จากการลดราคาอ่านแคช 75% Anthropic ประมาณว่าต้นทุนลดลงราว 25% สำหรับเวิร์กโหลดทั่วไป และสูงสุดประมาณ 45% สำหรับเวิร์กโหลดที่เป็นเอเจนต์มาก
เรื่องนี้สำคัญเพราะเอเจนต์ที่ทำงานยาวจะนำคอนเท็กซ์ของรีโพซิทอรี คำสั่ง คำอธิบายเครื่องมือ และสถานะก่อนหน้า กลับมาใช้ซ้ำบ่อย ต้นทุนต่อภารกิจที่สำเร็จจึงดีขึ้นได้แม้ราคาต่อโทเคนอินพุตและเอาต์พุตโดยพาดหัวจะไม่เปลี่ยน
Anthropic ยังรายงาน 60.9% สำหรับ Claude Mythos 5.1 บน Terminal-Bench 4.0 Mythos 5.1 เป็นรุ่นที่เปิดใช้แยกต่างหากพร้อมมาตรการคุ้มครองที่ต่างกัน และไม่ควรถือเป็นคะแนนของ Fable 5.1 ที่เปิดให้ใช้งานทั่วไป
ผล Benchmark ของ Claude Fable 5.1 บอกอะไร?
ค่าต่อไปนี้มาจาก การประเมินของ Anthropic เดือนกันยายน 2026 พวกมันอธิบายการกำหนดค่าร่วมระหว่างโมเดลและฮาร์เนส ไม่ใช่คุณสมบัติที่เปลี่ยนแปลงไม่ได้ของโมเดล
| Benchmark | วัดอะไร | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | งานวิจัยเชิงเอเจนต์ทางวิทยาศาสตร์ | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | การเขียนโค้ดในเทอร์มินัลแบบเอเจนต์ | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | งานความรู้ระดับมืออาชีพ, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | การใช้งานคอมพิวเตอร์ระยะยาว | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | งานคอมพิวเตอร์ที่เสร็จสมบูรณ์ | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | การให้เหตุผลสหสาขาระดับผู้เชี่ยวชาญ | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | การให้เหตุผลระดับผู้เชี่ยวชาญพร้อมเครื่องมือ | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | เวิร์กโฟลว์ธุรกิจแบบ End-to-end | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | การโค้ดใน IDE แบบเอเจนต์ | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 นำหน้า Fable 5 และ Opus 5 ในทั้งเก้าบรรทัดที่รายงาน ช่องว่างรุ่นที่ใหญ่ที่สุดอยู่ในการวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ และการโค้ดผ่านเทอร์มินัล ความแตกต่างที่เล็กกว่าบน Humanity's Last Exam และ CursorBench ก็สำคัญเช่นกัน เพราะชี้ให้เห็นว่าการปรับปรุงไม่ได้สม่ำเสมอในทุกเวิร์กโหลด
Fable 5.1 พัฒนามากที่สุดที่ไหน?
Terminal-Bench-Science 0.1: ผลลัพธ์เด่น
Fable 5.1 ทำได้ 52.6% เทียบกับ 24.7% สำหรับ Claude Fable 5, 29.0% สำหรับ Claude Opus 5 และ 22.4% สำหรับ GPT-5.6 Sol ในการรันของ Anthropic ช่องว่างรุ่นใหญ่ 27.9 คะแนนใหญ่กว่าความคลาดมาตรฐานต่อโมเดลที่รายงานมาก ขณะที่ช่องว่างเล็กกว่า เช่น 3.5 คะแนนระหว่าง Fable 5.1 กับ Opus 5 บน Terminal-Bench 4.0 ควรตีความด้วยความระมัดระวังมากกว่า
Terminal-Bench-Science ประเมินเวิร์กโฟลว์วิจัยที่สมบูรณ์ครอบคลุมโดเมนวิทยาศาสตร์และวิศวกรรม เอเจนต์ต้องผลิตโค้ด การวิเคราะห์ พิสูจน์ จำลอง หรือผลลัพธ์ข้อมูล แทนการตอบคำถามโดดๆ Anthropic รายงานความคลาดมาตรฐานประมาณ ±3.5–4.5 คะแนนต่อโมเดล ดังนั้นช่องว่างเล็กๆ ไม่ควรถูกตีความอัตโนมัติว่าเป็นความแตกต่างด้านความสามารถที่มีนัยสำคัญ
Terminal-Bench 4.0: การโค้ดอัตโนมัติที่แข็งแกร่งขึ้น
Fable 5.1 ไปถึง 55.8% นำหน้า Fable 5 ที่ 42.0% Opus 5 ที่ 52.3% และ GPT-5.6 Sol ที่ 37.3% การเพิ่มขึ้น 13.8 คะแนนเหนือ Fable 5 ถือว่าสำคัญ ขณะที่ความนำ 3.5 คะแนนเหนือ Opus 5 ถือว่าแคบกว่า
Benchmark นี้วางเอเจนต์ไว้ในสภาพแวดล้อมการดำเนินการ ความสำเร็จขึ้นอยู่กับการนำทางสภาพแวดล้อม เปลี่ยนโค้ด และตรวจสอบผลลัพธ์ เนื่องจาก Terminal-Bench 4.0 ใช้ชุดภารกิจที่ต่างจากรุ่นก่อน คะแนนควรเปรียบเทียบภายในเวอร์ชันของ Benchmark เดียวกันเท่านั้น
AutomationBench: การเพิ่มขึ้นมาก พร้อมช่องว่างอีกมาก
AutomationBench เพิ่มจาก 17.1% บน Fable 5 เป็น 31.4% บน Fable 5.1 นั่นคือเพิ่มขึ้น 14.3 คะแนน หรือประมาณ 84% แบบสัมพัทธ์
Benchmark นี้ประเมินเวิร์กโฟลว์ครอบคลุมฝ่ายขาย การตลาด ปฏิบัติการ สนับสนุน การเงิน และ HR โดยตรวจสอบสภาพแวดล้อมสุดท้าย ซึ่งเป็นตัวทดสอบว่ามีการทำเวิร์กโฟลว์เสร็จจริง ไม่ใช่แค่เสนอการกระทำที่ถูกต้อง คะแนนยังเผยข้อจำกัดที่เหลือ: ราวสองในสามของภารกิจยังไม่เสร็จในกำหนดการรันของ Anthropic
CursorBench 3.2.0: การเพิ่มขึ้นด้านโค้ดที่เล็กกว่า
Fable 5.1 ไปถึง 73.4% เทียบกับ 70.5% สำหรับ Fable 5, 70.0% สำหรับ Opus 5 และ 67.2% สำหรับ GPT-5.6 Sol กำไรเหนือ Fable 5 มีเพียง 2.9 คะแนน
จึงดูว่ารุ่นนี้เปลี่ยนแปลงน้อยกว่าในงานโค้ดสั้นสไตล์ IDE เมื่อเทียบกับเวิร์กโฟลว์ยาวที่เกี่ยวกับการวางแผน ดำเนินการ ตรวจสอบ และกู้คืน ชุดประเมินควรรวมการเปลี่ยนแปลงระดับรีโพซิทอรีและการกู้คืนจากเทสต์ที่ล้มเหลว แทนที่จะมีเพียงคุณภาพการสร้างโค้ด
OSWorld 2.0: การใช้งานคอมพิวเตอร์ยังคงท้าทาย
Fable 5.1 ทำได้ 77.9% แบบเครดิตบางส่วน และ 41.7% แบบเสร็จสมบูรณ์เข้มงวด Opus 5 ทำได้ 75.4% และ 39.6% ขณะที่ Fable 5 ทำได้ 72.9% และ 36.1%
คะแนนแบบเข้มงวดสะท้อนการใช้งานจริงมากกว่า น้อยกว่าครึ่งของภารกิจที่เสร็จสมบูรณ์ แสดงให้เห็นว่าความก้าวหน้าด้านการใช้งานคอมพิวเตอร์ไม่ได้ตัดความจำเป็นของจุดตรวจ สิทธิ์ การเฝ้าระวัง และตรรกะการกู้คืน
CursorBench และ Humanity's Last Exam: การเพิ่มขึ้นเล็กกว่า
Fable 5.1 ไปถึง 73.4% บน CursorBench 3.2.0 เพียง 2.9 คะแนนเหนือ Fable 5 บน Humanity's Last Exam เพิ่ม 3.1 คะแนนโดยไม่มีเครื่องมือ และ 1.2 คะแนนเมื่อมีเครื่องมือ
ช่องว่างที่แคบเหล่านี้สนับสนุนการตีความหลัก: Fable 5.1 เปลี่ยนแปลงมากกว่าบนเวิร์กโฟลว์ยาวที่ต้องวางแผน ดำเนินการ ตรวจสอบ และกู้คืน มากกว่างาน IDE ระยะสั้นหรือการให้เหตุผลเชิงวิชาการแบบปิด
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
คำตอบสั้น: Fable 5.1 เป็นตัวเลือกที่แข็งแกร่งที่สุดในตาราง Benchmark ระยะยาวที่เผยแพร่โดย Anthropic; Opus 5 เป็นจุดเริ่มต้นที่ประหยัดกว่าเมื่อช่องว่างประสิทธิภาพที่เล็กกว่ารับได้; Fable 5 ยังเป็นเส้นฐานแบบเดิม; GPT-6 Astra ต้องประเมินในฮาร์เนสเดียวกันก่อนอ้างอิงจัดอันดับโดยตรง
Fable 5.1 เป็นการอัปเกรดรุ่นชัดเจนเหนือ Fable 5 ใน Benchmark เอเจนต์ระยะยาวที่รายงานโดย Anthropic GPT-6 Astra เป็นตัวเปรียบเทียบจาก OpenAI ที่ใหม่กว่า แต่เปิดตัวหลังการประเมินวันที่ 1 กันยายนของ Anthropic และไม่ถูกรวมในฮาร์เนสเดียวกัน
| มิติ | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| หน้าต่างคอนเท็กซ์ | 1M tokens | 1M tokens | 1.05M tokens |
| เอาต์พุตสูงสุด | 128K | 128K | 128K |
| อินพุต / เอาต์พุตมาตรฐาน | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| การอ่านแคช | $0.25 / MTok | $1 / MTok | ตรวจสอบเงื่อนไขผู้ให้บริการปัจจุบัน |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | ไม่รวมในตารางเปิดตัวของ Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | ไม่รวมในตารางเปิดตัวของ Anthropic |
| AutomationBench | 31.4% | 17.1% | ไม่รวมในตารางเปิดตัวของ Anthropic |
| การวางตำแหน่งหลัก | งานให้เหตุผลระดับสูงและเอเจนต์ระยะยาว | เส้นฐานรุ่น Fable เดิม | งานมืออาชีพแบบ End-to-end ที่ยาก |
เมื่อเทียบกับ Fable 5, Fable 5.1 แสดงกำไรที่วัดได้มากที่สุดในวิจัยวิทยาศาสตร์ อัตโนมัติทางธุรกิจ และการโค้ดเทอร์มินัล โดยยังคงราคามาตรฐานต่อโทเคนเดิม ราคาการอ่านแคชที่ต่ำลงช่วยยกระดับเศรษฐศาสตร์ของเอเจนต์ที่ใช้คอนเท็กซ์ซ้ำ
กฎการเลือก: เริ่มจาก Opus 5 เมื่อให้ความสำคัญกับต้นทุน เลื่อนขึ้นไป Fable 5.1 เมื่อความสำเร็จระยะยาวและการกู้คืนสำคัญที่สุด คง Fable 5 ไว้เฉพาะเวิร์กโหลดที่อ่อนไหวต่อความเข้ากันได้ และประเมิน GPT-6 Astra ในฮาร์เนสเดียวกันก่อนใช้งานจริง
ประสิทธิภาพ Benchmark แยกตามงานเป็นอย่างไร?
| ความสามารถ | ผลลัพธ์ Fable 5.1 | เปลี่ยนแปลงเทียบกับ Fable 5 | การตีความ |
|---|---|---|---|
| วิจัยเชิงเอเจนต์ทางวิทยาศาสตร์ | 52.6% | +27.9 คะแนน | เพิ่มขึ้นมากมาก |
| อัตโนมัติเวิร์กโฟลว์ธุรกิจ | 31.4% | +14.3 คะแนน | เพิ่มขึ้นมาก |
| โค้ดผ่านเทอร์มินัล | 55.8% | +13.8 คะแนน | เพิ่มขึ้นมาก |
| ใช้คอมพิวเตอร์แบบเข้มงวด | 41.7% | +5.6 คะแนน | เพิ่มขึ้นปานกลาง |
| ใช้คอมพิวเตอร์แบบเครดิตบางส่วน | 77.9% | +5.0 คะแนน | เพิ่มขึ้นปานกลาง |
| ให้เหตุผลระดับผู้เชี่ยวชาญ, ไม่มีเครื่องมือ | 60.9% | +3.1 คะแนน | เพิ่มขึ้นเล็กน้อย |
| โค้ดใน IDE แบบเอเจนต์ | 73.4% | +2.9 คะแนน | เพิ่มขึ้นเล็กน้อย |
| ให้เหตุผลระดับผู้เชี่ยวชาญ, มีเครื่องมือ | 65.0% | +1.2 คะแนน | เพิ่มขึ้นเล็กน้อย |
| งานความรู้ระดับมืออาชีพ | 1853 Elo | +130 Elo | แข็งแกร่ง แต่อ่อนไหวต่อการตั้งค่า |
รูปแบบสอดคล้องกัน: การปรับปรุงที่ใหญ่ที่สุดปรากฏเมื่อความสำเร็จขึ้นกับความเพียร การวางแผน ปฏิสัมพันธ์กับสภาพแวดล้อม การใช้เครื่องมือ และการกู้คืนตลอดเวลา
สิ่งที่ Benchmark ไม่ได้บอกคุณ
ตาราง Benchmark บีบพฤติกรรมให้เป็นตัวเลขเดียว พวกมันไม่ได้พิสูจน์ว่าเอเจนต์อัตโนมัติถูกแก้ปัญหาแล้ว และไม่ได้ทำนายทุกเวิร์กโหลดการใช้งานจริง
- ตารางเปรียบเทียบหลักดำเนินการโดยผู้ขาย
- การตั้งค่าความพยายามส่งผลต่อคุณภาพ ความหน่วง และต้นทุน
- Benchmark เอเจนต์วัดผลรวมของโมเดล ฮาร์เนส เครื่องมือ และสิทธิ์
- มาตรการคุ้มครองในโปรดักชันถูกเปิดบน Fable 5.1 และส่งผลต่อบางผลลัพธ์
- เวอร์ชันของ Benchmark เปลี่ยนแปลงได้ ดังนั้นค่างานต่างเวอร์ชันอาจเทียบกันไม่ได้
- AutomationBench ยังอยู่ที่ 31.4% และ OSWorld แบบเข้มงวดอยู่ที่ 41.7% อัตราความล้มเหลวยังคงมีนัยสำคัญ
การประเมินเชิงปฏิบัติควรใช้คะแนนสาธารณะเพื่อคัดเลือกเบื้องต้น ทำซ้ำการเปรียบเทียบขนาดเล็กด้วยการตั้งค่าเหมือนกัน และทดสอบเวิร์กโฟลว์ใช้งานจริง
Claude Fable 5.1 คือโมเดล Claude ที่ดีที่สุดหรือไม่?
สำหรับความสามารถสูงสุดในงานยากที่รันยาว หลักฐาน Benchmark สนับสนุน Claude Fable 5.1 อย่างเข้มแข็ง สำหรับทุกเวิร์กโหลด ไม่ใช่
Anthropic ตั้งราคา $10 ต่อหนึ่งล้านโทเคนอินพุต และ $50 ต่อหนึ่งล้านโทเคนเอาต์พุต เทียบกับ $5 และ $25 สำหรับ Opus 5 ราคาพรีเมียมคุ้มค่าเมื่อ Fable 5.1 ให้สัดส่วนความสำเร็จสูงขึ้น รีทรายน้อยลง โทเคนต่อภารกิจที่ยอมรับได้น้อยลง หรือการลดเวลาตรวจทานของมนุษย์ได้พอ
ราคาการอ่านแคชที่ต่ำลงช่วยลดช่องว่างต้นทุนที่มีประสิทธิภาพสำหรับเอเจนต์ ต้นทุนต่อผลลัพธ์ที่ยอมรับจึงมีประโยชน์กว่าการดูราคาโทเคนเพียงอย่างเดียว
ควร Benchmark Claude Fable 5.1 อย่างไร?
การประเมินควรคล้ายเวิร์กโหลดการใช้งานจริงที่ตั้งใจ
- Coding: ทดสอบภารกิจครบถ้วนและบันทึกการยอมรับแพตช์ จำนวนเทสต์ผ่าน การรีทราย การเรียกเครื่องมือ เวลาโดยรวม และเวลาที่มนุษย์แก้ไข
- Research: ประเมินคุณภาพแหล่งข้อมูล ความถูกต้องข้อเท็จจริง ความครอบคลุมหลักฐาน การทำซับทาสก์ และการคงเป้าหมายในรันยาว
- Business agents: ให้คะแนนสภาพแวดล้อมสุดท้ายแทนการนับการกระทำที่ถูกต้องรายชิ้น
- Computer use: วัดการกู้คืนจากป๊อปอัป หน้าเว็บช้า เซสชันสะดุด และสภาพแอปพลิเคชันไม่สอดคล้อง
- Model comparison: คงพรอมป์ต์ ฮาร์เนส เครื่องมือ สิทธิ์ การตั้งค่าความพยายาม และกฎการให้คะแนนให้เหมือนกัน
- Economics: วัดต้นทุนต่อภารกิจที่ยอมรับ ไม่ใช่แค่ราคาต่อโทเคน
สรุป
หลักฐาน Benchmark ชี้ว่า Fable 5.1 มีค่าสูงสุดเมื่อภารกิจต้องการการดำเนินการต่อเนื่อง มากกว่าคำตอบเดี่ยว เคสใช้งานที่แข็งแกร่งที่สุดรวมถึงงานวิจัยวิทยาศาสตร์ การโค้ดอัตโนมัติ อัตโนมัติทางธุรกิจที่ซับซ้อน และเวิร์กโฟลว์ที่ต้องตรวจสอบและกู้ซ้ำ
หลักฐานไม่ได้สนับสนุนความเหนือกว่าทั่วไป ช่องว่างเล็กบนหลาย Benchmark อัตราความล้มเหลวที่มีนัยบนงานใช้คอมพิวเตอร์แบบเข้มงวด และการที่ GPT-6 Astra ไม่อยู่ในตารางเปิดตัวของ Anthropic ตอกย้ำความจำเป็นของการทดสอบตามเวิร์กโหลด
สำหรับผู้ใช้ CometAPI กฎการนำไปใช้งานที่เป็นรูปธรรมคือ ทดสอบ Fable 5.1 ในงานที่ความสำเร็จระยะยาวคุ้มค่าการคำนวณพรีเมียม แล้วเปรียบเทียบกับ Opus 5, GPT-5.6 Sol และ GPT-6 Astra บนภารกิจตัวแทนเดียวกันก่อนเลือกเส้นทางโปรดักชัน
คำถามที่พบบ่อย
Benchmark สูงสุดของ Claude Fable 5.1 คืออะไร?
ในบรรดาตัวชี้วัดแบบเปอร์เซ็นต์ที่ Anthropic รายงาน Fable 5.1 ไปถึง 77.9% แบบเครดิตบางส่วนบน OSWorld 2.0 และ 73.4% บน CursorBench 3.2.0 การพัฒนารุ่นที่ใหญ่ที่สุดคือ Terminal-Bench-Science ที่ 52.6% เทียบกับ 24.7% สำหรับ Fable 5
Claude Fable 5.1 ดีกว่า Fable 5 แค่ไหน?
กำไรต่างกันมากตามเวิร์กโหลด: 27.9 คะแนนบน Terminal-Bench-Science, 14.3 บน AutomationBench และ 13.8 บน Terminal-Bench 4.0 แต่เพียง 2.9 บน CursorBench และ 1.2 บน Humanity’s Last Exam แบบใช้เครื่องมือ
Claude Fable 5.1 ดีกว่า Claude Opus 5 หรือไม่?
มันทำคะแนนสูงกว่าทั้งตารางที่ Anthropic รายงาน แต่หลายช่องว่างมีขนาดเล็ก Anthropic แนะนำให้เริ่มจาก Opus 5 และเลื่อนเมื่อจำเป็นต้องใช้ความสามารถระยะยาวเพิ่มเติม
Claude Fable 5.1 ชนะ GPT-5.6 Sol หรือไม่?
Anthropic รายงานว่า Fable 5.1 ทำคะแนนสูงกว่าบนห้าตัวชี้วัดร่วม เนื่องจากนี่คือการประเมินคู่แข่งโดยผู้ขายและการกำหนดค่าแตกต่างกัน บทสรุปที่ปลอดภัยคือ Fable 5.1 มีความสามารถแข่งขันสูง มากกว่าการเหนือกว่าทุกด้าน
ผลลัพธ์ได้รับการยืนยันอิสระหรือไม่?
เพียงบางส่วน Benchmark หลายรายการมีลีดเดอร์บอร์ดสาธารณะ แต่ความพยายาม ฮาร์เนส พฤติกรรมสำรอง และเวอร์ชันภารกิจต้องสอดคล้องกันก่อนที่จะเทียบค่ากับการรันเปิดตัวของ Anthropic ได้โดยตรง
Claude Fable 5.1 เหมาะที่สุดกับอะไร?
โปรไฟล์ Benchmark แข็งแกร่งที่สุดสำหรับงานวิจัยวิทยาศาสตร์ที่รันยาว การโค้ดอัตโนมัติ เวิร์กโฟลว์เอเจนต์ที่ซับซ้อน อัตโนมัติทางธุรกิจ และงานที่ต้องวางแผน ใช้เครื่องมือ ตรวจสอบ และกู้คืน
จะเข้าถึง Claude Fable 5.1 ได้อย่างไร?
Claude Fable 5.1 มีรายชื่อบน CometAPI ด้วยรหัสโมเดล claude-fable-5-1 เอ็นด์พอยต์แบบรวมทำให้สามารถรันเวิร์กโหลดการประเมินชุดเดียวกันข้ามหลายโมเดลได้อย่างสะดวกก่อนเลือกเส้นทางโปรดักชัน
