TL;DR Grok 4.7 คือโมเดลแนวหน้าของ SpaceXAI สำหรับงานโค้ดดิ้ง เวิร์กโฟลว์แบบเอเจนต์ และงานความรู้ระดับมืออาชีพ เปิดตัวเมื่อ 21 กันยายน 2026 ผสานหน้าต่างบริบท 500,000 โทเค็น อินพุตข้อความและภาพ การให้เหตุผลที่ปรับได้ การเรียกใช้ฟังก์ชัน การค้นเว็บและ X และการรันโค้ด
สำหรับพรอมต์ต่ำกว่า 200,000 โทเค็น xAI API ทางการระบุราคา $2 ต่อหนึ่งล้านโทเค็นอินพุต, $0.50 ต่อหนึ่งล้านโทเค็นอินพุตที่แคช, และ $6 ต่อหนึ่งล้านโทเค็นเอาต์พุต ปัจจุบัน CometAPI แสดงราคา Grok 4.7 ที่ $1.60 อินพุต, $0.40 อินพุตที่แคช, และ $4.80 เอาต์พุต ต่อหนึ่งล้านโทเค็นในระดับเดียวกัน ซึ่งต่ำกว่าราคาทางการบนหน้าโมเดล 20%
คุณค่าทางปฏิบัติไม่ได้อยู่ที่การนำทุกเบนช์มาร์ก การเลือก Grok 4.7 น่าสนใจที่สุดเมื่อเวิร์กโหลดผสานงานวิศวกรรม ลูปเอเจนต์ยาวนาน การใช้เครื่องมือ บริบททำงานขนาดใหญ่ และความไวต่อค่าใช้จ่ายโทเค็นเอาต์พุต ทีมงานควรทดสอบกับรีโพสิทอรีและเวิร์กโฟลว์ของตนเองก่อนกำหนดเส้นทางในโปรดักชัน
Key Takeaways
- Grok 4.7 ใช้โมเดลฐานใหญ่กว่า Grok 4.6 รันการเรียนรู้แบบเสริมแรงยาวขึ้นบนงานที่ยากขึ้นหลายชั่วโมง และมีการตรวจสอบตนเองที่เข้มแข็งขึ้น
- API รองรับหน้าต่างบริบท 500,000 โทเค็น อินพุตข้อความและภาพ เอาต์พุตข้อความ 4 ระดับการให้เหตุผล เอาต์พุตเชิงโครงสร้าง การเรียกใช้ฟังก์ชัน การค้นเว็บและ X และการรันโค้ด
- SpaceXAI รายงาน 46.3% บน CursorBench 4.0, 71.0% บน DeepSWE v1.1 และ 38.0% บน Terminal-Bench 4.0 ซึ่งเป็นผลลัพธ์ที่ผู้ผลิตเผยแพร่ ไม่ใช่หลักฐานของภาวะผู้นำสากล
- CometAPI แสดงว่า Grok 4.7 พร้อมใช้งาน พร้อมเอ็นด์พอยต์ที่เข้ากันได้กับ OpenAI และราคาต่ำกว่าราคาทางการของ xAI 20% ตามที่แสดงในแค็ตตาล็อกปัจจุบัน
- เลือก Grok 4.7 สำหรับเอเจนต์วิศวกรรมที่ไวต่อราคาและการใช้เครื่องมืออย่างต่อเนื่อง; เลือกทางเลือกอื่นเมื่อบริบทยาวมากหรือโดเมนที่สำคัญต่อเบนช์มาร์กสำคัญกว่า ราคาต่อหน่วย
What Is Grok 4.7?
Grok 4.7 คือโมเดลภาษาขนาดใหญ่แนวหน้าตัวล่าสุดของ SpaceXAI ที่วางตำแหน่งสำหรับ การเขียนโค้ด งานเอเจนต์อัตโนมัติ และงานความรู้ระดับมืออาชีพ การเปิดตัวมุ่งสู่ภารกิจที่ต้องปฏิสัมพันธ์ต่อเนื่อง การใช้เครื่องมือ การตรวจสอบ และการแก้ไข มากกว่าคำตอบแบบครั้งเดียว
SpaceXAI ระบุว่า Grok 4.7 ถูกฝึกด้วย การเรียนรู้แบบเสริมแรงที่ยาวขึ้นบนชุดงานที่ยากขึ้น เน้นปัญหาที่อาจกินเวลาหลายชั่วโมง ทิศทางการฝึกนี้ทำให้เหมาะกับวิศวกรรมซอฟต์แวร์ระดับรีโพสิทอรี การดีบัก การวิจัย การสร้างเอกสาร การวิเคราะห์ทางวิศวกรรม และระบบอัตโนมัติหลายขั้นตอน
How Is Grok 4.7 Different From—and Better Than—Grok 4.6?
โมเดลฐานขนาดใหญ่ขึ้น
Grok 4.7 ย้ายไปสู่โมเดลฐานที่ใหญ่กว่า Grok 4.6 SpaceXAI ยังไม่เปิดเผยจำนวนพารามิเตอร์สาธารณะขั้นสุดท้ายอย่างเป็นทางการ ดังนั้นข้อสรุปที่ป้องกันตัวคือความจุของโมเดลฐานเพิ่มขึ้น ไม่ใช่ค่าประมาณพารามิเตอร์เฉพาะ
การเรียนรู้แบบเสริมแรงที่ยาวขึ้นบนงานที่ยากขึ้น
ช่วงการเรียนรู้แบบเสริมแรงถูกยืดและเบนไปสู่ปัญหาระยะยาวที่ยากขึ้น SpaceXAI เน้นงานที่อาจต้องทำหลายชั่วโมง สอดคล้องกับโค้ดดิ้งอัตโนมัติ การวิจัย และเวิร์กโฟลว์เอเจนต์ระดับมืออาชีพ
การตรวจสอบตนเองที่แข็งแกร่งขึ้น
Grok 4.7 ถูกฝึกให้ตรวจทานผลงานของตัวเองอย่างรอบคอบมากขึ้น ซึ่งสำคัญในวิศวกรรมซอฟต์แวร์เพราะเอเจนต์ที่เชื่อถือได้ต้องตรวจสอบ แก้ไข ทดสอบ วินิจฉัยความล้มเหลว แก้ไข และยืนยันซ้ำ ไม่ใช่แค่สร้างคำตอบแรก
การปรับปรุงที่วัดได้เหนือ Grok 4.6
| Dimension | Grok 4.6 | Grok 4.7 | Change |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9 pts |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8 pts |
| EEBench | 53.0% | 64.0% | +11.0 pts |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7 pts |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8 pts |
| HealthBench Professional | 48.5% | 56.7% | +8.2 pts |
ในชุดเปิดตัวที่เผยแพร่ Grok 4.7 ดีขึ้นเหนือ Grok 4.6 ในทุกผลลัพธ์ที่ระบุ การเพิ่มขึ้นที่มากที่สุดคือบน Terminal-Bench 4.0 ซึ่งสอดคล้องกับการเน้นของรุ่นนี้บนเวิร์กโฟลว์เทอร์มินัลและการใช้เครื่องมือที่ทำงานยาวนาน ตัวเลขเหล่านี้ยังคงเป็นข้อมูลที่ผู้ผลิตเผยแพร่และควรทดสอบกับงานจริงก่อนการย้าย
How Good Is Grok 4.7 on Benchmarks?
การประเมินเปิดตัวของ SpaceXAI ครอบคลุมวิศวกรรมซอฟต์แวร์ งานเทอร์มินัล งานออฟฟิศระดับมืออาชีพ งานกฎหมาย การให้เหตุผลทางคลินิก และวิศวกรรมไฟฟ้า นี่เป็นผลลัพธ์ที่ผู้ผลิตเผยแพร่และควรยืนยันกับเวิร์กโหลดโปรดักชันก่อนการจัดซื้อหรือการกำหนดเส้นทาง
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
ในผลลัพธ์การเปิดตัว Grok 4.7 SpaceXAI ระบุคะแนน 71.0% บน DeepSWE v1.1 ว่าเป็นความพยายามด้านการให้เหตุผลระดับสูง
ประกาศเปิดตัวไม่ได้เปิดเผยชุดฮาร์เนสต่อเบนช์มาร์ก การตั้งค่าเครื่องมือ จำนวนรัน หรือสภาพแวดล้อมการประเมินทั้งหมด ให้มองค่านี้เป็นข้อมูลที่ผู้ผลิตเผยแพร่และยืนยันโมเดลกับรีโพสิทอรี เครื่องมือ เป้าหมายด้านเวลา และเกณฑ์ความล้มเหลวของคุณก่อนกำหนดเส้นทางงานโปรดักชัน
What Does the Grok 4.7 Benchmark Profile Show?
วิศวกรรมซอฟต์แวร์
CursorBench 4.0 เพิ่มจาก 40.4% บน Grok 4.6 เป็น 46.3% บน Grok 4.7 ขณะที่ DeepSWE v1.1 เพิ่มจาก 65.2% เป็น 71.0% สนับสนุนการวางตำแหน่งของ Grok 4.7 ในฐานะโมเดลสำหรับเอเจนต์โค้ดดิ้งมากกว่าผู้ช่วยโค้ดเชิงสนทนาอย่างเดียว
งานเทอร์มินัลระยะยาว
Terminal-Bench 4.0 แสดงการเปลี่ยนแปลงระหว่างรุ่นที่มาก: 20.3% สำหรับ Grok 4.6 เทียบกับ 38.0% สำหรับ Grok 4.7 การเพิ่มขึ้น 17.7 จุดสอดคล้องกับการเน้นการเรียนรู้แบบเสริมแรงระยะยาวและการตรวจสอบตนเอง
วิศวกรรมไฟฟ้า
บน EEBench, Grok 4.7 ได้ 64.0% เทียบกับ 53.0% สำหรับ Grok 4.6 ในบรรดาการเปรียบเทียบที่เผยแพร่ นี่เป็นหนึ่งในผลลัพธ์ที่แข็งแกร่งที่สุดเชิงสัมพัทธ์ของ Grok 4.7
งานความรู้ระดับมืออาชีพ
AA Briefcase v1.1 เพิ่มจาก 1,546 เป็น 1,657 งานเหล่านี้สะท้อนงานมืออาชีพหลายชั่วโมงที่เกี่ยวข้องกับสิ่งส่งมอบเชิงโครงสร้าง เช่น เอกสาร งานนำเสนอ การวิเคราะห์ และอื่นๆ
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: How Do They Compare?
การตรวจราคาโดยผู้ให้บริการดั้งเดิม: OpenAI ระบุ GPT-5.6 Sol ที่ $4 ต่อหนึ่งล้านโทเค็นอินพุต และ $20 ต่อหนึ่งล้านโทเค็นเอาต์พุต ขณะที่ Anthropic ระบุ Claude Fable 5.1 ที่ $10 ต่อหนึ่งล้านโทเค็นอินพุต และ $50 ต่อหนึ่งล้านโทเค็นเอาต์พุต
| Dimension | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primary positioning | การเขียนโค้ด งานเอเจนต์ และงานความรู้ | การให้เหตุผลระดับมืออาชีพที่ซับซ้อนและการเขียนโค้ด | เอเจนต์ระยะยาว การเขียนโค้ด และงานความรู้ |
| Context window | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalities | อินพุตข้อความและภาพ; เอาต์พุตข้อความ | อินพุตข้อความและภาพ; เอาต์พุตข้อความ | อินพุตข้อความและภาพ; เอาต์พุตข้อความ |
| Reasoning control | Low, medium, high, xhigh | None through max | การคิดแบบปรับได้พร้อมความพยายามที่กำหนดค่าได้ |
| Provider API status | พร้อมใช้งานบน xAI API สาธารณะ | พร้อมใช้งานผ่าน OpenAI Chat Completions และ Responses | พร้อมใช้งานผ่าน Claude API และมาร์เก็ตเพลสคลาวด์ที่รองรับ |
| Input price / 1M tokens | $2 | $4 | $10 |
| Output price / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Best fit | เอเจนต์วิศวกรรมไวต่อราคาและการใช้เครื่องมือยาวนาน | การให้เหตุผลมืออาชีพกว้างพร้อมบริบทยาวมาก | สมรรถภาพเอเจนต์ระยะยาวสูงสุด งานโค้ด และงานความรู้ |
Which Model Should You Choose?
- เลือก Grok 4.7 เมื่อเวิร์กโหลดวิศวกรรม การใช้เครื่องมืออย่างต่อเนื่อง การให้เหตุผลที่กำหนดค่าได้ และต้นทุนโทเค็นเอาต์พุตที่ต่ำกว่า เป็นสิ่งสำคัญ เหมาะอย่างยิ่งกับเอเจนต์รีโพสิทอรี เวิร์กโฟลว์เทอร์มินัล และการวิจัยบริบทใหญ่ที่อยู่ต่ำกว่าเกณฑ์ราคา 200K
- เลือก GPT-5.6 Sol เมื่อภารกิจต้องการการให้เหตุผลมืออาชีพที่กว้างกว่า หน้าต่างบริบทเกินหนึ่งล้านโทเค็น หรือเมื่อผลลัพธ์ที่แข็งแกร่งบนการประเมินที่สำคัญต่อธุรกิจ เช่น DeepSWE หรือการให้เหตุผลทางคลินิก ถูกยืนยันในฮาร์เนสของคุณเอง
- เลือก Claude Fable 5.1 เมื่อสมรรถภาพเอజนต์ระยะยาวสูงสุด คุณภาพการเขียนโค้ด การรันเทอร์มินัล หรือการให้เหตุผลทางคลินิก คุ้มกับราคาต่อโทเค็นที่สูงกว่า
- ใช้การกำหนดเส้นทางโมเดลเมื่อเวิร์กโหลดหลากหลาย กำหนดเส้นทางขั้นตอนงานวิศวกรรมประจำและขั้นตอนเอเจนต์ปริมาณสูงไปยังโมเดลที่คัดเลือกแล้วและคุ้มค่าที่สุด และสำรองโมเดลที่แพงกว่าสำหรับงานที่อัตราความสำเร็จที่วัดได้คุ้มค่าพรีเมียม
การเลือกที่ถูกต้องขึ้นอยู่กับความสำเร็จภารกิจปลายทาง-ปลายทาง เวลาแฝง การลองซ้ำ ความแม่นยำของการเรียกเครื่องมือ และงานแก้ไขของมนุษย์ ไม่ใช่บนเบนช์มาร์กเดียวหรืออัตราโทเค็นพาดหัว
How Much Does the Grok 4.7 API Cost?
ตารางด้านล่างเปรียบเทียบอัตราทางการของ xAI กับราคาที่แสดงบนหน้ารุ่น Grok 4.7 ของ CometAPI ณ วันที่ 22 กันยายน 2026 CometAPI ระบุส่วนลด 20%; โปรดตรวจสอบราคาจริงก่อนใช้งานโปรดักชัน เพราะราคาของเกตเวย์และเงื่อนไขโปรโมชันอาจเปลี่ยนแปลง
| Prompt tier | Price type | xAI official | CometAPI | Difference |
|---|---|---|---|---|
| Below 200K prompt tokens | Input / 1M | $2.00 | $1.60 | 20% lower |
| Cached input / 1M | $0.50 | $0.40 | 20% lower | |
| Output / 1M | $6.00 | $4.80 | 20% lower | |
| Above 200K prompt tokens | Input / 1M | $4.00 | $3.20 | 20% lower |
| Cached input / 1M | $1.00 | $0.80 | 20% lower | |
| Output / 1M | $12.00 | $9.60 | 20% lower |
Standard Context Pricing for Prompts Up to 200,000 Tokens
สำหรับคำขอที่พรอมต์ไม่เกิน 200,000 โทเค็น Grok 4.7 มีค่าใช้จ่าย $2 ต่อหนึ่งล้านโทเค็นอินพุต, $0.50 ต่อหนึ่งล้านโทเค็นอินพุตที่แคช, และ $6 ต่อหนึ่งล้านโทเค็นเอาต์พุต อินพุตที่แคชเป็นหมวดที่ถูกที่สุด ดังนั้นแอปพลิเคชันที่มีคำสั่งระบบซ้ำหรือบริบทนำกลับมาใช้ใหม่จะลดต้นทุนได้เมื่อโทเค็นนั้นเข้าเกณฑ์การแคช
ตัวอย่างง่ายๆ พรอมต์ที่ใช้อินพุต 100,000 โทเค็นที่ไม่ได้แคชและสร้างเอาต์พุต 10,000 โทเค็น จะมีค่าใช้จ่ายประมาณ $0.26 ก่อนค่าบริการอื่นๆ: $0.20 สำหรับอินพุตบวก $0.06 สำหรับเอาต์พุต
Long-Context Pricing Above 200,000 Prompt Tokens
เมื่อพรอมต์เกิน 200,000 โทเค็น อัตราจะเพิ่มเป็น $4 ต่อหนึ่งล้านโทเค็นอินพุต, $1 ต่อหนึ่งล้านโทเค็นอินพุตที่แคช, และ $12 ต่อหนึ่งล้านโทเค็นเอาต์พุต ระดับที่สูงกว่านี้จะใช้ตามความยาวพรอมต์ ดังนั้นทีมควรเฝ้าระวังประวัติการสนทนาที่สะสม ร่องรอยเครื่องมือ เอกสารที่ดึง และบริบทของรีโพสิทอรีก่อนส่งคำขอแต่ละครั้ง
การตัดสินใจด้านต้นทุนเชิงปฏิบัติจึงไม่ใช่แค่จำนวนโทเค็นที่งานใช้ แต่คือการที่พรอมต์ข้ามเส้น 200,000 โทเค็นหรือไม่ การสรุปงานที่เสร็จแล้ว การลบเอาต์พุตเครื่องมือที่ล้าสมัย และการดึงเฉพาะไฟล์ที่เกี่ยวข้องที่สุด สามารถรักษาเวิร์กโหลดให้คงอยู่ในระดับมาตรฐานโดยไม่เสียบริบทจำเป็น
บันทึกประจำรุ่นของ SpaceXAI ระบุเกณฑ์นี้ งบประมาณโปรดักชันควรเผื่อการลองซ้ำ ลูปเอเจนต์ การเรียกเครื่องมือที่ล้มเหลว และความยาวเอาต์พุต แทนที่จะเปรียบเทียบผู้ให้บริการด้วยราคาอินพุตพาดหัวเพียงอย่างเดียว
What Makes Grok 4.7 Useful for AI Agents?
- หน้าต่างบริบท 500K: รองรับซอร์สโค้ด สเปก เอาต์พุตเครื่องมือ ล็อก และประวัติสนทนาปริมาณมากในบริบทเดียว มีประโยชน์สำหรับโค้ดดิ้งระดับรีโพสิทอรีและการวิเคราะห์หลายเอกสาร แม้ยังต้องคัดทอนบริบทอย่างกระตือรือร้น
- การให้เหตุผลที่กำหนดค่าได้: เลือกความพยายาม low, medium, high หรือ xhigh เพื่อแลกเวลาแฝงและคอมพิวต์กับการให้เหตุผลลึกขึ้นตามความยากของงาน
- การเรียกใช้ฟังก์ชันและเอาต์พุตเชิงโครงสร้าง: เอเจนต์สามารถคิวรีฐานข้อมูล รันทดสอบ ตรวจเอกสาร เรียก API ภายใน และคืนผลลัพธ์ที่เครื่องอ่านได้
- การค้นเว็บและ X: เครื่องมือค้นช่วยดึงข้อมูลปัจจุบันเมื่อข้อมูลฝึกสอนไม่พอ แต่ข้อมูลที่ดึงควรถูกมองเป็นอินพุตที่ไม่เชื่อถือและต้องตรวจสอบ
- การรันโค้ด: โมเดลสามารถตรวจสอบการคำนวณ แปลงข้อมูล และทดสอบวิธีแก้ที่สร้าง แทนการพึ่งเฉพาะอนุมานของโมเดลภาษา
- โฟกัสเวิร์กโฟลว์ระยะยาว: การฝึกที่เน้นงานหลายชั่วโมง การจัดการบริบท และการตรวจสอบตนเอง เป้าหมายเอเจนต์ที่มีลูปสะสมร่องรอยเครื่องมือและต้องกู้คืนหลังความล้มเหลว
How Does Grok 4.7 Improve Safety?
SpaceXAI ระบุว่า Grok 4.7 นำเสนอสแตกการป้องกันชุดใหม่ทั้งหมด และรายงานความต้านทานเจลเบรกและความปลอดภัยการใช้งานสองทางที่แข็งแกร่ง ในประกาศเปิดตัว บริษัทรายงาน 62.4% บนเบนช์มาร์ก biosafety ของ LatchBio และระบุว่ามีเพียง 3.3% ของพรอมต์เสี่ยงการใช้งานสองทางที่ผ่านบน HackerBench v0.3
ตัวเลขเหล่านี้เป็นการประเมินที่ผู้ผลิตเผยแพร่ มีประโยชน์ในการเข้าใจคำอ้างของรุ่น แต่ไม่ควรถูกมองเป็นมาตรการสากลของประสิทธิภาพความปลอดภัยในโลกจริง
How Can Developers Use the Grok 4.7 API?
Grok 4.7 พร้อมใช้งานผ่าน CometAPI ภายใต้รหัสโมเดล grok-4.7 CometAPI มีเอ็นด์พอยต์ที่เข้ากันได้กับ OpenAI คีย์ API เดียวและกระบวนการบิลลิงครอบคลุมผู้ให้บริการโมเดลหลายราย การทดสอบและกำหนดเส้นทางโมเดลแบบเคียงข้างกันที่ง่ายขึ้น และราคาที่แสดงปัจจุบันต่ำกว่าอัตราทางการของ xAI 20% ก่อนใช้งานโปรดักชัน โปรดตรวจสอบหน้ารุ่นล่าสุด สุขภาพเอ็นด์พอยต์ พารามิเตอร์ที่รองรับ ราคา และข้อกำหนดการจัดการข้อมูล
ตัวอย่างคำขอ CometAPI:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Is Grok 4.7 Worth Switching To?
สำหรับผู้ใช้ Grok 4.6 ที่พึ่งพาเอเจนต์โค้ดดิ้งหรือเวิร์กโฟลว์มืออาชีพระยะยาว Grok 4.7 เป็นผู้สมัครอัปเกรดที่สำคัญ เพราะชุดเบนช์มาร์กเปิดตัวดีขึ้นในทุกมิติที่รายงาน ขณะที่ราคามาตรฐานต่ำกว่าเกณฑ์บริบทยาวยังคงอยู่ที่ $2/$6
สำหรับผู้ใช้โมเดลแนวหน้ารายอื่น การตัดสินใจขึ้นกับเวิร์กโหลด Grok 4.7 น่าสนใจเป็นพิเศษเมื่อราคาต่อโทเค็นเอาต์พุต งานวิศวกรรม บริบทใหญ่ และการใช้เครื่องมืออย่างต่อเนื่องมีความสำคัญ เมื่อโมเดลอื่นแข็งแกร่งกว่าในโดเมนวิกฤต การกำหนดเส้นทางโมเดลอาจสมเหตุสมผลกว่าการแทนที่ทุกงานด้วยผู้ให้บริการเดียว
Conclusion
Grok 4.7 ไม่ได้เป็นเพียงการอัปเดตตัวเลขเล็กน้อยจาก Grok 4.6 รุ่นนี้มุ่งตรงไปที่ งานระยะยาวที่ทำผ่านเครื่องมือ การตรวจสอบซ้ำ บริบทใหญ่ และหลายขั้นตอนการรัน
ผลกำไรรุ่นต่อรุ่นที่แข็งแกร่งที่สุดปรากฏในจุดที่ทิศทางการฝึกควรมีผล: Terminal-Bench 4.0 จาก 20.3% เป็น 38.0%, EEBench จาก 53.0% เป็น 64.0%, และ CursorBench 4.0 จาก 40.4% เป็น 46.3% ขณะเดียวกันราคามาตรฐานต่ำกว่าเกณฑ์พรอมต์ 200K ยังคงอยู่ที่ $2/M อินพุต และ $6/M เอาต์พุต
คุณค่าทางปฏิบัติจึงไม่ใช่ “Grok 4.7 ชนะทุกเบนช์มาร์ก” แต่คือการที่ Grok 4.7 ลดช่องว่างระหว่างความสามารถเอเจนต์ระดับแนวหน้าและการรันที่ต้นทุนต่ำ ทำให้เกี่ยวข้องอย่างยิ่งกับเอเจนต์โค้ดดิ้ง ระบบวิจัย และเวิร์กโฟลว์มืออาชีพที่ต้องทำงานหลายขั้นตอนแทนการตอบครั้งเดียว
