ข้อมูลจำเพาะทาง技术ของ Gemini 4 Argon
| ข้อมูลจำเพาะ | Gemini 4 Argon |
|---|---|
| ผู้ให้บริการ | Google DeepMind |
| ตระกูลโมเดล | Gemini 4 |
| รหัสโมเดล | gemini-4-argon |
| ประเภทโมเดล | โมเดลการให้เหตุผลแบบมัลติโหมดระดับแนวหน้า |
| โฟกัสหลัก | เวิร์กโฟลว์ที่ซับซ้อน การเขียนโค้ดแบบเอเจนต์ งานความรู้ระดับองค์กร ความปลอดภัยไซเบอร์ |
| ความสามารถแบบมัลติโหมด | Google อธิบายความเข้าใจแบบมัลติโหมด; หน้ารุ่นสาธารณะยังไม่ได้ให้สคีมาของโหมด API ที่สมบูรณ์ |
| เอาต์พุตสูงสุด | สูงสุด 1,000,000 โทเคน ตามรายการ API ของบุคคลที่สามในปัจจุบัน; ไม่ควรสับสนกับหน้าต่างบริบทขาเข้า |
| หน้าต่างบริบทขาเข้า | ยังไม่ได้เผยแพร่ชัดเจนโดย Google บนหน้ารุ่นสาธารณะปัจจุบัน |
| ความพร้อมใช้งานของ API สาธารณะ | การเข้าถึงแบบจำกัด/ก่อนวางจำหน่าย; Google ยังไม่ประกาศวันเปิดให้ใช้งานสาธารณะ |
Gemini 4 Argon คืออะไร?
Gemini 4 Argon เป็นโมเดลเรือธงที่เป็นแกนของเจเนอเรชัน Gemini 4 ของ Google โดย Google อธิบายว่าออกแบบมาสำหรับประสิทธิภาพระดับแนวหน้าบนภาระงานที่ซับซ้อน รวมถึงวิศวกรรมซอฟต์แวร์ งานความรู้ระดับองค์กร และการป้องกันความปลอดภัยไซเบอร์ ชุดการประเมินที่เผยแพร่ครอบคลุมงานความรู้ การเขียนโค้ดแบบเอเจนต์ วิทยาศาสตร์และคณิตศาสตร์ การใช้งานคอมพิวเตอร์ ความเข้าใจแบบมัลติโหมด งานบริบทยาว และความปลอดภัยไซเบอร์
การวางตำแหน่งของ Argon เน้นที่เวิร์กโฟลว์อย่างเด่นชัด มากกว่าจำกัดอยู่ที่การถามตอบแบบสนทนา Google เน้นความสามารถในการรองรับงานหลายขั้นตอนระยะยาวและการทำงานครอบคลุมเวิร์กโฟลว์วิศวกรรมซอฟต์แวร์และองค์กรที่ซับซ้อน
คุณสมบัติหลักของ Gemini 4 Argon
- การให้เหตุผลกับเวิร์กโฟลว์ซับซ้อน: ออกแบบสำหรับงานหลายขั้นตอนระยะยาวที่ต้องใช้การให้เหตุผลต่อเนื่อง ไม่ใช่คำตอบสั้นเพียงครั้งเดียว
- การเขียนโค้ดแบบเอเจนต์: Google รายงานผลที่แข็งแกร่งใน DeepSWE v1.1, Vibe Code Bench และการประเมินการเขียนโค้ดอื่นๆ
- งานความรู้ระดับองค์กร: การประเมินที่เผยแพร่รวมถึงงานด้านการเงินและเอเจนต์กฎหมาย ตลอดจนระบบอัตโนมัติทางธุรกิจแบบ end-to-end
- ความเข้าใจแบบมัลติโหมด: Google รายงานผลที่แข็งแกร่งใน Chartography และ LVBench ครอบคลุมความเข้าใจแบบมัลติโหมดและวิดีโอยาว
- ประสิทธิภาพบริบทยาว: รายงานผล GraphWalks ทั้งช่วงสูงสุด 128K และช่วง 256K–1M โทเคน
- การป้องกันความปลอดภัยไซเบอร์: Google จัดวาง Argon สำหรับการป้องกันความปลอดภัยไซเบอร์โดยเฉพาะ และรายงานผล CWE-bench v1 สำหรับการแก้ไขช่องโหว่
ประสิทธิภาพตามเบนช์มาร์กของ Gemini 4 Argon
Google DeepMind รายงานผลลัพธ์ต่อไปนี้บนหน้าการประเมินปัจจุบันของ Gemini 4 Argon นี่เป็นผลลัพธ์ที่ผู้ขายเผยแพร่ และควรเปรียบเทียบเฉพาะภายในระเบียบวิธีของเบนช์มาร์กที่ระบุ [1]
| เบนช์มาร์ก | หมวดหมู่ | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | งานความรู้ | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | งานความรู้ | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | งานความรู้ | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | งานความรู้ | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | การเขียนโค้ดแบบเอเจนต์ | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | การเขียนโค้ดแบบเอเจนต์ | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | การเขียนโค้ดแบบเอเจนต์ | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | การเขียนโค้ดแบบเอเจนต์ | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | วิทยาศาสตร์และคณิตศาสตร์ | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | วิทยาศาสตร์และคณิตศาสตร์ | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | วิทยาศาสตร์และคณิตศาสตร์ | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | บริบทยาว | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | บริบทยาว | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | ความเข้าใจแบบมัลติโหมด | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | ความเข้าใจแบบมัลติโหมด | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | ความปลอดภัยไซเบอร์ | 68.0% | 68.0% | 58.0% | 67.0% |
ผลลัพธ์แสดงให้เห็นว่าประสิทธิภาพของ Argon แตกต่างกันไปตามงาน: โมเดลนี้นำในการเปรียบเทียบที่อ้างถึงหลายรายการในด้านงานความรู้ การเขียนโค้ด วิทยาศาสตร์ บริบทยาว และการประเมินแบบมัลติโหมด ในขณะที่โมเดลอื่นทำคะแนนได้สูงกว่าในเบนช์มาร์กเฉพาะด้านการเขียนโค้ด วิทยาศาสตร์ หรือการใช้งานคอมพิวเตอร์ ไม่ควรรวมคะแนนเหล่านี้เข้าเป็นการจัดอันดับรวมเพียงรายการเดียว
Gemini 4 Argon เทียบกับ GPT-6 Astra และ Claude Fable 5.1
| ด้าน | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| งานความรู้ | ผลลัพธ์ที่เผยแพร่แข็งแกร่งใน Vals, AutomationBench การเงิน และการประเมินเอเจนต์กฎหมาย | แข็งแกร่งในชุดการประเมินเดียวกัน | แข็งแกร่งในหลายการประเมินงานความรู้ |
| การเขียนโค้ดแบบเอเจนต์ | 77.9% บน DeepSWE v1.1; 91.9% บน Vibe Code Bench | 74.1% บน DeepSWE v1.1; 89.6% บน Vibe Code Bench | 67.4% บน DeepSWE v1.1; 90.3% บน Vibe Code Bench |
| บริบทยาว | 99.7% บน GraphWalks สูงสุด 128K; 84.2% ในช่วง 256K–1M | 98.7% และ 71.8% ตามลำดับ | 91.4% และ 65.0% ตามลำดับ |
| ความเข้าใจแบบมัลติโหมด | 71.6% บน Chartography; 91.7% บน LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| ความปลอดภัยไซเบอร์ | 68.0% บน CWE-bench v1 | 68.0% | 58.0% |
การเปรียบเทียบขึ้นกับเบนช์มาร์กเฉพาะตัวอย่างเช่น GPT-6 Astra ทำคะแนนสูงกว่า Argon บน FrontierSWE v2 และ Terminal-Bench Science 0.1 ในขณะที่ Argon ทำคะแนนสูงกว่าบน DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M และ LVBench
กรณีใช้งานตัวอย่าง
- วิศวกรรมซอฟต์แวร์ระดับรีโพสิทอรี — งานเขียนโค้ดระยะยาว การรีแฟคเตอร์ การดีบัก และการพัฒนาแบบเอเจนต์
- เวิร์กโฟลว์งานความรู้ระดับองค์กร — การวิจัยด้านกฎหมาย การวิเคราะห์ทางการเงิน และระบบอัตโนมัติกระบวนการทางธุรกิจ
- การป้องกันความปลอดภัยไซเบอร์ — การค้นหา การยืนยัน และการแก้ไขช่องโหว่ในสภาพแวดล้อมที่ควบคุมได้
- เวิร์กโฟลว์ด้านวิทยาศาสตร์และคณิตศาสตร์ — งานที่สะท้อนโดย LABBench, RiemannBench และการประเมินเชิงวิทยาศาสตร์
- การวิเคราะห์วิดีโอยาวและมัลติโหมด — ภาระงานที่ต้องตีความข้อมูลทั้งด้านภาพและเชิงเวลา
- เอเจนต์บริบทยาว — แอปพลิเคชันที่ต้องรักษาข้อมูลตลอดวิถีงานขนาดใหญ่มาก