Gemini 4 Argon 的技術規格
| 規格 | Gemini 4 Argon |
|---|---|
| 供應商 | Google DeepMind |
| 模型系列 | Gemini 4 |
| 模型 ID | gemini-4-argon |
| 模型類型 | 前沿多模態推理模型 |
| 主要重點 | 複雜工作流程、代理式編碼、企業知識工作、資安 |
| 多模態能力 | Google 描述了多模態理解;公開的模型頁面尚未提供完整的 API 模態綱要 |
| 最大輸出 | 根據目前第三方 API 列表,最高可達 1,000,000 個 token;這不應與輸入上下文視窗混為一談 |
| 輸入上下文視窗 | Google 在目前的公開模型頁面上未明確公布 |
| 公開 API 可用性 | 有限/預發布存取;Google 尚未宣布普遍公開的發布日期 |
什麼是 Gemini 4 Argon?
Gemini 4 Argon 是支撐 Google Gemini 4 世代的旗艦模型。Google 將其描述為針對複雜工作負載實現前沿表現而設計,包括軟體工程、企業知識工作與資安防禦。其已公布的評測集涵蓋知識工作、代理式編碼、科學與數學、電腦使用、多模態理解、長上下文任務與資安。
Argon 的定位明顯偏向工作流程導向,而非僅限於對話式問答。Google 強調其可在長期、多步驟任務中持續運作,並能橫跨複雜的軟體工程與企業工作流程。
Gemini 4 Argon 的主要特性
- 複雜工作流程推理: 針對需要持續推理的長期多步驟任務,而非單一短回覆。
- 代理式編碼: Google 報告在 DeepSWE v1.1、Vibe Code Bench 及其他編碼評測上表現強勁。
- 企業知識工作: 已發布的評測涵蓋金融與法律代理任務,以及端到端業務自動化。
- 多模態理解: Google 在 Chartography 與 LVBench 上報告了強勁成績,涵蓋多模態與長影片理解。
- 長上下文表現: 針對 GraphWalks,分別報告了最高至 128K 與 256K–1M token 範圍的結果。
- 資安防禦: Google 明確將 Argon 定位於防禦性資安,並公布 CWE-bench v1 在弱點修復方面的結果。
Gemini 4 Argon 的基準測試表現
Google DeepMind 在目前的 Gemini 4 Argon 評測頁面上報告了以下結果。這些為廠商公布的數據,僅應在其聲明的基準方法學範圍內比較。[1]
| 基準測試 | 類別 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | 知識工作 | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | 知識工作 | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | 知識工作 | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | 知識工作 | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | 代理式編碼 | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | 代理式編碼 | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | 代理式編碼 | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | 代理式編碼 | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | 科學與數學 | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | 科學與數學 | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | 科學與數學 | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | 長上下文 | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | 長上下文 | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | 多模態理解 | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | 多模態理解 | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | 資安 | 68.0% | 68.0% | 58.0% | 67.0% |
結果顯示 Argon 的表現因任務而異:它在多項知識工作、編碼、科學、長上下文與多模態評測中領先所引用的比較,而其他模型在特定的編碼、科學或電腦使用基準上得分更高。這些結果不應被折合為單一整體排名。
Gemini 4 Argon 對比 GPT-6 Astra 與 Claude Fable 5.1
| 領域 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| 知識工作 | 在 Vals、AutomationBench、金融與法律代理評測上公布了強勁結果 | 在相同評測集上表現強勁 | 在多項知識工作評測上表現強勁 |
| 代理式編碼 | 77.9% on DeepSWE v1.1; 91.9% on Vibe Code Bench | 74.1% on DeepSWE v1.1; 89.6% on Vibe Code Bench | 67.4% on DeepSWE v1.1; 90.3% on Vibe Code Bench |
| 長上下文 | 99.7% on GraphWalks up to 128K; 84.2% from 256K–1M | 98.7% and 71.8% respectively | 91.4% and 65.0% respectively |
| 多模態理解 | 71.6% Chartography; 91.7% LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| 資安 | 68.0% on CWE-bench v1 | 68.0% | 58.0% |
該比較是基於具體基準而定。例如,GPT-6 Astra 在 FrontierSWE v2 與 Terminal-Bench Science 0.1 上得分高於 Argon,而 Argon 在 DeepSWE v1.1、Vibe Code Bench、GraphWalks 256K–1M 與 LVBench 上得分更高。
代表性使用情境
- 程式碼庫規模的軟體工程 — 長期程式撰寫、重構、除錯與代理式開發。
- 企業知識工作流程 — 法律研究、財務分析與業務流程自動化。
- 資安防禦 — 在受控環境中的弱點發掘、驗證與修復。
- 科學與數學工作流程 — 與 LABBench、RiemannBench 及科學導向評測相對應的任務。
- 長影片與多模態分析 — 需要跨視覺與時間資訊進行解讀的工作負載。
- 長上下文代理 — 需要在非常大的任務軌跡中維持資訊的應用。