GPT-6.1 Sol are now live on CometAPI →
new/CometAPI 研究

Gemini 4 Argon:基準測試、功能、價格與 API 存取

探索 Gemini 4 Argon 的基準測試、1M-token 輸出、安全性、價格、可用性,以及與 GPT-6 Astra 和 Claude Opus 5 的比較。

CometAPI
AnnaAI 模型與 API 研究團隊
更新於 Oct 1, 2026 6 分鐘閱讀
Gemini 4 Argon:基準測試、功能、價格與 API 存取
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: 2026 年 9 月 30 日,Google DeepMind 宣布推出 Gemini 4 Argon,作為其全新前沿模型以及 Gemini 4 系列的開端。它在長期軟體工程(DeepSWE v1.1 取得 77.9%)、企業知識型工作(Vals Index 以 68.9% 領先)以及防禦型資安方面提供最先進的表現。關鍵升級包括業界領先的 100 萬個 token 輸出上限(由先前的 64K 提升)。

Key Takeaways

  • Gemini 4 Argon 是 Google 迄今最強大的模型,針對複雜的多步驟工作流程進行最佳化,涵蓋程式設計、法律/財務知識型工作與網路防禦。
  • Argon 旨在在長期、跨多步驟的工作流程中維持推理,而非一般的短篇聊天。Google 強調真實世界的軟體工程、法律與財務工作、多模態理解,以及資安防禦。
  • Google 將最大輸出從先前的 64K token 擴大到 100 萬 token。Google 尚未公開 Argon 的完整 Gemini API 規格,包括輸入上下文、模態、端點行為或速率限制。
  • 在 Google 的比較表中,Argon 在 Vals Index 取得 68.9%、在 DeepSWE v1.1 取得 77.9%、在 LVBench 取得 91.7%、在 CWE-bench v1 取得 68%。它並未在所有測試中領先:GPT-6 Astra 贏得 FrontierSWE v2 與 Terminal-Bench Science,而 Claude Opus 5.5 領先 Terminal-Bench 4.0 與 PostTrainBench。
  • Google 的入門 API 價格為每 100 萬個輸入 token 2 美元、每 100 萬個輸出 token 10 美元。入門期後,價格分別提高至 4 美元與 20 美元。快取輸入宣稱相較適用的輸入 token 價格便宜 95%。
  • CometAPI 的公開型錄在 2026 年 10 月 1 日將 gemini-4-argon 列為可用,而非即將推出。

Google 透過推出 Gemini 4 Argon,在前沿 AI 競賽中重新取得領先地位。該模型於 2026 年 9 月 30 日發布,標誌著 Gemini 4 時代的開始,並明確定位為 Google 的「前沿智能下一個時代」。它鎖定最困難的真實工作負載:持續的代理型程式設計、高風險企業知識型工作(法律、財務、稅務),以及防禦型資安。

與先前的漸進式更新不同,Argon 透過大幅擴展輸出長度與針對長期任務的專門訓練,帶來能力深度上的根本轉變。數千名 Google 員工已在內部用於生產級工程工作,而外部存取則先由審核過的資安夥伴少量開放。

What Is Gemini 4 Argon?

Gemini 4 Argon 是 Google DeepMind 最新的前沿大型語言模型,也是 Gemini 4 家族的首次發布。它專為在複雜、多步驟、長期的工作流程中維持深度推理而設計,這是先前模型難以在單次軌跡中可靠完成的。

根據 Google 的說法,Argon「在真實世界的軟體工程、企業知識型工作(如法律與財務)以及資安防禦的複雜工作流程中提供前沿表現」。它汲取了 2026 年早些時候延遲或取消的 Gemini 3.5 Pro 學到的教訓,以及後續聚焦於 Gemini 3.8 Flash 系列的經驗。

該模型強調代理能力——自主規劃、工具使用、程式碼生成與編輯、弱點發掘與修補、多文件分析,以及長影片理解——同時融入更強的安全系統,以匹配前沿級能力。

在內部,Argon 已經在 Google 規模上帶來可衡量的影響:

  • 量子運算團隊使用它最佳化時空資源(qubits × gates),在數分鐘內擊敗已發表基準 40%。
  • 代理團隊分析全域遙測並自主套用記憶體最佳化,釋放跨資料中心超過 300 TiB 的記憶體(估計總節省 500 TiB 至 1 PiB)。
  • 大規模將程式碼從 C/C++ 遷移至 Rust 的工作正在進行中,包含核心函式庫(re2、libgav1)中的數萬行,以及 Fuchsia Zircon 核心中的超過 80 萬行。一項顯著成果:一個具記憶體安全性的視訊解碼器(libgav1),在進行導向剖析最佳化後,比先前的 Rust 移植版本快 2.7 倍。

這些真實部署突顯 Argon 不只是基準測試的冠軍,更是複雜工程組織的實用效率乘數。

Gemini 4 Argon Accessibility as of October 1st

由於模型具備先進能力,Google 採取刻意的分階段發布方式。目前正透過 Fairwind Program 將模型推送給一組受信任的資安防禦者(該計畫已招募超過 650 個組織,包括主要資安公司)。Google 也參與美國政府的自願性發佈前模型存取流程。更廣泛的開放——從付費 API 客戶與 Google AI Ultra 訂閱者開始——預期會在基於早期回饋進一步迭代防護機制後「儘快」推出。

Gemini 4 Argon Key Features

1. Long-Horizon Reasoning With Up to 1M Output Tokens

Google 表示 Argon 的最大輸出為 100 萬個 token,較前一代的 64,000 個 token 大幅提升。這是生成的最大上限,而非每次回應都應該非常巨大。它為模型提供足夠空間,以進行長推理軌跡、多檔案程式碼生成、詳盡研究或延伸的代理工作,而不必每隔幾步就發起新請求。

Gemini 4 Argon:基準測試、功能、價格與 API 存取

2. Real-World Software Engineering

Argon 在 DeepSWE v1.1 取得 77.9%,是 Google 比較表中的最高值。DeepSWE 著重於長期的軟體工程工作,較短程式碼補全測試更貼近自主程式代理。該模型在 Vibe Code Bench 也達到 91.9%。

情況並非一面倒。GPT-6 Astra 在 FrontierSWE v2 得分 65.5%,而 Argon 為 55.0%;Claude Opus 5.5 在 Terminal-Bench 4.0 得分 66.4%,而 Argon 為 57.4%。因此,買家應分別測試版本庫編輯、終端機使用、除錯與遷移工作,而非只依賴單一「程式設計」分數。

Gemini 4 Argon:基準測試、功能、價格與 API 存取

3. Enterprise Knowledge Work

Google 報告指出 Argon 在 Vals Index 取得 68.9%,該指數依據金融、程式設計、法律與稅務工作對美國 GDP 的貢獻加權。它也在 Vals Finance Agent v2、Harvey 的 Legal Agent Benchmark 與 AutomationBench 上領先所比較的模型。

這些評估使 Argon 對研究密集型工作流程特別具有相關性:盡職調查、合約審閱、財務分析、稅務研究,以及跨文件綜整。它們並未消除來源驗證或專業審閱的需求。基準測試的領先反映在特定測試框架下的表現;並不表示適合在法律或財務領域中不受監督地作出決策。

4. Multimodal and Long-Video Understanding

Argon 在 Chartography 取得 71.6%,在 LVBench 取得 91.7%,在圖表理解上略領先 GPT-6 Astra,在長影片理解上則領先更明顯。Google 也描述了 Argon 於工作流程中解讀一連串文件並據此採取行動的能力。

當僅有文字不足以支撐分析時,這項組合很有用:同時分析財報圖表與申報文件、從數小時的影片中擷取證據、搭配書面需求檢視產品螢幕截圖,或在多個 PDF 與視覺化報告之間進行資料對齊。

5. Defensive Cybersecurity

Google 訓練 Argon 用於發現、驗證並修補關鍵弱點。在 CWE-bench v1 上,Argon 與 GPT-6 Astra 皆為 68%,而 Claude Opus 5.5 為 67%。Google 表示 Argon 在內部的弱點發掘與黑箱滲透測試評估中也優於 Gemini 3.8 Flash Cyber。

初期存取反映了風險。受信任的資安防禦者可透過 Google 的 Fairwind Program 使用該模型;Google 表示 Wiz 在其 Scan for Good 計畫中使用 Argon 識別出影響醫療軟體的關鍵弱點。受限的分發讓 Google 有時間收集證據,然後再更廣泛地釋出這些先進的資安能力。

6. The hallucination rate dropped to 10%.

Gemini 4 Argon 在 Artificial Analysis 上具有極低的幻覺率。15%。Arena 報告對 Gemini 4 Argon High 的工具幻覺估計為 0.10% +/- 0.48%,相較於 Gemini 3.8 Flash High 的 0.16% +/- 0.09%。點估計較低,表示有所改善。然而,不確定性區間大幅重疊,且 Argon 的區間更寬。

Gemini 4 Argon:基準測試、功能、價格與 API 存取

Gemini 4 Argon Benchmark Performance

以下數據來自 Google DeepMind 的比較表。 Google 提供了分開的方法學文件,並聲明分數除非另有註明,皆為 pass@1。請將這些視為供應商發布的結果,並用私有工作負載加以驗證。

BenchmarkWorkloadGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Leader
Vals IndexGDP-weighted knowledge work68.9%63.1%67.0%Argon
AutomationBenchEnd-to-end business automation51.3%41.4%42.5%Argon
Vals Finance Agent v2Multi-step finance research65.4%53.5%58.6%Argon
Harvey Legal AgentLegal research and drafting19.6%5.4%3.8%Argon
DeepSWE v1.1Long-horizon software engineering77.9%74.1%74.2%Argon
FrontierSWE v2Agentic coding55.0%65.5%62.3%Astra
Terminal-Bench 4.0Terminal-based agent work57.4%58.2%66.4%Opus
Terminal-Bench Science 0.1Science and math agents57.6%68.1%63.3%Astra
GraphWalks, 256K-1MLong-context graph traversal, F184.2%71.8%66.8%Argon
Agent's Last ExamComputer use39.5%34.2%38.2%Argon
OSWorld 2.0 offline subsetComputer use, partial score69.2%72.6%Not reportedAstra
ChartographyChart understanding71.6%71.0%66.3%Argon
LVBenchLong-video understanding91.7%87.5%83.7%Argon
CWE-bench v1Vulnerability remediation68.0%68.0%67.0%Tie

How to Read the Results

Argon 最明顯的優勢是其在專業知識型工作、長上下文、圖表分析與長影片方面的廣度。其 19.6% 的法律代理結果是 Astra 5.4% 的三倍以上,儘管三者的絕對分數也顯示該基準仍然困難。Argon 也在 AutomationBench 上以 8.8 個百分點領先 Opus 5.5。

程式設計需要更細緻的結論。Argon 領先 DeepSWE 與 Vibe Code Bench,但 Astra 領先 FrontierSWE,Opus 領先 Terminal-Bench 4.0。對於科學導向的終端機工作,Astra 以 10.5 分領先 Argon。正確的標題並非「Argon 在所有基準中獲勝」,而是 Argon 在長期企業工作流程上格外強大,同時競爭對手仍在特定任務上保有重要優勢。

Gemini 4 Argon:基準測試、功能、價格與 API 存取

基準證據強而不全面。GPT-6 Astra 在數項科學、程式設計與電腦使用衡量上仍保持領先,而 Claude Opus 5.5 則在重要的終端機與 ML 工程測試上領先。 Independent evidence is similarly nuanced:Artificial Analysis 將 Argon 在其比較類別中排第 8(共 223 個模型),而 Arena 將 Gemini 4 Argon High 在代理模型中排第 8(共 46 個)並將其可引導性列為第一。Argon 最大的優勢是長程推理、企業領域表現與多模態深度的組合,再加上積極的公布價格。

Is Gemini 4 Argon Available?

就公告(2026 年 9 月 30 日)及後續報導而言,答案是「否」——對一般公眾或標準開發者尚未開放。存取限制於:

  • Fairwind Program 的受信任成員(資安防禦者、政府、關鍵基礎設施夥伴)。
  • Google 內部團隊。
  • 參與美國政府自願性發佈前流程的參與者。

Google 表示,在收集回饋並迭代防護機制之後,將「儘快」擴大開放,首先面向付費 API 客戶與 Google AI Ultra 訂閱者,接著再擴及更廣泛的開發者、企業與消費者。尚未提供固定的公開日期。

Gemini 4 Argon API Pricing

Google 的入門價格為每 100 萬個輸入 token 2 美元、每 100 萬個輸出 token 10 美元。入門期後,輸入為 4 美元、輸出為 20 美元。快取輸入以適用輸入費率的 95% 折扣計價,若政策完全如公告執行,則入門期為每 100 萬個 0.10 美元、其後為 0.20 美元。

該價格相對於其他高端前沿模型頗具吸引力,但每 token 成本並非每項完成任務的成本。生成數十萬個輸出 token 或執行大量工具呼叫的模型仍可能產生高額費用。請設定輸出上限、監控工具迴圈,並量測每個被接受結果的成本。

How to Access Gemini 4 Argon API Through CometAPI

一旦 Google 開放更廣泛的 API 存取,聚合前沿模型的平台將成為開發者實驗與產品化的最快且往往最具成本效益的方式。

CometAPI 提供與 OpenAI 相容的統一端點,支援來自 OpenAI、Anthropic、Google 等超過 500 款模型。這意味著你只需變更 model 參數,就能在 Gemini 系列、GPT-6 變體與 Claude 模型間切換——無需管理多個帳戶、計費系統或 SDK。

建議的準備與存取步驟:

  1. 在 cometapi.com 註冊,並從儀表板產生 API 金鑰(以 sk- 開頭)。
  2. 使用基底 URL https://api.cometapi.com/v1.
  3. 透過標準 OpenAI SDK 或原生 Gemini 格式呼叫模型。

CometAPI 已支援 Gemini 系列(包括先前的 Pro 與 Flash 模型),提供具競爭力的定價、免費試用額度,以及無縫切換。請定期查看 CometAPI Models 頁面以了解 Gemini 4 Argon 的可用性。此方式可避免 Google Cloud 的導入摩擦,並讓同一程式碼庫中更易於對 Claude Opus 5.5 或 GPT-6 Astra 進行 A/B 測試。

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

CategoryGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
ProviderGoogleOpenAIAnthropic
Release status on Oct. 1, 2026限量受信任測試者推出;更廣泛存取即將到來啟用中的 API 模型最新模型,於 2026 年 9 月 22 日發布
Best fit長上下文知識型工作、多模態分析、防禦型資安、超大型輸出複雜推理、科學、電腦使用、廣泛的工具生態系長時間運行的代理型程式設計與知識型工作
Input context尚未發布最終公開 API 規格1,050,000 tokens1,000,000 tokens
Max output1,000,000 tokens128,000 tokens同步 128,000;Batch 測試版 300,000
Inputs and outputs宣稱具多模態能力;詳細的公開 API 矩陣待定文字與圖片輸入;文字輸出文字與圖片輸入;文字輸出
Reasoning control長程推理;公開 API 控制項待定可設定推理努力程度從低到最高自適應思考始終開啟;預設投入為中等
Standard price per 1M tokens入門:輸入 2 美元/輸出 10 美元;之後 4 美元/20 美元輸入 10 美元/輸出 50 美元輸入 4 美元/輸出 20 美元
Standout wins in Google's tableVals、AutomationBench、DeepSWE、長上下文、LVBenchFrontierSWE、科學終端機工作、OSWorld 子集Terminal-Bench 4.0、PostTrainBench
Main caveat廣泛的 API 可用性與完整規格仍在逐步推出三者中標示價格最高並未領先 Google 的知識型工作表;自適應思考無法停用

Which Model Is Best?

當工作負載以長上下文知識型工作、多模態證據、資安防禦,或異常龐大的生成成品為主時,選擇 Gemini 4 Argon。當你需要成熟的 OpenAI 工具介面、強大的科學代理表現,或其特定的電腦使用優勢時,選擇 GPT-6 Astra。當既有評估框架下的行為表現良好,且偏好 Claude 原生的代理型程式設計與終端機工作時,選擇 Claude Opus 5.5。

對多數企業而言,更好的策略不是永久的單一模型決策。將例行請求路由至較低成本的模型,對困難尾端同時評估 Argon、Astra 與 Opus,並保留回退機制。CometAPI 在此頗具用處,因為單一整合層即可讓跨模型測試與受控路由更容易。

Conclusion

Gemini 4 Argon 標誌著 Google 強勢重返絕對前沿,在數項企業關鍵與長期基準上重拾領先,同時帶來實用進展,例如 100 萬輸出 token 與積極的入門定價。其分階段、以安全為先的推出策略,優先確保對強大資安防禦能力的負責任部署。

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Oct 1, 2026
最後更新 Oct 1, 2026
66 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

閱讀更多