GPT-6 Astra is now live on CometAPI →
technology/CometAPI 研究

什麼是 Gemini 3.8 Flash?規格、基準測試、定價,以及有哪些變更

探索 Gemini 3.8 Flash API 定價、規格、1M-token 上下文、基準測試、思考層級、多模態輸入、工具、限制,以及與 Gemini 3.7 的比較。

CometAPI
Mia MarenAI 模型與 API 研究團隊
更新於 Sep 6, 2026 6 分鐘閱讀
什麼是 Gemini 3.8 Flash?規格、基準測試、定價,以及有哪些變更
套用此模式

發出第一個 API 請求。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

摘要

Gemini 3.8 Flash 是 Google 面向複雜程式設計、代理式與多模態工作的生產級 Flash 升級版本。它保留了 Gemini 3.7 Flash 的 1M-token 上下文等級,同時更強調更深入的推理、更持久的工具使用,以及在長時程任務上的更高完成率。

重點摘要

1,048,576 個輸入 tokens 與 65,536 個輸出 tokens,支援文字、影像、影片、音訊與 PDF 輸入。

• Google 報告 DeepSWE v1.1 成績為 73.7%,相較於同一比較中的 Gemini 3.7 Flash 的 65.3% 有所提升。

• 導入期標準費率為 每 1M 輸入 tokens $0.75、每 1M 輸出 tokens $3.75,至 2026 年 12 月 31 日止。

• 當較難的任務受益於重試、驗證與多工具執行時可升級;對於短小、可預期且延遲敏感的流量則保留 3.7。

Google 已於 2026 年 9 月 2 日發佈 Gemini 3.8 Flash,距 Gemini 3.7 Flash 僅三週。Google 將其定位為面向程式設計、代理、跨模態推理與專業工作流程的最智慧的 Flash 模型

此次釋出並非單純的上下文視窗擴充。直接建構於 Gemini 3.7 Flash 之上,新模型在困難任務上投入更多計算、執行額外推理步驟,並更持續地使用工具。

這種設計帶來務實的權衡:在長時程工作上更高的完成率,但每個任務可能需要更多推理 tokens 與更高延遲。本指南聚焦於 3.8 的差異——规格、官方基準結果、定價與升級決策——不重覆已於 CometAPI 涵蓋的 Gemini 3.7 一般特性概覽。

什麼是 Gemini 3.8 Flash?規格、基準測試、定價,以及有哪些變更

Google 官方發佈圖片 - Gemini 3.8 Flash 與 3.8 Flash Cyber

什麼是 Gemini 3.8 Flash?

Gemini 3.8 Flash 是 Google 面向長時程軟體工程、自主代理、多模態分析與專業知識工作的生產級 Flash 模型。其差異化行為在於「持續性」:能檢視中間結果、重複喚用工具、修正失敗步驟,並持續朝更大的目標推進。

該模型可透過 Gemini API 與 Google AI Studio 一般可用。Google 的發佈公告亦列出其在 Gemini 應用、Gemini Enterprise Agent Platform、AI Mode 與 Google Antigravity 上的可用性。

Gemini 3.8 Flash 規格

對於 Gemini 3.7 Flash 的使用者而言,技術範圍相當熟悉。以下彙整最有用的生產規格;訊號較低的「未支援生成模式清單」已移除。

Official specificationGemini 3.8 Flash
Stable model IDgemini-3.8-flash
Release statusGeneral availability
Maximum input1,048,576 tokens
Maximum output65,536 tokens
Input modalitiesText, image, video, audio, and PDF
Output modalityText
Thinking levelsLow, medium, and high; medium by default
Core toolsFunction calling, code execution, structured output, search grounding, URL context, and file search
Computer useSupported in preview
Knowledge cutoffMarch 2026 for some domains; some knowledge may remain limited to January 2025

Google 確認了 1,048,576-token 的輸入上限與 65,536-token 的輸出上限。由於 3.7 提供相同的上下文範圍,僅憑上下文大小並非遷移理由;升級案例建立在推理品質與任務完成度之上。

Gemini 3.8 Flash 有何新變化?

Gemini 3.8 Flash 保留上一代的上下文容量,但改變了模型在推理、工具使用與完成長工作流程方面的方式。主要差異落在四種運行行為上。

更深入的推理

Google 表示模型在任務變得困難時,能執行更多推理步驟。程式設計或研究代理可以檢視中間證據、修正方法,並在承諾於第一個看似合理的答案之前先驗證結果。

代理式執行

Gemini 3.8 Flash 設計能貫穿包含搜尋、程式碼執行、函式呼叫、錯誤檢視與恢復的多步驟工作。當成功仰賴完成整個使用工具的工作流程,而非只產出一次性的回應時,此升級尤其重要。

思考層級

生產模型提供 低、中與高思考層級,預設為中。團隊可對例行請求使用低推理,並將較高推理保留給完成品質比延遲或 token 使用更重要的任務。

多模態工作流程

該模型可將文字、影像、影片、音訊與 PDF與函式呼叫、程式碼執行、搜尋溯源對齊、URL 情境與結構化輸出結合使用。改進之處不在於新增媒體型態,而是跨混合證據與工具更持續的推理。本次發佈同時推出了 Gemini 3.8 Flash Cyber,作為針對核准的防禦性資安工作的獨立模型。

與 Gemini 3.7 Flash 有何不同?

關於較早模型的一般能力與部署情境,請參見 CometAPI 的 Gemini 3.7 Flash 概覽。3.8 的變化更狹義且更偏運營層面。

更持久的推理

Google 表示 Gemini 3.8 Flash 能在困難任務上執行更多推理步驟。例如,儲存庫代理可以檢視相依性、編輯多個檔案、執行測試、診斷失敗、修訂修補程式,並再次驗證,而不是在第一個看似合理的答案後就停止。

更迭代的工具使用

該模型在證據改變時更願意重複呼叫工具。這對於瀏覽器自動化、研究、程式設計與文件工作流程很重要,因為正確的下一步取決於先前工具的結果。

更高的任務層級品質,可能更高的 token 使用

Google 也提醒模型可能消耗更多 tokens,尤其在較高思考層級。Gemini 3.7 Flash 因此仍是針對例行流量的效率優先選項,而 3.8 更適合需要重試與驗證以提高完成機率的任務。

沒有上下文視窗擴充

兩代皆保有相同的 1M-token 輸入與 64K-token 輸出等級。升級在於行為,而非單純增加提示容量。

Gemini 3.8 Flash vs Gemini 3.7 Flash - 比較表 - 誰該升級

兩代共享相同的上下文等級,因此升級決策應基於任務完成度、工具的持續性、延遲與 token 使用,而不是僅憑提示容量。

Comparison dimensionGemini 3.8 FlashGemini 3.7 FlashDecision impact
PositioningMost intelligent production Flash modelPrevious efficiency-first Flash generation3.8 targets harder end-to-end work
Context capacity1,048,576 input; 65,536 output tokensSame 1M-input / 64K-output classNo capacity-driven migration is required
DeepSWE v1.173.7%65.3%3.8 has the stronger coding-agent result
Reasoning and toolsMore reasoning steps and persistent multi-tool executionBetter suited to short, predictable flows3.8 is preferable when retries and verification matter
Token and latency profileCan use more tokens, especially at higher thinking levelsGenerally the lighter option for routine trafficBenchmark cost per completed task, not token price alone
Best-fit workloadsRepository coding, research, multimodal analysis, multi-tool agentsClassification, extraction, short drafting, stable automationsRoute by workload instead of replacing 3.7 everywhere

誰該升級?

若你執行儲存庫級程式設計、多工具自動化、專業研究、多模態分析,或經常需要升級到高階模型的工作流程,現在就評估 Gemini 3.8 Flash。對於短小、重複、延遲敏感且已可靠成功的任務,保留 Gemini 3.7 Flash。

實務上的路由器可以將困難或失敗的任務送往 3.8,同時讓效率優先的流量繼續在 3.7。於更改預設模型前,量測接受任務率、端到端延遲、工具呼叫次數與總 tokens。

Gemini 3.8 Flash 官方基準測試表現

Google 公布的評測顯示,在長時程程式設計、終端機工作、專業代理、進階推理與電腦操作方面提升最為明顯。

什麼是 Gemini 3.8 Flash?規格、基準測試、定價,以及有哪些變更

Google DeepMind 的官方 Gemini 3.8 Flash 評測圖表

Gemini 3.8 Flash 的領先之處

在 DeepSWE v1.1 上,73.7% 對比 65.3%為 8.4 個百分點的代際提升,且幾乎追平 Claude Opus 5 的 74.0%。在 Terminal-Bench 2.1 上的 89.4% 略高於 Opus 5 所示的 89.1%。Vals Finance Agent v2 與法律代理基準在 Google 的比較中也偏向 3.8。

仍由高階模型領先的領域

結果並非處處領先。Claude Opus 5 在 Terminal-Bench 4.0 上達到 51.8%,而 Gemini 3.8 Flash 為 19.1%;在 OSWorld-2.0 上為 75.4%,對比 59.0%。證據支持 Gemini 3.8 Flash 在成本-能力上的優勢,但並不代表其取代所有高階前沿模型。

基準結論

當工作負載類似長時程程式設計或專業化代理時,Gemini 3.8 Flash 最為強勢。對於困難的電腦操作環境與部分終端機任務,Claude Opus 5 仍更出色。生產團隊應以接受任務率、延遲與總 token 消耗來驗證,而非僅憑單一基準平均值。

Gemini 3.8 Flash 定價與每個完成任務的成本

Gemini 3.8 Flash 以與 3.7 相同的導入期每 token 費率推出,但相同的 token 定價不保證任務成本相同,因為 3.8 可能推理時間更長。

Google pricing modeInput / 1M tokensOutput / 1M tokensCached input / 1M tokens
Standard through Dec. 31, 2026$0.75$3.75$0.075
Standard from Jan. 1, 2027$1.50$7.50$0.15
Batch through Dec. 31, 2026$0.375$1.875$0.0375
Flex through Dec. 31, 2026$0.375$1.875$0.0375

官方定價頁面指出,輸出定價包含思考 tokens。請評估每個被接受任務的成本:當額外推理能避免一次失敗執行或避免回退至高階模型時,可能是經濟的;但對分類、抽取或短對話則可能浪費。

RouteInput / 1M tokensOutput / 1M tokens
Google introductory price$0.75$3.75
CometAPI listed price$0.60$3.00
Nominal difference20% lower20% lower

CometAPI 的 Gemini 3.8 Flash 頁面提供當前路由價格與可用性。由於供應商價格可能變動,預算規劃前請確認即時模型頁面。

Gemini 3.8 Flash 對比 Claude Opus 5 與 Sonnet 5

Decision dimensionGemini 3.8 FlashGemini 3.7 FlashClaude Opus 5Claude Sonnet 5
PositioningHigh-intelligence FlashEfficiency-first FlashPremium frontier reasoningBalanced production agent
Context class1M1M1M1M
Long-horizon codingNear Opus 5 on DeepSWEStrong but lowerStrongest overall rangeLower in Google's table
Computer useImprovedLowerClear leader on OSWorld-2.0Below Gemini 3.8 in Google's table
Reasoning behaviorPersistent, more iterativeMore efficiency-orientedDeep premium reasoningBalanced quality and speed
Likely best fitCost-sensitive complex agentsHigh-volume predictable tasksHardest terminal and computer-use workGeneral production agents

比較結果取決於工作負載。當需要重試帶來的好處時選擇 3.8;對可預測、高量的流量保留 3.7;在最困難的終端機與電腦操作工作上,若其經濟性值得,使用 Opus 5;若偏好平衡的 Claude 部署,測試 Sonnet 5。

Gemini 3.8 Flash 使用情境:它能做什麼?

可將文字、影像、影片、音訊與 PDF 輸入與函式呼叫、程式碼執行、搜尋溯源對齊、URL 情境、檔案搜尋與結構化輸出結合。3.8 的特定優勢在於如何將這些能力持續串聯,完成整個工作流程。

程式設計

在一個工作上下文中提供原始碼、架構說明、議題歷史與測試輸出。模型可檢視相依性、編輯多個檔案、執行測試、診斷失敗、修訂修補,並驗證結果。請以每次執行的被接受修復數來評估,而非只看第一個生成的修補。

代理

對必須規劃、呼叫多個工具、檢視狀態變更並從失敗步驟恢復的工作流程,使用 Gemini 3.8 Flash。生產級代理應強制工具許可、步數上限、審批關卡與稽核記錄,以避免「持續性」演變為不受控的動作。

研究

結合 PDF、政策文件、公開 URL 與內部證據,然後使用檔案搜尋與具溯源的檢索比較來源,並輸出可稽核的簡報或結構化紀錄。對法律、金融或合規決策,保留來源段落並要求人工審核。

多模態工作流程

支援或營運管線可結合螢幕截圖、通話錄音、影片、PDF 與文字,擷取相關證據、分類案例,並準備結構化交接。當證據不完整或相互矛盾時,置信門檻與升級規則至關重要。

電腦操作

對瀏覽器式工作流程,模型能解讀頁面、選擇下一步動作、喚用工具、檢視新狀態,並在步驟失敗時恢復。由於電腦操作仍在預覽階段,在購買、提交、帳戶變更與其他不可逆操作上保留審批關卡。

侷限

更多推理可能增加 token 消耗與延遲。官方模型卡也指出幻覺與偶發的緩慢或逾時。其標示的知識截斷點需要留意:部分領域為 2026 年 3 月,另有部分知識可能仍限於 2025 年 1 月。

該模型產出文字,而非原生影像或音訊,且不支援 Live API。Google 的自動化安全評估亦報告在 Multilingual Safety 上下降 5.4 分,分數越低越好,這表示在生產部署前需要額外的多語言測試。

常見問題

Gemini 3.8 Flash 的模型 ID 是什麼?

穩定的 API 模型 ID 為 gemini-3.8-flash。

上下文視窗有多大?

支援最多 1,048,576 個輸入 tokens 與 65,536 個輸出 tokens。

Gemini 3.8 Flash 是否優於 Gemini 3.7 Flash?

在 Google 公布的大多數代理與專業基準上更強,但對簡單任務而言,3.7 可能仍更有效率。

它是否優於 Claude Opus 5?

在 Google 的比較中,它在部分程式設計結果上幾乎追平或略領先 Opus 5,但 Opus 5 在 Terminal-Bench 4.0 與 OSWorld-2.0 上大幅領先。

它會生成影像或音訊嗎?

不會。它接受多模態輸入,但輸出為文字。

結論

Gemini 3.8 Flash 是在 3.7 基礎上的「推理與持續性」升級,而非更大上下文的重新設計。其最強證據在長時程程式設計與專業化代理;最明顯的差距仍在更困難的終端機與電腦操作環境,Claude Opus 5 可能領先。

對生產團隊而言,決定性指標不是每個 token 的價格,而是每個被接受任務的成本。請使用你的實際軌跡在 CometAPI 上測試 Gemini 3.8 Flash,對照 3.7 與相關的 Claude 模型,再決定是否更改預設路由。

SEO 中繼資料

Meta title: 什麼是 Gemini 3.8 Flash?規格、基準測試與定價

Meta description: 探索 Gemini 3.8 Flash API 定價、規格、1M-token 上下文、基準測試、思考層級、多模態輸入、工具、限制,以及與 Gemini 3.7 的比較。

Keywords: Gemini 3.8 Flash, Gemini 3.8 Flash API, Gemini 3.8, Gemini 3.8 Flash 基準測試, Gemini 3.8 Flash 定價, Gemini 3.8 Flash vs Gemini 3.7 Flash, Gemini Flash, Google Gemini API, Gemini 程式設計模型, AI 代理模型

URL slug: what-is-gemini-3-8-flash

繼續學習

把這篇文章連到下一個決策。

查看所有主題
發布於 Sep 4, 2026
最後更新 Sep 6, 2026
0 次瀏覽
已審核內容清晰度、來源標註與最新 API 術語。

準備好將 AI 開發成本降低 20% 了嗎?

幾分鐘內免費開始。包含免費試用點數。無需信用卡。

閱讀更多