重點摘要
MiMo-V2.6 是 Xiaomi 新推出的開放權重、原生多模態、面向智能體推理的模型家族。MiMo-V2.6-Pro 採用稀疏 MoE 設計,總參數量 1.02 兆,每個 token 約啟用 420 億參數;MiMo-V2.6-Flash 總參數量 3090 億,每個 token 約啟用 150 億參數。兩者皆支援 1M-token 上下文視窗,並支援文字、圖像、視訊與音訊等多模態輸入。
關鍵重點
- MiMo-V2.6-Pro 是一個 1.02T 參數的稀疏 MoE 模型,每個 token 約啟用 42B 參數;Flash 總參數 309B,每個 token 約啟用 15B 參數。
- 兩個模型均透過 Xiaomi 的 API 支援 1M-token 上下文、多模態輸入,以及最高 128K 輸出 token。
- 該系列專為推理、工具使用、網頁搜尋、結構化輸出與長程智能體工作流程而設計。
- Xiaomi 以混合強化學習 (RL) 訓練 V2.6,涵蓋程式設計、通用智能體、視覺任務與資安環境。
- 官方結果將 Pro 定位為更高能力、Flash 為更低成本且高吞吐的選擇;仍需針對特定工作負載進行評測。
什麼是 Xiaomi MiMo-V2.6?
MiMo-V2.6 是 Xiaomi 的 MiMo 模型家族的最新一代。其重點不僅是產生更好的答案,而是執行長序列的行動:檢視環境、呼叫工具、觀察結果、修正錯誤,並持續進行直到完成目標。Xiaomi 將此次發佈框定為遞迴自我改進 (RSI),意指在 RL 訓練迴圈中,模型反覆探索環境、接收更豐富的獎勵訊號、比較軌跡,並學習更有效的策略。這不應被解讀為模型能自主重寫並訓練其自身的後繼者。
Pro vs Flash vs UltraSpeed:差異是什麼
| 功能 | MiMo-V2.6-Pro | MiMo-V2.6-Flash | MiMo-V2.6-Pro-UltraSpeed |
|---|---|---|---|
| 定位 | 旗艦級推理 | 高吞吐 / 高性價比 | 低延遲旗艦 |
| 總參數量 | 1.02T | 309B | 與 Pro 相同 |
| 啟用參數 | 42B | 15B | 與 Pro 能力相同 |
| 架構 | 稀疏 MoE | 稀疏 MoE | Pro 的服務模式 |
| 上下文 | 1M | 1M | 1M |
| 最大輸出 | 128K | 128K | 128K |
| 文字 / 圖像 / 視訊 / 音訊輸入 | Yes | Yes | Yes |
| 深度推理 / 工具呼叫 | Yes | Yes | Yes |
| 結構化輸出 / 上下文快取 | Yes | Yes | Yes |
| 主要優勢 | 極致能力 | 成本效率 | 最高快 20 倍的服務速度 |
選 Pro 還是 Flash:你應該用哪一款?
實用選擇: 對於艱難的長程工程、研究、資安與高價值智能體工作,選擇 MiMo-V2.6-Pro;針對高吞吐自動化、文件與多模態處理,以及對成本敏感的重複呼叫,選擇 MiMo-V2.6-Flash;當需要 Pro 級推理但延遲占主導時,選擇 MiMo-V2.6-Pro-UltraSpeed。UltraSpeed 是一種服務等級,而非不同能力的模型,宣稱輸出速度最高為標準 Pro 的 20×。
Xiaomi MiMo-V2.6 如何運作?
稀疏專家混合 (Sparse Mixture-of-Experts) 架構
MiMo-V2.6 不會為每個 token 啟用整個參數集。旗艦 Pro checkpoint 擁有總計 1.02 兆參數,但每個 token 只啟用約 420 億。Xiaomi 的模型卡描述了 70 層 Transformer、384 個路由專家,以及同時啟用 8 個專家。Flash 明顯更小,總計 309B / 啟用 15B,擁有 48 層 Transformer 與 256 個路由專家。
| 架構規格 | MiMo-V2.6-Pro | MiMo-V2.6-Flash |
|---|---|---|
| 總參數量 | 1.02T | 309B |
| 啟用參數 | 42B | 15B |
| Transformer 層數 | 70 | 48 |
| 隱藏維度 | 6,144 | 4,096 |
| 路由專家數 | 384 | 256 |
| 啟用專家數 | 8 | 8 |
| 最大上下文 | 1M | 1M |
| MiMo ViT | 681M 參數 | 681M 參數 |
| AudioTokenizer | 308M 參數 | 308M 參數 |
| Audio patch encoder | 127M 參數 | 127M 參數 |
| 推測式解碼器 | 5 層 | 5 層 |
該架構結合了滑動視窗注意力與全域注意力層,並包含一個五層、多 token 預測的推測式解碼器。實務含義是:標稱參數數量與每 token 的計算量是非常不同的量;稀疏路由讓 Xiaomi 能維持龐大的專家池,但不需對每個 token 進行跨所有權重的稠密推論。
原生多模態理解
MiMo-V2.6 使用 Xiaomi 的 6.81 億參數 MiMo ViT 進行視覺編碼,並結合專用的音訊元件。這讓同一個智能體能處理文字指令、螢幕截圖、照片、視訊與音訊。對於電腦使用型智能體而言,原生多模態很重要,因為感知與決策能在同一個推理迴圈中進行,而不是分散在互不相連的使用者端模型之間。
為什麼強化學習對 MiMo-V2.6 如此重要?
Xiaomi 報告稱,Flash 與 Pro 都在六天的公開訓練實驗中經歷了約30 個 RL 步驟與約 750,000 條軌跡。據報導訓練成本約為 Flash 的 $850,000、Pro 的 $2.62 million。每次更新使用 1,568 筆訓練樣本,單次訓練步驟約達 3.5–3.7 billion tokens。任務混合涵蓋程式碼、通用智能體、視覺任務、資安與多個智能體基座。
在此 RL 過程中,Xiaomi 指出外樣本 DeepSWE v1.1 分數從 Flash 的 48.8 提升至 65.7、Pro 從 58.4 提升至 72.6。這些數字描述了即時 RL 實驗,不應與發佈的 checkpoint 的所有最終基準分數混為一談,因為評測設定可能不同。
分組式智能體評分
對智能體訓練而言,二元的通過/失敗獎勵可能隱藏兩條成功軌跡之間的關鍵差異。一種解法可能以少數工具呼叫快速完成,另一種則可能浪費數十步。Xiaomi 因此提出Groupwise Reward Synthesis 與 Groupwise Advantage Redistribution,作為在組內比較軌跡並將學習訊號重新分配到更乾淨解法的機制。目標是不僅提升任務完成率,還優化路徑效率。
Xiaomi MiMo-V2.6 在智能體基準上表現如何?
目前對 V2.6 的最強公開證據集中在智能體基準,而非傳統的選擇題測試。Xiaomi 的官方圖表將 Pro 與 Flash 與 MiMo-V2.5-Pro、Claude Opus 5、GPT-5.6 Sol、Fable 5 在程式設計、通用智能體、資安與視覺智能體任務上進行比較。

| 基準測試 | MiMo-V2.6-Pro | MiMo-V2.6-Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 67.9 | 74.0 | 73.0 |
| ProgramBench | 26.5 | 26.0 | 37.0 | 25.0 |
| MiMo Code Bench | 63.2 | 61.2 | 68.6 | 59.3 |
| AutomationBench v1.0.6 | 53.1 | 52.3 | 50.3 | 45.8 |
| Toolathlon-Verified | 76.9 | 73.6 | 80.6 | 74.9 |
| Agents' Last Exam | 31.6 | 27.6 | 31.6 | 30.8 |
| Terminal Bench 2.1 | 89.9 | 87.6 | 89.1 | 88.8 |
| OSWorld-Verified | 82.0 | 80.8 | 83.4 | 83.0 |
| JobBench | 62.0 | 61.2 | 65.7 | 45.4 |
| MiMo Visual Coding | 72.3 | 71.5 | 70.0 | 73.4 |
程式設計進展
在長程執行上,程式設計的提升最為明顯。在即時 RL 運行中,Xiaomi 報告外樣本 DeepSWE v1.1 對 Flash 從 48.8 提升至 65.7、對 Pro 從 58.4 提升至 72.6。在已發佈的跨模型表格中,Pro 在 DeepSWE v1.1 達到 71.9、在 MiMo Code Bench 達到 63.2;Flash 則分別為 67.9 與 61.2。Pro 並未在所有程式設計測試中勝出——Claude Opus 5 仍在 DeepSWE、ProgramBench 與 MiMo Code Bench 領先——但 V2.6 將具競爭力的倉庫級表現與開放權重、顯著更低的 API 定價結合。
推理與智能體進展
這次推理進展更適合作為規劃、工具使用與恢復能力的提升來理解,而非某個抽象的智慧分數。Pro 在 Terminal Bench 2.1 記錄 89.9、在 AutomationBench 53.1、在 Toolathlon-Verified 76.9;Flash 分別為 87.6、52.3 與 73.6。Pro 在 Terminal Bench 2.1 略高於所列的 Claude Opus 5 與 GPT-5.6 Sol,兩個 V2.6 模型在 AutomationBench 上也領先這些對照。Xiaomi 將改進歸因於分組軌跡比較、更豐富的評分器、多基座訓練,以及偏好更短、更乾淨解法路徑的獎勵訊號。
知識與研究進展
知識密集型進展更多由智能體評測與展示所支撐,而非傳統的知識測驗組。Pro 在 Agents' Last Exam 拿下 31.6,與 Claude Opus 5 持平,並在 JobBench 達到 62.0。Xiaomi 也報告了材料研究工作流程,涵蓋文獻與專利檢索、假設生成與計算篩選,以及一個超過 6,000 行、由 Lean 核心驗證的 Lean 4 形式化專案。這些例子顯示更強的檢索、綜述、形式化推理與工具支撐的知識工作,但不應被視為對普遍知識優勢的獨立證據。
總結: V2.6 的進展廣泛但不均衡。其最強之處在於長程程式設計與智能體執行的提升;而對一般推理與知識的主張應與具體基準、基座與展示相聯繫。
基準說明: 除非另有說明,下列跨模型結果由 Xiaomi 在 MiMo-V2.6 模型卡中報告。分數可能受基準版本、智能體基座、工具設定、推論預算與評估流程影響,因此不應被解讀為獨立重現的排名。
MiMo-V2.6 與 MiMo-V2.5:有哪些改變?
| 維度 | MiMo-V2.5 世代 | MiMo-V2.6 突破 |
|---|---|---|
| 訓練焦點 | 強大的多模態智能體、長上下文與 token 效率 | 更大規模的混合 RL 計畫,涵蓋程式碼、通用智能體、視覺、資安與多個基座 |
| 智能體能力 | V2.5-Pro 瞄準艱難的長程工作 | Xiaomi 報告 V2.6-Flash 在其智能體基準套件上全面超越 V2.5-Pro |
| 學習效率 | 先前的生產 checkpoint | 約 750,000 條軌跡、30 個 RL 步驟;在訓練期間,Flash 的外樣本 DeepSWE 大約提升 17 分、Pro 約提升 14 分 |
| 開放性 | 開放權重與生態支援 | 新增完整 RL 程式碼、7,000+ 個任務環境、訓練框架、輕量基座,以及一個 9B 蒸餾 checkpoint |
| 經濟性 | 現有 V2.5 API 價格水準 | 在相同官方 API 價格下報告更高智慧,將能力-成本前沿外推 |
程式與智能體執行
相較 V2.5,最明顯的變化是更強的智能體策略,而非更長的上下文視窗。Xiaomi 報告 V2.6-Flash 在其智能體基準套件上優於 V2.5-Pro。在 V2.6 訓練過程中,外樣本 DeepSWE v1.1 對 Flash 從 48.8 提升至 65.7、對 Pro 從 58.4 提升至 72.6;這些訓練過程的分數無法與上文釋出的最終模型基準表直接互換。
推理、知識與訓練廣度
V2.6 將強化學習擴展到程式、通用智能體、視覺、資安與多個基座。Xiaomi 報告約 750,000 條軌跡,約 30 個 RL 步驟。這支援更廣的規劃、工具使用與恢復能力,但本身並不足以在所有知識或推理基準上建立普遍性提升;請對照匹配的任務與評測設定。
遷移與開放性
此次發佈還新增 RL 程式碼、7,000 多個任務環境、訓練基礎設施,以及一個 9B 蒸餾 checkpoint。1M-token 上下文與多模態輸入是從 V2.5 延續而來,並非 V2.6 新突破。
因此實務上的變化不是新的上下文範圍——1M 上下文與完整多模態在 V2.5 已存在——而是透過大幅增加的強化學習運算與更廣的可驗證環境,訓練出更強的智能體策略。Xiaomi 宣布 V2.5 與 V2.5-Pro 的模型名稱將於 2026 年 10 月 21 日停止運作,因此新部署應鎖定 V2.6,而現有部署應規劃遷移測試。
V2.6 與其他前沿模型的比較

| 維度 | MiMo-V2.6-Pro | 封閉前沿模型 | 其他開放權重模型 |
|---|---|---|---|
| 權重 | 開放權重 | 通常封閉 | 因模型而異 |
| 已驗證 MiMo 上下文 | 1M tokens | 需查各官方模型頁 | 需查各官方模型卡 |
| 已驗證 MiMo 模態 | 文字、圖像、視訊、音訊 | 視提供者而定 | 因模型而異 |
| 智能體導向 RL | 發佈重點強調 | 因模型與系統而異 | 因模型與 checkpoint 而異 |
| 自主部署 | 可,但需可觀的基礎設施 | 通常不可 | 對開放 checkpoint 常可行 |
| 主要 MiMo 優勢 | 開放權重、原生多模態、低 API 成本 | 供應商生態與受管工具 | 視授權、規模與部署棧而異 |
針對當前比較集合,請將 MiMo-V2.6 與Claude Opus 5.5 比較長時智能體程式設計、與Claude Fable 5.1 比較最困難的自主工作、與 GPT-6 Sol 與 Gemini 4 Pro。模型供應與價格具動態性,因此生產比較應使用線上目錄並匹配的提示、工具、投入預算與驗收標準。
Xiaomi MiMo-V2.6 實際能做什麼?
程式與軟體工程智能體
MiMo-V2.6 旨在處理長程軟體工程軌跡:檢視倉庫、修改程式碼、使用終端工具、執行測試、診斷失敗,並持續進行直到滿足目標。其在 DeepSWE、Terminal Bench、AutomationBench 與 Toolathlon 的結果顯示 Xiaomi 正在優化「執行」,而非僅是程式碼補全。實務工作包括程式設計智能體、自動除錯、倉庫重構、CI 問題解決與多工具工程工作流程。
電腦使用
Xiaomi 明確展示了 Computer Use Agent (CUA)。模型能解讀圖形介面、擷取資訊、編輯內容、處理資料、檢視結果、診斷問題,並根據視覺回饋改變後續行動。在這種工作流程中,模型輸出往往不是最終產品;它可能決定下一個軟體或瀏覽器動作。
3D 世界與 Blender 工作流程
在「Vibe World」概念下,MiMo-V2.6 能接收文字、圖像或視訊參考,並將 3D 請求拆分為場景構建、互動程式設計與視覺驗證任務。Xiaomi 也展示模型控制 Blender,從描述或參考影像建立 3D 物件與場景。這將 vibe coding 從應用程式碼擴展至互動環境。
機器人與具身智能體
Xiaomi 在具身模擬環境中展示 MiMo-V2.6,使用多視角相機影像與 Franka Panda 機械手臂。示例任務包括抓取物體、顏色匹配與精準放置。這並不意味著 V2.6 是通用機器人基礎模型,但顯示原生視覺與長程決策如何連接到具身控制迴路。
科學研究與形式化推理
Xiaomi 報告一個材料科學案例,MiMo-V2.6-Pro 協助研究人員處理金屬有機框架的 PFAS 吸附,包括文獻與專利搜尋、候選配方與計算工具呼叫。另一項實驗中,模型協助在 Lean 4 中形式化《Period Three Implies Chaos》的主要定理。Xiaomi 報告專案已完成超過 6,000 行 Lean 代碼,並由 Lean 核心驗證、未使用未證明的占位。這些示例最好被解讀為智能體研究工作流程的展示,而非自主科學發現的證據。
網站、簡報、影片與音樂
MiMo-V2.6 能協調前端程式設計、設計工作流程、投影片、SVG 素材、影片管線與音樂製作工具。Xiaomi 展示以專門的媒體系統進行協作(包括透過 MiMo-V2.5-TTS 的旁白),而非宣稱 V2.6 自身取代所有影像、視訊或音訊生成器。因此,該模型自然適合作為創意製作的協作編排者。
本節所述用例皆為 Xiaomi 的展示,而非獨立證據,不能保證每次部署皆能重現相同結果。生產團隊應使用自身的工具、權限、故障恢復與評估標準來測試模型。
Xiaomi MiMo-V2.6 價格是多少?
| 定價 | MiMo-V2.6-Pro | MiMo-V2.6-Flash | Pro UltraSpeed |
|---|---|---|---|
| 快取輸入 / 每 1M tokens | $0.0036 | $0.0028 | $0.036 |
| 未快取輸入 / 每 1M tokens | $0.435 | $0.14 | $4.35 |
| 輸出 / 每 1M tokens | $0.87 | $0.28 | $8.70 |
Xiaomi 將 V2.6 API 定價維持在與 V2.5 世代大致相同的水準。對於高吞吐工作負載,Flash 尤為值得注意:官方 Xiaomi 定價顯示未快取輸入每百萬 token 為 $0.14、輸出每百萬 token 為 $0.28。

CometAPI 定價與供應情況
| CometAPI 路由 | Input / 1M | Output / 1M | 目錄狀態 |
|---|---|---|---|
| mimo-v2.6-pro-ultraspeed | $3.48 | $6.96 | 可用;低於官方未快取費率 20% |
| mimo-v2.6-pro | $0.348 | $0.6960 | 可用;低於官方未快取費率 20% |
| mimo-v2.6-flash | $0.112 | $0.2240 | 可用;低於官方未快取費率 20% |
開發者如何存取 Xiaomi MiMo-V2.6?
Xiaomi 透過與 OpenAI 相容的 API 對外提供模型,並在官方模型頁面上說明與 Anthropic 協議的相容性。官方識別符為 mimo-v2.6-pro、mimo-v2.6-flash 與 mimo-v2.6-pro-ultraspeed。Xiaomi 文件涵蓋工具呼叫、結構化輸出、串流、推理控制、上下文快取與網頁搜尋。與 OpenAI 相容的介面使用 thinking.type 值,如 enabled 或 disabled;V2.6 模型預設啟用深度思考。
開發者有三種實務存取方式。其一,下載 Pro 或 Flash 的開放權重 checkpoint 以自我託管整合,但需可觀的服務資源。其二,使用 Xiaomi 的受管 API,搭配 Xiaomi 金鑰與其文件化端點。其三,使用支援的 CometAPI 路由,搭配 CometAPI 金鑰與 base URL;這能簡化多模型評測與計費。像 Claude Code 這類程式設計助理可在相容時使用與 Anthropic 相容的路由,但相容性必須測試而非想當然。
透過 CometAPI 存取 MiMo-V2.6
CometAPI 為支援的模型提供統一端點與計費層。主要的操作優勢是遷移簡單:團隊可保留熟悉的 SDK,只需更改 base URL 與模型 ID,即可在同一帳戶下將 MiMo 與其他前沿模型比較,並集中化使用量、定價與可用性檢查。這對多模型路由、降級備援、合併帳單與需要對多提供者使用相同提示的評測尤為有用。
CometAPI 在平台層級文件化了三種文字請求格式:OpenAI Chat Completions、Anthropic Messages 與 OpenAI Responses。對於相容 SDK,遷移通常意味著更改 base URL、API 金鑰與模型 ID,而非重寫整個應用。端點與參數支援可能因模型而異,因此在宣稱三種路徑都可用之前,請先測試確切的 MiMo-V2.6 變體與請求格式。
截至 2026 年 9 月 23 日檢查,MiMo-V2.6-Pro-UltraSpeed 在目錄中有可用路由並列出輸入與輸出價格。Pro 與 Flash 的專頁在目錄截圖上顯示 Coming soon,但其 API 健康面板顯示 Available。將此視為頁面訊號不一致,而非已確認的生產可用性或定價。在部署前,請檢查即時目錄、儀表板與一個測試請求。
下例遵循 CometAPI 發布的 Anthropic-SDK 範式,並呼叫目前列出的 UltraSpeed 路由。請將 API 金鑰存於環境變數。
import Anthropic from '@anthropic-ai/sdk';
const client = new Anthropic({
apiKey: process.env.COMETAPI_KEY,
baseURL: 'https://api.cometapi.com',
});
const message = await client.messages.create({
model: 'mimo-v2.6-pro-ultraspeed',
max_tokens: 4096,
messages: [{ role: 'user', content: 'Analyze this project and propose the next implementation steps.' }],
});
Xiaomi MiMo-V2.6 是開源的嗎?
Xiaomi 已釋出模型權重、技術資料、RL 資源、訓練環境與相關基礎設施。此次釋出包含超過 7,000 個 RL 任務環境,涵蓋軟體工程、漏洞重現、知識密集工作與網頁設計/開發。Xiaomi 亦釋出 MiMo-V2.6-Distill-Qwen-9B,讓研究人員能在更小規模上研究 RL 管線。
官方模型卡:MiMo-V2.6-Pro-RL | MiMo-V2.6-Flash-RL
Xiaomi MiMo-V2.6 的限制是什麼?
兆級參數的標題不應被視為 V2.6 普遍強於封閉前沿系統的證據。Xiaomi 自身的基準表顯示結果不一:Claude Opus 5 在部分程式、工具使用與作業系統基準上仍領先,GPT-5.6 Sol 在部分測試中也領先。因此,基於特定工作負載的評估比籠統的「贏家」標籤更有意義。
自我託管完整的 Pro checkpoint 也需要重型基礎設施。開放權重並不意味著能輕鬆在工作站部署。此外,多個亮點展示——研究、具身控制、3D 世界與影片製作——皆依賴外部工具與智能體基座。MiMo-V2.6 應被作為系統中的一個模型進行評估,而非僅作為單一對話模型。
為什麼 Xiaomi MiMo-V2.6 很重要?
MiMo-V2.6 結合了三個重要方向:超大型稀疏 MoE 模型、原生多模態,以及在真實智能體環境中的強化學習。1.02T 的參數數字固然吸睛,但更關鍵的設計選擇是 Xiaomi 在反覆的環境互動、軌跡評分、工具使用與自我修正上的投入。
若這條路線持續擴展,開放模型可能不再僅以靜態知識多寡區分,而更在於其行動、評估、恢復與完成長任務的效能。MiMo-V2.6 因此最好被理解為一個面向智能體的開放基礎模型,而非僅僅是另一個兆級參數的 chatbot。
結論
MiMo-V2.6 是一次重要的開放權重發佈,因為它結合了原生文字、圖像、視訊與音訊輸入、長上下文、稀疏 MoE 推論,以及跨實際智能體環境的強化學習。Pro 更適合艱難的長程任務,Flash 面向高吞吐與對成本敏感的工作負載,UltraSpeed 則以顯著更高的 API 價格換取更低延遲。
該模型家族在多個由供應商報告的智能體基準上具競爭力,但並未領先所有評測,也不應被視為封閉前沿模型的普遍替代。最可靠的採用路徑,是用預期的生產工作流程之工具、延遲目標、故障型態與成本輪廓,來測試 MiMo-V2.6。
常見問題
團隊在將 MiMo-V2.6 導入生產前應測試什麼?
請測試完整系統而非僅模型本身。衡量任務完成率、工具呼叫準確度、失敗動作恢復、延遲、token 消耗、上下文管理與權限邊界。智能體基準提供參考,但內部評估應鏡像實際的倉庫、瀏覽器、文件或研究工作流程。
為何即使是稀疏架構,自我託管 MiMo-V2.6-Pro 仍然困難?
稀疏啟用相較稠密的兆級模型降低了每 token 計算量,但完整 checkpoint 仍有極大的記憶體與分散式服務足跡。生產部署可能需要多節點推論、專家並行、特殊核心與審慎的容量規劃。
開發者應如何解讀 Xiaomi 的跨模型基準表?
將其視為供應商報告的證據,而非獨立重現的普遍排名。結果會隨智能體基座、推論預算、工具、環境映像、取樣方法與基準版本而變。請跨多項任務比較趨勢,並在內部重現最相關的工作負載。
何時 MiMo-V2.6-Flash 比 Pro 更適合?
當呼叫量與成本占主導時,尤其是文件處理、多模態分析與重複的智能體步驟,Flash 是更強的預設選擇。當困難推理或長程執行能帶來足夠商業價值以支撐更高價格時,Pro 更為合適。
1M-token 上下文視窗是否消除了檢索或提示管理的需求?
沒有。更大的視窗提高容量,但傳送不必要的歷史會提升延遲與成本,且可能稀釋相關證據。檢索、摘要、結構化記憶與上下文修剪在可靠的生產智能體中仍然重要。
