TL;DR
Meta 在 released Muse Spark 1.2 中發佈了針對 Muse Spark 1.1 的編碼強化更新。它面向程式碼生成、複雜除錯、儲存庫理解與端到端開發者工作流程,而非一次全面的規格重置。該模型保留 1M-token 上下文視窗,接受文字、影像、影片與 PDF 作為輸入,並產生文字輸出。
本次發佈的關鍵在於模型與 Muse Code 的關係。Meta 透過 co-trained the model with Muse Code,結合代理軌跡、目標條件化、上下文壓縮、子代理行為與編碼工具集本身進行共同訓練。這使 Muse Spark 1.2 在 Meta 自家編碼環境中特別有吸引力,但同時也意味著最強的發佈分數應解讀為「模型+代理系統」的結果。
在 Meta 的編碼評測 中,Muse Spark 1.2 搭配 Muse Code 在 Terminal-Bench 2.1 上取得 82.9%,在 DeepSWE 1.1 上取得 59.3%。Artificial Analysis 模型頁目前報告的 Intelligence Index 分數為 57,取代先前索引版本下的發佈分數 54。其最新的 GDPval-AA v2 評級 為 1,623 Elo,位列 213 個受評模型中的第 15 名。因此,Muse Spark 1.2 在編碼與代理型工作上仍具競爭力,但並非整體領先者;Claude Opus 5 在 Meta 的重點編碼基準與當前 GDPval-AA v2 排行上都更勝一籌。
Key Takeaways
- Coding-first update: Muse Spark 1.2 將提升集中於生成、除錯、程式碼庫理解與長時開發者工作流。
- 1M-token context: API 列出 1,048,576-token 的上下文視窗,支援儲存庫級工作與持續的代理會話。
- Multimodal input: 代管模型接受文字、影像、影片與 PDF 文件,並回傳文字。
- Agent-system optimization: 模型針對 Muse Code 的規劃、工具、壓縮與子代理模式進行了訓練優化。
- Strong but harness-dependent coding results: Meta 報告在 Muse Code 下,Terminal-Bench 2.1 為 82.9%,DeepSWE 1.1 為 59.3%。
- Competitive API economics: 標準定價為每百萬輸入 Token $1.25、快取輸入 $0.15、輸出 $4.25;Contributor 階層在不同資料條款下價格更低。
- Important caveat: 未公開參數規模、架構與訓練 Token 數。
What Is Muse Spark 1.2?
Muse Spark 1.2 是 Meta Superintelligence Labs 的針對編碼最佳化之多模態推理模型。Meta 將其描述為 Muse Spark 1.1 的更新版本,在程式碼生成、複雜除錯、程式碼庫理解與完整開發者工作流方面皆有所改進。本次發佈同時搭配了 Muse Code beta,一款終端機編碼代理,能規劃變更、撰寫程式碼、執行工具、協調持續性子代理,並在大型儲存庫中驗證結果。
這樣的定位很重要。Muse Spark 1.2 並非主要作為更好的聊天機器人或更大的通用模型來行銷。它是圍繞讓軟體代理變難的條件而設計:需求分散在多個檔案、終端輸出不斷累積、測試反覆失敗、計畫不斷調整、長時間會話,以及在眾多中間步驟後仍需守住原始目標。
Muse Spark 1.2 Specifications
| Specification | Muse Spark 1.2 |
|---|---|
| Developer | Meta Superintelligence Labs |
| Release date | August 5, 2026 |
| API model ID | muse-spark-1.2 |
| Model type | Proprietary multimodal reasoning and coding model |
| Primary focus | Coding agents, debugging, repository understanding, long-horizon development |
| Context window | 1,048,576 tokens |
| Input modalities | Text, image, video, PDF |
| Output modality | Text |
| Reasoning setting in Meta evaluation | xhigh |
| Tool profile | Tool calling and agent-oriented workflows |
| Standard price | $1.25/M input; $0.15/M cached input; $4.25/M output |
| Public parameter count | Not disclosed |
| Public architecture details | Not disclosed |
| Launch deployment | Muse Code and Meta Model API |
Specification note: Meta's model documentation 提供模型定位、上下文與定價;代管 API 文件提供支援的輸入與輸出模態。部署限制可能與基礎模型的理論能力有所不同。
What Is New in Muse Spark 1.2?
More Coding Training
Meta 表示顯著增加了在編碼任務上的訓練運算量,同時擴充了訓練環境的多樣性。實際目標不僅是產生正確片段,還要提升首次嘗試的成功率,特別是在代理必須檢視陌生儲存庫、找出相關檔案、實作變更、執行建置或測試,並依據回饋修正工作的情境下。
這使得此次更新相較單回合程式碼生成,更貼近生產工程的需求。實際的儲存庫包含框架慣例、隱性耦合、不完整文件、脆弱測試,以及無法僅靠編輯單一函式就能滿足的需求。Muse Spark 1.2 是針對更大任務邊界明確訓練而來。
Co-Training With Muse Code
Meta 以 co-trained Muse Spark 1.2 with Muse Code 的方式,讓模型更貼合代理的工具集與執行時環境。訓練包含對抗式篩選的工具軌跡,以及針對目標、上下文壓縮與子代理的配方最佳化。這比起在訓練後把通用模型接上命令列包裝器更為縝密。
好處是相容性:模型學會工具回饋的樣貌、何時需要修正計畫、背景工作者如何溝通,以及在上下文壓縮時哪些狀態必須被保留。取捨在於可移植性:針對某個工具框架調校的模型仍可在其他環境運作,但最佳結果可能仰賴其訓練中見過的提示、工具、記憶系統與控制迴圈。
Long-Horizon Coding
Muse Spark 1.2 受訓於 whole-repository generation and long projects,包括自動化研究工作流。Meta 強調三種行為:以規劃串接工作、透過目標條件化保持代理朝原始目標前進、以及上下文壓縮以在會話變長時保留關鍵知識。
這些機制處理了編碼代理常見的失敗模式:系統在局部上有效率,卻在整體上迷失方向。它可能修了某個測試卻破壞了需求、重複先前的調查,或忘了某項設計決策的理由。長期跨度訓練旨在讓進展可累積,而非零散。
Self-Improvement With Muse Spark 1.1
Meta 也使用 Muse Spark 1.1 生成具挑戰性的編碼環境與指令遵循範本。較早的模型依據生成的需求對候選解答進行評分,為 Muse Spark 1.2 創造可擴展的訓練資料。這可理解為模型協助的任務生成與評估,而非在部署模型上不受限的自我修改。
Multimodal Repository Work
1M-token 視窗與多模態輸入十分關鍵,因為許多開發工作並非純文字。代理可能需要將前端與螢幕截圖對照、檢視 PDF 規格、解讀 UI 錄影,或在編輯程式碼時維持視覺需求。發佈示範中,Muse Code 解讀家居導覽影片並產出行銷與預訂頁面,展示了從感知到實作的工作流程。
Muse Spark 1.2 vs Muse Spark 1.1: What Actually Changed?
| Muse Spark 1.1 | Muse Spark 1.2 | |
|---|---|---|
| Context | 1M | 1M |
| Standard Input | $1.25 | $1.25 |
| Standard Output | $4.25 | $4.25 |
| Intelligence Index | 53 current | 57 current |
| Terminal-Bench | 78% AA | 80% AA |
| Coding focus | High | Higher |
| Muse Code co-training | No | Yes |
| Long-horizon training | Yes | Expanded |
| Open weights | No | No |
How Muse Spark 1.2 Works With Muse Code
Muse Spark 1.2 是模型;Muse Code 則是將模型呼叫轉化為持續性軟體工程工作的代理產品。Muse Code 在主代理旁執行異步的背景代理,並在整個會話期間保持活躍。這些工作者可以收集上下文、執行下一步,並將相關發現回報給主代理,而無需為每個任務重新建立。
執行時還維護在地事件日誌。每次模型呼叫、工具執行、批准與編輯都會附加到同一段歷史中,讓代理在崩潰後能恢復,而不是重頭再來。像 /plan、/grill 與 /goal 這類內建技能則提供了經批准門檻的規劃、對規劃的壓力測試,以及以目標為導向的執行。

Figure 1. Muse Code 將 Muse Spark 1.2 轉化為持續性的規劃、執行與驗證系統。來源: Meta launch description
Interpretation: Muse Code 的持久性、事件日誌、工具與子代理編排是系統能力,不應歸因於基礎模型本身。
Benchmark Performance of Muse Spark 1.2
以下結果由 Meta 報告。編碼分數衡量的是完整的模型+代理系統,而稍後的多模態綜合測量則比較啟用與未啟用工具的 Meta Model API 配置。這些不應與後續獨立的 Artificial Analysis 指標混為一談。
Coding Benchmark Performance
| Meta coding benchmarks | Muse Spark 1.2 result | Leading comparison in Meta's chart | Evaluation scope | How to read it |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% with Muse Code | Claude Opus 5: 86.7% with Claude Code | Terminal tasks in selected coding agents | Vendor-reported system result |
| DeepSWE 1.1 | 59.3% with Muse Code | Claude Opus 5: 65.0%; GPT-5.6 Terra: 64.8% | 113 tasks, 91 repositories, five languages | Vendor-reported system result |
| Meta Internal Coding Bench | 70.6% | Claude Opus 5: 79.4% | 440 private tasks derived from Meta pull requests | Private and not independently reproducible |
Meta 的 evaluation methodology 為 Muse Spark 1.2 使用 Muse Code,為 Claude Opus 5 使用 Claude Code,為 GPT-5.6 Terra 使用 Codex,為 Grok 4.5 使用 Grok Build。因此更高的分數可能同時反映了模型、代理迴圈、提示、工具與記憶設計。較準確的表述是 Muse Spark 1.2 在 Muse Code 中取得 82.9%,而非單指基礎模型取得 82.9%。
Multimodal Benchmark Performance
Meta 的 8 月 20 日多模態評測 報告了在視覺感知、視覺知識、空間與 UI 推理、以及圖表理解等十個基準上的綜合分數。最大增益出現在 Muse Spark 1.2 能使用工具時。
| Meta multimodal evaluation | Direct response | With tools | Tool uplift | Interpretation |
|---|---|---|---|---|
| Muse Spark 1.2 | 59.8 | 72.0 | +12.2 | 啟用工具配置下更強 |
| Muse Spark 1.1 | 60.2 | 69.1 | +8.9 | 未啟用工具時略高,啟用工具時較低 |
官方的 multimodal methodology 將 BabyVision、PerceptionBench、ZeroBench、WorldVQA、SimpleVQA、ERQA、OmniSpatial、CharXiv Reasoning、ChartMuseum 與 ChartQAPro 等十項指標等權平均。該比較對於衡量 Meta 框架內的工具帶來提升很有用;但它不是獨立重現的基準。
Independent Benchmark Results
在當前的 Artificial Analysis Intelligence Index v4.1.1 下,Muse Spark 1.2 得分 57,相較於 Muse Spark 1.1 的 53,以及原始 Muse Spark 的估計 44。其最新的 GDPval-AA v2 評級 為 1,623 Elo,位列 213 個受評模型中的第 15。Muse Spark 1.2 也領先當前的 AA-LCR 長上下文基準(83.3%),顯示其優勢延伸至代理型知識工作、編碼工作流與長上下文推理。
| Evaluation | Score | Environment | What it tells you |
|---|---|---|---|
| Meta Terminal-Bench 2.1 | 82.90% | Muse Code | Model + Meta's optimized agent |
| Artificial Analysis Terminal-Bench 2.1 | 80% | AA harness | More independent cross-model signal |
| Meta DeepSWE 1.1 | 59.30% | Muse Code | Long-horizon coding |
| Meta Internal Coding | 70.60% | Meta internal | Internal engineering tasks |

可靠性資料需要謹慎解讀。AA-Omniscience 從 18 提升至 22,幻覺率從 38% 降至 28%,但嘗試率也從 82% 降至 67%;準確率由 41% 降至 38%。換言之,Muse Spark 1.2 在不確定時更傾向於避免作答,這降低了錯誤主張,但也使嘗試回答的比例變少。
科學推理相對持平。CritPt 從 15% 升至 18%,SciCode 從 58% 降至 56%,Humanity's Last Exam 從 45% 降至 44%。此模式也支持 Meta 的定位:Muse Spark 1.2 是專注於編碼與代理的更新,而非在所有推理領域整齊躍進。
Muse Spark 1.2 Pricing
Meta 提供 Standard 與 Contributor 存取。Standard 模型定價為每百萬輸入 Token $1.25、每百萬快取輸入 $0.15、每百萬輸出 $4.25。Contributor 變體價格大幅降低,但 Meta 表示其資料可能被用於改進產品。
| Tier | Input / 1M | Cached input / 1M | Output / 1M | Data treatment |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | Not used to improve Meta products |
| Contributor | $0.10 | $0.002 | $0.20 | May be used to improve Meta products |
Pricing source: Meta's official model page。團隊應在經由 Contributor 路徑傳送專有程式碼、憑證、客戶資料或內部文件前,審閱適用的產品與資料條款。
低 Token 價格不必然意味著完成任務的最低成本。Artificial Analysis 估算 Muse Spark 1.2 的每個 Intelligence Index 任務約 $0.40,高於 Muse Spark 1.1 的 $0.29。成本上升主要來自更高的 Token 使用,尤其在專業的代理型工作上。因此團隊應衡量每個被接受的 Pull Request、已解決問題或已驗證交付物的成本,而不是只比較標價。
Muse Spark 1.2 vs Other Frontier Coding Models
最相關的比較集包括 Claude Opus 5、GPT-5.6 Terra、Grok 4.5、以及 Kimi K3。這些模型在編碼、工具、長上下文與專業代理工作流方面重疊,但在部署方式、模態廣度、生態系與性價比優先級上有所不同。
| Model | Context | Inputs | Terminal-Bench 2.1 signal | Deployment | Best fit |
|---|---|---|---|---|---|
| Muse Spark 1.2 | 1M | Text, image, video, PDF | 82.9% with Muse Code | Meta hosted API | Muse Code、長時儲存庫工作、較低 API 價格 |
| Claude Opus 5 | 1M | Text, image, documents | 86.7% with Claude Code | Hosted API | 最高的編碼可靠性與複雜代理判斷 |
| GPT-5.6 Terra | ~1.05M | Text, image | 81.8% with Codex | Hosted API | 在編碼、生產力與廣泛工具工作流之間取得平衡 |
| Grok 4.5 | 500K | Text, image | 81.6% with Grok Build | Hosted API | 結合 xAI 工具與即時資訊的編碼 |
| Kimi K3 | 1M | Text, image, video | Not shown in Meta chart | Hosted and open-weight options | 長期任務與部署彈性 |
Where Muse Spark 1.2 Has the Clearest Advantage
當應用能利用 Muse Code 的持久事件日誌、子代理設計與模型特定訓練時,Muse Spark 1.2 的差異化最為明顯。其標準 API 價格相對高階前沿編碼模型也更具侵略性。對重視緊密整合代理系統的團隊而言,這種組合可能比單一基準上的小幅差距更重要。
Where Claude Opus 5 Remains Stronger
Claude Opus 5 在 Meta 所呈現的三個編碼圖表中皆領先。當失敗變更的代價很高、且端到端的編碼可靠性比 Token 價格更重要時,它仍是更安全的選擇。Muse Spark 1.2 縮小了差距,尤其在終端任務上,但尚未抹平差異。
Where GPT-5.6 Terra Fits
GPT-5.6 Terra 在 Meta 的評測中,Terminal-Bench 與 Muse Spark 1.2 接近、DeepSWE 略勝。其優勢是廣度:已使用 OpenAI 的 response、search、file、shell、computer、MCP 工具的團隊,即便另一款模型稍微便宜,也可能偏好能無縫融入既有生產堆疊的模型。
When Grok 4.5 or Kimi K3 May Be Better
對結合編碼、xAI 即時資訊與工具生態的工作流,Grok 4.5 是強勁替代方案。當長期任務表現、開源權重部署或供應商掌控更重要時,Kimi K3 更具吸引力。實際選擇取決於完整執行時:提示、工具、記憶、資安需求與驗證策略,往往與基礎模型本身同等重要。
What Can Muse Spark 1.2 Do?
Repository-Scale Software Engineering
1M-token 上下文可容納大量原始碼、文件、測試輸出、Issue 歷史與代理狀態。適合的任務包括多檔案功能、框架升級、整個儲存庫的重構、API 遷移、測試修復、Pull Request 審查與架構分析。長上下文搭配檢索與壓縮最有價值,而非不加選擇地載入整個儲存庫。
Complex Debugging
Muse Spark 1.2 能檢視程式碼、執行工具、閱讀失敗、形成假設、套用修補並重新測試。其編碼導向訓練旨在改進這個迴圈;難點不在於提出似是而非的修補,而是找出根因並驗證修補不會造成回歸。
Long-Running Coding Agents
持續性的專案是核心用例。Muse Code 的事件日誌與背景代理允許工作在多次模型呼叫與工具步驟間持續進行。這對於升級、效能調校、文件生成、測試現代化,以及無法在一次回應中安全完成的功能切片特別有用。
Automated Technical Research
Meta 在超過 1,000 次工具呼叫、長達 24 小時的情境中測試了 Muse Spark 1.2 的 GPU 核心最佳化。代理撰寫、編譯、剖析並改進 Triton 實作,與參考基準對照。更廣泛的啟示是:該模型適用於由實驗驅動、逐步指引下一動作的迭代技術工作。
Multimodal Development
影像、影片與 PDF 輸入將開發迴圈擴展至程式碼以外。團隊可以利用模型對照 UI 與截圖、從產品文件抽取需求、解讀錄製互動,或從視覺參考生成實作。對於可及性、品牌一致性、安全性與視覺內容中蘊含的事實陳述,仍需要人工審查。
When should you NOT use Muse Spark 1.2?
Don't choose it primarily for:
- 簡單聊天
- 基礎程式碼補全
- 低延遲自動完成
- 一般寫作
- 以最大基準可靠性為首要考量的任務
- 若 Contributor 資料條款不合適之高度受管制工作負載
Limitations of Muse Spark 1.2
- Undisclosed architecture: Meta 未公開參數規模、模型拓撲、專家路由或訓練 Token 數。
- Harness-dependent launch results: 最強分數來自 Muse Spark 1.2 搭配 Muse Code,而競品使用不同的編碼產品。
- Private internal benchmark: Meta Internal Coding Bench 無法由外部獨立重現或稽核。
- Uneven capability gains: 獨立評測顯示在代理型工作上提升更大,而在科學推理上較有限。
- Abstention trade-off: 較低的幻覺率伴隨較低的嘗試率,以及在 AA-Omniscience 上略低的準確率。
- Data-policy choice: 最便宜的 Contributor 階層可能使用提交的資料來改進 Meta 產品,不一定適合敏感程式碼。
- Long context is not perfect memory: 1M-token 限制不保證在每個位置都有一致的檢索、注意力或準確性。
- Hosted launch: 發佈提供的是 API 與 Muse Code 存取,而非可下載的模型權重。
How to Access Muse Spark 1.2
開發者可透過 Muse Code 或 Meta Model API 使用 Muse Spark 1.2。標準 API 模型 ID 為 muse-spark-1.2;較低成本的 contributor 路徑使用 muse-spark-1.2-contributor。Meta 的代管 API 提供與 OpenAI 相容的基底 URL,使許多既有的 chat-completions 用戶端只需更換金鑰、基底 URL 與模型名稱即可適配。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODEL_API_KEY"],
base_url="https://api.meta.ai/v1",
)
response = client.chat.completions.create(
model="muse-spark-1.2",
messages=[
{"role": "user", "content": "Review this repository plan and identify the highest-risk implementation steps."}
],
)
print(response.choices[0].message.content)
Implementation note: 在部署前,請於 Meta's API documentation 驗證有效模型名稱、帳號資格、速率限制、支援參數與區域可用性。不要將 API 金鑰直接寫入原始碼。
對於並排測試,CometAPI 已提供可統一存取的 Claude Opus 5、GPT-5.6、Grok 4.5、以及 Kimi K3,這有助於簡化 A/B 測試與供應商切換。Muse Spark 1.2 也即將登上 CometAPI。
Is Muse Spark 1.2 Worth Using?
當工作負載以儲存庫級編碼、長時間執行、反覆的工具回饋與多代理協作為主時,Muse Spark 1.2 值得測試。其最強論點是:編碼專精模型、專為此目的打造的持續性代理、1M-token 多模態上下文,以及較低的標準 API 價格的結合。
它並非通用基準的領跑者。Claude Opus 5 在 Meta 的重點編碼評測中仍領先,GPT-5.6 Terra 在編碼與一般生產工具上也極具競爭力,且獨立資料顯示 Muse Spark 1.2 的提升是集中而非均勻。因此最佳選擇流程應以工作負載為準:在實際代理執行時中測試各模型、衡量經驗證的任務完成率,並對安全敏感或高影響變更納入人工審查。
Bottom line:
Muse Spark 1.2 是迄今為止 Meta 在 Muse 系列中最強的編碼導向更新。其真正的差異化不在於單一基準分數,而在於模型、Muse Code、持續性子代理、長上下文與驗證迴圈之間的緊密設計整合。
