TL;DR
Meta は、Muse Spark 1.1 のコーディング特化アップデートとして Muse Spark 1.2 をリリース した。これは広範な仕様刷新というより、コード生成、複雑なデバッグ、リポジトリ理解、エンドツーエンドの開発者ワークフローに向けて設計されている。モデルは 1M トークンのコンテキストウィンドウを維持し、テキスト・画像・動画・PDF を入力として受け取り、出力はテキストである。
このリリースで最も重要なのは、モデルと Muse Code の関係だ。Meta はエージェント軌跡、目標条件付け、コンテキスト圧縮、サブエージェント動作、およびコーディング用ツールセットを用いて Muse Code と共同学習 させた。これにより、Muse Spark 1.2 は Meta 自社のコーディング環境で特に魅力的だが、最良のローンチスコアはモデル+エージェントシステムの結果として読むべきことも意味する。
Meta のコーディング評価 では、Muse Spark 1.2 を Muse Code と組み合わせると Terminal-Bench 2.1 で 82.9%、DeepSWE 1.1 で 59.3% を記録した。Artificial Analysis の現在のモデルページには Intelligence Index スコア 57 が報告されており、旧版の指標下でのローンチスコア 54 を置き換えている。直近の GDPval-AA v2 評価 は 1,623 Elo で、評価対象 213 モデル中 15 位だ。したがって Muse Spark 1.2 は、コーディングとエージェント的作業で競争力を保っているが全体のトップではなく、Meta の看板コーディングベンチマークと現行 GDPval-AA v2 のランキングの両方で Claude Opus 5 が先行している。
Key Takeaways
- コーディング重視のアップデート: Muse Spark 1.2 は生成、デバッグ、コードベース理解、長時間の開発者ワークフローに改善を集中
- 1M トークン・コンテキスト: API は 1,048,576 トークンのコンテキストウィンドウを掲示し、リポジトリ規模の作業や持続的なエージェントセッションを想定
- マルチモーダル入力: ホストモデルはテキスト・画像・動画・PDF を受け取り、テキストを返す
- エージェントシステム最適化: Muse Code の計画、ツール、圧縮、サブエージェントのパターンで動作するよう訓練
- 強いがハーネス依存のコーディング成果: Meta は Muse Code と組み合わせて Terminal-Bench 2.1 で 82.9%、DeepSWE 1.1 で 59.3% を報告
- 競争力のある API エコノミクス: 標準価格は入力量 $1.25/M、出力量 $4.25/M。異なるデータ条件の下で大幅に安価な Contributor ティアも提供
- 重要な但し書き: 公開のパラメータ数、アーキテクチャ、学習トークン数は未開示
What Is Muse Spark 1.2?
Muse Spark 1.2 は Meta Superintelligence Labs のコーディング最適化マルチモーダル推論モデルである。Meta は、Muse Spark 1.1 のアップデートとして、コード生成、複雑なデバッグ、コードベース理解、完全な開発者ワークフローを改善したと説明している。リリースは Muse Code beta と対で提供され、これは大規模リポジトリにわたって、変更の計画、コード記述、ツール実行、持続的サブエージェントの調整、結果検証を行うターミナル型コーディングエージェントだ。
この位置付けは重要だ。Muse Spark 1.2 は、より良いチャットボットやより大型の汎用モデルとして主に売り出されてはいない。要件が多くのファイルに分散し、端末出力が蓄積し、テスト失敗が繰り返され、計画が変化し、長いセッションが続き、多くの中間ステップを経ても当初の目的を保持する必要がある、といったソフトウェアエージェントを難しくする条件に合わせて設計されている。
Muse Spark 1.2 Specifications
| Specification | Muse Spark 1.2 |
|---|---|
| Developer | Meta Superintelligence Labs |
| Release date | 2026年8月5日 |
| API model ID | muse-spark-1.2 |
| Model type | 独自のマルチモーダル推論・コーディングモデル |
| Primary focus | コーディングエージェント、デバッグ、リポジトリ理解、長期的な開発 |
| Context window | 1,048,576 tokens |
| Input modalities | Text, image, video, PDF |
| Output modality | Text |
| Reasoning setting in Meta evaluation | xhigh |
| Tool profile | ツール呼び出しとエージェント指向のワークフロー |
| Standard price | $1.25/M input; $0.15/M cached input; $4.25/M output |
| Public parameter count | 非公開 |
| Public architecture details | 非公開 |
| Launch deployment | Muse Code and Meta Model API |
Specification note: Meta のモデルドキュメント はモデルの位置付け、コンテキスト、価格を提供し、ホスト API ドキュメントは対応する入出力モダリティを提供する。デプロイ上の制約は、基礎モデルの理論上の能力と異なる場合がある。
What Is New in Muse Spark 1.2?
More Coding Training
Meta はコーディングタスクへの学習計算量を大幅に増やすとともに、学習環境の多様性を拡大したという。実務上の目標は、正しいスニペットを生成するだけでなく、未知のリポジトリを調査し、関連ファイルを特定し、変更を実装し、ビルドやテストを実行し、フィードバック後に作業を修正する必要がある場面での初回精度を高めることだ。
これは単一ターンのコード生成での向上より、プロダクションエンジニアリングにとって重要性が高い。実際のリポジトリにはフレームワークの慣習、隠れた結合、不完全なドキュメント、脆いテストが存在し、単一の関数を編集するだけでは満たせない要件もある。Muse Spark 1.2 は、そのより大きなタスク領域に明示的に合わせて訓練されている。
Co-Training With Muse Code
Meta は、モデルがエージェントのツールセットとランタイムにより適合するように Muse Code と共同学習 した。学習には、拒否サンプリングしたハーネス軌跡や、目標、コンテキスト圧縮、サブエージェントに関するレシピ最適化が含まれる。これは、学習後に一般モデルをコマンドラインラッパーに接続するのとはより意図的に異なる。
利点は互換性だ。モデルは、ツールからのフィードバックがどのように見えるか、いつ計画を修正すべきか、バックグラウンド作業者がどのように通信するか、どの状態がコンテキスト圧縮中も保持されるべきかを学習する。一方でトレードオフは移植性である。特定のハーネスに合わせたモデルは他所でも動くが、最良の結果は、訓練中に見たプロンプト、ツール、メモリシステム、制御ループに依存する可能性がある。
Long-Horizon Coding
Muse Spark 1.2 は、リポジトリ全体の生成や長期プロジェクト に対しても訓練されており、自動リサーチのワークフローも含まれる。Meta は三つの挙動を強調する。作業を順序化するための計画、エージェントを当初の目的に向け続けるための目標条件付け、セッション拡大時にも重要知識を保持するためのコンテキスト圧縮である。
これらは、コーディングエージェントの一般的な失敗モードに対処する。すなわち、局所的には生産的でも大局的に道に迷うという問題だ。テストを直す一方で要件を破ったり、以前の調査を繰り返したり、なぜ設計上の選択がなされたかを忘れたりする。長期スパンの訓練は、進捗を断続的ではなく累積的にすることを意図している。
Self-Improvement With Muse Spark 1.1
Meta はまた、Muse Spark 1.1 を用いて難易度の高いコーディング環境と指示追従テンプレートを生成した。前モデルが生成要件に対する候補解を採点し、Muse Spark 1.2 用のスケーラブルな学習データを作成した。これは、デプロイ済みモデルを無制限に自己改変するのではなく、モデル支援によるタスク生成と評価として理解するのが適切である。
Multimodal Repository Work
1M トークンのウィンドウとマルチモーダル入力は、開発タスクの多くがテキストのみではないため重要だ。エージェントはフロントエンドをスクリーンショットと比較し、PDF の仕様を確認し、UI の録画を解釈し、コード編集中に視覚的要件を維持する必要があるかもしれない。Muse Code が家のフライスルー動画を解釈してマーケティングと予約のページを生成するデモは、この知覚から実装へのワークフローを示している。
Muse Spark 1.2 vs Muse Spark 1.1: What Actually Changed?
| Muse Spark 1.1 | Muse Spark 1.2 | |
|---|---|---|
| Context | 1M | 1M |
| Standard Input | $1.25 | $1.25 |
| Standard Output | $4.25 | $4.25 |
| Intelligence Index | 53 current | 57 current |
| Terminal-Bench | 78% AA | 80% AA |
| Coding focus | High | Higher |
| Muse Code co-training | No | Yes |
| Long-horizon training | Yes | Expanded |
| Open weights | No | No |
How Muse Spark 1.2 Works With Muse Code
Muse Spark 1.2 はモデルであり、Muse Code はモデル呼び出しを持続的なソフトウェアエンジニアリング作業に変えるエージェント製品だ。Muse Code は、メインエージェントと、セッションを通じて存続する非同期バックグラウンドエージェントを並行して実行する。これらのワーカーは、コンテキストを収集し、次のステップを実行し、毎回のタスクで再生成されることなく、関連する知見をメインエージェントへ伝達できる。
ランタイムはローカルのイベントログも維持する。すべてのモデル呼び出し、ツール実行、承認、編集が一つの履歴に追加され、エージェントはクラッシュ後にタスクを最初からやり直すのではなく再開できる。/plan、/grill、/goal のようなビルトインスキルは、承認ゲート付きの計画、計画のストレステスト、目的指向の実行を追加する。

Figure 1. Muse Code は Muse Spark 1.2 を持続的な計画・実行・検証システムへと変換する。出典: Meta のローンチ説明
Interpretation: Muse Code の持続性、イベントログ、ツール、サブエージェントのオーケストレーションはシステム機能であり、ベースモデル単体に帰すべきではない。
Benchmark Performance of Muse Spark 1.2
以下の結果は Meta の報告による。コーディングスコアはモデルとエージェントのシステム全体を測定する。一方、後段のマルチモーダル複合は、ツールあり/なしの Meta Model API 構成を用いる。これらを独立系の Artificial Analysis 指標と混同すべきではない。
Coding Benchmark Performance
| Meta coding benchmarks | Muse Spark 1.2 result | Leading comparison in Meta's chart | Evaluation scope | How to read it |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% with Muse Code | Claude Opus 5: 86.7% with Claude Code | 主要なコーディングエージェントでのターミナルタスク | ベンダー報告のシステム結果 |
| DeepSWE 1.1 | 59.3% with Muse Code | Claude Opus 5: 65.0%; GPT-5.6 Terra: 64.8% | 113 タスク、91 リポジトリ、5 言語 | ベンダー報告のシステム結果 |
| Meta Internal Coding Bench | 70.6% | Claude Opus 5: 79.4% | Meta のプルリク由来の 440 件の私有タスク | 私有で外部再現不可 |
Meta の 評価手法 は、Muse Spark 1.2 には Muse Code、Claude Opus 5 には Claude Code、GPT-5.6 Terra には Codex、Grok 4.5 には Grok Build を用いる。より高いスコアは、モデル、エージェントループ、プロンプト、ツール、メモリ設計の総体を反映し得る。正確な表現は、Muse Spark 1.2 が Muse Code で 82.9% を記録、であり、ベースモデル単体が 82.9% を記録、ではない。
Multimodal Benchmark Performance
Meta の 8 月 20 日のマルチモーダル評価 は、視覚認識、視覚知識、空間・UI 推論、チャート理解にわたる 10 ベンチマークの複合を報告している。最大の向上は、Muse Spark 1.2 がツールを使用できる場合に見られる。
| Meta multimodal evaluation | Direct response | With tools | Tool uplift | Interpretation |
|---|---|---|---|---|
| Muse Spark 1.2 | 59.8 | 72.0 | +12.2 | ツール有効構成でより強い |
| Muse Spark 1.1 | 60.2 | 69.1 | +8.9 | ツールなしではわずかに高く、ツールありでは低い |
公式の マルチモーダル手法 は、BabyVision、PerceptionBench、ZeroBench、WorldVQA、SimpleVQA、ERQA、OmniSpatial、CharXiv Reasoning、ChartMuseum、ChartQAPro を等加重で平均する。比較は Meta の枠組み内部でのツールによる向上を測るのに有用だが、独立に再現されたベンチマークではない。
Independent Benchmark Results
現行の Artificial Analysis Intelligence Index v4.1.1 では、Muse Spark 1.2 は 57 を記録し、Muse Spark 1.1 の 53、および初代 Muse Spark の推定 44 と比較して向上している。直近の GDPval-AA v2 評価 は 1,623 Elo で、213 モデル中 15 位。Muse Spark 1.2 は、AA-LCR 長文脈ベンチマーク でも 83.3% で首位となっており、エージェント的知識作業、コーディングワークフロー、長文脈推論における強みが広がっていることを示す。
| Evaluation | Score | Environment | What it tells you |
|---|---|---|---|
| Meta Terminal-Bench 2.1 | 82.90% | Muse Code | モデル+Meta 最適化エージェント |
| Artificial Analysis Terminal-Bench 2.1 | 80% | AA harness | より独立したクロスモデル信号 |
| Meta DeepSWE 1.1 | 59.30% | Muse Code | 長期スパンのコーディング |
| Meta Internal Coding | 70.60% | Meta internal | 社内エンジニアリングタスク |

信頼性データは慎重な解釈が必要だ。AA-Omniscience は 18 から 22 へと改善し、ハルシネーション率は 38% から 28% に低下したが、試行率も 82% から 67% に低下した。正答率は 41% から 38% に低下。つまり Muse Spark 1.2 は不確実なときに辞退しやすくなり、虚偽の主張は減る一方で、試みられる回答も減少する。
科学的推論は比較的横ばいだ。CritPt は 15% から 18% に改善した一方で、SciCode は 58% から 56% に低下し、Humanity's Last Exam は 45% から 44% に低下。これは Meta 自身の位置付けを支持する。Muse Spark 1.2 は、すべての推論分野で一様な飛躍ではなく、コーディングとエージェント的更新に特化したアップデートである。
Muse Spark 1.2 Pricing
Meta は Standard と Contributor のアクセスを提供する。Standard モデルの価格は、入力量 $1.25/百万トークン、キャッシュ済み入力量 $0.15/百万トークン、出力量 $4.25/百万トークン。Contributor 版は劇的に安価だが、Meta はそのデータが製品改善に用いられる可能性を明示している。
| Tier | Input / 1M | Cached input / 1M | Output / 1M | Data treatment |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | Meta 製品の改善には使用しない |
| Contributor | $0.10 | $0.002 | $0.20 | Meta 製品の改善に使用される可能性あり |
Pricing source: Meta の公式モデルページ。チームは、機密コード、認証情報、顧客データ、社内文書を Contributor ルートで送る前に、適用される製品とデータ利用条件を確認すべきだ。
トークン単価が低いことは、完了タスクのコストが最安であることを自動的には意味しない。Artificial Analysis は、Muse Spark 1.2 の Intelligence Index のタスクあたりコストを約 $0.40 と推定しており、Muse Spark 1.1 の $0.29 から上昇している。この増加は、特にプロフェッショナルなエージェント作業でのトークン使用増に起因する。したがって、価格表の比較だけでなく、受理されたプルリク、解決済み issue、検証済み成果物あたりのコストを測定すべきだ。
Muse Spark 1.2 vs Other Frontier Coding Models
最も関連する比較対象は、Claude Opus 5、GPT-5.6 Terra、Grok 4.5、Kimi K3 である。これらのモデルはコーディング、ツール、長文脈、プロフェッショナルなエージェントワークフローで重なるが、デプロイ、モダリティの幅、エコシステム、価格性能の優先度が異なる。
| Model | Context | Inputs | Terminal-Bench 2.1 signal | Deployment | Best fit |
|---|---|---|---|---|---|
| Muse Spark 1.2 | 1M | Text, image, video, PDF | 82.9% with Muse Code | Meta hosted API | Muse Code、長時間のリポジトリ作業、より低い API 価格 |
| Claude Opus 5 | 1M | Text, image, documents | 86.7% with Claude Code | Hosted API | 最大のコーディング信頼性と複雑なエージェント判断 |
| GPT-5.6 Terra | ~1.05M | Text, image | 81.8% with Codex | Hosted API | コーディング、プロダクティビティ、広範なツールワークフローのバランス |
| Grok 4.5 | 500K | Text, image | 81.6% with Grok Build | Hosted API | コーディングと xAI ツールおよび最新情報の組み合わせ |
| Kimi K3 | 1M | Text, image, video | Not shown in Meta chart | Hosted and open-weight options | 長期スパン作業とデプロイ柔軟性 |
Where Muse Spark 1.2 Has the Clearest Advantage
Muse Spark 1.2 は、アプリケーションが Muse Code の持続的イベントログ、サブエージェント設計、モデル特化訓練を活用できる場合に最も差別化される。標準 API 価格も、プレミアムなフロンティア・コーディングモデルに比べて攻めている。緊密に統合されたエージェントシステムを重視するチームにとっては、単一ベンチマークの小差よりもこの組み合わせが重要になり得る。
Where Claude Opus 5 Remains Stronger
Claude Opus 5 は、Meta が示す三つのコーディングチャートすべてで首位に立っている。失敗した変更のコストが高く、エンドツーエンドのコーディング信頼性を最大化したい場合には、トークン価格よりも優先される安全な選択であり続ける。Muse Spark 1.2 は差を縮め、とりわけターミナルタスクで近づいたが、差を完全には消していない。
Where GPT-5.6 Terra Fits
GPT-5.6 Terra は、Meta の評価では Terminal-Bench で Muse Spark 1.2 に近く、DeepSWE では上回っている。その強みは幅だ。OpenAI の response、search、file、shell、computer、MCP ツール群を既に利用するチームは、多少高価でも既存の本番スタックに適合するモデルを好む場合がある。
When Grok 4.5 or Kimi K3 May Be Better
Grok 4.5 は、コーディングと xAI の最新情報・ツールエコシステムを組み合わせるワークフローに強力な代替となる。Kimi K3 は、長期スパンの性能、オープンウェイトでのデプロイ、プロバイダ制御が重要な場合により魅力的だ。実際の選択はランタイム全体に依存する。プロンプト、ツール、メモリ、セキュリティ要件、検証戦略は、ベースモデルと同程度に結果を左右し得る。
What Can Muse Spark 1.2 Do?
Repository-Scale Software Engineering
1M トークンのコンテキストは、相当量のソースコード、ドキュメント、テスト出力、issue 履歴、エージェント状態を保持できる。適したタスクには、複数ファイルの機能、フレームワークのアップグレード、リポジトリ全体のリファクタリング、API 移行、テスト修復、プルリクレビュー、アーキテクチャ分析がある。長文脈は、リポジトリを無差別に読み込むより、リトリーバルと圧縮と組み合わせたときに最も有用だ。
Complex Debugging
Muse Spark 1.2 は、コードを調査し、ツールを実行し、失敗を読み取り、仮説を立て、変更を適用し、再テストできる。コーディング特化の訓練は、このループの改善を狙う。難しいのはもっともらしい修正案の提示ではなく、根本原因の特定と、パッチが回帰を生まないことの検証だ。
Long-Running Coding Agents
持続的なプロジェクトは中核ユースケースだ。Muse Code のイベントログとバックグラウンドエージェントにより、多数のモデル呼び出しとツールステップにわたり作業を継続できる。これは、アップグレード、性能チューニング、ドキュメント生成、テストの近代化、一回の応答では安全に完了できない機能スライスに有用だ。
Automated Technical Research
Meta は、1,000 回超のツール呼び出しと最長 24 時間にわたる GPU カーネル最適化で Muse Spark 1.2 を試験した。エージェントは参照ベースラインに対して Triton 実装を記述、コンパイル、プロファイル、改良した。より広い教訓は、モデルが、実験が次のアクションを導く反復的な技術作業向けに設計されているということだ。
Multimodal Development
画像、動画、PDF 入力は、開発ループをソースコードの外へ拡張する。UI をスクリーンショットと比較し、製品文書から要件を抽出し、記録された操作を解釈し、視覚的な参照から実装を生成することができる。アクセシビリティ、ブランド一貫性、セキュリティ、視覚コンテンツに埋め込まれた事実の検証には人的レビューが必要である。
When should you NOT use Muse Spark 1.2?
Don't choose it primarily for:
- 簡単なチャット
- 基本的なコード補完
- 低レイテンシのオートコンプリート
- 一般的なライティング
- 最大のベンチマーク信頼性が最重要なタスク
- Contributor データ条件が不適切な高規制ワークロード
Limitations of Muse Spark 1.2
- 未公開のアーキテクチャ: Meta はパラメータ数、モデルトポロジ、エキスパートルーティング、学習トークン数を公開していない
- ハーネス依存のローンチ結果: 最も強いスコアは Muse Spark 1.2 を Muse Code と組み合わせ、競合は別のコーディング製品を用いる
- 私有の社内ベンチマーク: Meta Internal Coding Bench は外部の開発者が独立に再現・監査できない
- 能力向上の偏り: 独立評価ではエージェント作業での改善が大きく、科学的推論では小さい
- 辞退のトレードオフ: ハルシネーション率の低下は、試行率の低下と AA-Omniscience でのわずかな正答率低下を伴う
- データポリシーの選択: 最安の Contributor ティアは送信データが Meta 製品改善に用いられる可能性があり、機密コードには不向きな場合がある
- 長文脈は完全な記憶ではない: 1M トークン制限は、あらゆる位置での一様なリトリーバル、注意、精度を保証しない
- ホスト型ローンチ: リリースは API と Muse Code へのアクセスを提供し、モデルウェイトの配布はない
How to Access Muse Spark 1.2
開発者は、Muse Code または Meta Model API を通じて Muse Spark 1.2 を利用できる。標準 API のモデル ID は muse-spark-1.2。低価格の Contributor ルートは muse-spark-1.2-contributor を用いる。Meta のホスト API は OpenAI 互換のベース URL を公開しており、多くの既存の chat-completions クライアントは、キー、ベース URL、モデル名を差し替えるだけで適応できる。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODEL_API_KEY"],
base_url="https://api.meta.ai/v1",
)
response = client.chat.completions.create(
model="muse-spark-1.2",
messages=[
{"role": "user", "content": "Review this repository plan and identify the highest-risk implementation steps."}
],
)
print(response.choices[0].message.content)
Implementation note: デプロイ前に、使用中のモデル名、アカウントの適格性、レート制限、サポートされるパラメータ、地域提供状況を Meta の API ドキュメント で確認すること。API キーをソースコードに直接埋め込まないこと。
並行比較のために、CometAPI はすでに Claude Opus 5、GPT-5.6、Grok 4.5、Kimi K3 への統一アクセスを提供しており、A/B テストやプロバイダの切替を簡素化できる。Muse Spark 1.2 も近日中に CometAPI で提供予定だ。
Is Muse Spark 1.2 Worth Using?
Muse Spark 1.2 は、リポジトリ規模のコーディング、長時間の実行、繰り返されるツールフィードバック、マルチエージェント調整が支配的なワークロードでテストする価値がある。その最大の強みは、コーディング特化モデル、目的構築の持続的エージェント、1M トークンのマルチモーダル文脈、低価格の標準 API という組み合わせにある。
これは普遍的なベンチマークリーダーではない。Claude Opus 5 は Meta の看板コーディング評価で依然先行し、GPT-5.6 Terra はコーディングと汎用生産ツール全般で極めて競争力がある。独立データは Muse Spark 1.2 の向上が一様ではなく、特定領域に集中していることを示す。したがって最良の選択プロセスはワークロード基準である。実際のエージェントランタイム内で各モデルを試し、検証済みタスク完了率を測り、セキュリティに敏感または影響の大きい変更には人的レビューを含めるべきだ。
Bottom line:
Muse Spark 1.2 は、これまでで最もコーディング指向の Muse アップデートだ。本当の差別化要因は単一のベンチマークスコアではなく、モデル、Muse Code、持続的サブエージェント、長文脈、検証ループが緊密に連携する設計にある。
