TLDR 2026年9月中旬に流出したベンチマークと Arena.ai のステルステストにより、未発表の Google の Gemini 4 Pro がフロンティアの新たなリーダーとして位置づけられ、ソフトウェア工学、エージェント型タスク、ナレッジワーク、推論、マルチモーダル系ベンチマーク全般で GPT-6 Astra と Claude Fable 5.1 を上回ったとされる。
主要なポイント
- Gemini 4 Pro は DeepSWE v1.1(88.7%)、GDPval-AA v2(2064 Elo)、Terminal-bench 2.1(95.3%)、OSWorld-2.0(86.8%)など、複数のエージェント/推論系スイートの流出評価で首位に立っている。
- リスト価格では GPT-6 Astra($12/$60)や Claude Fable 5.1($10/$50)を下回りつつ、両者の 1M クラスのコンテキストウィンドウに匹敵またはそれ以上とされる。
- Arena.ai 上でプレースホルダー名(例: gemini-3.8-flash)でのステルステストにおいて、際立った SVG、Three.js、エージェント型コーディングのデモが確認された。
- RSI(再帰的自己改善)に関する噂は流れているが、Gemini 4 自体のクローズドループな自律的モデル改良を裏付ける公的証拠はない。
- Google はより大規模な Gemini 4 ベースモデルへの大規模投資を認めているが、公開時期は未公式のまま。
- CometAPI のようなプラットフォームはすでに Gemini、GPT-6 Astra、Claude Fable/Opus、その他数百のモデルを、競争力のある料金で OpenAI 互換の単一エンドポイントの背後に集約しており、新フロンティアが公開された際のベンチマークに最適。
Gemini 4 について分かっていること(リーク、情報源、検証済みコンテキスト)
2026年9月20日現在、Gemini 4 Pro は Google から公式発表、モデルカード、パブリック API エンドポイントを受けていない。Google が以前に「より大きな Gemini 4 ベースモデル」への投資を表明した(2026年7月の決算)以外は、コミュニティのリーク、Arena.ai のブラインドテスト、流通しているベンチマーク表に基づく情報である。
主な情報源と主張には以下が含まれる:
- リーカーの Pankaj Kumar とその後の投稿(9月上旬〜中旬頃)が、10月の一般公開を見込む内部 Pro チェックポイントを示唆し、Flash-Lite 版がそれより早い可能性にも言及。
- 複数の開発者が Arena.ai で「gemini-3.8-flash」(または類似のプレースホルダー)とラベル付けされた高能力モデルを引けたと報告。出力には複雑な SVG(例: 自転車に乗るペリカン)、Three.js による機械仕掛けの蝶、非反復で長い JSON 生成、強力なエージェント挙動が含まれた。バックエンドに関して、数百万トークン級のコンテキスト、256k 出力上限、セッション横断メモリ、ネイティブのツール/インターネット能力などの主張も一部で見られた。
- 広く共有された比較表では、Gemini 4 Pro、Gemini 4 Flash、Gemini 4 Flash-Lite、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5、GPT-5.6 Sol が並べられている。
- Google は Arena のテストや表を確認していない。過去のパターンでは、正式なローンチの数週間前に公共プラットフォーム上でステルス評価を行うことが多い。

コンテキストウィンドウ
流出表では Gemini 4 ファミリーの最大入力トークンが 2M とされ、GPT-6 Astra の 1M の倍であり、Claude Fable/Opus 5 ラインの 200k を大きく上回る(Claude の一部バリアントは別メカニズムでより大きな実効ウィンドウを提供)。別途、ゴーストルーティングで 10M 上限との主張も浮上したが、未検証である。
Gemini 4 の価格(流出数値)
流通する表によると:
- Gemini 4 Pro: 入力 $2.25 / 出力 $11.25(1M トークンあたり、キャッシュなし)
- Gemini 4 Flash: $0.75 / $3.75
- Gemini 4 Flash-Lite: $0.35 / $1.75
これらは GPT-6 Astra の $12/$60 や Claude Fable 5.1 の $10/$50 より大幅に低い。Fable 5.1 は積極的なキャッシュ読み出し割引でエージェント系ワークロードの実効コストを下げられる。一方、現行の公式 Gemini 3.x Pro 価格はコンテキスト長により入力 $2–$4 / 出力 $12–$18 のレンジにあり、流出した Pro の数値は次世代の調整として妥当性がある。
正式な公開価格はローンチ時に判明する。Google は歴史的に競争力のあるトークン単価とフリーティアで普及を促進してきた。
Gemini 4 Pro の性能:流出ベンチマークの詳細
流通表では、Gemini 4 Pro はほぼすべてのカテゴリーでトップに位置づけられている。これらの数値は執筆時点で Google や独立第三者機関により公式確認されておらず、方向性の指標として扱うべきである。
ソフトウェア工学とエージェント型コーディング
- DeepSWE v1.1(長期的ソフトウェア工学):88.7%(対 GPT-6 Astra 86.9%、Claude Fable 5.1 69.1%、Claude Opus 5 75.0%)
- Terminal-bench 2.1(エージェント型ターミナルコーディング):95.3%(対 Astra 94.1%、Fable 92.8%)
- Terminal-bench 4.0(一般的エージェント能力):69.7%(Flash や競合に対する相対差が最大)
ナレッジワークとプロフェッショナルタスク
- GDPval-AA v2(Elo、ナレッジワーク):2064(2000超は唯一;Astra 1994、Fable 1853)
- Vals Finance Agent v2:74.2%
- Harvey’s Legal Agent Benchmark(複雑な法務ワークフロー、全合格率):18.7%
推論、マルチモーダル、専門領域
- CharXiv Reasoning(複雑なチャートからの情報統合、ツールなし):94.7%
- LVBench(長尺動画理解):エージェント 95.8% / スタティック 95.0%
- HLE-Verified(学際的エキスパート推論):72.1%
- OSWorld-2.0(エージェント型コンピュータ利用、部分得点、バッチツール有効):86.8%
- BioMysteryBench & LABBench2(バイオインフォマティクスおよび生物学研究ワークフロー):人間可解サブセットと難関サブセットの双方で先導的スコア
これらが概ね正しいとすれば、長期・多段・ツール活用型のエージェント系ワークロードで特に強みを示しており、これは 9 月初頭のリリースでリーダーとされた GPT-6 Astra と Claude Fable 5.1 が重視している領域と重なる。
Arena の定性的テストもこの像を補強しており、ステルスモデルの複雑な SVG や Three.js 生成は、コミュニティの並列比較で Astra と比肩または優越と評価されている。
Gemini 4 はどのように機能するのか?
Gemini 4(Pro)はまだリリースされていないため、「どのように機能するか」の記述は、Google の公式発言、内部初期チェックポイントに関する限られたリーク、Gemini 3.x の軌跡、妥当なエンジニアリング推測に依拠する。以下は確定仕様ではない。
中核となる学習とスケール戦略
Google は Gemini 4 を「これまでで最も野心的な事前学習」と表現し、従来よりも「有意に大きいベースモデル」に基づいていると述べた。特にコーディングと自律エージェントでフロンティアに対抗することが明確な狙いである。
これは次を示唆する:
- パラメータ数の増加、または Mixture-of-Experts、より良いスパース化、より密なスケーリング等による効果的容量の増大
- 事前学習における計算投資の増強
- マルチモーダル訓練データ(テキスト、画像、動画、音声、コード、ツール利用軌跡)への継続的注力
このモデルは高能力の新たなベースラインとして機能し、そこから高速な Flash 系バリアントが派生される見込みである。
推論と思考スタイル
初期「argon」チェックポイントのリーク描写では、単一生成に約 2.4 分を要し、出力上限が劇的に引き上げられた(従来の約 64k に対し 256k と報告)「高思考負荷」モードが言及されている。
これは次を示唆する:
- 競合モデルの拡張思考や「最大努力」モードに類する、オプションの計算集約的推論パス
- 出力前に難問へより多くの内部計算を割く能力
- 完全なコードベース、多段計画、長尺レポートなど、より長く一貫した出力のサポート向上
現行の Gemini Flash モデルが低/中/高の思考レベルで速度/コストと推論深度のトレードオフを制御できるのと同様に、ユーザーはこのトレードオフを調整可能になる公算が高い。
重点強化領域
Sundar Pichai の公開発言と開発軌跡に基づくと:
- コーディングとソフトウェア工学 長期的性能の強化:マルチファイルのリファクタ、リポジトリ横断のデバッグ、自己修正ループ、現実的タスクでの完了率向上。
- 自律/エージェント挙動 計画、ツール使用、中間結果の観察、エラーからの回復、多段ステップで目標に向かい続ける能力の向上。これはすでに Gemini 3.5/3.8 Flash に存在するコンピュータ利用やエージェント機能を直接拡張する。
- 長文脈の信頼性 コミュニティ報告は 1.5M トークン(またはそれ以上)を目標にしていると述べる。実務上の狙いは、単なるウィンドウ拡大ではなく、非常に長い文書、コードベース、数時間のエージェントトレースでの取得忠実度や劣化の低減である。
- マルチモーダル理解と生成 テキスト+画像+動画+音声をネイティブに扱い、空間推論、動画理解、リアルタイム音声/エージェント対話での向上が期待される(2026年9月の Gemini 3.8 Live モデル群を基盤)。
- ツール利用と構造化出力 より堅牢な関数呼び出し、コード実行、検索グラウンディング、JSON/XML 形式の構造化出力で、アプリやエージェントへの信頼性の高い統合を実現。
Gemini 3.x との違い
- スケール:段階的改良ではなく、明示的に大きいベースモデル
- 出力容量:リークされたより高いトークン上限により、単一パスでより長い生成が可能
- 推論深度:難問向けの高負荷モードをより明確化
- エージェント重視:単発・短期タスクより、持続的で多段の自律作業を強調
- ポジショニング:新たなフロンティアの Pro ティアとして位置づけ、Flash ラインは速度とコスト効率で迅速に反復
再帰的自己改善(RSI)との関係
Google 幹部は同社の大規模 AI 設備投資を、長期的な再帰的自己改善(次世代を生み出すプロセスやそのシステム自体を意味ある形で改善し得るシステム)に結びつけている。Dream-RSI 論文のような関連研究では、モデル重みを変更せずとも、エージェントが探索戦略を自己改善できることを示している。
Gemini 4 Pro は GPT-6 と Claude Fable 5.1 を上回るか?
| カテゴリ | Gemini 4 Pro | GPT-6 Astra | Claude Fable 5.1 | 備考 |
|---|---|---|---|---|
| 入力/出力価格 | $2.25 / $11.25 | $12.00 / $60.00 | $10.00 / $50.00 | Gemini 4 Pro は Astra の約 1/5 の価格 |
| コンテキストウィンドウ | 2M | 1M | 200k | Gemini に大きな優位 |
| DeepSWE v1.1 | 88.7% | 86.9% | 69.1% | 強いコーディング優位 |
| GDPval-AA v2 (Elo) | 2064 | 1994 | 1853 | ナレッジワークのリーダー |
| Terminal-bench 4.0 | 69.7% | 66.4% | 57.9% | 一般的エージェント能力 |
| OSWorld-2.0 | 86.8% | 84.5% | 77.9% | コンピュータ利用 |
| HLE-Verified | 72.1% | 67.3% | 62.1% | 専門的推論 |
| LVBench(動画) | 95.8% / 95.0% | 93.8% | 90.4% | マルチモーダル強み |
| バイオ/ラボ研究 | 最高スコア | 強力 | 競争力あり | 科学的ワークフロー |
Gemini 4 Pro は表の主要項目すべてで首位に立ち、多くの場合で有意な差を示す一方、提示価格は GPT-6 Astra や Claude Fable 5.1 より大幅に攻めた設定とされる。
重要な注意事項
- これは Google 公式の表ではない。2026年9月20日現在、Google は Gemini 4 Pro のモデルカード、API エンドポイント、価格、ベンチマークを公表していない。数値はコミュニティ情報源/Arena の目撃情報/内部チェックポイント(コード名「argon」関連)からのリークに基づく。
- 以前に流布した一部のシートは、予測や部分的な転記であると後に指摘された。個々のパーセンテージや価格は、Google の確認があるまで未検証として扱うべきである。
- Claude Fable 5.1 のコンテキストウィンドウはここでは 200k と記載されているが、Anthropic の公式ドキュメントで一般的に報告される 1M より小さい。これは特定の評価設定を反映しているか、流出シートの誤りの可能性がある。
- 現在、公的にリリースされ独立評価が行われたフロンティアモデルは GPT-6 Astra と Claude Fable 5.1 のみである。Artificial Analysis など第三者トラッカーは、両者が総合的に拮抗していることを示している(得意分野は異なる)。
現実的な現状(2026年9月20日)
| モデル | ステータス | 最適用途 | 価格帯 |
|---|---|---|---|
| Gemini 4 Pro | 未リリース(強力との主張) | 長文脈、コーディング、エージェント、マルチモーダル、コスト | 非常に攻めた(主張) |
| GPT-6 Astra | リリース済み | 数学、コンピュータ利用、ターミナル、オートメーション、サイバー | プレミアム |
| Claude Fable 5.1 | リリース済み | 長期エージェント、推論、コード品質、キャッシュ効率 | プレミアム |
| Gemini 4 Flash / Flash-Lite | 同系統(とされる) | 速度とコスト重視のワークロード | きわめて低コスト |
まとめ(要点)
- 全方位で強力:Gemini 4 Pro は記載されたすべてのカテゴリで首位に立ち、しばしば明確な差を示す。
- 特に強い領域:長期コーディング/エージェント(DeepSWE、Terminal-bench)、ナレッジワーク、マルチモーダル(動画+チャート)、専門ドメイン(金融、法務、生物学、コンピュータ利用)。
- 価格ポジショニング:GPT-6 Astra と Claude Fable 5.1 の約 1/5 の入出力単価で、スコアはそれ以上。
Astra はコンピュータ利用、サイバーセキュリティ閾値、科学的発見を強調し、Fable 5.1 は長時間のナレッジワークとコーディング、洗練されたセーフガード、低いキャッシュ読み出しコストを強調する。Gemini 4 Pro の流出プロフィールは、広範なエージェント型ソフトウェア工学とマルチモーダル推論で最も強力に見える。
開発者が準備するには:CometAPI の推奨
公式の Gemini 4 Pro アクセスを待つ間でも、現行フロンティア(Gemini 3.x、GPT-6 Astra、Claude Fable 5.1 / Opus 5、その他 500+ モデル)をすでにサポートする統合ゲートウェイを使うメリットは大きい。CometAPI はまさにそれで、OpenAI 互換の単一エンドポイント、1 つの API キー、従量課金で通常はベンダー直より 20–40% 低い料金、モデル切り替えは 1 パラメータ変更で完了する。
実践的なワークフロー:
- CometAPI 経由で現行の Gemini Flash/Pro、GPT-6 Astra、Claude Fable 5.1 を用いてエージェント系パイプラインを試作する。
- 同一プロンプトでモデル横断のベンチマークを行い、ベースラインを確立する。
- Gemini 4 Pro(およびその Flash 系)が CometAPI カタログに登場したら(同プラットフォームは歴史的に Google の新モデルを迅速に追加)、モデル ID を差し替えて最小限のコード変更で評価を再実行する。
- コストダッシュボードでプロバイダ横断のトークン支出を追跡し、大量トラフィックや低レイテンシが必要な経路は、最も経済的かつ十分な能力を備えるモデルへルーティングする。
このアプローチは複数キー管理を不要にし、ベンダーロックインのリスクを低減し、Gemini 4 Pro の一般公開初日に採用できる体制を整える。
リークが方向性として正しければ、Gemini 4 Pro は Google による、エージェント型ソフトウェア工学と長文脈マルチモーダル推論におけるフロンティア奪還の最有力の試みであるといえる。性能、巨大なコンテキスト、攻めた価格設定の組み合わせは、多くの本番ワークロードでデフォルト候補となるだろう。公式ローンチと独立評価が出るまでは、統合アクセスが可能なプラットフォームを通じて現行フロンティアの継続的ベンチマークを行うのが賢明である。正式発表は近いと見られ、今後数週間でどこまでの「噂」が実運用で裏づけられるかが明らかになるはずだ。
よくある質問
Gemini 4 Pro はリリースされていますか?
いいえ。最新のカタログおよび Google の発言(2026年9月中〜下旬)時点で、公共にリリースされておらず、公式モデル ID も未掲載である。
Gemini 4 Pro の公開予定日は?
リーカーは 2026年10月を指し示しており(9 月下旬の推測も一部あり)、Google は公式日程を出していない。API カタログやブログ投稿での確認待ちのウィンドウとして捉えるべきである。
Google は Gemini 4 Pro で RSI を達成しましたか?
公的証拠は、モデル改良のための高度なエージェントループと、戦略レベルの再帰的改善(例: Dream-RSI)の研究を示すが、モデル自体を生み出した完全な RSI の達成を独立に裏づけるものはない。
ベンチマークで GPT-6 Astra と Claude Fable 5.1 と比べてどうですか?
コミュニティの流出チャートは、いくつかのエージェント/コーディング系スイートでリードを主張している。公開された Gemini 4 Pro に対する公式の独立スコアはまだ存在しない。現在の公開データでは、ライブモデル(Astra と Fable 5.1)を各自のタスクで評価することが推奨される。
Gemini 4 Pro を待ってから開発すべきですか?
いいえ。現時点で入手可能な最強モデルで出荷しつつ、評価セットを準備しておき、独立・社内テストが切替の正当化を示す場合に新モデルを採用するのがよい。
現在のフロンティアモデルに簡単にアクセスするには?
CometAPI のような統合プロバイダは、OpenAI 互換の形で GPT-6 Astra クラス、Claude Fable 5.1、現行の Gemini モデルなどへのアクセスを提供し、課金・切り替えも簡素化する。最新のモデル一覧とドキュメントで最新の ID と価格を確認してほしい。
