まず回答
GPT-6 Astra は、OpenAI による困難なエンドツーエンド作業向けの新しいフラッグシップモデルです。OpenAI は 2026 年 9 月 3 日に GPT-6 Astra をリリース し、複雑な推論、コンピュータ操作、コーディング、リサーチ、科学、プロフェッショナルな成果物作成に重点を置いて位置づけました。API モデルは 1.05M-token コンテキストウィンドウ と最大 128K の出力を備え、テキストと画像入力を受け付け、推論強度は low から max までサポートします。標準 API 料金は百万トークンあたり 入力 $10 / 出力 $50 からです。実務上の最重要点は、あらゆる汎用知能ベンチマークで一律に伸びたわけではないことです。Astra の最大の伸びは、エージェント的実行、コンピュータ操作、長コンテキストのリトリーバル、コーディングワークフロー、科学、サイバーセキュリティに現れています。
これは、以前の CometAPI 記事 GPT-6 Is Coming Soon — What Will It Look Like? が必然的に仮説的であったため重要です。Astra が公開された今、本ガイドは確認済みのモデル挙動、ベンチマークのトレードオフ、API の経済性、そしてより安価なフロンティア代替より実際に優れている領域に焦点を当てます。
What Is GPT-6 Astra?
GPT-6 Astra は、OpenAI のフラッグシップであった GPT-5.6 Sol の後継です。OpenAI は Astra を、最も困難なエンドツーエンド作業に対して最も有能なモデル と説明しており、推論、ツール使用、ソフトウェアとの対話、途中成果物の推敲、初期要求から最終成果までタスクを運び切るワークフローに重点を置いています。この位置づけは重要です。Astra は単なる大型のチャットモデルではありません。ブラウザ、ターミナル、ドキュメント、スプレッドシート、開発環境、エンタープライズソフトウェアにまたがって動作するエージェントの内部で、推論エンジンとして機能するよう設計されています。
ローンチ投稿では、コンピュータ操作、ブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学、プロフェッショナル業務の各分野で最先端の結果が強調されています。FrontierMath Tier 4、ARC-AGI-3、ExploitBench において 97.6% / 99.9% / 100% を報告しています。目を引くスコアですが、これを「Astra がすべてのベンチマークで勝利した」と解釈すべきではありません。OpenAI 自身の比較表で用いられている Artificial Analysis Intelligence Index では、Astra は 61.2、Claude Fable 5.1 は 65.7 です。したがって、このリリースは実行とエージェント的作業における段階的な前進として理解するのが適切で、すべての知能指標での完全勝利とは異なります。
What Changed From GPT-5.6 Sol?
コンピュータ操作が第一級の能力に
Astra の世代的な伸びで最も明確なのはコンピュータ操作です。OSWorld 2.0 で OpenAI は、Astra が 72.6%、GPT-5.6 Sol が 65.7% と報告しています。同じレイテンシーシミュレーションでは、Astra は Sol の約 75 分に対し約 40 分でタスクを完了し、約 47% の短縮でした。更新された Codex ハーネスと組み合わせることで、Mind2Web で 1.9× 高速な完了を報告しています。実務的なポイントは、Astra が画面を見られること自体ではありません。高コストな寄り道を減らしつつ、より長い時間にわたり多段のソフトウェアタスクの整合性を保てる点です。
プロフェッショナルな成果物の作成がより熟慮的に
OpenAI は、最終的に使える成果物で終わるプロフェッショナルなワークフロー向けに Astra を明示的に訓練しました。ローンチ資料では、ドキュメント、スプレッドシート、プレゼンテーション、データ分析、デザイン作業、テンプレート遵守での強化が説明されています。Astra は タスク途中で要件が変化しても方針を保つ のが得意になっており、ステアリングメッセージが元の目標を上書きする可能性が低くなっています。これは長時間稼働するエンタープライズエージェントに特に有用で、ワークフロー開始後に新たな指示が到着することがよくあるためです。
長時間セッションで有用な作業コンテキストをより保持
長いコーディングセッションでは、Astra はアクティブなコンテキストが埋まった後も Codex がノートを保存・取得するための新しい方法を導入します。以前のアプローチは圧縮に大きく依存しており、修正が失敗した理由や既に検証済みの制約が省かれることがありました。OpenAI によれば Astra は コンテキストウィンドウをまたいでノートを保持 でき、大規模なリファクタリングやデバッグ時の連続性を改善します。
推論強度は最大まで選択可能に
開発者は low、medium、high、xhigh、max の推論強度を選択できます。これは Astra を単一の固定運用点として扱うよりも、より広い品質–コスト曲線を生みます。公式モデルガイダンス は、評価目標を満たす最も低い強度を選ぶことを推奨しています。なぜなら、このモデルの最良の経済性は、常に最大推論で走らせることより、トークン効率から得られる場合が多いからです。
GPT-6 Astra Benchmark Performance
OpenAI は、コンピュータ操作、プロフェッショナル業務、コーディング、学術的推論、ヘルス、サイバーセキュリティ、長コンテキスト、アラインメントをまたぐ広範な比較を公開しました。この表を読む上で最も有用なのは、「汎用知能」と「ツールを使って作業を完遂する能力」を分けて考えることです。OpenAI の表における Artificial Analysis Intelligence Index では Astra は Sol をわずかに上回るだけですが、いくつかのエージェント的かつ運用的なベンチマークでは大幅に先行しています。
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | What the delta suggests |
|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | エンドツーエンドの業務ワークフローで大幅な伸び |
| OSWorld 2.0 | 72.6% | 65.7% | コンピュータとの対話とタスク完了が向上 |
| Terminal-Bench 4.0 | 57.9% | 37.3% | ターミナルベースのエージェント的コーディングで大幅増 |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | コード/ツールを用いる科学ワークフローで大幅増 |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | フロンティア級の数学的推論が強化 |
| ExploitBench | 100.0% | 78.5% | クリティカル級のサイバーセキュリティ能力 |
| SRE-Bench, one attempt | 88.0% | 55.9% | 逆アセンブル/ SRE 業務が大幅に強化 |
| MRCR v2, 512K-1M | 96.3% | 73.8% | 超長コンテキストのリトリーバルが改善 |
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | 一般知能は Sol 比で実質横ばい |
傾向は珍しいほど明確です。ベンチマークがツールや環境との持続的なインタラクションを要求するほど、Astra の優位性は大きくなります。AutomationBench は 18.1% から 41.4% に上昇、Terminal-Bench Science は 22.4% から 64.6% に上昇、長コンテキスト MRCR は 512K–1M 帯で 73.8% から 96.3% に改善しました。対照的に Artificial Analysis Intelligence Index は 60.9 から 61.2 への動きに留まります。ゆえに、「Astra は 2.5 倍高価だが少し賢い」と表現するのは、この製品の実際の価値提案を見誤ります。
出典: OpenAI AutomationBench チャート (元画像、再描画なし)
独立ベンチマーク:GPT-6 Astra は世代的飛躍か?
独立評価は重要な現実確認を加えます。Artificial Analysis は、Astra の Intelligence Index スコアを 61 と報告しており、GPT-5.6 Sol の max 強度と同等です。同時に、Astra は Coding Agent Index を大きく改善し、エージェント的コーディングで使用トークンを大幅に削減しています。Artificial Analysis は、同社の Codex ハーネスにおいて、Astra が GPT-5.6 Sol の max 強度比でトークン使用量を約 3 分の 1 に減らし、コーディングエージェントタスクあたりのコストをほぼ同等に保ちながらより高いスコアを達成したと測定しました。
経済性は汎用知能では見劣りします。Astra は Intelligence Index の max 強度で Sol より出力トークンを約 10% 少なくしますが、トークン単価の 2.5 倍増がその効率を上回ります。Artificial Analysis は、Astra が max 強度ではタスクあたり 約 75% 高価 と見積もっています。また AA-Omniscience における 幻覚率が 92% から 51% に低下 しつつ、正確性が 4 ポイント上昇したと報告しています。
有用な結論はワークロード固有です。エージェントが行動し、反復し、ツールを使い、複雑な仕事を完遂する必要がある場面で、GPT-6 Astra は最も世代的に見えます。通常の推論や大量のテキスト生成では、価格プレミアムの回収がはるかに難しい場合があります。
GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash
実務的なモデル選定には、能力、マルチモーダル性、コンテキスト、エージェント的実行、価格が含まれるべきです。以下のモデルは相互に代替可能ではありません。Astra は困難なエンドツーエンド実行に最適化され、Claude Fable 5.1 は一部の汎用知能指標で先行し、Gemini 3.8 Flash はより低いトークン価格と広いネイティブ入力モダリティを提供します。

| Metric | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| Context window | 1.05M | 1.05M | 1M | 1.048M |
| Max output | 128K | 128K | 128K | 65.5K |
| Input modalities | Text, image | Text, image | Text, image/PDF | Text, image, audio, video, PDF |
| AA Intelligence Index | 61.2 | 60.9 | 65.7 | 58.7 |
| AutomationBench | 41.4% | 18.1% | 31.4% | — |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 19.1% |
| DeepSWE 1.1 | 74.1% | 72.7% | 67.4% | 73.8% |
| FrontierMath Tier 4 v2 | 97.6% | 83.0% | 87.8% | — |
| HLE with tools | 57.2% | — | 65.0% | — |
| HealthBench Professional | 63.4% | 60.5% | 58.1% | 52.1% |
| Official standard input price | $10/M | $4/M | $10/M | $0.75/M |
| Official standard output price | $50/M | $20/M | $50/M | $3.75/M |
GPT-6 Astra を選ぶべきとき
人間が失敗したエージェント実行を救済するコストが高いタスク、すなわち長尺のコード変更、ブラウザ/デスクトップ自動化、ツールにまたがる深いリサーチ、技術的成果物の作成、複雑な科学・運用ワークフローでは Astra を選びましょう。リトライや手作業の修正が減り、出力トークンが少なくなるほど、トークン単価よりもプレミアムを正当化しやすくなります。
Claude Fable 5.1 を選ぶべきとき
Claude Fable 5.1 は依然として強力なフロンティア競合です。OpenAI 自身のローンチ表では、Artificial Analysis Intelligence Index で Astra の 61.2 に対し 65.7、HLE with tools でも Astra の 57.2 に対し 65.0 を記録しています。つまり、Astra を万能の知能勝者として売り込むべきではありません。評価セットがコンピュータ操作より長文推論に近い場合は、Claude Fable 5.1 の方が適する可能性があります。
Gemini 3.8 Flash を選ぶべきとき
Gemini 3.8 Flash はフロンティアの別のポイントを狙っています。約 1M トークンのコンテキストウィンドウでテキスト、画像、音声、動画、PDF 入力に対応し、公式の導入価格は Astra より大幅に低廉です。大量のマルチモーダル抽出、動画/音声理解、日常的なエージェント、$10/$50 のトークン経済を正当化しづらいワークロードでは、Gemini 3.8 Flash がより経済的な本番選択肢となることが多いでしょう。
Why GPT-6 Astra’s Cybersecurity Rating Matters
Astra は、OpenAI の Preparedness Framework における クリティカルなサイバーセキュリティ能力の閾値 に初めて到達した、広く展開された OpenAI モデルです。OpenAI によれば、このモデルは適切なツールとアクセスが与えられれば、これまで知られていなかったセキュリティ欠陥を特定し、堅牢化されたシステムを横断して悪用戦略を開発できます。ローンチ評価では、Astra は ExploitBench で 100%、ExploitGym で 42.4%、SRE-Bench で一回の試行あたり 88.0% を記録しました。
この能力にはより厳格なデプロイ管理が伴います。OpenAI は、本番のセーフガードが特にリスクの高いサイバー領域で正当な作業を遅延・一時停止・停止 する場合があると述べています。ChatGPT や Codex は継続前にユーザーへアクション確認を求めることがあり、API タスクは停止する可能性があります。デフォルトの Astra デプロイは、より高度なエクスプロイト作成要求を拒否します。OpenAI の Daybreak プログラムは、防御ワークフローの一部に対しては別枠の審査済みアクセスを提供します。
システムカードはモニタリング可能性のトレードオフを記録しています。Astra は全体として Sol よりアラインメントが良好ですが、対向的評価条件下では記述的推論のモニタリングが難しくなる 場合があります。そのため OpenAI は、ツールを使用する Astra 推論の周囲により広範なミスアラインメント監視を展開します。エンタープライズチームは、エージェントの権限、承認境界、監査ログ、最小権限のツールアクセスを、モデルアーキテクチャの一部として扱うべきで、オプションの付加物とみなしてはなりません。

出典: OpenAI 公式 ExploitGym ハニーポット安全性チャート (元画像、再描画なし)
GPT-6 Astra Pricing
OpenAI の 現在の API 料金ページ は、短コンテキストと長コンテキストのリクエストを区別しています。Standard 処理では、短コンテキストの料金は入力 $10、キャッシュ済み入力 $1、キャッシュ書き込み $12.50、出力 $50(いずれも百万トークンあたり)です。272K を超える入力トークンのリクエストは長コンテキストの料金表が適用され、入力 $20、キャッシュ済み入力 $2、キャッシュ書き込み $25、出力 $75(いずれも百万トークンあたり)となります。
| Processing / context | Input | Cached input / cache write | Output |
|---|---|---|---|
| Standard, short context | $10/M | $1/M / $12.50/M | $50/M |
| Standard, long context (>272K input) | $20/M | $2/M / $25/M | $75/M |
| Batch / Flex, short context | $5/M | $0.50/M / $6.25/M | $25/M |
| Batch / Flex, long context | $10/M | $1/M / $12.50/M | $37.50/M |
| Fast mode, short context | $20/M | $2/M / $25/M | $100/M |
| Fast mode, long context | $40/M | $4/M / $50/M | $150/M |
GPT-5.6 Sol と比べると、Astra の短コンテキスト Standard トークン料金は 2.5 倍高い($10/$50 対 $4/$20)です。とはいえ、これは完了タスクあたりのコストが自動的に 2.5 倍になることを意味しません。エージェント的コーディングでは、OpenAI と Artificial Analysis の双方が、構成によっては Astra の出力トークン使用量が少ないと報告しています。したがって、評価の適切な単位はトークン単価ではなく、成功タスクあたりのコストです。
How to Access GPT-6 Astra
OpenAI は 2026 年 9 月 3 日に 段階的なロールアウト を開始しました。Astra は、今後数日にわたり ChatGPT Plus、Pro、Business、Enterprise ユーザー、OpenAI API、AWS に順次展開される予定です。エンタープライズ管理者はワークスペースごとに Astra を有効化でき、ローンチ時点ではデフォルトで無効です。
Call GPT-6 Astra with the OpenAI Responses API
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "high"},
input=(
"このリポジトリのアーキテクチャをレビューしてください。最もリスクの高い"
"設計上の問題を特定し、その根拠を説明し、移行計画を提案してください。"
),
)
print(response.output_text)
モデル ID は gpt-6-astra です。ツールを多用するワークフローでは、Astra が関数呼び出し、構造化出力、ウェブ検索、ファイル検索、コードインタープリタ、ホストシェル、apply patch、computer use、MCP、ツール検索をサポートするため、Responses API が自然な出発点になります。ファインチューニングは現在サポートされていません。
Real-World GPT-6 Astra Use Cases
ゲーム開発とビジュアルソフトウェアのワークフロー
Playco は、Unity と Godot で直接動作する AI 搭載 IDE の Playbot に Astra を組み込みテストしました。OpenAI は、前モデル比で 手作業の修正が 50% 減少 し、単一のグレーボックス基盤から 3 つのテーマ付きプロトタイプを構築したと報告しています。この例が重要なのは、必要なのがソースコード生成以上のものだからです。モデルは空間レイアウトについて推論し、ゲームをプレイし、変更をテストし、バグを特定し、ビジュアル環境の内部で反復する必要があります。
法務・財務ドキュメントレビュー
OpenAI は、最終的に完成度の高いドキュメント、スプレッドシート、分析を生み出す 多段のプロフェッショナルワークフロー に Astra を位置づけています。法務・財務レビューでは、多数のファイルにわたるタスク状態の維持、証拠の相互照合、個別の質問ではなく完成した成果物の返却が実務的な価値です。専門家による検証、承認コントロール、最小権限のデータアクセスは依然として必要です。
長期視野のエンジニアリングエージェント
Terminal-Bench、DeepSWE、データベース移行、コンピュータ操作、長コンテキストの結果の組み合わせにより、Astra はリポジトリ規模のエンジニアリングに特に関連があります。有用なデプロイパターンは、Astra に制約された開発環境、課題または移行目標、テスト、ツールアクセスを与え、成功をマージ後のタスク品質、失敗反復の数、人的レビュー時間、総コストで評価することです。これは単一のコーディングベンチマークスコアより本番に適した指標です。
GPT-6 Astra Limitations
- プレミアムなトークン価格。Astra は Standard の短コンテキスト価格で GPT-5.6 Sol の 2.5 倍のため、日常的なチャット、分類、抽出、簡単なドラフトには非経済的なことが多い。
- 長コンテキストは割増。272K を超える入力トークンのリクエストはリクエスト全体が高い料金帯に移行するため、「1.05M コンテキスト」を均一価格のメモリと解釈すべきではない。
- モデルのネイティブ音声・動画入力なし。Astra はテキストと画像を受け付けテキストを出力します。音声/動画のネイティブ理解が中心のワークロードでは Gemini 3.8 Flash の方が柔軟。
- ファインチューニング非対応。公式モデルページでは現時点でファインチューニングは非対応とされており、カスタマイズはプロンプト、ツール、リトリーバル、ワークフローデザインに依存。
- サイバー系セーフガードがワークフローを中断しうる。OpenAI は、リスクの高い文脈では追加の安全チェックが正当な作業を一時停止・停止しうると明言。
- 普遍的なベンチマーク勝者ではない。OpenAI 公開の比較でも、Artificial Analysis Intelligence Index と HLE with tools で Claude Fable 5.1 が Astra を上回る。
FAQs
Is GPT-6 Astra officially released?
はい。OpenAI は 2026 年 9 月 3 日に ロールアウトを開始 しました。組織、ChatGPT 有料プラン、API アクセス、AWS に段階的に展開され、すべてのアカウントに同時に出現するわけではありません。
What is the GPT-6 Astra context window?
公式モデルページは 1.05M-token のコンテキストウィンドウ と 128K トークンの最大出力を掲示しています。272K を超える入力トークンのリクエストは長コンテキストの料金体系が適用されます。
How much does GPT-6 Astra cost?
Standard の短コンテキスト価格は百万トークンあたり 入力 $10 / 出力 $50 で、キャッシュ済み入力 $1、キャッシュ書き込み $12.50 です。長コンテキスト、Batch/Flex、Fast モードは別料金のため、本番の見積もりは実際のリクエストに合った階層を用いてください。
Is GPT-6 Astra better than Claude Fable 5.1?
ワークロード次第です。Astra はコンピュータ操作、コーディングエージェント、科学、サイバー、プロフェッショナル業務評価のいくつかで先行し、一方で Claude Fable 5.1 は OpenAI の公開比較に含まれる Artificial Analysis Intelligence Index と HLE with tools で Astra を上回ります。あるモデルがあらゆるカテゴリを支配すると仮定せず、自組織のエージェント/タスク評価を使いましょう。
Is GPT-6 Astra AGI?
OpenAI の公式製品ページは、Astra を新世代の知能であり広く展開された中で最も有能なモデルと説明していますが、製品自体を「AGI」とは定義していません。いくつかのタスクでベンチマークが飽和しても、普遍的で確立した AGI の定義とは同義ではありません。
Conclusion
GPT-6 Astra は、実行に焦点を当てたフロンティアモデルとして理解するのが最適です。進歩の最も強い証拠は、OpenAI の Artificial Analysis Intelligence Index での 60.9 から 61.2 というわずかな動きではありません。コンピュータ操作、エージェント的コーディング、科学ワークフロー、長コンテキストのリトリーバル、プロフェッショナルなタスク完了、サイバーセキュリティにおける大幅な改善です。1.05M のコンテキストウィンドウと深いツールスタックにより、開発者は単一の応答を超えて有用性を維持するエージェントを構築しやすくなります。
トレードオフは価格です。Standard の $10/$50 という価格はプレミアムであり、長コンテキストのリクエストはさらに高くつき、独立評価では汎用知能ワークロードで Astra が Sol より有意に高価になりうることが示されています。人手による修正が減り、完了率が上がり、出力トークンが減ることでトークンコストを上回る価値を生むとき、このモデルはプレミアムに見合います。より単純または大量のワークロードでは、GPT-5.6、Claude Fable 5.1、特に Gemini 3.8 Flash は、旧世代ではなく依然として有力な代替肢です。
