要約 AlibabaのQwenチームは2026年8月3日にQwen3.8-Maxを正式リリース — 2.4 trillion total parameters(95 billion active)のスパースMixture-of-Expertsモデルで、1-million-tokenのコンテキストウィンドウ、ネイティブのマルチモーダル(テキスト+画像+動画)対応を備える。
これはオープンウェイト提供が予定される初のMaxクラスQwenモデル(翌週公開予定)。価格は積極的に設定されており、入力トークン100万あたり$2、出力トークン100万あたり$6。長期地平のエージェントタスク、自律型ソフトウェアエンジニアリング(文書化された16日間の自己進化型コーディングプロジェクトを含む)、研究再現、マルチモーダル系ベンチマークで強力な結果を示す。Kimi K3と拮抗し、DeepSeek V4 Flashのような軽量オプションより上位の能力を持ちながら、出力が多いワークロードで西側フロンティアモデルよりはるかにコスト効率が高い。本日よりQwenCloud / Alibaba Cloud Model Studio、ならびにCometAPIのような統合プラットフォームで利用可能。
重要ポイント
- スケールと効率: 2.4T total / 95B activeのMoEアーキテクチャはQwen 3.5の基盤上に構築され、実用的な推論コストでフロンティア級の性能を実現。
- 長期地平の強さ: マルチデーの自律コーディング(~16日間で265コミット、127 PR、完全無人)、研究論文の再現+改善、1年規模のシミュレーテッドEC運用を実証。
- ベンチマークのハイライト: PaperBench 93.0(トップクラス)、Terminal Bench 2.1 86.6、強力なマルチモーダルおよびドキュメント系スコア;純粋なコーディングエージェントの一部ランキングではClaude Fable 5やGPT-5.6 Solに対して競合的だが必ずしも支配的ではない。
- 価格優位: フルの1Mコンテキスト全域で一律$2 / $6(キャッシュ済み入力は~$0.25)、出力面でKimi K3や多くの西側モデルを下回る価格。
- 提供状況: QwenCloudおよびAlibaba Cloud Model Studioで提供中(OpenAI/Anthropic互換API);オープンウェイトを計画済み;すでにCometAPIで
qwen3.8-maxとしてリストされ統合アクセスが可能。オープンウェイトは間もなく提供予定。ローカル/エッジ向けの実用的なQwen3.8-27Bも計画中。 - 実務上の強み: 単発回答ではなくエンドツーエンドの成果物生産に強み — コーディングエージェント、研究パイプライン、オフィス業務、持続的なエージェントループに最適。
Qwen3.8-Maxとは?
Qwen3.8-MaxはQwenシリーズにおけるAlibabaの最新かつ最上位のフラグシップモデルで、2026年8月3日に正式リリース(7月中旬の上海・世界AI会議でプレビューに続く)。複雑でマルチデーのタスクを最小限の監督でエンドツーエンドに完了し、出荷可能な成果物を生み出すモデルへと意図的にシフトした成果である。
アーキテクチャ的にはスパースMixture-of-Experts(MoE)で、2.4 trillion total parametersのうち、トークンあたり約95 billionが活性化。Qwen 3.5の基盤上に構築され、大容量と推論効率を両立。1-million-tokenのコンテキストウィンドウ(文書化された最大入力は約991Kトークン、最大出力は約131Kトークン)、ネイティブなマルチモーダル入力(テキスト、画像、動画)とテキスト出力に対応。推論負荷の制御(xhigh / medium / low)を備え、OpenAI Chat CompletionsとAnthropic互換プロトコルをサポートし、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClawなどの一般的なエージェントフレームワークにドロップインで対応する。
従来のMaxクラスモデルがクローズドに留まったのとは異なり、AlibabaはQwen3.8-Max(および小型のQwen3.8-27B)について、ローンチ翌週にHugging FaceとModelScopeでウェイト公開することを約束 — Max級Qwenモデルとしては初のオープン提供となる。
同モデルはコーディングエージェント、実務(“cowork”)、研究、長期計画、マルチモーダルのエージェントループを主目的に位置付けられている。公式デモは自己進化的挙動を強調:課題を作成し自分にアサイン、コードを記述・テストし、フィードバックで反復し、長期間にわたり自身のツールチェーンを改善する。
出典: Official Qwen blog および Alibaba Cloud announcements(2026年8月);Artificial Analysisのモデルカード;GAリリースを要約する独立レビュー。
Qwen3.8-Maxの新点は?
前世代のQwen3.7-Maxと比べ、3.8世代はエージェント的コーディング、長期信頼性、マルチモーダル推論、ドキュメント/オフィス性能で大幅な向上を達成。主な革新点は以下。
真の長期自律性:
数百ターンや複数日にわたるクローズドループの適応学習を維持可能。文書化された例として、16日間の自律ソフトウェア工学プロジェクト(oh-my-cli:265コミット、127プルリク、151課題、完全無人)、研究論文手法の再現と改善(GPUトレーニングループと測定可能なベンチマーク改善を含む)、そして1年分のEC運用シミュレーションでベースラインを大幅に上回る成果がある。
フィードバックループとしてのマルチモーダル:
ビジョンは単なる入力ではない。プランニング、実行監視、自己修正に視覚理解を活用 — スクリーンショットからのコード再現、インタラクティブなゲーム/アニメーション生成、2Dから3Dへの可視化といったタスクを可能にする。
リリース直後のデータではText Arenaで上位(報告上5位)、Vision Arenaで2位(報告)にランク。


エンドツーエンドの成果物重視:
孤立した回答ではなく、数百の専門領域にわたり本番品質のアウトプットを生産することに重点。
ThinkingモードとFast Inferenceモード
2つのモード:thinkingモードとfast inferenceモード。thinkingモードはより深い推論と複雑な計画に、fastモードはタスクが単純な場合の低レイテンシ応答に向く。Alibaba Cloud's OpenCodeのドキュメントでは、Qwen3.8ルートでthinkingが有効で、プレビュー用ルートにxhigh、medium、lowといった推論制御が記載されている。
この分離はプロダクト設計で価値が高い。すべてのリクエストに最重量の推論モードを使うべきではない。サポートボットは簡単なチケットを安価に分類し、要約は高速モデルで行い、ユーザーが複雑な方針判断、根本原因分析、契約レビュー、コード移行計画を求めた場合にのみQwen3.8-Maxのthinkingモードへエスカレーションできる。
これらの能力は、内部の長時間実験と、コーディングエージェント、汎用エージェント、マルチモーダル推論、文書理解、パーセプション/グラウンディングタスクを網羅する包括的ベンチマークスイートで検証された。
ベンチマーキング: データ量子化パフォーマンス
GAにあたりAlibabaは広範な内部ベンチマークスイートを公開。独立検証(Artificial Analysis Intelligence Index、LMArenaなど)はリリース直後には追随中だったが、初期のArtificial AnalysisデータではQwen3.8-MaxのIntelligence Indexは53(追跡セット内で~16/186位)、冗長性が高めで速度が相対的に低いとの指摘あり。
選抜された公式/報告スコア(Qwen3.8-Maxと主要比較):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8-Maxはマルチモーダル推論、ドキュメント/オフィス、特定のエージェント的コーディング/研究指標でしばしばトップまたは上位を獲得しつつ、純粋なソフトウェア工学系エージェントスイートの一部では最強のクローズドモデルに後れを取る。FrontierSWEやDeepSWEでの世代飛躍は特に顕著。ベンダー数値は方向性の参考とし、独立実行やワークロード固有の評価が引き続き重要。
Qwen3.8-MaxのAPI料金
Qwen3.8-Maxの公式(2026年8月上旬GA時点)QwenCloud / Alibaba Cloud Model Studio料金:
- 入力: 100万トークンあたり$2.00
- 出力: 100万トークンあたり$6.00(thinking/reasoningトークン込み)
- キャッシュ済み入力: 100万トークンあたり約$0.25(長文コンテキストの繰り返しで大幅節約)
1Mトークンのコンテキスト全域で一律価格 — 長コンテキストにサーチャージを課す競合が多い中で注目点。リージョンやプランにより一括割引等が適用される場合あり。
比較コンテキスト(同時期のおおよそのリスト価格):
- Kimi K3: ~$3 / $15
- 上位のClaude / GPTフロンティアモデル: 多くが$5+ / $15–25+
- DeepSeek V4 Flash系: 大幅低価格(多くの用途で合算$0.50未満)
複数プロバイダを併用するチームにとって、CometAPIのような集約ゲートウェイは公式料金比で~20%のディスカウント、単一のOpenAI互換エンドポイント、統合課金、容易なモデル切替/フェイルオーバーを提供するのが一般的。これによりQwen3.8-Maxの試行(同時にDeepSeek V4 Flash、Kimiモデル等との比較)を運用的に簡便かつ低コスト化。最新の実効レートはCometAPIの料金ページや無料クレジット提供を確認のこと。
Qwen3.8-MaxはKimi K3やDeepSeek V4 Flashとどう比較されるか
| Dimension | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Total / Active params | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Context | 1M | 1M | 1M |
| Multimodal | Text + Image + Video | Text + Image + Video | Text only |
| Pricing (in/out) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28 (much cheaper) |
| Open weights | Planned (next week) | Already released | MIT, available |
| Strengths | Long-horizon autonomy, multimodal, PaperBench, pricing on output | Strong independent scores, frontend coding Arena leadership | Extreme cost-efficiency, solid agentic coding for size |
| Relative standing | Competitive / leading on several agent & multimodal benches | Slight edge on some audited intelligence indices | Excellent value; lower absolute capability |
Qwen3.8-Maxは、出力が多い作業やマルチモーダルタスクでのコスト効率で概してKimi K3に匹敵または優位。一方、DeepSeek V4 Flashは高ボリュームのテキストワークロードにおける価格対効果の王者。多くのチームは統合ゲートウェイ経由で3者を併用し、単純なトラフィックはFlash級モデルに、複雑なエージェントセッションはQwen3.8-MaxまたはKimi K3にルーティングするだろう。
Qwen3.8-MaxはKimi K3に匹敵するか?
いくつかの点ではイエス。1Mコンテキストに一致し、マルチモーダルでも強力で、公式の入力/出力の標準価格ではKimi K3より安い。総パラメータの2.8Tには届かず、Kimiの公開ドキュメントはツール、コンテキストキャッシュ、構造化出力、ビジョンガイダンスに関して特に詳細である。
Qwen3.8-MaxはDeepSeek V4 Flashに匹敵するか?
1MコンテキストやMoEアーキテクチャで競合するが、製品の狙う仕事が異なる。DeepSeek V4 Flashは経済的で高速なルート。Qwen3.8-Maxは、マルチモーダル理解、高度な推論、エンタープライズ生産性が最優先の作業に向けた、より大きく高機能なルートである。
Qwen3.8-Maxで何ができるか?
コーディングとソフトウェア工学
Qwen3.8-Maxはフルスタック開発、コードレビュー、リポジトリ理解、移行計画、API設計、デバッグ、テスト推論、ソフトウェアアーキテクチャに有望。長いコンテキストは多くのファイル・ログ・要件を同時に視野に入れる必要がある際に有効。すべての補完や単純なLint説明ではなく、難度の高いコードタスクに使うべき。
オフィス/ナレッジワーク
本モデルの「Cowork」ポジショニングは重要。企業社員は単にチャットで質問するだけではない。PDFを比較し、会議を要約し、スライドをレビューし、スプレッドシートを解釈し、契約を確認し、レポートを書き、雑多な証拠から意思決定を準備する。Qwen3.8-Maxのマルチモーダルと長コンテキスト設計は、テキスト、ドキュメント、スクリーンショット、構造化データを組み合わせて推論するオフィスワークフローに適している。
エージェントワークフロー
Qwen3.8-Maxはエージェントのプランニングに有用:目標をステップに分解し、どのツールを呼ぶかを決定し、結果を評価し、計画を修正する。CometAPIでは、同一アプリで単純ステップを安価なモデルに回し、Qwen3.8-Maxを計画や検証に専念させる運用がより実用的になる。
はじめ方とCometAPI統合のヒント
- 直接アクセス: モデルID
qwen3.8-maxでQwenCloudまたはAlibaba Cloud Model Studioを利用。OpenAI互換とAnthropic互換の両エンドポイントをサポート。 - CometAPIによる統合アクセス: CometAPI.comにサインアップしAPIキーを取得、
base_urlをhttps://api.cometapi.com/v1に設定し、model="qwen3.8-max"を呼び出す。同一キーでDeepSeek V4 Flash、Kimi K3、Claude、GPT、他数百モデルも利用可能 — 実験、コスト管理、本番ルーティングに最適。CometAPIは競争力ある価格、低レイテンシ、新モデルの迅速追加を強調(Qwen3.8-Maxはローンチ直後にリスト入り)。 - エージェントフレームワーク: Claude Code、OpenClaw、またはカスタム基盤に直接接続。長期・複雑ジョブには高い推論努力を有効化。
- オープンウェイト: オンプレやファインチューニングが必要な場合は、近日公開予定のHugging Face / ModelScopeを監視のこと。
