Qwen3.8-Flash の解説: 100万トークンのコンテキスト、6Bアクティブ MoE 設計、コーディングとマルチモーダルのベンチマーク、価格性能、比較、CometAPI での利用方法。
TL;DR Alibaba の Qwen3.8-Flash は、大量のコーディング、エージェント、長コンテキスト業務、マルチモーダルタスク向けのプロダクションモデル。ホスト型で100万トークンのコンテキストをサポートし、強力なベンチマーク結果と低価格 API を両立。オープンウェイト版の Qwen3.8-Flash-Next はローカル評価・デプロイにも対応。
主なポイント
- プロダクション版とオープンウェイトの名称: Qwen3.8-Flash はホスト提供のプロダクションモデル、Qwen3.8-Flash-Next はモデル詳細とベンチマーク公開に用いられたオープンウェイトのアーキテクチャ公開版。
- 極端なスパース活性化: メイン 125B パラメータ + 51B N-gram 埋め込み、トークン当たりのアクティブは 6B のみ。
- 長コンテキスト: オープンモデルは 262K ネイティブ、YaRN で 1M へ拡張可。プロダクションの QwenCloud ルートはデフォルトで 1M を公開。
- 強力なエージェント的コーディング: SWE-bench Pro 62.5、CoWorkBench 73.9、Toolathlon Verified 73.5、LiveCodeBench v6 91.9(Qwen公表)。
- マルチモーダルの強み: AndroidWorld 84.5、RealWorldQA 88.5、MathVision 90.6(コードインタプリタなし)(Qwen公表)。
- 効率: 1M トークン時、QSA はプリフィル最大 7.6x、デコード 4.9x のカーネル高速化。高いプレフィックスキャッシュ命中環境で、Qwen3.7-Plus 比 8.6x の 1M トークン・プリフィルスループット(Qwen公表)。
- 価格: Alibaba Cloud 国際は現在 入力 US$0.15/M、出力 US$0.47/M。CometAPI は 入力 US$0.12/M、出力 US$0.376/M を掲載。
公式 Qwen3.8-Flash ローンチ画像 — Alibaba/Qwen 出典
Qwen3.8-Flash とは?
Qwen3.8-Flash は、Alibaba Qwen による効率特化のプロダクションモデルで、コーディング、エージェント、長コンテキストの知的業務、マルチモーダルタスクに対応。オープンウェイトの Qwen3.8-Flash-Next と併せて発表された。Alibaba はこれを能力・レイテンシ・コストを最適化したオープンウェイトのマルチモーダル MoE モデルと説明し、Qwen4 に向けたアイデアの早期プレビューと位置付けている。
“Flash” のラベルは重要。Qwen3.8-Max が最大能力のフラッグシップ層であるのに対し、Qwen3.8-Flash はアクティブ計算を大幅に削減しつつ、実用的なコーディングとエージェント性能を提供する設計。今回のリリースはトークン当たり 6B パラメータを活性化し、フラッグシップ MoE システムに比べてアクティブ規模を小さく抑えている。
プロダクションモデルは model ID qwen3.8-flash で提供。QwenCloud は OpenAI 互換の Chat Completionsと Responses API、Anthropic 互換インターフェースをサポートし、既存のエージェントやコーディング基盤に統合しやすい。
Qwen3.8-Flash と Qwen3.8-Flash-Next の違いは?
Qwen3.8-Flash-Next はオープンウェイトのリリース。アーキテクチャ、モデル重み、デプロイ手引き、ベンチマーク一式を公開しており、重みは Hugging Face と ModelScope で入手可能。オープンモデルは 262,144 トークンのネイティブコンテキストをサポートし、YaRN で 1M に拡張できる。
Qwen3.8-Flash はプロダクション API 版。公式発表では、プロダクション版はデフォルトで 1M コンテキストを用い、公式ビルトインツールを含む。評価・導入時はホスト提供モデルの API 挙動と価格を参照し、アーキテクチャとベンチマーク詳細は Flash-Next の公開情報が有用。
Qwen3.8-Flash 仕様
| 仕様 | Qwen3.8-Flash / Flash-Next |
|---|---|
| プロバイダー | Alibaba Qwen |
| プロダクション model ID | qwen3.8-flash |
| オープンウェイトモデル | Qwen3.8-Flash-Next |
| アーキテクチャ | マルチモーダル Mixture-of-Experts; GDN + QSA ハイブリッド注意 |
| メインパラメータ | 125B |
| アクティブパラメータ | トークン当たり 6B |
| N-gram 埋め込みパラメータ | 51B |
| ネイティブ(オープン)文脈長 | 262,144 トークン |
| 拡張/ホスト文脈長 | 最大 1,000,000 トークン |
| プロダクション入力モダリティ | テキスト + 画像(公式統合例で記載) |
| オープンウェイトのモダリティ | テキスト + ビジョン(マルチモーダルとして公開) |
| リーズニング制御 | low / medium / xhigh(QwenCloud 例) |
| 並列ツール呼び出し | 公式 Codex モデル構成でサポート |
| オープンウェイト | あり(Qwen3.8-Flash-Next) |
| リリース日 | 2026年8月26–27日のリリースウィンドウ |
注目の効率指標はトークン当たり 6B のアクティブパラメータ。追加の 51B N-gram 埋め込みはルックアップ型のキャパシティで、トランスフォーマ重みとは異なり、トークン当たりの行列積予算には同じ形で入らないと Qwen は述べている。
Qwen3.8-Flash アーキテクチャの新要素
公式 Qwen アーキテクチャ図 — Qwen3.8-Flash-Next
1. GDN + Qwen Sparse Attention(QSA)
本モデルは 2 つの仕組みを組み合わせる。4 層のうち 3 層が Gated DeltaNet(GDN) を用いて履歴情報を固定サイズの状態へ圧縮し、残りの 1 層が厳密なリトリーバルのためにグローバルアテンションを担う。グローバルアテンション層では、処理すべきコンテキスト量を削減するために Qwen Sparse Attention を用いる。
実務的な目的は明快:GDN が低コストのメモリを担い、リトリーバルが重要な箇所にだけ QSA がフルアテンションを支出する。フルアテンションが計算・KV キャッシュの双方で高コスト化する長コンテキスト用途で特に有効。
2. 4 本の情報経路を持つ Gated Residual
Gated Residual は残差ストリームを 4 本の並列分岐に広げる。動的な要素単位ゲートが各分岐からの読み書き量を制御。単一ストリームに繰り返し混合されるのではなく、初期情報が深いネットワークを通じて生き残る経路を増やす。残差状態を FP8 で保持しメモリトラフィックを削減可能とも述べられている。
3. N-gram 埋め込みで計算増を伴わず容量拡張
Qwen は51B の N-gram 埋め込みパラメータを、ローカルなトークン文脈でアドレス指定して参照。通常のトランスフォーマ重みと異なりルックアップで取得され、非同期プリフェッチでホストメモリにオフロード可能。トークン当たりの演算を増やさず容量を拡張する設計。
4. Muon オプティマイザと学習の共同設計
コアの 2D 線形マップ重みに Muon オプティマイザ を適用しつつ、埋め込み・ルータ・一部の低ランク重みには AdamW を継続採用。新アーキテクチャ向けにスケーリング則を再フィットし、バッチサイズのウォームアップは不要で、実験では 18.8% の追加オプティマイザステップを回避したと報告。
5. 超スパース MoE と Multi-Token Prediction
大規模なエキスパートプールを確保しつつ、トークン当たりのルーティング先は少数に制限。さらに Multi-Token Prediction を採用し、推測デコードの受理率向上とともに学習時のバックボーン強化に寄与。いずれも「フラッグシップ級のトークン当たり計算を払わずに容量とスループットを高める」という設計目的を補強。
Qwen3.8-Flash ベンチマーク
コーディング系ベンチマーク
Alibaba はプロダクションの Qwen3.8-Flash に対応するオープンウェイト版 Qwen3.8-Flash-Next で一式のベンチマークを公開。以下は Qwen 公表のリリーススコアで、CometAPI 経由でも利用可能な競合に焦点を当てる。

| ベンチマーク | Qwen3.8-Flash | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | — | 77.5 |
| NL2Repo-Bench | 48.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 45.1 | 68.2 |
| JobBench | 55.7 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 70.3 | — |
| IFBench | 81.3 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 90.8 | 91.3 |
| HLE | 35.9 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.6 | 88.8 |
コーディング結果: Qwen3.8-Flash は SWE-bench Pro(62.5)、SWE-bench Multilingual(81.0)、LiveCodeBench v6(91.9)で選定した競合に対してリード。例外は NL2Repo-Bench で、DeepSeek V4 Flash が 54.2、Qwen は 48.1。
エージェント結果: Qwen3.8-Flash は CoWorkBench 73.9、JobBench 55.7 と、Qwen の表で選定した競合を大きく上回る。Toolathlon Verified でも DeepSeek V4 Flash を 73.5 対 70.3 で上回る。
推論結果: 差は小さい領域。GPQA Diamond では Qwen3.8-Flash が 91.7、Claude Opus 4.6 が 91.3、DeepSeek V4 Flash が 90.8。HLE では Claude Opus 4.6 が 40.0 で、Qwen(35.9)をリード。
マルチモーダル系ベンチマーク

| ベンチマーク | Qwen3.8-Flash | Claude Opus 4.6 |
|---|---|---|
| ClawEval-MM (Pass@3 / 平均) | 64.4 / 60.4 | 52.5 / 54.7 |
| AndroidWorld | 84.5 | 62.0 |
| ERQA | 72.3 | 40.8 |
| LVBench | 76.6 | 63.0 |
| RealWorldQA | 88.5 | 73.9 |
| MathVision(CIなし/あり) | 90.6 / 95.7 | 65.5 / — |
| CharXiv RQ(CIなし/あり) | 84.6 / 90.6 | 66.0 / — |
マルチモーダルのリリース結果はQwen3.8-Flashを推す強い材料。AndroidWorld 84.5、RealWorldQA 88.5、MathVision(コードインタプリタ無し)90.6 を公表。これは、単なる画像 QA に留まらず、画面を読み取り、視覚状態を理解し、行動を継続する必要があるエージェント用途を想定していることを示唆。
ベンチマーク備考: これらはベンダー公表のリリース結果であり、中立な同条件の実験ではない。ベンチマークごとにハーネスやツール設定が異なる場合や社内課題も含まれる。方向性の指標として捉え、自身のプロンプト、ツール、レイテンシ目標、受理基準で検証を。
Qwen3.8-Flash が高速かつコスト効率に優れる理由

100万トークンのコンテキストにおいて、QSA 注意カーネルはプリフィル最大 7.6x、デコード 4.9x の高速化を実現と公表。プレフィックスキャッシュ 90% 命中のサービング実験では、Qwen3.8-Flash-Next が Qwen3.7-Plus 比 8.6x のプリフィルスループット を達成。
システム全体の肝はアクティブ計算。メイン 125B モデルは大きく見えるが、トークン当たりに活性化されるのは 6B のみ。これは、DeepSeek V4 Flash の 13B(公称)より半分以下で、Qwen3.8-Max の約 95B よりはるかに小さい。パラメータ数は速度に線形には効かないが、Qwen3.8-Flash には明確な効率目標がある。
Alibaba は学習に必要なリソースがQwen3.7-Plus の約 9 分の 1で、コーディングとオフィス作業性能を向上したとも公表。別途、モデル搭載の QwenWork Standard モードでは、タスク当たりのトークン消費を 75% 削減し、生成速度を約 2 倍にしたと報告。これらは普遍的な API レイテンシ保証ではないが、想定ユースを示している。
Qwen3.8-Flash の価格
Alibaba の発表では、QwenCloud の開始価格は入力 $0.16/百万トークン、出力 $0.47/百万トークン。地域やプロダクト面、キャッシュ、更新で変動し得るため、大規模見積もり前には必ずライブの提供ページを確認すること。
本記事作成時点で、CometAPI は Qwen3.8-Flash を 入力 $0.12/百万トークン、出力 約 $0.376/百万トークンで掲載。CometAPI のモデルページでは参照価格比 20% 割引と表記。
| ルート | 入力 / 100万トークン | 出力 / 100万トークン | 例: 入力 1,000 万 + 出力 200 万 |
|---|---|---|---|
| QwenCloud 開始レート | $0.16 | $0.47 | $2.54 |
| CometAPI 掲載レート | $0.12 | ~$0.376 | ~$1.95 |
入力 1,000 万、出力 200 万トークンのワークロードでは、試算は QwenCloud が約 $2.54、CometAPI 掲載レートでは約 $1.95。実運用のエージェント請求は、ツール呼び出し、リトライ、長い推論、重複コンテキスト、外部サービスにより増える可能性がある。単なるトークン単価ではなく「受理結果あたりのコスト」で比較を。
Qwen3.8-Flash と Qwen3.8-Max と DeepSeek V4 Flash の比較
| 次元 | Qwen3.8-Flash | Qwen3.8-Max | Gemini 3.7 Flash | DeepSeek V4 Flash |
|---|---|---|---|---|
| ポジショニング | 効率最優先の Qwen プロダクションモデル | Qwen のフラッグシップ | Google の実務向け Flash モデル | 効率最優先のテキスト MoE |
| 総/アクティブパラメータ | 125B + 51B ルックアップ / 6B | 2.4T / ~95B | 非公開 | 284B / 13B |
| コンテキスト | 1M(ホスト) | 1M | 1,048,576 | 1M |
| マルチモーダル | テキスト + ビジョン(文書化) | テキスト + 画像 + 動画 | テキスト + 画像 + 動画 + 音声 + PDF | テキスト特化 |
| リーズニング制御 | low / medium / xhigh | 高度推論 / 高速モード | low / medium / high | Non-think / Think / Think Max |
| CometAPI 入力価格 | US$0.12/M | US$1.60/M | US$0.60/M | US$0.176/M |
| 公式プロバイダー価格(入力 / 出力) | US$0.15 / US$0.47(Alibaba Cloud 国際) | US$2 / US$6(Alibaba Cloud 国際) | US$0.75 / US$3.75(~2026/12/31) | ピーク: US$0.44 / US$1.32; オフピーク: US$0.22 / US$0.66 |
| 適合 | 大量コーディング、エージェント、協働 | 最難度の Qwen タスク、長期自律 | Google ツール生態系、広範マルチモーダル | 高スループットなテキスト推論・コーディング |
Qwen3.8-Flash が優れる点
- アクティブ計算の効率: トークン当たり 6B の活性化は、エージェント的コーディングやマルチモーダルで強いスコアを出すモデルとしては極めて小さい。
- Qwen 生態系での価値: フラッグシップの Qwen3.8-Max に比べ、Max を要しないワークロードには大幅に低コスト。
- エージェント + オフィスのバランス: CoWorkBench、JobBench、Toolathlon、SWE-bench Pro、マルチモーダルエージェント系で特に強く、学術 QA のみではない。
- オープンウェイトの道: Qwen3.8-Flash-Next が重みを提供し、ローカルデプロイや独立評価、ファインチューニングが可能。
他モデルが適する場合
- 最大の Qwen 能力が必要な場合は Qwen3.8-Max を。Max はアクティブ計算枠が大きく、最難の長期タスク向け。
- 広い入力モダリティが重要な場合は Gemini 3.7 Flash を。音声・動画・PDF および Google ツール統合を明示サポート。
- テキスト優先の効率なら DeepSeek V4 Flash。Qwen の比較では NL2Repo-Bench で優位、コスト重視のコーディング代替として強力。
- プレミアム推論とエンタープライズ成熟度には Claude Opus 4.6。Qwen 表では HLE をリードし、GPQA でも非常に競争力。
Qwen3.8-Flash の主なユースケース
コーディングエージェントとリポジトリ作業
Qwen3.8-Flash は、課題修正、リファクタリング、コードレビュー、リポジトリ探索、テスト生成、デバッグ、ツール駆動のコーディングループに好適。LiveCodeBench と SWE-bench Pro の高スコアは、単なる低レイテンシのチャットモデルではなく、複数手順のソフトウェア業務を意図した設計であることを示す。
長コンテキストのエンタープライズ知的業務
100万トークンのプロダクションコンテキストは、大量の文書、コードベース、ログ、会議書き起こし、長期間のエージェント履歴を保持可能。CoWorkBench と JobBench の結果から、文書統合、スプレッドシート/スライド業務、リサーチ支援、コンプライアンスレビュー、運用分析に特に魅力的。
マルチモーダルエージェント
AndroidWorld、RealWorldQA、ERQA、MathVision のスコアは、スクリーンショット、視覚文書、UI、図表、実画像をワークフローの一部として理解するエージェントを指向。ブラウザエージェント、UI テスト、ビジュアル QA、ドキュメントエージェント、画面認識オートメーションに関連。
大量ルーティング
Qwen3.8-Flash はフラッグシップより大幅に安価なため、実用的なアーキテクチャとしては大半のトラフィックを Flash に流し、曖昧・高リスク・極めて難しい要求のみを Qwen3.8-Max や他のプレミアムモデルにエスカレーションする構成が考えられる。CometAPI のような統一ゲートウェイは、単一の API 契約の裏でプロバイダーを切り替えられるため、このルーティングを容易にする。
制約と注意点
- ベンチマークは自己申告。 Qwen 選定のハーネス、社内課題、ツール有効設定を含むものがある。独立検証が重要。
- 全ベンチマークで勝つわけではない。 DeepSeek V4 Flash は Qwen の比較で NL2Repo-Bench をリードし、Claude Opus 4.6 は HLE をリード。
- コンピュータ使用は絶対値で依然難しい。 OSWorld 2.0 の二値スコアは 19.4(部分点は大幅に高い)。
- ホストとオープンウェイトで挙動差があり得る。 システムプロンプト、ツール、コンテキスト管理、量子化、サービングスタック、更新で、実運用結果は公開された Flash-Next のセットアップからずれ得る。
- 価格は動的。 ローンチ時と集約サイトの参照価格に差がある場合がある。予算化は常にライブのエンドポイント価格で。
CometAPI で Qwen3.8-Flash API を使う方法
CometAPI は Qwen3.8-Flash を OpenAI 互換エンドポイントで公開。既存の OpenAI SDK 統合は、API キー・ベース URL・モデル ID を差し替えるだけで切り替えられる場合が多い。
Qwen3.8-Flash に CometAPI を使う理由
CometAPI は統一 API エンドポイントを提供し、個別のプロバイダー統合を維持せずに Qwen3.8-Flash と他モデルの比較検証が可能。ベンチマーク比較、フォールバックルーティング、コスト基準のモデル選択に有用。
- CometAPI の API キーを作成。 CometAPI ダッシュボード でキーを生成し、ソースコードではなく環境変数に保存。
- 統一ベース URL を使用。 SDK の base URL を
https://api.cometapi.com/v1.に設定。 - モデルを選択。 model ID は qwen3.8-flash を使用。
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "You are a precise coding assistant."},
{"role": "user", "content": "Review this API design and identify reliability risks."},
],
)
print(response.choices[0].message.content)
cURL
curl "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{"role": "user", "content": "Summarize the main risks in this migration plan."}
]
}'
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.
FAQs
Qwen3.8-Flash はオープンソースですか?
プロダクションの Qwen3.8-Flash はホスト API。対応するオープンウェイト版 Qwen3.8-Flash-Next は Hugging Face と ModelScope で重みを公開。“オープンウェイト”がより正確な表現で、利用権はモデルライセンスに依存。
Qwen3.8-Flash のコンテキストウィンドウは?
オープンモデルはネイティブで 262,144 トークン、YaRN で 1,000,000 トークンに拡張可。Alibaba はプロダクションの Qwen3.8-Flash サービスがデフォルトで 1M コンテキストを用いると述べている。
Qwen3.8-Flash のパラメータ数は?
リリースは、メイン 125B、N-gram 埋め込み 51B、トークン当たりのアクティブは 6B。低アクティブ数が効率設計の中核。
Qwen3.8-Flash は画像入力に対応しますか?
はい。リリースはマルチモーダルで、オープンウェイトのデプロイスタックはテキストとビジョンをサポート。ホストモデルの公式統合例でもテキストと画像入力が記載。プロバイダーごとに公開モダリティが異なる場合があるため、導入前に最新の API 機能ページを確認を。
Qwen3.8-Flash は Qwen3.8-Max より優れていますか?
一概には言えない。レイテンシ・アクティブ計算・価格が重視されるなら Qwen3.8-Flash が適切。最難・高価値タスクにはフラッグシップの Qwen3.8-Max。ルーティングで両者を併用する構成が実務的。
Qwen3.8-Flash の価格は?
Alibaba はローンチ時点で 入力 $0.16/M、出力 $0.47/M を公表。CometAPI は現在 入力 約 $0.12/M、出力 約 $0.376/M を掲載。価格は変動するため、予算化ではライブ価格を確認。
結論
Qwen3.8-Flash は、「より大きなモデル」から「より良いシステム経済性」へのシフトを体現する代表例。紙面上のメイン 125B は大きいが、トークン当たりの活性化は 6B に抑え、N-gram 埋め込みでルックアップ型に容量を追加。QSA、Gated Residual、超スパース MoE ルーティング、長コンテキスト志向のサービング設計はすべて、「フラッグシップ級の推論コストなしにエージェント的コーディングとマルチモーダル能力を届ける」という同一方向に収斂している。
リリース結果は、ソフトウェアエンジニアリング、オフィスエージェント、ツール使用、ビジュアルワークフローに特に説得力がある。一方で万能ではなく、Qwen の表では少なくともリポジトリ生成系で DeepSeek V4 Flash が勝ち、HLE では Claude Opus 4.6 が強い。Qwen3.8-Max は Qwen 階層で依然として高能力。
実務としては、Qwen3.8-Flash を実タスクで評価し、Gemini 3.7 Flash、DeepSeek V4 Flash、ルーティングスタック内のプレミアムモデルと「受理結果あたりのコスト」を比較するのが有益。CometAPI は、そのようなマルチモデルの検証・デプロイに単一の OpenAI 互換インターフェースを提供する。
