Qwen3.8-Flash-Next 技術仕様
| 仕様 | Qwen3.8-Flash-Next |
|---|---|
| 開発元 | Qwen Team, Alibaba Group |
| モデルタイプ | ビジョンエンコーダを備えたマルチモーダル因果言語モデル;超スパースMoE |
| メインモデルパラメータ数 | 125B |
| 有効化パラメータ | トークンあたり 6B |
| N-gram 埋め込みパラメータ | 51B 追加 |
| MTP パラメータ | 4B |
| 層数 | 48 |
| ハイブリッドアテンションパターン | 12 x [3 Gated DeltaNet 層 + 1 Qwen Sparse Attention 層] |
| MoE エキスパート | 合計 512; トークンあたり 10 ルーティング + 1 共有 |
| ゲート付き残差 | 4 分岐; ボトルネックランク 320 |
| ネイティブのコンテキストウィンドウ | 262,144 トークン |
| 拡張コンテキスト | YaRN により最大 1,000,000 トークン |
| モダリティ | テキスト、画像、動画入力;テキスト出力 |
| 思考コントロール | 対応APIにおける思考/非思考および推論負荷のコントロール |
| デプロイ | Transformers、vLLM、SGLang、TokenSpeed などの対応フレームワーク |
| オープンウェイト | はい |
| CometAPI モデルID | qwen3.8-flash-next |
Qwen3.8-Flash-Next とは?
Qwen3.8-Flash-Next は Alibaba の Qwen チームによるオープンウェイトのマルチモーダルMoEモデル(近日公開)です。重要なのは、単なる Qwen3.8 の増分的なチェックポイントではなく、将来の Qwen4 モデルファミリーを支える予定のアーキテクチャの早期プレビューとして位置付けられている点です。
Qwen は、このリリースを通じて次世代アーキテクチャの方向性を Qwen4 の本格展開に先立ってオープンソースエコシステムに公開します。これにより、推論エンジン開発者、量子化プロジェクト、モデル提供フレームワーク、アプリケーション開発者が、アーキテクチャの変更に事前に対応できるようになります。
現時点で公開されているアーキテクチャは、2つの重要なコンポーネントを導入しています。すなわち、GDN ベースのハイブリッドアーキテクチャと Qwen Sparse Attention(QSA)です。GDN は、Qwen3-Next で先行して探求されたハイブリッドアテンションの方向性に基づく、DeltaNet スタイルの線形アテンションにゲートを組み合わせた手法を指します。QSA は新しいスパースアテンション機構として提示されていますが、その完全な技術仕様はまだ公表されていません。
Qwen3.8-Flash-Next の主な特徴
- Qwen4 アーキテクチャのプレビュー:Qwen3.8-Flash-Next は、今後登場する Qwen4 ファミリーを支えるアーキテクチャの早期実装として明示的に位置付けられています。
- マルチモーダルMoE設計:本モデルはマルチモーダルな Mixture-of-Experts モデルとして説明されており、Qwen の効率的なスパースモデル戦略を次世代アーキテクチャへ拡張します。
- GDN ハイブリッドアーキテクチャ:Qwen3-Next で導入されたハイブリッドアテンションの研究方向を継承し、精密な検索が重要な場面では従来型アテンションを、長文脈での効率向上には線形アテンションを組み合わせます。Qwen3-Next は、このアプローチが長文脈推論の効率を大幅に改善できることを示しました。
- Qwen Sparse Attention:QSA は Flash-Next における2つのアーキテクチャ変更のひとつとして公に強調されています。その詳細な実装と定量的な効果は、今後 Qwen により文書化される予定です。
- オープンウェイトエコシステム志向:このリリースは、Qwen4 が登場する前にオープンソースコミュニティへアーキテクチャの変更点を早期公開し、推論ランタイムや下流のツール群が適応できるようにすることを目的としています。
- Qwen3.8-Flash-Next のコーディングおよびエージェント性能
| ベンチマーク | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next と Qwen3.8-Max と Qwen3.8-27B の比較
| モデル | 位置付け | アーキテクチャ / 規模 | マルチモーダル | 現状 |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Qwen4 アーキテクチャのプレビュー / 効率重視のオープンモデル | マルチモーダルMoE; 完全な仕様は未公開 | はい | 近日公開 |
| Qwen3.8-Max | フラグシップのホスト提供Qwen3.8モデル | 大規模MoE | はい | 提供中 |
| Qwen3.8-27B | オープンウェイトのQwen3.8モデル | 27B デンスモデル | モデル固有の機能 | 提供中 |
Qwen3.8-Max はすでに Alibaba のクラウドエコシステムで利用可能で、高度な推論、視覚理解、コーディング、エージェント的ワークロード向けに位置付けられています。現在のドキュメントでは Qwen3.8-Max のコンテキストウィンドウが 1M トークンとされており、CometAPI ではすでに qwen3.8-max が公開されています。
したがって Flash-Next は異なる見方をするべきです。現段階での主たる意義はベンチマークではなくアーキテクチャにあります。Qwen4 の技術的方向性をプレビューし、オープンソースエコシステムに対してランタイムやデプロイの最適化に取り組むための早期ターゲットを提供します。