ข้อมูลจำเพาะทางเทคนิคของ Qwen3.8-Flash-Next
| ข้อมูลจำเพาะ | Qwen3.8-Flash-Next |
|---|---|
| ผู้พัฒนา | Qwen Team, Alibaba Group |
| ประเภทโมเดล | โมเดลภาษาก่อเหตุแบบมัลติโหมดพร้อมตัวเข้ารหัสภาพ; MoE แบบเบาบางระดับสูง |
| พารามิเตอร์โมเดลหลัก | 125B |
| พารามิเตอร์ที่ถูกกระตุ้น | 6B ต่อโทเค็น |
| พารามิเตอร์ฝัง N-gram | เพิ่มเติม 51B |
| พารามิเตอร์ MTP | 4B |
| จำนวนเลเยอร์ | 48 |
| รูปแบบ attention แบบไฮบริด | 12 x [3 Gated DeltaNet เลเยอร์ + 1 Qwen Sparse Attention เลเยอร์] |
| MoE experts | ทั้งหมด 512; มีการกำหนดเส้นทาง 10 + 1 ที่แชร์ต่อโทเค็น |
| Gated Residual | 4 แขนง; bottleneck rank 320 |
| หน้าต่างบริบทแบบเนทีฟ | 262,144 โทเค็น |
| บริบทที่ขยาย | สูงสุด 1,000,000 โทเค็น ด้วย YaRN |
| รูปแบบสื่อ | อินพุตข้อความ ภาพ วิดีโอ; เอาต์พุตข้อความ |
| การควบคุมการคิด | โหมดคิด/ไม่คิด พร้อมตัวควบคุมความพยายามในการให้เหตุผลใน API ที่รองรับ |
| การปรับใช้ | Transformers, vLLM, SGLang, TokenSpeed และเฟรมเวิร์กอื่นที่รองรับ |
| เปิดเผยน้ำหนัก | Yes |
| รหัสโมเดล CometAPI | qwen3.8-flash-next |
Qwen3.8-Flash-Next คืออะไร?
Qwen3.8-Flash-Next เป็นโมเดล MoE แบบมัลติโหมดที่เปิดน้ำหนักซึ่งจะเปิดตัวจากทีม Qwen ของ Alibaba ที่สำคัญกว่านั้น มันถูกวางตำแหน่งให้เป็น พรีวิวช่วงต้นของสถาปัตยกรรมที่จะขับเคลื่อนตระกูลโมเดล Qwen4 ในอนาคต มากกว่าจะเป็นเพียงเช็คพอยต์ Qwen3.8 แบบเพิ่มพูนอีกตัวหนึ่ง
Qwen ใช้การเปิดตัวครั้งนี้เพื่อเปิดเผยทิศทางสถาปัตยกรรมรุ่นถัดไปสู่ระบบนิเวศโอเพนซอร์สก่อนที่ตระกูล Qwen4 โดยรวมจะมาถึง ซึ่งช่วยให้ผู้พัฒนากลไกอนุมาน โครงการควอนไตเซชัน เฟรมเวิร์กให้บริการโมเดล และนักพัฒนาแอปพลิเคชัน มีโอกาสเตรียมตัวล่วงหน้าสำหรับการเปลี่ยนแปลงด้านสถาปัตยกรรม
สถาปัตยกรรมที่เปิดเผยในปัจจุบันแนะนำสององค์ประกอบสำคัญ: สถาปัตยกรรมไฮบริดแบบ GDN และ Qwen Sparse Attention (QSA) GDN หมายถึงแนวทาง linear-attention แบบ DeltaNet ที่มีการ gated ซึ่งติดตามทิศทาง attention แบบไฮบริดที่เคยสำรวจไว้ใน Qwen3-Next QSA ถูกนำเสนอเป็นกลไก sparse-attention แบบใหม่ แม้ว่าข้อมูลจำเพาะทางเทคนิคฉบับสมบูรณ์ยังไม่ได้ถูกเปิดเผยต่อสาธารณะ
คุณสมบัติหลักของ Qwen3.8-Flash-Next
- พรีวิวสถาปัตยกรรม Qwen4: Qwen3.8-Flash-Next ถูกวางตำแหน่งอย่างชัดเจนว่าเป็นการนำสถาปัตยกรรมที่จะขับเคลื่อนตระกูล Qwen4 ที่กำลังจะมาถึงมาใช้งานช่วงต้น
- การออกแบบ MoE แบบมัลติโหมด: โมเดลถูกอธิบายว่าเป็นโมเดล Mixture-of-Experts แบบมัลติโหมด ที่ต่อยอดกลยุทธ์โมเดลแบบเบาบางที่มีประสิทธิภาพของ Qwen ไปสู่สถาปัตยกรรมรุ่นใหม่
- สถาปัตยกรรมไฮบริดแบบ GDN: โมเดลสานต่อทิศทางการวิจัย attention แบบไฮบริดที่เปิดตัวมากับ Qwen3-Next โดยผสานกลไก linear-attention ที่มีประสิทธิภาพเข้ากับ attention แบบดั้งเดิมในบริเวณที่การค้นคืนอย่างแม่นยำมีความสำคัญ Qwen3-Next แสดงให้เห็นว่าแนวทางนี้สามารถเพิ่มประสิทธิภาพการอนุมานบริบทยาวได้อย่างมีนัยสำคัญ
- Qwen Sparse Attention: QSA เป็นหนึ่งในสองการเปลี่ยนแปลงด้านสถาปัตยกรรมที่ถูกกล่าวถึงต่อสาธารณะสำหรับ Flash-Next รายละเอียดการนำไปใช้และประโยชน์เชิงปริมาณยังรอการเผยแพร่โดย Qwen
- มุ่งสู่ระบบนิเวศน้ำหนักเปิด: การเปิดตัวนี้มีเจตนาให้ชุมชนโอเพนซอร์สเข้าถึงการเปลี่ยนแปลงด้านสถาปัตยกรรมล่วงหน้า เพื่อให้รันไทม์อนุมานและเครื่องมือปลายน้ำสามารถปรับตัวได้ก่อนที่ Qwen4 จะมาถึง
- ประสิทธิภาพด้านการเขียนโค้ดและเอเจนต์ของ Qwen3.8-Flash-Next
| เกณฑ์มาตรฐาน | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next เทียบกับ Qwen3.8-Max เทียบกับ Qwen3.8-27B
| โมเดล | การวางตำแหน่ง | สถาปัตยกรรม / ขนาด | มัลติโหมด | สถานะปัจจุบัน |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | พรีวิวสถาปัตยกรรม Qwen4 / โมเดลเปิดเน้นประสิทธิภาพ | MoE แบบมัลติโหมด; ข้อมูลจำเพาะฉบับสมบูรณ์ยังไม่พร้อมเผยแพร่ | Yes | อยู่ระหว่างมา |
| Qwen3.8-Max | โมเดล Qwen3.8 ระดับเรือธงแบบโฮสต์ | MoE ขนาดใหญ่ | Yes | ใช้งานได้ |
| Qwen3.8-27B | โมเดล Qwen3.8 น้ำหนักเปิด | โมเดล dense 27B | ความสามารถเฉพาะรุ่น | ใช้งานได้ |
Qwen3.8-Max พร้อมให้ใช้งานแล้วผ่านระบบนิเวศคลาวด์ของ Alibaba และถูกวางตำแหน่งสำหรับงานให้เหตุผลขั้นสูง ความเข้าใจเชิงภาพ การเขียนโค้ด และงานเชิงเอเจนต์ เอกสารปัจจุบันของ Qwen ระบุว่า Qwen3.8-Max มีหน้าต่างบริบท 1M โทเค็น ขณะที่ CometAPI เปิดเผย qwen3.8-max
ดังนั้น Flash-Next จึงควรถูกมองต่างออกไป: ความสำคัญหลักของมันในระยะนี้อยู่ที่ด้านสถาปัตยกรรมมากกว่าตัวชี้วัด มันแสดงพรีวิวทิศทางเทคนิคของ Qwen4 และให้ระบบนิเวศโอเพนซอร์สมีเป้าหมายล่วงหน้าสำหรับการปรับให้เหมาะสมด้านรันไทม์และการปรับใช้