Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →
technology/งานวิจัย CometAPI

ขอข้อมูลเพิ่มเติมหน่อย: “Qwen3.8-Flash-Next” เป็นชื่อรุ่นบนแพลตฟอร์มใด (เช่น DashScope, OpenRouter หรือชื่อภายในระบบของคุณ)? หากมีลิงก์หรือรหัสรุ่นที่แน่ชัด โปรดส่งมาเพื่อให้ตอบได้ตรงรุ่นมากขึ้น

สำรวจ Qwen3.8-Flash-Next: สถาปัตยกรรม MoE 125B, พารามิเตอร์ที่ใช้งานจริง 6B, QSA, บริบทแบบขยาย 1M โทเคน, เกณฑ์มาตรฐานแบบมัลติโมดัล, คุณสมบัติ, การกำหนดราคา.

CometAPI
Mia Marenทีมวิจัยโมเดล AI และ API
อัปเดตแล้ว Aug 30, 2026 9 นาทีในการอ่าน
ขอข้อมูลเพิ่มเติมหน่อย: “Qwen3.8-Flash-Next” เป็นชื่อรุ่นบนแพลตฟอร์มใด (เช่น DashScope, OpenRouter หรือชื่อภายในระบบของคุณ)? หากมีลิงก์หรือรหัสรุ่นที่แน่ชัด โปรดส่งมาเพื่อให้ตอบได้ตรงรุ่นมากขึ้น
ใช้รูปแบบนี้

เรียกใช้ API ครั้งแรก

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Qwen3.8-Flash-Next ไม่ได้เป็นเพียงสมาชิกที่เล็กกว่าหรือเร็วกว่าในตระกูล Qwen3.8 เท่านั้น Qwen อธิบายว่าเป็นแบบจำลอง MoE หลายโมดาลิตีแบบ open-weight และเป็นพรีวิวเบื้องต้นของสถาปัตยกรรมที่จะใช้ใน Qwen4 การออกแบบได้ปรับทั้ง Attention, การเชื่อมต่อ Residual, ความจุ Embedding และการเพิ่มประสิทธิภาพไปพร้อมกัน โดยมีเป้าหมายเพื่อเพิ่มขีดความสามารถขณะเดียวกันก็ลดปริมาณคอมพิวต์ต่อโทเค็นอย่างมาก

TL;DR

Qwen3.8-Flash-Next ผสานแบบจำลองหลัก 125B พารามิเตอร์เข้ากับตาราง N-gram Embedding ขนาด 51B เพิ่มเติม พร้อมทั้ง เปิดใช้งานเพียง 6B พารามิเตอร์ต่อโทเค็น โดยรองรับคอนเท็กซ์ 262,144 โทเค็นแบบ native และขยายได้ถึง 1,000,000 โทเค็นด้วย YaRN สถาปัตยกรรมสร้างบนสัดส่วนผสม 3:1 ของ Gated DeltaNet และ Qwen Sparse Attention, การเชื่อมต่อ Gated Residual สี่แขนง, N-gram Embedding, คลังผู้เชี่ยวชาญ MoE แบบเบาบางมาก, Multi-Token Prediction และการฝึกด้วย Muon

ประเด็นสำคัญที่สุดคือประสิทธิภาพ ไม่ใช่เพียงจำนวนพารามิเตอร์โดยรวม Qwen รายงานว่าการฝึกแบบจำลองนี้ มีต้นทุนประมาณหนึ่งในเก้าของ Qwen3.7-Plus แต่ผลประเมินตอนเปิดตัวจัดวางโมเดลให้นำหน้าเบสไลน์ Qwen รุ่นก่อนในหลายงานด้านโค้ดดิ้ง เอเจนต์สำนักงาน และงานหลายโมดาลิตี ตัวเลขเหล่านี้มาจากผู้ผลิตและควรถูกมองเป็นหลักฐานตอนเปิดตัว มากกว่าการยืนยันโดยอิสระ

สำหรับนักพัฒนา น้ำหนักแบบเปิดมีให้ผ่านช่องทางของ Qwen ขณะที่เวอร์ชันให้บริการแบบจัดการในโปรดักชันใช้ชื่อ Qwen3.8-Flash บน QwenCloud CometAPI แสดงรายการ Qwen3.8-Flash-Next ด้วยรหัสโมเดล qwen3.8-flash-next ทำให้นักพัฒนามีเส้นทางรวมกับโมเดลแนวหน้าอื่นๆ

ใจความสำคัญ (Key Takeaways)

  • พารามิเตอร์แบบจำลองหลัก 125B + N-gram embedding 51B โดยเปิดใช้งาน 6B พารามิเตอร์ต่อโทเค็น
  • รูปแบบความสนใจแบบผสม 3 GDN : 1 QSA ถูกออกแบบมาเพื่อผสานหน่วยความจำที่มีประสิทธิภาพเข้ากับการเรียกคืนระยะไกลที่แม่นยำ
  • คอนเท็กซ์ native 262,144 โทเค็น และขยายได้ถึง 1M โทเค็นผ่าน YaRN
  • Qwen รายงานว่า QSA ให้ ความเร็ว prefill สูงสุด 7.6 เท่า และ decode kernel 4.9 เท่า ที่คอนเท็กซ์ 1M
  • สตรีม residual ถูกขยายเป็น สี่แขนงพร้อมเกต ช่วยปรับปรุงการไหลของข้อมูลข้ามเลเยอร์และความเสถียรในการฝึก
  • ตารางเปิดตัวอย่างเป็นทางการแสดงผลลัพธ์ที่แข็งแรงบน SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld และ RealWorldQA แต่ไม่ได้กวาดทุกชุดทดสอบ
  • Qwen วางตำแหน่งรุ่นนี้ว่าเป็นพรีวิวสถาปัตยกรรม ดังนั้นความสำคัญส่วนหนึ่งจึงอยู่ที่สัญญาณสำหรับ Qwen4 มากกว่าจำนวนอันดับบนบัลลังก์ในปัจจุบันเพียงอย่างเดียว

What Is Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next คือแบบจำลองภาษาชนิดเชิงสาเหตุแบบหลายโมดาลิตีที่มีตัวเข้ารหัสวิชั่นและแกนภาษาแบบ Mixture-of-Experts ที่เบาบางมากเป็นพิเศษ โมเดลการ์ดอย่างเป็นทางการอธิบาย สถาปัตยกรรม 48 เลเยอร์ พร้อมผู้เชี่ยวชาญ 512 ราย มี 10 routed experts ต่อโทเค็นและ 1 shared expert และโครงร่างชั้นซ่อนที่วนรอบสามเลเยอร์ของ Gated DeltaNet ตามด้วยหนึ่งเลเยอร์ของ Qwen Sparse Attention

การเปิดตัวนี้มีบทบาทคล้ายกับ Qwen3-Next: เปิดเผยการเปลี่ยนแปลงด้านสถาปัตยกรรมก่อนจะสเกลสู่ตระกูลเต็มรุ่นถัดไป Qwen ระบุชัดว่าแบบจำลองนี้เป็น พรีวิวเชิงทดลองของสถาปัตยกรรมที่จะเป็นแกนของ Qwen4 ทำให้แบบจำลองนี้น่าสนใจเป็นพิเศษสำหรับวิศวกรที่ให้ความสำคัญกับประสิทธิภาพการให้บริการ คอนเท็กซ์ยาว และทิศทางการวิจัยสถาปัตยกรรมโมเดลเปิด

4 องค์ประกอบแกนของ Qwen3.8-Flash-Next

โมเดลเปลี่ยนแปลงองค์ประกอบหลักพร้อมกันสี่ด้าน: ความสนใจ (attention), การไหลของ residual, ความจุ embedding และการเพิ่มประสิทธิภาพ การออกแบบร่วมกันนี้สำคัญ เพราะกำไรด้านประสิทธิภาพในองค์ประกอบหนึ่งอาจสูญหายหากอีกองค์ประกอบหนึ่งกลายเป็นคอขวดเมื่อคอนเท็กซ์ยาวหรือสเกลใหญ่

Hybrid Attention: GDN + Qwen Sparse Attention

เลเยอร์ส่วนใหญ่จะไม่ทำ Attention แบบทั่วโลก โดย สามในสี่ของทุกเลเยอร์ใช้ Gated DeltaNet เพื่อบีบอัดข้อมูลในอดีตให้เป็นสถานะขนาดคงที่ ส่วนเลเยอร์ที่สี่ใช้ Attention แบบทั่วโลกเพื่อเรียกคืนอย่างแม่นยำ แต่ถูกออกแบบใหม่เป็น Qwen Sparse Attention (QSA)

QSA หลีกเลี่ยงการค้นหาทุกโทเค็นอย่างอิสระ ตัวทำดัชนีที่เบาแบ่งลำดับเป็นไมโครบล็อก ประเมินว่าบล็อกไหนสำคัญ แล้วจึงทำ attention เฉพาะบริเวณที่เลือก ในคำอธิบายของ Qwen การออกแบบนี้ลดทั้งคอมพิวต์ของ attention และค่าใช้จ่ายด้านการทำดัชนีที่ต้องใช้ในการค้นหาคอนเท็กซ์ที่เกี่ยวข้อง การออกแบบเข้ากันได้ดีกับเครือข่ายแบบไฮบริด เพราะดัชนีแบบเบาบางถูกสร้างขึ้นอย่างอิสระในแต่ละเลเยอร์ของ attention ไม่ได้พึ่งความคล้ายกันระหว่างเลเยอร์ที่อยู่ติดกัน

ตัวเลขประสิทธิภาพโดดเด่น ที่คอนเท็กซ์ 1M โทเค็น Qwen รายงาน ความเร็ว prefill สูงสุด 7.6 เท่าและความเร็ว decode สูงสุด 4.9 เท่าสำหรับเคอร์เนล QSA ในการให้บริการที่มีการใช้แคชซ้ำสูง โดยมีอัตรา hit ของ prefix-cache 90% โมเดลเต็มทำได้ throughput prefill สูงกว่าของ Qwen3.7-Plus ถึง 8.6 เท่า ที่คอนเท็กซ์ 1M

Gated Residual: สี่เส้นทางแทนหนึ่ง

Transformer แบบดั้งเดิมจะอ่านและเขียนสตรีม residual เดียวซ้ำๆ Qwen3.8-Flash-Next ใช้ Gated Residual เพื่อขยายสตรีมนั้นเป็นสี่แขนงแบบขนาน เกตอ่านแบบต่อองค์ประกอบตัดสินว่าควรรับข้อมูลจากแต่ละแขนงเท่าไร ส่วนเกตเขียนระดับแขนงกำหนดว่าจะเขียนอะไรกลับไป

วัตถุประสงค์คือรักษาคุณลักษณะที่มีประโยชน์ผ่านความลึก โดยไม่บังคับให้ทุกคุณลักษุผ่านช่องเดียวที่ถูกผสมอย่างต่อเนื่อง Qwen ยังรายงานว่าเกตช่วยกดค่ากระตุ้นที่ผิดปกติ และสถานะ residual สามารถเก็บใน FP8 ลดการจราจรของหน่วยความจำ แนวคิดสำคัญไม่ใช่เพียงเพิ่มความจุของ residual แต่เป็นการคัดเส้นทางข้อมูลข้ามเลเยอร์อย่างมีการควบคุม

N-gram Embedding: เพิ่มความจุโดยไม่เพิ่มคอมพิวต์ตามสัดส่วน

โมเดลเพิ่ม พารามิเตอร์ N-gram Embedding อีก 51B นอกเหนือจากแกนหลัก 125B ต่างจาก Embedding ปกติที่อ้างอิงจากโทเค็นเดี่ยว N-gram Embedding ใช้แพตเทิร์นโทเค็นเฉพาะถิ่น เช่น bigram และ trigram ทำให้โมเดลมีหน่วยความจำแบบ lookup ขนาดใหญ่สำหรับแพตเทิร์นเฉพาะถิ่นที่เกิดซ้ำ

สิ่งที่ไม่ปกติคือที่อยู่ของความจุ เนื่องจากที่อยู่สำหรับ lookup รู้ได้ก่อนต้องใช้ embedding ตารางจึงสามารถเก็บไว้ในหน่วยความจำของโฮสต์และดึงล่วงหน้าแบบอะซิงโครนัสขณะที่การคำนวณบน GPU ยังดำเนินต่อไป นั่นหมายความว่าพารามิเตอร์ 51B เพิ่มเติมนี้ไม่ได้ทำตัวเหมือนพารามิเตอร์การคูณเมทริกซ์แบบหนาแน่น 51B สถาปัตยกรรมจึงกำลังสเกลทรัพยากรสองประเภท: พารามิเตอร์ของโมเดลที่ใช้คอมพิวต์หนัก และหน่วยความจำแบบ lookup ที่ใช้คอมพิวต์ต่ำ

Muon และการเพิ่มประสิทธิภาพการฝึก

Qwen ฝึกสถาปัตยกรรมนี้ด้วย ตัวเพิ่มประสิทธิภาพ Muon สำหรับแผนที่เชิงเส้นสองมิติ เช่น น้ำหนักหลักใน attention, GDN และผู้เชี่ยวชาญ MoE ขณะที่ embeddings, router และพารามิเตอร์ Gated Residual แบบอันดับต่ำยังคงใช้ AdamW เมทริกซ์ที่ถูกฟิวส์เช่น QKV และการฉาย SwiGLU ถูกแยกเป็นการแปลงเชิงเส้นอิสระก่อนการทำให้ตั้งฉาก

ทีมยังปรับกฎการสเกลสำหรับสถาปัตยกรรมใหม่ และรายงานว่า Batch Size Warmup แบบเดิมไม่จำเป็น การเพิ่มขนาดแบตช์ทีละน้อยไม่ได้ปรับปรุงผลลัพธ์สุดท้าย กลับต้องใช้ ขั้นตอนของตัวเพิ่มประสิทธิภาพมากขึ้น 18.8% สูตรสุดท้ายจึงเริ่มที่ขนาดแบตช์เป้าหมายโดยตรง

Ultra-Sparse MoE และ Multi-Token Prediction

โมเดลการ์ดอย่างเป็นทางการระบุว่า มีผู้เชี่ยวชาญ 512 ราย โดยเปิดใช้ 10 routed experts และ 1 shared expert ต่อโทเค็น คลังผู้เชี่ยวชาญขนาดใหญ่เพิ่มความจุที่เก็บได้โดยไม่ต้องเปิดใช้โมเดลทั้งหมดสำหรับทุกโทเค็น โมดูล Multi-Token Prediction (MTP) ชั้นเดียวถูกฝึกด้วยหลายสเต็ปเพื่อเพิ่มอัตราการยอมรับการถอดรหัสแบบคาดคะเน ขณะเดียวกันก็สนับสนุนแกนหลักของโมเดล

ประสิทธิภาพบนชุดทดสอบของ Qwen3.8-Flash-Next

Qwen เผยแพร่การประเมินกว้างครอบคลุมภาษา โค้ด เอเจนต์ และวิสัน-ภาษา ตัวเลขเหล่านี้มีประโยชน์เพราะหลายโมเดลเปรียบเทียบถูกเรียกใหม่ในกรอบทดสอบของ Qwen แต่ก็ยังเป็น การประเมินตอนเปิดตัวที่รายงานโดยผู้ผลิต ไม่ใช่การทำซ้ำชุดทดสอบโดยอิสระ แถวนอกจากนี้ยังใช้กรอบงานหรือผู้ตัดสินเฉพาะชุดทดสอบ ดังนั้นการตีความที่ปลอดภัยที่สุดคือเชิงทิศทาง: แสดงให้เห็นจุดที่ Qwen3.8-Flash-Next แข็งแกร่ง และจุดที่คู่แข่งยังนำ

ประสิทธิภาพด้านโค้ดและเอเจนต์

ชุดทดสอบQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek V4 FlashClaude Opus 4.6
DeepSWE 1.158.742.216.554.4--
SWE-bench Pro62.561.755.856.053.4
SWE-bench Multilingual81.073.875.8--77.5
NL2Repo-Bench48.142.341.154.247.6
CoWorkBench73.970.765.145.168.2
JobBench55.733.427.641.336.6
Toolathlon Verified73.567.150.670.3--
IFBench81.379.579.179.262.5
GPQA Diamond91.789.290.390.891.3
HLE35.930.834.733.840.0
LiveCodeBench v691.990.389.690.688.8

ภาพรวมด้านโค้ดแข็งแรงแต่มีความละเอียดอ่อน Qwen3.8-Flash-Next นำหน้าชุดเปรียบเทียบที่ระบุบน SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified และ LiveCodeBench v6 อย่างไรก็ตาม DeepSeek V4 Flash นำหน้าใน NL2Repo-Bench ขณะที่ Claude Opus 4.6 นำบน HLE ทำให้ประสิทธิภาพเป็นพาดหัวที่ป้องกันได้มากกว่าการครองอันดับทุกชุดทดสอบ

กำไรที่โดดเด่นที่สุดเมื่อเทียบกับเบสไลน์ Qwen รุ่นก่อนปรากฏในงานระยะยาว คะแนน CoWorkBench เพิ่มจาก 65.1 บน Qwen3.7-Plus เป็น 73.9 ขณะที่ JobBench ขยับจาก 27.6 เป็น 55.7 เนื่องจาก CoWorkBench เป็นชุดทดสอบภายในของ Qwen กำไรดังกล่าวควรได้รับการทำซ้ำโดยอิสระ แต่ก็สอดคล้องกับโฟกัสสถาปัตยกรรมที่กล่าวไว้บนเวิร์กโฟลว์เอเจนต์และงานสำนักงานที่คุ้มค่าต้นทุน

ประสิทธิภาพหลายโมดาลิตี

ชุดทดสอบQwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude Opus 4.6
ClawEval-MM (Pass@3 / Avg)64.4 / 60.457.4 / 56.957.4 / 60.152.5 / 54.7
RecreationBench49.947.130.2--
AndroidWorld84.581.981.062.0
OSWorld 2.0 (Binary / Partial)19.4 / 52.319.4 / 48.02.8 / 21.5--
Vision2Web64.062.942.1--
ERQA72.365.569.840.8
LVBench76.672.476.263.0
RealWorldQA88.585.986.973.9
MathVision (without / with CI)90.6 / 95.790.0 / 94.690.3 / 88.765.5 / --
CharXiv RQ (without / with CI)84.6 / 90.683.7 / 90.285.8 / 85.966.0 / --

แหล่งข้อมูล: การประเมินตอนเปิดตัวอย่างเป็นทางการของ Qwen**.

ผลหลายโมดาลิตีสนับสนุนมุมมองว่านี่ไม่ใช่เพียงโมเดล Flash ที่เน้นโค้ด Qwen3.8-Flash-Next ทำได้ 84.5 บน AndroidWorld, 64.0 บน Vision2Web, 76.6 บน LVBench และ 88.5 บน RealWorldQA ในตารางของ Qwen โมเดลการ์ดยังให้ตัวอย่างอินพุตภาพและวิดีโอ รวมถึงข้อแนะนำสำหรับการสุ่มตัวอย่างอัตราเฟรมที่สูงขึ้นบนงานวิดีโอระดับชั่วโมง video workloads.

Qwen3.8-Flash-Next เทียบกับโมเดลอื่น

การเปรียบเทียบที่มีประโยชน์ควรแยกสามคำถาม: คอมพิวต์ที่เปิดใช้งานต่อโทเค็นมีเท่าไร โมเดลรองรับโมดาลิตีและคอนเท็กซ์กว้างเพียงใด และประสิทธิภาพบนเวิร์กโฟลว์ตัวแทนเป็นอย่างไร เพียงดูจำนวนพารามิเตอร์รวมไม่ตอบคำถามเหล่านี้

Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus

มิติQwen3.8-Flash-NextQwen3.8-27BQwen3.7-Plus
พารามิเตอร์โมเดล125B + 51B N-gram embedding27B397B
พารามิเตอร์ที่เปิดใช้6B27B17B
คอนเท็กซ์ native262K262K ในการตั้งค่าเทียบของ Qwenโมเดลคอนเท็กซ์ยาวรุ่นก่อน
DeepSWE 1.158.742.216.5
CoWorkBench73.970.765.1
JobBench55.733.427.6
AndroidWorld84.581.981.0

ผลสำคัญคือความสามารถต่อพารามิเตอร์ที่เปิดใช้งาน Qwen3.8-Flash-Next เปิดใช้งาน 6B พารามิเตอร์ต่อโทเค็น เทียบกับ 27B ของ Qwen3.8-27B และ 17B ของ Qwen3.7-Plus แต่กลับนำหน้าในคะแนน DeepSWE, CoWorkBench, JobBench และ AndroidWorld ที่ระบุ ข้อแลกเปลี่ยนคือรอยเท้าหน่วยความจำ: ความเบาบางลดคอมพิวต์ที่เปิดใช้งาน ไม่ใช่ปริมาณความจุของโมเดลที่ท้ายที่สุดต้องเก็บไว้ที่ใดที่หนึ่ง

Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6

มิติQwen3.8-Flash-NextDeepSeek V4 FlashClaude Opus 4.6
WeightsOpen-weightOpen-weightปิด (Closed)
โปรไฟล์พารามิเตอร์ที่รายงาน125B หลัก + 51B N-gram; 6B เปิดใช้284B รวม; 13B เปิดใช้ไม่เปิดเผยสาธารณะ
เรื่องราวด้านประสิทธิภาพหลักQSA + GDN + MoE แบบเปิดใช้ 6B + lookup memoryMoE แบบเบาบาง throughput สูงสแต็กเหตุผลและเอเจนต์แบบจัดการระดับแนวหน้า
ความเป็นหลายโมดาลิตี nativeข้อความ, ภาพ, วิดีโอ -> ข้อความตระกูล Flash เน้นข้อความ; เส้นทางวิชั่นมีแยกบน CometAPIข้อความ + วิชั่น/ไฟล์ผ่าน API โฮสต์
SWE-bench Pro*62.556.053.4
CoWorkBench*73.945.168.2
NL2Repo-Bench*48.154.247.6
HLE*35.933.840.0

DeepSeek V4 Flash ยังแข็งแกร่งกว่าใน NL2Repo-Bench ในการเปรียบเทียบของ Qwen ซึ่งสำคัญต่อการสร้างโค้ดระดับรีโพซิทอรี Claude Opus 4.6 นำบน HLE ในตารางเดียวกัน และเป็นโมเดลแบบจัดการแบบปิด ไม่ใช่เป้าหมายการปรับใช้แบบเปิด Qwen3.8-Flash-Next แตกต่างเด่นที่การผสานน้ำหนักแบบเปิด ความเป็นหลายโมดาลิตีแบบ native วิศวกรรมคอนเท็กซ์ยาว และงบพารามิเตอร์ที่เปิดใช้งานต่อโทเค็นที่เล็กมาก

Qwen3.8-Flash-Next vs Qwen3.8-Max

มิติQwen3.8-Flash-NextQwen3.8-Max
บทบาทพรีวิวสถาปัตยกรรมที่เน้นประสิทธิภาพเป็นอันดับแรกเรือธงของ Qwen3.8
สเกลหลัก/รวม125B หลัก + 51B N-gram; 6B เปิดใช้รวม 2.4T; เปิดใช้ราว 95B ตามหน้ารายการโมเดลของ CometAPI
การเน้นสถาปัตยกรรมQSA, GDN, Gated Residual, N-gram Embedding, Muonความสามารถแนวหน้าสูงสุดที่สเกลใหญ่กว่ามาก
เหมาะที่สุดสำหรับเอเจนต์ปริมาณสูง ผู้ช่วยโค้ด งานอัตโนมัติหลายโมดาลิตี การโฮสต์ด้วยตนเองงานเหตุผลยาก เอเจนต์องค์กรขนาดใหญ่ เวิร์กโหลดที่เน้นความสามารถ
คอนเท็กซ์262K native; สูงสุด 1M ด้วย YaRNคอนเท็กซ์ระดับ 1M บนเส้นทางโฮสต์ของ Qwen3.8 เรือธงปัจจุบัน

สเปกของ Qwen3.8-Max อ้างอิงจากรายการโมเดลของ CometAPI ปัจจุบัน

ความแตกต่างเรียบง่าย: Qwen3.8-Max คือเรือธงที่เน้นความสามารถ ขณะที่ Qwen3.8-Flash-Next คือการทดลองด้านสถาปัตยกรรมและประสิทธิภาพ นักพัฒนาที่เลือกควรถามว่าคอขวดคือความสามารถสูงสุดของโมเดล หรือค่าการรันทาส์กคอนเท็กซ์ยาวที่เรียกใช้เครื่องมือจำนวนมากในสเกล

ราคาและความพร้อมใช้งานของ Qwen3.8-Flash-Next

น้ำหนักแบบเปิดสำหรับ Qwen3.8-Flash-Next เผยแพร่ผ่าน Hugging Face และ ModelScope สำหรับการให้บริการแบบจัดการ Qwen ระบุว่าเวอร์ชันโปรดักชันใช้ชื่อ Qwen3.8-Flash บน QwenCloud โดยเปิดใช้คอนเท็กซ์ 1M เป็นค่าเริ่มต้นและมีเครื่องมือทางการในตัว

Qwen ระบุราคาการให้บริการแบบจัดการที่ $0.16 ต่อหนึ่งล้านโทเค็นขาเข้า และ $0.47 ต่อหนึ่งล้านโทเค็นขาออก ราคานี้อ้างอิงโมเดลโปรดักชัน QwenCloud ชื่อ Qwen3.8-Flash ไม่ใช่การโฮสต์น้ำหนักแบบเปิดด้วยตนเอง

เส้นทางขาเข้าขาออก
โมเดลโปรดักชันบน QwenCloud (Qwen3.8-Flash)$0.16 / 1M tokens$0.47 / 1M tokens
โฮสต์น้ำหนักแบบเปิดด้วยตนเองขึ้นกับโครงสร้างพื้นฐานขึ้นกับโครงสร้างพื้นฐาน
เส้นทาง CometAPIตรวจที่หน้ารายการโมเดลสดตรวจที่หน้ารายการโมเดลสด

ราคาของ QwenCloud มาจาก บทความเปิดตัวอย่างเป็นทางการของ Qwen; การคิดค่าบริการของ CometAPI ควรตรวจสอบบนหน้ารายการโมเดลสด

สำหรับผู้ใช้ CometAPI โมเดล Qwen3.8-Flash-Next โดยเฉพาะ ระบุเส้นทางเป็น qwen3.8-flash-next เนื่องจากการกำหนดเส้นทาง ความพร้อมจากต้นทาง และการคิดค่าบริการอาจเปลี่ยนแยกจากการปล่อยน้ำหนักเปิด การผสานระบบโปรดักชันควรอ่านแคตตาล็อกสดของ CometAPI ก่อนฮาร์ดโค้ดสมมติฐานราคา

คำแนะนำ CometAPI

คาดว่า Qwen3.8-Flash-Next จะพร้อมใช้งานผ่าน CometAPI ในเร็วๆ นี้ CometAPI จัดเตรียม endpoint ที่เข้ากันได้กับ OpenAI เพียงรายการเดียว (https://api.cometapi.com/v1) ที่รวมโมเดลกว่า 500+ จากผู้ให้บริการชั้นนำ รวมถึงตระกูลโมเดล Qwen แนวทางนี้ลดการล็อกอินผู้ขาย ทำให้ง่ายต่อการทดลองกับ Qwen3.8-Flash (เมื่อพร้อมใช้งานผ่านแพลตฟอร์มหรือ endpoint ที่เกี่ยวข้องของ Qwen) และปรับให้เรียบง่ายสำหรับการใช้งานโปรดักชันที่อาจผสมหลายโมเดลสำหรับงานต่างๆ (เช่น Qwen สำหรับเอเจนต์โค้ดที่คุ้มค่า + โมเดลอื่นสำหรับเหตุผลเฉพาะทาง) มีเอกสารและคู่มือเริ่มต้นอย่างรวดเร็วที่ apidoc.cometapi.com และเว็บไซต์หลักของ CometAPI

ไม่ว่าคุณจะโฮสต์น้ำหนักแบบเปิดด้วยตนเอง ใช้ QwenCloud หรือใช้แพลตฟอร์มรวมอย่าง CometAPI Qwen3.8-Flash-Next ทำให้การเข้าถึงเอเจนต์หลายโมดาลิตีคอนเท็กซ์ยาวประสิทธิภาพสูงง่ายขึ้น

Qwen3.8-Flash-Next ทำอะไรได้บ้าง?

1. เอเจนต์โค้ดปริมาณสูง

งบพารามิเตอร์ที่เปิดใช้งานเพียง 6B ผสานกับคะแนน SWE-bench Pro 62.5 ในการประเมินของ Qwen ทำให้ Qwen3.8-Flash-Next น่าสนใจเป็นพิเศษสำหรับระบบโค้ดดิ้งที่ต้องรันเซสชันขนานจำนวนมาก ตัวอย่างเช่น code review การคัดแยก issue การนำทางรีโพซิทอรี การสร้างเทสต์ และการแพตช์แบบวนซ้ำที่ throughput สำคัญพอๆ กับความฉลาดในการรันครั้งเดียว

2. งานสำนักงานและความรู้แบบระยะยาว

CoWorkBench และ JobBench เป็นแกนของการวางตำแหน่งโมเดล สถาปัตยกรรมถูกออกแบบมาสำหรับลูปของเอเจนต์ที่อ่านคอนเท็กซ์ซ้ำ เรียกใช้เครื่องมือ อัปเดตสถานะ และทำงานต่อ แทนที่จะตอบเพียงครั้งเดียว ซึ่งสอดคล้องกับเวิร์กโฟลว์เอกสาร การวิเคราะห์สเปรดชีต การประกอบรายงาน การสังเคราะห์งานวิจัย และระบบอัตโนมัติกระบวนการธุรกิจ

3. เอเจนต์คอมพิวเตอร์และมือถือแบบหลายโมดาลิตี

อินพุตภาพและวิดีโอ ประสิทธิภาพบน AndroidWorld การประเมิน OSWorld และผล Vision2Web ทำให้โมเดลเกี่ยวข้องกับเอเจนต์ GUI สามารถทำหน้าที่เป็นชั้นเหตุผลเบื้องหลังระบบที่ตีความสกรีนช็อต ปฏิบัติการอินเทอร์เฟซมือถือ ทำซ้ำเลย์เอาต์แอปพลิเคชัน หรือผสานสถานะภาพกับการเรียกใช้เครื่องมือ

4. วิดีโอความยาวสูงและการให้เหตุผลเชิงภาพ

โมเดลการ์ดอย่างเป็นทางการมีตัวอย่างอินพุตวิดีโอและ แนวทางการพรีโพรเซสสำหรับวิดีโอระดับชั่วโมง ทำให้โมเดลเหมาะสำหรับการถามตอบวิดีโอ การค้นหาวิดีโอความยาวสูง การสกัดเหตุการณ์เชิงภาพ และเวิร์กโฟลว์ที่ผสานความเข้าใจวิดีโอกับเครื่องมือปลายน้ำ

5. งานวิจัยและเวิร์กโฟลว์รีโพซิทอรีระดับล้านโทเค็น

โมเดลเปิดนี้ รองรับ native ที่ 262,144 โทเค็นและขยายได้ถึง 1,000,000 ด้วย YaRN ความแตกต่างนี้สำคัญ: 1M เป็นการขยาย ไม่ใช่คอนเท็กซ์ native ของโมเดลเปิด สำหรับรีโพซิทอรีขนาดใหญ่หรือคลังงานวิจัย QSA มีเป้าหมายเพื่อลดต้นทุนการเรียกคืนของคอนเท็กซ์ยาวเหล่านั้นให้เป็นจริงได้มากกว่า attention แบบทั่วโลกที่หนาแน่น

นักพัฒนาจะรัน Qwen3.8-Flash-Next ได้อย่างไร?

นักพัฒนาสามารถดาวน์โหลดน้ำหนักแบบเปิดจาก Hugging Face และรันโมเดลด้วย Transformers, vLLM, SGLang หรือ TokenSpeed Qwen จัดเตรียมตัวอย่าง OpenAI-compatible Chat Completions สำหรับทั้งอินพุตข้อความและหลายโมดาลิตี

ตัวอย่างเช่น โมเดลการ์ดอย่างเป็นทางการสาธิตการให้บริการ Qwen/Qwen3.8-Flash-Next ด้วย vLLM และการเรียกผ่าน /v1/chat/completions อินพุตภาพและวิดีโอยังถูกสาธิตผ่านอินเทอร์เฟซที่เข้ากันได้กับ OpenAI

Qwen3.8-Flash-Next ทำงานในโหมด thinking โดยค่าเริ่มต้น นักพัฒนาสามารถควบคุมพฤติกรรม thinking ผ่าน enable_thinking, preserve_thinking และ reasoning_effort; ระดับ reasoning-effort ที่มีเอกสารคือ xhigh, medium และ low

ข้อจำกัดของ Qwen3.8-Flash-Next คืออะไร?

ข้อจำกัดเชิงปฏิบัติที่ใหญ่ที่สุดคือค่าฮาร์ดแวร์ แม้จะเปิดใช้พารามิเตอร์ภาษาจำนวนเพียง 6B แต่เช็กพอยต์ประกอบด้วยพารามิเตอร์ภาษา 125B บวกส่วนประกอบ n-gram embedding 51B และพารามิเตอร์ MTP 4B รีโพซิทอรีปัจจุบันมีขนาดประมาณ 360 GB ดังนั้นการปรับใช้ในเครื่องยังต้องการโครงสร้างพื้นฐานสูง

ข้อจำกัดที่สองคือ 262K เป็นความยาวคอนเท็กซ์แบบ native ไม่ใช่ 1M โมเดลสามารถขยายได้ถึง 1M โทเค็น แต่หน้าของ CometAPI หรือรายการโมเดลไม่ควรเขียนว่า “1M native context” คำที่ถูกต้องคือ 262K native context ที่ขยายได้ถึง 1M

สุดท้าย ประสิทธิภาพบนชุดทดสอบไม่สม่ำเสมอ Qwen3.8-Flash-Next แข่งขันได้สูงในงานโค้ดและเอเจนต์ แต่ไม่ได้เป็นผู้นำทุกชุดทดสอบ ตัวอย่างเช่น Claude Opus 4.6 ทำได้ 40.0 บน HLE เทียบกับ 35.9 ของ Flash-Next ขณะที่ DeepSeek-V4-Flash-0731 นำใน NL2Repo-Bench ในชุดที่ระบุ

Qwen3.8-Flash-Next: สิ่งที่สะท้อนสำหรับ Qwen4

ความสำคัญที่กว้างกว่านั้นคือบทบาทในฐานะพรีวิวเบื้องต้นของสถาปัตยกรรมที่คาดว่าจะเป็นแกนของ Qwen4 Qwen3.8-Flash-Next ผสาน Qwen Sparse Attention, Gated DeltaNet, การเชื่อมต่อ Gated Residual สี่แขนง, N-gram Embedding, คลังผู้เชี่ยวชาญ MoE แบบเบาบางมาก และ Multi-Token Prediction เข้าด้วยกัน ทางเลือกเหล่านี้แสดงให้เห็นว่า Qwen กำลังสำรวจความจุที่สูงขึ้น คอนเท็กซ์ที่ยาวขึ้น และประสิทธิภาพหลายโมดาลิตีและเอเจนต์ที่แข็งแรงขึ้น โดยไม่เพิ่มคอมพิวต์ที่เปิดใช้งานต่อโทเค็นในอัตราเดียวกัน

ข้อสรุปสุดท้าย

Qwen3.8-Flash-Next มีความสำคัญเพราะเปลี่ยนรูปแบบของปัญหาด้านประสิทธิภาพ แทนที่จะมองว่าพารามิเตอร์ทั้งหมดเท่าเทียมกัน มันผสานเส้นทาง MoE ที่เปิดใช้งานค่อนข้างเล็กเข้ากับหน่วยความจำแบบ lookup ขนาดใหญ่มาก และกลไกการเรียกคืนแบบเบาบางที่ออกแบบมาสำหรับคอนเท็กซ์ยาว สิ่งนี้ให้คันโยกอิสระหลายตัวแก่ Qwen ในการเพิ่มความจุโดยไม่เพิ่มการคูณเมทริกซ์ต่อโทเค็นในอัตราเดียวกัน

สำหรับนักพัฒนา โมเดลนี้เป็นตัวเลือกที่น่าดึงดูดสำหรับผู้ช่วยโค้ดปริมาณสูง เอเจนต์คอนเท็กซ์ยาว งานอัตโนมัติหลายโมดาลิตี และการทดลองแบบโฮสต์ด้วยตนเอง สำหรับโรดแมปที่กว้างกว่าของ Qwen ยิ่งสำคัญเข้าไปอีก: Qwen ใช้การเปิดตัวนี้เพื่อเปิดเผยทิศทางด้านสถาปัตยกรรมที่ตั้งใจจะขัดเกลาไปสู่ Qwen4 โดยชัดเจน

เรียนรู้ต่อ

เชื่อมโยงบทความนี้กับการตัดสินใจถัดไป

ดูทุกหัวข้อ
เผยแพร่เมื่อ Aug 28, 2026
อัปเดตล่าสุด Aug 30, 2026
15 ครั้งที่ดู
ตรวจสอบความชัดเจน การอ้างอิงแหล่งที่มา และคำศัพท์ API ปัจจุบันแล้ว

พร้อมลดต้นทุนการพัฒนา AI ลง 20% แล้วหรือยัง?

เริ่มต้นฟรีภายในไม่กี่นาที มีเครดิตทดลองใช้ฟรี ไม่ต้องใช้บัตรเครดิต

อ่านเพิ่มเติม