ข้อกำหนดทาง技术ของ Qwen3.7-Plus
| รายการ | ข้อกำหนด |
|---|---|
| ชื่อโมเดล | Qwen3.7-Plus |
| ผู้ให้บริการ | Alibaba Cloud (Qwen Team) |
| รหัสโมเดล API | qwen3.7-plus |
| ประเภทโมเดล | โมเดลเอเจนต์แบบมัลติโมดัล |
| ประเภทอินพุต | ข้อความ, ภาพ, วิดีโอ |
| ประเภทเอาต์พุต | ข้อความ |
| หน้าต่างบริบท | สูงสุด 1,000,000 โทเค็น |
| จำนวนโทเค็นอินพุตสูงสุด | ~991.8K |
| จำนวนโทเค็นเอาต์พุตสูงสุด | ~65.5K |
| จุดแข็งหลัก | การให้เหตุผลเชิงภาพ–ภาษา, การเขียนโค้ด, การโต้ตอบกับ GUI, เวิร์กโฟลว์เชิงเอเจนต์ |
| คุณสมบัติในตัว | การเรียกใช้ฟังก์ชัน, เอาต์พุตที่มีโครงสร้าง, แคช, การค้นเว็บ, Batch API |
| ความเข้ากันได้ของ API | เข้ากันได้กับ OpenAI ผ่าน DashScope / Model Studio |
Qwen3.7-Plus คืออะไร?
Qwen3.7-Plus คือรุ่นเรือธงแบบมัลติโมดัลที่สมดุลในสายผลิตภัณฑ์ Qwen 3.7 ของ Alibaba ขณะที่ Qwen3.7-Max มุ่งเน้นการให้เหตุผลเชิงข้อความล้วนและการเขียนโค้ดระยะยาว Qwen3.7-Plus ขยายความสามารถเหล่านั้นด้วยความเข้าใจภาพและวิดีโอแบบเนทีฟ ทำให้สามารถให้เหตุผลข้ามข้อมูลเชิงภาพและเชิงข้อความภายในโมเดลเดียว
โมเดลนี้ถูกออกแบบภายใต้แนวคิดของ เอเจนต์ไฮบริดเชิงโต้ตอบแบบมัลติโมดัล: สามารถตีความภาพหน้าจอ วิเคราะห์แผนภูมิ เข้าใจอินเทอร์เฟซ สร้างโค้ดจากข้อมูลอ้างอิงเชิงภาพ และใช้เครื่องมือเพื่อทำงานหลายขั้นตอนให้เสร็จสมบูรณ์ ทำให้เหมาะอย่างยิ่งสำหรับเอเจนต์ AI ระบบอัตโนมัติบน GUI และเวิร์กโฟลว์เพิ่มผลิตภาพที่บริบทเชิงภาพมีความสำคัญ
คุณสมบัติหลักของ Qwen3.7-Plus
- อินพุตมัลติโมดัลแบบเนทีฟ รองรับข้อความ ภาพ และวิดีโอในสายการให้เหตุผลแบบรวม
- หน้าต่างบริบทสูงสุด 1M โทเค็น ช่วยให้วิเคราะห์ฐานโค้ดขนาดใหญ่และเวิร์กโฟลว์เอกสารยาวได้
- ความสามารถเชิงเอเจนต์แบบผสาน GUI + CLI ทำให้โมเดลเข้าใจหน้าจอและโต้ตอบกับสภาพแวดล้อมซอฟต์แวร์ได้
- ความสามารถการเขียนโค้ดและการใช้เครื่องมือขั้นสูง รวมถึงการเรียกใช้ฟังก์ชัน เอาต์พุตที่มีโครงสร้าง และการผสานเครื่องมือภายนอก
- ความเข้าใจเชิงภาพสำหรับแผนภูมิ เอกสาร และภาพหน้าจอ ทำให้เหมาะกับงานด้านธุรกิจ วิศวกรรม และ UI
- ปลายทาง API ที่เข้ากันได้กับ OpenAI ช่วยให้ย้ายจากโครงสร้างพื้นฐาน LLM ที่มีอยู่ได้ค่อนข้างง่าย
ประสิทธิภาพตามเกณฑ์มาตรฐานของ Qwen3.7-Plus
ตามรายงานเกณฑ์มาตรฐานสาธารณะและแพลตฟอร์มประเมินจากบุคคลที่สาม Qwen3.7-Plus มอบประสิทธิภาพระดับแนวหน้าด้านมัลติโมดัลและความสามารถเชิงเอเจนต์:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: ประมาณ 90.0%.
- IFBench: ประมาณ 78.0%.
- AA Long Context Reasoning (AA-LCR): ประมาณ 65.0%.
- Terminal-Bench Hard: ประมาณ 47.0%, สะท้อนความสามารถเชิงเอเจนต์ด้านการเขียนโค้ดที่แข็งแกร่ง
Alibaba ยังรายงานว่า Qwen3.7-Plus ทำผลงานได้ทัดเทียมกับโมเดลเชิงกรรมสิทธิ์ชั้นนำในการทดสอบด้านเอเจนต์และการเขียนโค้ด โดยเฉพาะอย่างยิ่งในงานมัลติโมดัลและการโต้ตอบกับ UI
Qwen3.7-Plus เทียบกับ Qwen3.7-Max และ Claude Opus 4.6
| คุณลักษณะ | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| รูปแบบอินพุต | ข้อความ, ภาพ, วิดีโอ | เฉพาะข้อความ | ข้อความ, ภาพ |
| หน้าต่างบริบท | สูงสุด 1M โทเค็น | 1M โทเค็น | บริบทขนาดใหญ่ |
| ความเข้าใจเชิงภาพ | ยอดเยี่ยม | ไม่รองรับ | แข็งแกร่ง |
| เอเจนต์ / การโต้ตอบ GUI | เน้นเป็นหลัก | จำกัด | ดี |
| การให้เหตุผลเชิงข้อความระยะยาว | แข็งแกร่งมาก | ดีที่สุดในตระกูล Qwen | ยอดเยี่ยม |
| กรณีใช้งานที่เหมาะที่สุด | เอเจนต์มัลติโมดัลและผลิตภาพ | การเขียนโค้ด คณิตศาสตร์ และการให้เหตุผลเชิงลึก | การให้เหตุผลและการเขียนโค้ดระดับองค์กร |
สำหรับโปรเจ็กต์ที่มีภาพหน้าจอ ระบบอัตโนมัติบน UI การดีบักเชิงภาพ หรือเวิร์กโฟลว์แบบมัลติโมดัล โดยทั่วไปแล้ว Qwen3.7-Plus เป็นตัวเลือกที่ดีกว่า สำหรับงานให้เหตุผลเชิงข้อความล้วนหรือการเขียนโค้ดระดับคลังเก็บข้อมูล Qwen3.7-Max ยังคงแข็งแกร่งกว่า
ข้อจำกัด
- Qwen3.7-Plus ขณะนี้เปิดตัวเป็น โมเดลเชิงกรรมสิทธิ์ระยะพรีวิว และความสามารถบางอย่างอาจเปลี่ยนแปลงก่อนรุ่นเสถียร
- ฟังก์ชันการเรียกใช้และคุณสมบัติเครื่องมือบางอย่างของเอเจนต์ยังอยู่ระหว่างทยอยเปิดใช้งาน
- สำหรับงานที่เป็นข้อความล้วนและต้องการการให้เหตุผลอย่างเข้มข้น Qwen3.7-Max อาจให้ประสิทธิภาพดีกว่าเล็กน้อย
- เช่นเดียวกับโมเดลมัลติโมดัลขนาดใหญ่ส่วนใหญ่ นักพัฒนาควรตรวจสอบประสิทธิภาพกับชุดข้อมูลภาพและ UI ของตนเองก่อนใช้งานจริง
กรณีใช้งานตัวอย่าง
- เอเจนต์ AI ที่ผสานการโต้ตอบกับเบราว์เซอร์ GUI และเทอร์มินัล
- การดีบักซอฟต์แวร์จากภาพหน้าจอและการจับภาพ UI
- การวิเคราะห์เอกสาร แผนภูมิ และแดชบอร์ด
- ผู้ช่วยการเขียนโค้ดเชิงภาพที่สร้างโค้ดจากม็อกอัปหรือไดอะแกรม
- เวิร์กโฟลว์เพิ่มผลิตภาพระดับองค์กรที่มีอินพุตแบบผสมระหว่างข้อความและภาพ
- ผู้ช่วยวิจัยแบบมัลติโมดัลที่ผสานการค้นเว็บกับความเข้าใจเชิงภาพ