ข้อมูลจำเพาะทาง技术ของ Qwen3.7-Plus
| Item | Specification |
|---|---|
| Model Name | Qwen3.7-Plus |
| Provider | Alibaba Cloud (Qwen Team) |
| API Model ID | qwen3.7-plus |
| Model Type | โมเดลเอเจนต์แบบมัลติโหมด |
| Input Types | ข้อความ, ภาพ, วิดีโอ |
| Output Types | ข้อความ |
| Context Window | สูงสุด 1,000,000 โทเค็น |
| Maximum Input Tokens | ~991.8K |
| Maximum Output Tokens | ~65.5K |
| Core Strengths | การให้เหตุผลระหว่างภาพและภาษา, การเขียนโค้ด, การโต้ตอบกับ GUI, เวิร์กโฟลว์ของเอเจนต์ |
| Built-in Features | การเรียกใช้ฟังก์ชัน, เอาต์พุตแบบมีโครงสร้าง, แคช, การค้นหาเว็บ, Batch API |
| API Compatibility | เข้ากันได้กับ OpenAI ผ่าน DashScope / Model Studio |
Qwen3.7-Plus คืออะไร?
Qwen3.7-Plus เป็นเรือธงมัลติโหมดที่สมดุลในเจเนอเรชัน Qwen 3.7 ของ Alibaba ขณะที่ Qwen3.7-Max มุ่งเน้นการให้เหตุผลด้วยข้อความล้วนและการเขียนโค้ดระยะยาว Qwen3.7-Plus ขยายความสามารถนั้นด้วยความเข้าใจภาพและวิดีโอแบบเนทีฟ ทำให้สามารถให้เหตุผลข้ามข้อมูลเชิงภาพและเชิงข้อความภายในโมเดลเดียว
โมเดลนี้ถูกออกแบบตามแนวคิดของเอเจนต์ไฮบริดเชิงโต้ตอบแบบมัลติโหมด: สามารถตีความภาพหน้าจอ วิเคราะห์แผนภูมิ เข้าใจอินเทอร์เฟซ สร้างโค้ดจากข้อมูลอ้างอิงเชิงภาพ และใช้เครื่องมือต่างๆ เพื่อทำภารกิจหลายขั้นตอนให้สำเร็จ ทำให้เหมาะอย่างยิ่งสำหรับเอเจนต์ AI การทำงานอัตโนมัติของ GUI และเวิร์กโฟลว์เพิ่มประสิทธิภาพที่บริบทเชิงภาพมีความสำคัญ
คุณลักษณะหลักของ Qwen3.7-Plus
- อินพุตมัลติโหมดแบบเนทีฟ รองรับข้อความ ภาพ และวิดีโอในไปป์ไลน์การให้เหตุผลแบบรวม
- หน้าต่างบริบทได้สูงสุด 1M โทเค็น รองรับการวิเคราะห์โค้ดเบสขนาดใหญ่และเวิร์กโฟลว์เอกสารยาว
- ความสามารถเอเจนต์แบบไฮบริด GUI + CLI ทำให้โมเดลเข้าใจหน้าจอและโต้ตอบกับสภาพแวดล้อมซอฟต์แวร์ได้
- การเขียนโค้ดและการใช้เครื่องมือขั้นสูง รวมถึงการเรียกใช้ฟังก์ชัน เอาต์พุตแบบมีโครงสร้าง และการผสานเครื่องมือภายนอก
- ความเข้าใจเชิงภาพสำหรับแผนภูมิ เอกสาร และภาพหน้าจอ เหมาะกับงานธุรกิจ วิศวกรรม และ UI
- จุดปลายทาง API ที่เข้ากันได้กับ OpenAI ช่วยให้ย้ายจากโครงสร้างพื้นฐาน LLM ที่มีอยู่ได้ค่อนข้างง่าย
ประสิทธิภาพตามชุดทดสอบมาตรฐานของ Qwen3.7-Plus
ตามรายงานชุดทดสอบแบบสาธารณะและแพลตฟอร์มประเมินจากบุคคลที่สาม Qwen3.7-Plus ให้ประสิทธิภาพมัลติโหมดและเชิงเอเจนต์ระดับแนวหน้า:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: ประมาณ 90.0%.
- IFBench: ประมาณ 78.0%.
- AA Long Context Reasoning (AA-LCR): ประมาณ 65.0%.
- Terminal-Bench Hard: ประมาณ 47.0% สะท้อนความสามารถด้านเอเจนต์สำหรับการเขียนโค้ดที่แข็งแกร่ง
Alibaba ยังรายงานว่า Qwen3.7-Plus มีประสิทธิภาพแข่งขันได้กับโมเดลเชิงพาณิชย์ชั้นนำในการทดสอบด้านเอเจนต์และการเขียนโค้ด โดยโดดเด่นเป็นพิเศษในงานมัลติโหมดและการโต้ตอบกับ UI
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Feature | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Input Modalities | ข้อความ, ภาพ, วิดีโอ | ข้อความเท่านั้น | ข้อความ, ภาพ |
| Context Window | สูงสุด 1M โทเค็น | 1M โทเค็น | บริบทขนาดใหญ่ |
| Vision Understanding | ยอดเยี่ยม | ไม่รองรับ | แข็งแกร่ง |
| Agent / GUI Interaction | เน้นโดยตรง | จำกัด | ดี |
| Long-Horizon Text Reasoning | แข็งแกร่งมาก | ดีที่สุดในตระกูล Qwen | ยอดเยี่ยม |
| Best Use Case | เอเจนต์มัลติโหมดและเพิ่มผลิตภาพ | การเขียนโค้ด คณิตศาสตร์ การให้เหตุผลเชิงลึก | การให้เหตุผลและการเขียนโค้ดระดับองค์กร |
สำหรับโปรเจ็กต์ที่เกี่ยวข้องกับภาพหน้าจอ การทำงานอัตโนมัติของ UI การดีบักเชิงภาพ หรือเวิร์กโฟลว์แบบมัลติโหมด Qwen3.7-Plus โดยทั่วไปเป็นตัวเลือกที่ดีกว่า สำหรับงานที่เป็นการให้เหตุผลด้วยข้อความล้วนหรือการเขียนโค้ดระดับรีโพสิทอรี Qwen3.7-Max ยังคงแข็งแกร่งกว่า
ข้อจำกัด
- Qwen3.7-Plus เปิดตัวเป็นโมเดลเชิงพาณิชย์เวอร์ชันพรีวิว และความสามารถบางอย่างอาจมีการเปลี่ยนแปลงก่อนรุ่นเสถียร
- ความสามารถการเรียกใช้ฟังก์ชันและเครื่องมือบางอย่างของเอเจนต์ยังอยู่ระหว่างทยอยเปิดใช้งาน
- สำหรับงานข้อความล้วนที่เน้นการให้เหตุผลอย่างเข้มข้น Qwen3.7-Max อาจให้ประสิทธิภาพดีกว่าเล็กน้อย
- เช่นเดียวกับโมเดลมัลติโหมดขนาดใหญ่ส่วนใหญ่ นักพัฒนาควรยืนยันประสิทธิภาพกับชุดข้อมูลภาพและ UI ของตนเองก่อนการใช้งานจริงในระบบผลิต
กรณีใช้งานที่เป็นตัวแทน
- เอเจนต์ AI ที่ผสานการโต้ตอบผ่านเบราว์เซอร์ GUI และเทอร์มินัล
- การดีบักซอฟต์แวร์จากภาพหน้าจอและการจับภาพ UI
- การวิเคราะห์เอกสาร แผนภูมิ และแดชบอร์ด
- ผู้ช่วยการเขียนโค้ดเชิงภาพที่สร้างโค้ดจากม็อกอัปหรือไดอะแกรม
- เวิร์กโฟลว์เพิ่มประสิทธิภาพในระดับองค์กรที่มีอินพุตแบบผสมระหว่างข้อความและภาพ
- ผู้ช่วยวิจัยแบบมัลติโหมดที่ผสานการค้นหาเว็บกับความเข้าใจเชิงภาพ