Thông số kỹ thuật của Qwen3.7-Plus
| Hạng mục | Thông số |
|---|---|
| Model Name | Qwen3.7-Plus |
| Provider | Alibaba Cloud (Qwen Team) |
| API Model ID | qwen3.7-plus |
| Model Type | Mô hình tác tử đa phương thức |
| Input Types | Văn bản, Hình ảnh, Video |
| Output Types | Văn bản |
| Context Window | Lên đến 1,000,000 token |
| Maximum Input Tokens | ~991.8K |
| Maximum Output Tokens | ~65.5K |
| Core Strengths | Suy luận thị giác-ngôn ngữ, lập trình, tương tác GUI, quy trình tác tử |
| Built-in Features | Gọi hàm, đầu ra có cấu trúc, bộ nhớ đệm, tìm kiếm web, API hàng loạt |
| API Compatibility | Tương thích với OpenAI thông qua DashScope / Model Studio |
Qwen3.7-Plus là gì?
Qwen3.7-Plus là mẫu đa phương thức hàng đầu cân bằng trong thế hệ Qwen 3.7 của Alibaba. Trong khi Qwen3.7-Max tập trung vào suy luận văn bản thuần và lập trình tầm dài, Qwen3.7-Plus mở rộng các khả năng đó với năng lực hiểu hình ảnh và video nguyên sinh, cho phép suy luận trên cả thông tin thị giác và văn bản trong một mô hình duy nhất.
Mô hình được thiết kế xoay quanh ý tưởng về một tác tử lai tương tác đa phương thức: nó có thể diễn giải ảnh chụp màn hình, phân tích biểu đồ, hiểu giao diện, tạo mã từ tham chiếu thị giác và sử dụng công cụ để hoàn thành các tác vụ nhiều bước. Điều này khiến nó đặc biệt hấp dẫn cho các tác tử AI, tự động hóa GUI và quy trình làm việc nâng cao năng suất nơi bối cảnh thị giác đóng vai trò quan trọng.
Các tính năng chính của Qwen3.7-Plus
- Đầu vào đa phương thức nguyên sinh hỗ trợ văn bản, hình ảnh và video trong một chuỗi suy luận thống nhất.
- Cửa sổ ngữ cảnh lên đến 1M token, cho phép phân tích kho mã lớn và quy trình tài liệu dài.
- Khả năng tác tử lai GUI + CLI, cho phép mô hình hiểu màn hình và tương tác với môi trường phần mềm.
- Khả năng lập trình và sử dụng công cụ nâng cao, bao gồm gọi hàm, đầu ra có cấu trúc và tích hợp công cụ bên ngoài.
- Khả năng hiểu thị giác đối với biểu đồ, tài liệu và ảnh chụp màn hình, hữu ích cho các tác vụ kinh doanh, kỹ thuật và UI.
- Điểm cuối API tương thích với OpenAI, giúp chuyển đổi từ hạ tầng LLM hiện có tương đối dễ dàng.
Hiệu suất trên các benchmark của Qwen3.7-Plus
Theo các báo cáo benchmark công khai và nền tảng đánh giá bên thứ ba, Qwen3.7-Plus đạt hiệu suất đa phương thức và tác tử ở mức tiên tiến:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: xấp xỉ 90.0%.
- IFBench: xấp xỉ 78.0%.
- AA Long Context Reasoning (AA-LCR): xấp xỉ 65.0%.
- Terminal-Bench Hard: xấp xỉ 47.0%, phản ánh khả năng lập trình tác tử mạnh mẽ.
Alibaba cũng báo cáo rằng Qwen3.7-Plus có hiệu năng cạnh tranh với các mô hình độc quyền hàng đầu trên các benchmark về tác tử và lập trình, đặc biệt mạnh ở các tác vụ đa phương thức và tương tác UI.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Tính năng | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Phương thức đầu vào | Văn bản, Hình ảnh, Video | Chỉ văn bản | Văn bản, Hình ảnh |
| Cửa sổ ngữ cảnh | Lên đến 1M token | 1M token | Ngữ cảnh lớn |
| Khả năng hiểu thị giác | Xuất sắc | Không hỗ trợ | Mạnh |
| Tương tác tác tử/GUI | Trọng tâm nguyên sinh | Hạn chế | Tốt |
| Suy luận văn bản tầm dài | Rất mạnh | Tốt nhất trong dòng Qwen | Xuất sắc |
| Trường hợp sử dụng tốt nhất | Tác tử đa phương thức và năng suất | Lập trình, toán học, suy luận sâu | Suy luận và lập trình cho doanh nghiệp |
Đối với các dự án liên quan đến ảnh chụp màn hình, tự động hóa UI, gỡ lỗi dựa trên thị giác hoặc quy trình đa phương thức, Qwen3.7-Plus thường là lựa chọn tốt hơn. Với các tác vụ thuần văn bản hoặc lập trình ở quy mô kho mã, Qwen3.7-Max vẫn là lựa chọn mạnh hơn.
Hạn chế
- Qwen3.7-Plus hiện được phát hành như một mô hình độc quyền ở giai đoạn xem trước, và một số khả năng có thể thay đổi trước khi phát hành ổn định.
- Tính năng gọi hàm và một số công cụ dành cho tác tử vẫn đang được triển khai.
- Với khối lượng công việc thuần văn bản và đòi hỏi suy luận cao, Qwen3.7-Max có thể mang lại hiệu suất nhỉnh hơn một chút.
- Giống như hầu hết các mô hình đa phương thức lớn, nhà phát triển nên xác thực hiệu suất trên bộ dữ liệu hình ảnh và UI của riêng mình trước khi triển khai sản xuất.
Trường hợp sử dụng tiêu biểu
- Các tác tử AI kết hợp tương tác trình duyệt, GUI và terminal.
- Gỡ lỗi phần mềm từ ảnh chụp màn hình và ảnh/bản chụp UI.
- Phân tích tài liệu, biểu đồ và bảng điều khiển.
- Trợ lý lập trình dựa trên thị giác tạo mã từ mockup hoặc sơ đồ.
- Quy trình làm việc nâng cao năng suất doanh nghiệp với đầu vào kết hợp văn bản và hình ảnh.
- Trợ lý nghiên cứu đa phương thức kết hợp tìm kiếm web với khả năng hiểu thị giác.