Thông số kỹ thuật của GLM-4.6V-Flash
| Hạng mục | |
|---|---|
| Họ mô hình | Họ mô hình đa phương thức GLM-4.6V |
| Định vị | Mô hình đa phương thức miễn phí, nhẹ |
| Mô hình | GLM-4.6V-Flash |
| Tên trong danh mục CometAPI | glm-4.6v-flash-free |
| Loại đầu vào | Video, hình ảnh, văn bản, tệp |
| Loại đầu ra | Văn bản |
| Cửa sổ ngữ cảnh | 128K token |
| Suy nghĩ | Có thể bật hoặc tắt |
| Gọi hàm | Hỗ trợ gọi hàm gốc (native) |
| Ngôn ngữ | Tiếng Trung và Tiếng Anh |
| Mô hình nguồn mở | zai-org/GLM-4.6V-Flash trên Hugging Face; giấy phép MIT |
GLM-4.6V-Flash(Free) là gì?
GLM-4.6V-Flash là phiên bản miễn phí của GLM-4.6V từ Z.ai. CometAPI cũng cung cấp sử dụng miễn phí; ID là glm-4.6v-flash-free. Đây là một mô hình đa phương thức nhẹ, được thiết kế để kết hợp khả năng hiểu thị giác với suy luận và sử dụng công cụ. Mô hình chấp nhận video, hình ảnh, văn bản và tệp, tạo đầu ra dạng văn bản, hỗ trợ cửa sổ ngữ cảnh 128K token, và có thể bật/tắt chế độ suy nghĩ sâu. Z.ai cũng mô tả hỗ trợ gọi hàm gốc (native) là một tính năng kiến trúc chủ chốt để kết nối nhận thức thị giác với các hành động có thể thực thi.
Các tính năng chính của GLM-4.6V Flash(Free)
- Ngữ cảnh đa phương thức 128K: Mô hình được huấn luyện cho cửa sổ ngữ cảnh 128K token và có thể xử lý các đầu vào dài, đa phương thức như tài liệu và video cùng với văn bản.
- Hiểu hình ảnh, video, tệp và văn bản: Đầu vào không bị giới hạn ở văn bản thông thường; GLM-4.6V-Flash được thiết kế để hiểu kết hợp thông tin thị giác và văn bản.
- Gọi hàm gốc (native): Gọi hàm được tích hợp vào mô hình thị giác, cho phép các đầu vào trực quan tham gia vào các quy trình làm việc hướng công cụ thay vì chỉ được xem là nội dung mô tả.
- Suy nghĩ có thể cấu hình: Có thể bật hoặc tắt chế độ suy nghĩ sâu, mang lại sự cân bằng thực tế giữa độ sâu suy luận và hành vi phản hồi.
- Hiểu tài liệu đa phương thức: Mô hình có thể diễn giải các trang có định dạng phong phú, bao gồm văn bản, bố cục, biểu đồ, bảng và hình, trong các quy trình ngữ cảnh dài.
- Lập trình dựa trên thị giác và quy trình tác tử: Dòng GLM-4.6V hỗ trợ tái tạo/chỉnh sửa frontend dựa trên ảnh chụp màn hình và các kịch bản tác tử đa phương thức; biến thể Flash được định vị là thành viên nhẹ của họ.
Hiệu năng benchmark của GLM-4.6V-Flash (Free)
Model card đã công bố các kết quả đánh giá sau: MMBench V1.1 86.9, MMStar 74.7, MMMU (Val) 71.1, MMMU-Pro 60.6, VideoMMU 70.1, MathVista 82.7, AI2D 89.2, OCRBench 84.7, Design2Code 69.8, và MMLongBench-128K 63.4. Các con số này do nhà phát hành/model card báo cáo và cần được diễn giải cùng với phiên bản benchmark cụ thể và thiết lập đánh giá.
Z.ai cho biết GLM-4.6V-Flash 9B vượt Qwen3-VL-8B tổng thể trong so sánh đánh giá đa phương thức đã báo cáo. Tài liệu tương tự định vị GLM-4.6V đầy đủ là một mô hình lớn hơn 106B, trong khi GLM-4.6V-Flash là biến thể nhẹ/miễn phí.
GLM-4.6V-Flash so với GLM-4.6V và GLM-4.6V-FlashX
| Mô hình | Định vị | Ngữ cảnh | Phù hợp nhất |
|---|---|---|---|
| GLM-4.6V-Flash | Miễn phí, nhẹ | 128K | Ứng dụng đa phương thức nhạy về chi phí, tạo mẫu, quy trình với mô hình cục bộ/mã nguồn mở |
| GLM-4.6V-FlashX | Nhẹ, tốc độ cao | 128K | Khối lượng công việc sản xuất đa phương thức tốc độ cao hơn |
| GLM-4.6V | Đầu bảng hiệu năng cao | 128K | Khối lượng công việc suy luận đa phương thức và tác tử đòi hỏi cao hơn |
Các trường hợp sử dụng của GLM-4.6V-Flash
GLM-4.6V-Flash đặc biệt phù hợp với các ứng dụng cần khả năng hiểu thị giác mà không chỉ dựa vào mô hình văn bản: phân tích tài liệu và biểu đồ, quy trình làm việc hướng OCR, hiểu ảnh chụp màn hình, hỏi đáp về video, định vị trực quan, hỗ trợ lập trình đa phương thức và tác tử được trang bị công cụ.
Hạn chế và lưu ý của GLM-4.6V-Flash
Mô hình là thành viên nhẹ 9B của họ GLM-4.6V, vì vậy không nên mặc định coi tương đương với bản đầu bảng GLM-4.6V lớn hơn. Điểm số benchmark cũng thay đổi theo tác vụ và giao thức đánh giá. Khi đưa vào sản xuất, hãy kiểm thử đúng đầu vào, luồng gọi công cụ, độ trễ và ràng buộc đầu ra của ứng dụng dự định thay vì chỉ dựa vào xếp hạng benchmark tổng hợp.
Cách sử dụng API GLM-4.6V-Flash trên CometAPI
Vì CometAPI sử dụng giao diện tương thích OpenAI, bạn có thể gọi glm-4.6v-flash-free với cùng mẫu cơ bản như SDK của OpenAI. URL cơ sở được ghi trong tài liệu của CometAPI là https://api.cometapi.com/v1, và điểm cuối REST là /v1/chat/completions.
Bước 1: Lấy khóa API CometAPI
Đầu tiên, đăng nhập vào tài khoản CometAPI của bạn. Nếu chưa có tài khoản, hãy đăng ký trên CometAPI. Sau khi đăng nhập, mở trang quản lý token API và tạo khóa API mới. Sao chép khóa đã tạo và giữ an toàn, vì khóa này sẽ được dùng để xác thực các yêu cầu API của bạn.
Bước 2: Chọn mô hình GLM-4.6V-Flash
Khi tạo yêu cầu API, hãy chỉ định ID mô hình CometAPI glm-4.6v-flash-free. Đây là định danh dành riêng cho CometAPI cho phiên bản miễn phí của GLM-4.6V-Flash.
Mô hình hỗ trợ yêu cầu đa phương thức, vì vậy bạn có thể dùng cho tác vụ liên quan đến văn bản, hình ảnh và các đầu vào thị giác được hỗ trợ khác.
Bước 3: Cấu hình yêu cầu API
Gửi yêu cầu của bạn đến điểm cuối chat completions của CometAPI. Xác thực yêu cầu bằng khóa API CometAPI và đặt trường model là glm-4.6v-flash-free.
Trong nội dung yêu cầu, cung cấp hướng dẫn bạn muốn GLM-4.6V-Flash xử lý. Với yêu cầu chỉ văn bản, hãy cung cấp một prompt văn bản thông thường. Với phân tích thị giác, đính kèm hình ảnh cùng với hướng dẫn văn bản để mô hình có thể hiểu cả thông tin thị giác và câu hỏi.
Bước 4: Gửi yêu cầu
Gửi yêu cầu đã cấu hình đến CometAPI. CometAPI sẽ chuyển tiếp yêu cầu tới GLM-4.6V-Flash và trả về phản hồi của mô hình qua API.
Phản hồi chứa nội dung được tạo và thông tin phản hồi liên quan. Ứng dụng của bạn có thể trích xuất câu trả lời của mô hình và hiển thị cho người dùng hoặc tiếp tục xử lý theo lập trình.
Bước 5: Xử lý và xác minh phản hồi
Sau khi nhận phản hồi, phân tích nội dung trả về và sử dụng trong ứng dụng của bạn. Với ứng dụng đa phương thức, hãy xác minh diễn giải của mô hình về hình ảnh hoặc nội dung thị giác đã cung cấp phù hợp với yêu cầu quy trình làm việc của bạn.
Đối với ứng dụng sản xuất, cũng cần xử lý lỗi API, timeout yêu cầu và phản hồi không hợp lệ để ứng dụng có thể phục hồi một cách ổn định khi yêu cầu không thể hoàn thành.
Đối với các yêu cầu CometAPI, sử dụng:
glm-4.6v-flash-free
ID mô hình này khác với tên mô hình cơ sở của nhà cung cấp. Hãy đảm bảo yêu cầu của bạn dùng đúng ID mô hình CometAPI như đã cung cấp.