Thông số kỹ thuật của GLM-5.3-Flash
| Thông số | GLM-5.3-Flash |
|---|---|
| Nhà cung cấp | Z.ai (Zhipu AI) |
| Họ mô hình | GLM-5 |
| Loại mô hình | Mô hình Hỗn hợp Chuyên gia (MoE) đa phương thức gốc |
| Tổng tham số | 320B |
| Tham số kích hoạt | 18B |
| Kiến trúc | Chú ý thưa lai + chú ý tuyến tính |
| Cửa sổ ngữ cảnh | 1,048,576 token (1M) |
| Đầu ra tối đa | 131,072 token |
| Phương thức đầu vào | Văn bản, hình ảnh, video |
| Phương thức đầu ra | Văn bản |
| Suy luận | Được hỗ trợ |
| Thị giác | Được hỗ trợ |
| Gọi hàm | Được hỗ trợ |
| Sử dụng công cụ | Được hỗ trợ |
| Tìm kiếm web | Được hỗ trợ qua tích hợp API được hỗ trợ |
| Trọng số mở | Có |
| Giấy phép | MIT |
| Phát hành | 26 tháng 8, 2026 |
Z.ai mô tả GLM-5.3-Flash là mô hình đa phương thức gốc đầu tiên trong họ GLM-5. Mô hình có tổng 320B tham số nhưng chỉ kích hoạt 18B tham số mỗi bước suy luận. Mô hình giới thiệu kiến trúc lai kết hợp chú ý thưa và chú ý tuyến tính, và dùng mHC để cải thiện hiệu quả mở rộng.
GLM-5.3-Flash là gì?
GLM-5.3-Flash là thành viên định hướng hiệu quả của thế hệ GLM-5 của Z.ai, được thiết kế để kết hợp khả năng suy luận mức tiên tiến hàng đầu và lập trình tác tử với chi phí suy luận thấp hơn đáng kể.
Khác biệt quan trọng nhất so với một mô hình “Flash” thông thường là việc Flash không đồng nghĩa với một mô hình nhỏ. GLM-5.3-Flash có tổng 320B tham số, nhưng kiến trúc MoE của nó chỉ kích hoạt 18B tham số mỗi token. Điều này cho phép Z.ai nhắm tới lượng tính toán suy luận thấp hơn nhiều trong khi vẫn giữ một kho tham số lớn cho năng lực của mô hình.
Đây cũng là mô hình GLM-5 đầu tiên có khả năng đa phương thức gốc. Mô hình hỗ trợ đầu vào hình ảnh bên cạnh văn bản và được định vị cho lập trình, tương tác trình duyệt, hiểu tài liệu, lập trình trực quan và các quy trình tác tử.
Z.ai cho biết GLM-5.3-Flash được huấn luyện từ một mô hình nền mới thay vì chỉ là phiên bản nén của GLM-5.2. Quá trình huấn luyện dùng tập dữ liệu tiền huấn luyện đa phương thức 30 nghìn tỷ token, đồng thời kiến trúc được thiết kế lại xoay quanh năng lực và hiệu quả suy luận.
Tính năng chính của GLM-5.3-Flash
- 320B MoE với 18B tham số kích hoạt: GLM-5.3-Flash kết hợp dung lượng tham số tổng rất lớn với dấu chân tham số kích hoạt tương đối nhỏ, giúp mô hình hiệu quả hơn nhiều khi phục vụ so với mô hình đặc dày 320B.
- Hiểu đa phương thức gốc: Khác với các mô hình GLM-5 trước đây, GLM-5.3-Flash xử lý đa phương thức gốc với đầu vào hình ảnh. Thẻ mô hình cung cấp ví dụ hiểu hình ảnh và xác định mô hình là đa phương thức.
- Ngữ cảnh 1M token: Mô hình được thiết kế cho các ứng dụng ngữ cảnh dài liên quan đến kho mã lớn, tài liệu đồ sộ, hành trình tác tử dài và quy trình nhiều bước phức tạp. Cloudflare và Vercel đều liệt kê cửa sổ ngữ cảnh 1,048,576 token.
- Chú ý thưa lai + chú ý tuyến tính: GLM-5.3-Flash là mô hình GLM đầu tiên kết hợp chú ý thưa và chú ý tuyến tính. Z.ai cho biết kiến trúc này giảm chi phí phục vụ ngữ cảnh dài trong khi vẫn giữ khả năng ngữ cảnh dài chính xác.
- Lập trình tác tử và sử dụng công cụ: Mô hình được tối ưu cho kỹ nghệ phần mềm, tác vụ terminal, tương tác trình duyệt và quy trình dẫn động bởi công cụ. Điểm Terminal-Bench 2.1 được báo cáo là 84.3.
- Triển khai trọng số mở: Trọng số theo giấy phép MIT có thể triển khai với Transformers, vLLM, SGLang, TokenSpeed và KTransformers, cho phép nhà phát triển tự lưu trữ và tối ưu suy luận.
Hiệu năng benchmark của GLM-5.3-Flash
GLM-5.3-Flash đặc biệt mạnh ở các benchmark về lập trình và tác tử.
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Ghi chú |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | Terminal / lập trình tác tử |
| DeepSWE v1.1 | 63.4 | 46.2 | Kỹ nghệ phần mềm |
| AutomationBench | 48.8 | 26.2 | Tự động hoá sử dụng máy tính |
| Toolathlon-Verified | 78.4 | 59.9 | Khả năng sử dụng công cụ |
| NL2Repo-Bench | 56.3 | 48.9 | Mã hoá kho từ ngôn ngữ tự nhiên |
| Agent's Last Exam | 26.3 | 20.4 | Suy luận tác tử |
| Humanity's Last Exam | 55.3 | — | Với công cụ |
| GDPval-AA v2 | 1773 Elo | 1504 Elo | Năng suất / công việc tri thức |
| OfficeQA-Pro | 62.4 | — | Năng suất đa phương thức |
| CharXiv RQ | 89.4 | — | Suy luận đa phương thức |
Mục đánh giá chính thức trên Hugging Face liệt kê 84.3 trên Terminal-Bench 2.1, 63.4 trên DeepSWE và 55.3 trên HLE. Tài liệu ra mắt của Z.ai báo cáo thêm các kết quả gồm AutomationBench, Toolathlon, NL2Repo và GDPval.
Independent Artificial Analysis hiện cho GLM-5.3-Flash Chỉ số Trí tuệ là 57, xếp #3 trong 108 mô hình trong tập so sánh hiện tại của họ.
Những con số này vẫn cần được diễn giải cùng các lưu ý đặc thù theo benchmark: một số kết quả do nhà cung cấp báo cáo, bộ công cụ đánh giá khác nhau, và điểm benchmark không nên được coi là bảng xếp hạng phổ quát về chất lượng mô hình.
GLM-5.3-Flash so với GLM-5.3 và GLM-5.2
| Tính năng | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Thế hệ mô hình | GLM-5 | GLM-5 | GLM-5 |
| Định vị | Mô hình hiệu quả đa phương thức / tác tử | Mô hình suy luận tổng quát cao cấp | Mô hình thế hệ trước tổng quát |
| Thị giác gốc | Có | Không | Phụ thuộc mô hình |
| Tổng tham số | 320B | Cấu hình đầu bảng lớn hơn | Mô hình quy mô lớn |
| Tham số kích hoạt | 18B | — | — |
| Ngữ cảnh | 1M | Triển khai cấp 200K | Triển khai cấp 200K |
| Chú ý thưa/tuyến tính lai | Có | Không | Không |
| Lập trình tác tử | Xuất sắc | Xuất sắc | Mạnh |
| Trọng số mở | Có | Phụ thuộc triển khai | Phụ thuộc triển khai |
| Lợi thế chính | Năng lực trên mỗi đơn vị tính toán suy luận | Khả năng suy luận tối đa của GLM-5 | Thế hệ GLM trưởng thành và chi phí thấp hơn |
Khác biệt then chốt là GLM-5.3-Flash không đơn thuần là GLM-5.3 ở kích thước nhỏ hơn. Z.ai cho biết mô hình bắt đầu từ một mô hình nền mới và giới thiệu kiến trúc chú ý lai được thiết kế lại, mHC và tiền huấn luyện đa phương thức.
GLM-5.3-Flash so với DeepSeek V4 Flash — Tóm tắt so sánh
| Chiều so sánh | GLM-5.3-Flash (Z.ai / Zhipu) | DeepSeek V4 Flash (DeepSeek) | Lợi thế |
|---|---|---|---|
| Ngày phát hành | 26 tháng 8, 2026 | Xem trước tháng 4, 2026; checkpoint lớn (0731) 31 tháng 7, 2026 | — |
| Tổng / Kích hoạt tham số | 320B / 18B | 284B / 13B | GLM lớn hơn chút |
| Cửa sổ ngữ cảnh | 1M token | 1M token | Hòa |
| Đầu ra tối đa | ~131K token | Tới 384K token | DeepSeek |
| Phương thức | Đa phương thức gốc (đầu vào văn bản + hình ảnh + video) | Chủ yếu văn bản (các biến thể thị giác thử nghiệm có sẵn) | GLM |
| Điểm nổi bật kiến trúc | Chú ý thưa + tuyến tính lai (~3× tính toán chú ý thấp hơn, ~4.4× KV cache nhỏ hơn so với GLM-5.3 đầy đủ) | Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA) | Mỗi bên có điểm mạnh |
| Giấy phép | MIT (trọng số trên Hugging Face) | MIT (trọng số có sẵn) | Hòa |
| Giá API chuẩn ($ / 1M token) | Đầu vào $0.15 / Đầu ra $0.50 (đầu vào được cache ~$0.03) | Phổ biến $0.14–$0.44 đầu vào / $0.28–$1.32 đầu ra (cao điểm/không cao điểm thay đổi) | GLM rẻ hơn |
| Giá khuyến mãi ra mắt | ~$0.075 đầu vào / $0.25 đầu ra (thời gian giới hạn, ~đầu tháng 9, 2026) | Không có khuyến mãi tương đương | GLM |
| AA Intelligence Index | 57 (do nhà cung cấp báo cáo) | ~50 (đo lường độc lập) | GLM |
| Terminal-Bench 2.1 | 84.3 | 82.7 | GLM |
| DeepSWE | 63.4 | 54.4 | GLM |
| SWE-bench Verified | Dữ liệu độc lập còn hạn chế | ~79% (kết quả độc lập mạnh) | DeepSeek |
| Điểm mạnh chính | Giá thấp hơn, đa phương thức gốc, dẫn đầu ở một số điểm lập trình/tác tử, hiệu quả ngữ cảnh dài | Xác thực độc lập trưởng thành hơn, hồ sơ lập trình/tác tử xuất sắc, thiết kế ngữ cảnh dài hiệu quả cao, hệ sinh thái mạnh | — |
| Điểm yếu chính | Bản phát hành mới (một số điểm vẫn do nhà cung cấp báo cáo); tốc độ trung bình | Hỗ trợ đa phương thức yếu hơn; giá hiệu dụng cao hơn ở nhiều tuyến | — |
| Phù hợp nhất | Sử dụng chung, khối lượng công việc đa phương thức, dự án nhạy chi phí, khả năng tác tử cân bằng | Tác tử thuần lập trình, suy luận văn bản ngữ cảnh dài, kịch bản cần benchmark độc lập đã được chứng minh | — |
Một câu tóm tắt:
Tính đến cuối tháng 8/2026, GLM-5.3-Flash hiện dẫn đầu về giá, khả năng đa phương thức và một số benchmark chồng lấn, mang lại giá trị tổng thể tốt hơn. DeepSeek V4 Flash vẫn là lựa chọn đáng tin cậy cho tác tử tập trung lập trình nhờ xác thực độc lập mạnh và hiệu quả ngữ cảnh dài. Hãy thử cả hai trên khối lượng công việc cụ thể trước khi quyết định.
Trường hợp sử dụng GLM-5.3-Flash
1. Kỹ thuật phần mềm tác tử
GLM-5.3-Flash đặc biệt phù hợp với các tác tử lập trình cần kiểm tra kho mã, sửa đổi nhiều tệp, thực thi lệnh terminal, chạy kiểm thử và lặp lại triển khai.
Điểm 84.3 Terminal-Bench 2.1 và 63.4 DeepSWE cho thấy kỹ nghệ phần mềm là một trong các lĩnh vực ứng dụng mạnh nhất của mô hình.
2. Lập trình trực quan
Vì GLM-5.3-Flash là đa phương thức gốc, nhà phát triển có thể cung cấp ảnh chụp màn hình, sơ đồ và đầu vào trực quan khác cùng với chỉ dẫn lập trình. Điều này hữu ích cho triển khai UI, gỡ lỗi trực quan và quy trình từ thiết kế đến mã.
3. Phân tích tài liệu ngữ cảnh dài
Cửa sổ ngữ cảnh 1M token khiến mô hình phù hợp với bộ tài liệu kỹ thuật lớn, kho mã, báo cáo dài và lịch sử tác tử nhiều giai đoạn.
4. Tác tử trình duyệt và sử dụng máy tính
Khả năng sử dụng công cụ và đa phương thức của mô hình khiến nó phù hợp với quy trình liên quan đến trình duyệt, giao diện đồ họa và công cụ bên ngoài.
5. Công việc tri thức doanh nghiệp
GLM-5.3-Flash có thể xử lý lượng lớn thông tin có cấu trúc và phi cấu trúc đồng thời sử dụng công cụ để thực hiện các tác vụ nhiều bước, phù hợp cho phân tích tài liệu, trợ lý nghiên cứu và tự động hoá quy trình.
6. Hạ tầng AI tự lưu trữ
Giấy phép MIT và trọng số công khai khiến GLM-5.3-Flash hấp dẫn với tổ chức cần kiểm soát triển khai, xử lý dữ liệu và hạ tầng suy luận.
Tham số API của GLM-5.3-Flash
| Tham số | Mô tả |
|---|---|
| model | Định danh mô hình theo nhà cung cấp |
| messages | Đầu vào hội thoại có cấu trúc |
| prompt | Đầu vào prompt đơn trên các API được hỗ trợ |
| max_tokens / max_completion_tokens | Giới hạn token đầu ra |
| temperature | Điều khiển mức ngẫu nhiên khi lấy mẫu |
| tools | Định nghĩa công cụ/hàm |
| stream | Bật truyền tải theo luồng |
| reasoning | Điều khiển nỗ lực suy luận trên cổng hỗ trợ |
| Image content | Được hỗ trợ |
| Function calling | Được hỗ trợ |
| Context | Tối đa 1M token |
Vercel AI Gateway hiện ghi nhận tối đa 131,000 token đầu ra, với token suy luận được tính vào giới hạn đầu ra.
Cách dùng GLM-5.3-Flash API trong CometAPI
Bước 1: Lấy quyền truy cập API
Đăng nhập cometAPI. Nếu bạn chưa là người dùng, vui lòng đăng ký trước. Đăng nhập bảng điều khiển CometAPI. Lấy khóa API truy cập. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy khóa token: sk-xxxxx và gửi.

Bước 2: Gửi yêu cầu tới GLM-5.3-Flash API
Chọn endpoint “GLM-5.3-Flash” để gửi yêu cầu API và đặt phần thân yêu cầu. Phương thức và phần thân yêu cầu được lấy từ tài liệu API trên website của chúng tôi. Website cũng cung cấp Apifox để thử nghiệm thuận tiện. Thay <YOUR_API_KEY> bằng CometAPI key thực tế từ tài khoản của bạn.
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đây là nội dung mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời được tạo.
Bước 3: Xử lý phản hồi
API trả về các phản hồi ứng viên có cấu trúc gồm văn bản được tạo, trích dẫn, siêu dữ liệu an toàn và đầu ra công cụ tùy chọn. Với yêu cầu đa phương thức, nội dung tin nhắn có thể được cấu trúc với đầu vào văn bản và hình ảnh khi endpoint CometAPI đã chọn phơi bày khả năng thị giác của mô hình.
Endpoint CometAPI chính xác, tham số được hỗ trợ và tình trạng sẵn sàng hiện tại nên được lấy từ tài liệu API trực tiếp của CometAPI thay vì suy diễn từ API gốc của Z.ai.
Với CometAPI, tích hợp nên dùng model ID hiển thị trên endpoint mô hình trực tiếp của CometAPI thay vì tự động sao chép ID theo nhà cung cấp từ Z.ai, Cloudflare hoặc Vercel.
Hạn chế của GLM-5.3-Flash
- Dấu chân mô hình lớn: Dù chỉ 18B tham số được kích hoạt, mô hình phát hành chứa khoảng 321B tham số, khiến tự lưu trữ đòi hỏi nhiều hơn đáng kể so với triển khai mô hình 7B–70B thông thường.
- Tốc độ suy luận không nhất thiết “flash” theo nghĩa tuyệt đối: Artificial Analysis hiện đo khoảng 50 token/giây trong môi trường so sánh của họ, đặt mô hình thấp hơn đáng kể so với các mô hình nhỏ nhanh nhất.
- Ngữ cảnh rất dài làm tăng yêu cầu hạ tầng: Cửa sổ ngữ cảnh 1M hữu ích nhưng có thể làm tăng bộ nhớ và độ phức tạp phục vụ.
- Hiệu năng benchmark khác nhau theo tác vụ: GLM-5.3-Flash đặc biệt mạnh ở benchmark lập trình tác tử và sử dụng công cụ, nhưng không benchmark đơn lẻ nào chứng minh ưu thế tuyệt đối so với các mô hình độc quyền hàng đầu.
- Đầu ra đa phương thức bị hạn chế: Khả năng đa phương thức gốc của mô hình chủ yếu ở phía đầu vào; đầu ra chuẩn là văn bản thay vì tạo hình ảnh hoặc video.