Thông số kỹ thuật của Gemini 4 Argon
| Thông số | Gemini 4 Argon |
|---|---|
| Nhà cung cấp | Google DeepMind |
| Họ mô hình | Gemini 4 |
| ID mô hình | gemini-4-argon |
| Loại mô hình | Mô hình suy luận đa phương thức thuộc nhóm frontier |
| Trọng tâm chính | Quy trình phức tạp, lập trình agentic, công việc tri thức doanh nghiệp, an ninh mạng |
| Khả năng đa phương thức | Google mô tả năng lực hiểu đa phương thức; trang mô hình công khai hiện chưa cung cấp đầy đủ sơ đồ modality của API |
| Đầu ra tối đa | Lên tới 1,000,000 token, theo danh sách API bên thứ ba hiện tại; điều này không nên bị nhầm lẫn với cửa sổ ngữ cảnh đầu vào |
| Cửa sổ ngữ cảnh đầu vào | Chưa được Google công bố rõ ràng trên trang mô hình công khai hiện tại |
| Tình trạng API công khai | Truy cập hạn chế/trước phát hành; Google chưa công bố ngày phát hành công khai rộng rãi |
Gemini 4 Argon là gì?
Gemini 4 Argon là mô hình chủ lực neo giữ thế hệ Gemini 4 của Google. Google mô tả mô hình này được thiết kế để đạt hiệu năng frontier trên các khối lượng công việc phức tạp, bao gồm kỹ nghệ phần mềm, công việc tri thức doanh nghiệp và phòng thủ an ninh mạng. Bộ đánh giá được công bố bao phủ công việc tri thức, lập trình agentic, khoa học và toán học, sử dụng máy tính, hiểu đa phương thức, tác vụ ngữ cảnh dài và an ninh mạng.
Vị thế của Argon đặc biệt mang tính định hướng quy trình công việc thay vì chỉ giới hạn ở hỏi đáp hội thoại. Google nhấn mạnh khả năng duy trì các tác vụ dài, nhiều bước và vận hành trong các quy trình kỹ nghệ phần mềm và doanh nghiệp phức tạp.
Các tính năng chính của Gemini 4 Argon
- Lập luận theo quy trình phức tạp: Được thiết kế cho các tác vụ dài, nhiều bước, yêu cầu lập luận bền bỉ thay vì một phản hồi ngắn duy nhất.
- Lập trình agentic: Google báo cáo kết quả mạnh trên DeepSWE v1.1, Vibe Code Bench và các đánh giá lập trình khác.
- Công việc tri thức doanh nghiệp: Các đánh giá công bố bao gồm tác vụ tài chính và pháp lý dựa trên tác tử, cũng như tự động hóa doanh nghiệp đầu-cuối.
- Hiểu đa phương thức: Google báo cáo kết quả mạnh trên Chartography và LVBench, bao phủ hiểu đa phương thức và video dài.
- Hiệu năng ngữ cảnh dài: Kết quả GraphWalks được báo cáo cho cả dải lên tới 128K và 256K–1M token.
- Phòng thủ an ninh mạng: Google định vị riêng Argon cho phòng thủ an ninh mạng và báo cáo kết quả CWE-bench v1 cho việc khắc phục lỗ hổng.
Hiệu năng benchmark của Gemini 4 Argon
Google DeepMind báo cáo các kết quả sau trên trang đánh giá Gemini 4 Argon hiện tại. Đây là các kết quả do nhà cung cấp công bố và chỉ nên so sánh trong phạm vi phương pháp luận benchmark đã nêu. [1]
| Benchmark | Danh mục | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Công việc tri thức | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Công việc tri thức | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Công việc tri thức | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Công việc tri thức | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Lập trình agentic | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Lập trình agentic | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Lập trình agentic | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Lập trình agentic | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Khoa học & toán học | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Khoa học & toán học | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Khoa học & toán học | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Ngữ cảnh dài | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Ngữ cảnh dài | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Hiểu đa phương thức | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Hiểu đa phương thức | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | An ninh mạng | 68.0% | 68.0% | 58.0% | 67.0% |
Các kết quả cho thấy hiệu năng của Argon thay đổi theo tác vụ: mô hình dẫn đầu trong so sánh đã nêu trên một số đánh giá về công việc tri thức, lập trình, khoa học, ngữ cảnh dài và đa phương thức, trong khi các mô hình khác đạt điểm cao hơn trên một số benchmark về lập trình, khoa học hoặc sử dụng máy tính. Không nên gộp chúng lại thành một xếp hạng tổng thể duy nhất.
Gemini 4 Argon so với GPT-6 Astra và Claude Fable 5.1
| Lĩnh vực | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Công việc tri thức | Kết quả công bố mạnh trên Vals, AutomationBench, tài chính và các đánh giá tác tử pháp lý | Mạnh trên cùng bộ đánh giá | Mạnh trên một số đánh giá công việc tri thức |
| Lập trình agentic | 77.9% trên DeepSWE v1.1; 91.9% trên Vibe Code Bench | 74.1% trên DeepSWE v1.1; 89.6% trên Vibe Code Bench | 67.4% trên DeepSWE v1.1; 90.3% trên Vibe Code Bench |
| Ngữ cảnh dài | 99.7% trên GraphWalks tới 128K; 84.2% trong dải 256K–1M | Lần lượt 98.7% và 71.8% | Lần lượt 91.4% và 65.0% |
| Hiểu đa phương thức | 71.6% Chartography; 91.7% LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| An ninh mạng | 68.0% trên CWE-bench v1 | 68.0% | 58.0% |
So sánh dựa trên benchmark cụ thể. Ví dụ, GPT-6 Astra đạt điểm cao hơn Argon trên FrontierSWE v2 và Terminal-Bench Science 0.1, trong khi Argon đạt điểm cao hơn trên DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M và LVBench.
Các trường hợp sử dụng tiêu biểu
- Kỹ nghệ phần mềm ở quy mô kho lưu trữ — Lập trình đường dài, tái cấu trúc, gỡ lỗi và phát triển agentic.
- Quy trình công việc tri thức doanh nghiệp — Nghiên cứu pháp lý, phân tích tài chính và tự động hóa quy trình kinh doanh.
- Phòng thủ an ninh mạng — Phát hiện, xác thực và khắc phục lỗ hổng trong môi trường kiểm soát.
- Quy trình khoa học và toán học — Các tác vụ phản ánh qua LABBench, RiemannBench và các đánh giá thiên về khoa học.
- Phân tích đa phương thức và video dài — Khối lượng công việc yêu cầu diễn giải thông tin thị giác và theo thời gian.
- Tác tử ngữ cảnh dài — Ứng dụng cần duy trì thông tin xuyên suốt các quỹ đạo tác vụ rất lớn.