DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 đã ra mắt: Kết quả benchmark ở mức GPT-5.6 & hiệu suất viết mã

CometAPI
AnnaAug 13, 2026
Grok 4.6 đã ra mắt: Kết quả benchmark ở mức GPT-5.6 & hiệu suất viết mã

TL;DR xAI đã phát hành chính thức Grok 4.6 vào ngày 12 tháng 8 năm 2026 và cung cấp qua xAI API, Cursor và Grok Build. Mô hình có cửa sổ ngữ cảnh 500.000 token, nhận đầu vào văn bản và hình ảnh, cung cấp bốn mức độ nỗ lực suy luận, và có mốc kiến thức đến ngày 1 tháng 2 năm 2026. Theo thông báo chính thức về Grok 4.6 của xAI, mô hình đạt mức tương đương với GPT-5.6 Sol trên Artificial Analysis Intelligence Index, một chỉ số tổng hợp của chín bài đánh giá.

Giá API bắt đầu từ $2 cho mỗi 1 triệu token đầu vào, $0,50 cho mỗi 1 triệu token đầu vào được lưu trong bộ nhớ đệm và $6 cho mỗi 1 triệu token đầu ra với prompt dưới 200.000 token. Khi một prompt đạt 200.000 token, toàn bộ yêu cầu sẽ được tính theo mức giá ngữ cảnh dài là $4 đầu vào, $1 đầu vào lưu đệm và $12 đầu ra mỗi 1 triệu token. Với nhà phát triển cần quyền truy cập linh hoạt đa mô hình, các nền tảng như CometAPI giúp tích hợp Grok 4.6 cùng các mô hình tiên tiến khác dễ dàng hơn, Giá API là 80% so với mức giá của xAI.

Các điểm chính

  • xAI đã phát hành chính thức Grok 4.6 vào ngày 12 tháng 8 năm 2026; các báo cáo về khung thời gian phát hành trước đó hiện không còn phù hợp.
  • ID mô hình API là , và mô hình cũng có trên Cursor và Grok Build.grok-4.6
  • Cửa sổ ngữ cảnh là 500K token, nhận đầu vào văn bản và hình ảnh, đầu ra chỉ văn bản.
  • Mức giá tiêu chuẩn dưới 200K token trong prompt là $2/M đầu vào, $0,50/M đầu vào lưu đệm và $6/M đầu ra.
  • Prompt từ 200K token trở lên sẽ kích hoạt mức giá cao hơn cho tất cả token trong yêu cầu đó, không chỉ phần vượt ngưỡng.
  • Mức nỗ lực suy luận có thể đặt thành low, medium, high hoặc xhigh; là mặc định được ghi nhận.
  • Grok 4.6 đạt mức tương đương GPT-5.6 Sol trên Artificial Analysis Intelligence Index (điểm 61) và thể hiện mức tăng lớn so với Grok 4.5 về coding agent, công việc tri thức và các tác vụ dài hạn.
  • Grok Imagine Image 2.0 là API tạo sinh hình ảnh riêng. Grok 4.6 có thể hiểu hình ảnh nhưng không tự trả về hình ảnh được tạo.

Thông số Grok 4.6 và giá nhìn nhanh

Các thông số sau được xác nhận trong tài liệu mô hình của xAI ghi chú phát hành ngày 12 tháng 8.

Thông sốGrok 4.6
Ngày phát hành chính thứcAugust 12, 2026
ID mô hình APIgrok-4.6
Định vịMô hình chủ lực cho lập trình, agent và khối lượng công việc chung
Cửa sổ ngữ cảnh500,000 tokens
Đầu vàoVăn bản và hình ảnh
Đầu raVăn bản
Giới hạn đầu ra văn bản được công bốxAI không nêu giới hạn đầu ra văn bản
Điều khiển suy luậnLow, medium, high và xhigh
Mức suy luận mặc địnhCao
Mốc kiến thứcFebruary 1, 2026
Truy cập API gốcCó sẵn
Truy cập công cụ lập trìnhCursor và Grok Build
Truy cập sự kiện hiện tạiYêu cầu công cụ Web Search hoặc X Search

Bảng giá API chính thức của xAI

Bảng giá API hiện tại của xAI tách yêu cầu ngữ cảnh ngắn và ngữ cảnh dài.

Kích thước promptĐầu vào mỗi 1M tokenĐầu vào lưu đệm mỗi 1M tokenĐầu ra mỗi 1M token
Dưới 200,000 token$2.00$0.50$6.00
Từ 200,000 token trở lên$4.00$1.00$12.00

Ngưỡng này đặc biệt quan trọng với agent cho codebase. Khi prompt của yêu cầu đạt 200.000 token, xAI tính mức giá ngữ cảnh dài cho tất cả token trong yêu cầu đó, không chỉ phần vượt ngưỡng. Do đó, một yêu cầu chứa 199.000 token trong prompt có thể rẻ hơn đáng kể so với yêu cầu chứa 200.000 token, ngay cả khi kích thước gần như tương đương.

Hiện không có mức giảm giá theo lô cho Grok 4.6 trong tài liệu giá của xAI. Các nhóm không nên giả định rằng công việc ngoại tuyến được hưởng ưu đãi giống một số mô hình khác của xAI.

Grok 4.6 là gì?

Grok 4.6 là mô hình ngôn ngữ lớn chủ lực mới nhất của SpaceXAI, ra mắt vào ngày 12 tháng 8 năm 2026. Mô hình phát triển trực tiếp từ Grok 4.5 bằng cách áp dụng một giai đoạn huấn luyện bổ sung dài hơn, tập trung vào dữ liệu do mô hình tạo được tuyển chọn cho suy luận nâng cao và các khái niệm kỹ thuật, bộ dữ liệu kỹ thuật chất lượng cao, bộ tối ưu hóa được cải thiện và học tăng cường mở rộng cho các kịch bản lập trình và công việc tri thức.

Mô hình giữ nguyên nền tảng 1,5 nghìn tỷ tham số như người tiền nhiệm; các cải thiện chủ yếu đến từ hậu huấn luyện chứ không phải tăng quy mô tham số. Mô hình được thiết kế đặc biệt để duy trì hiệu quả qua nhiều bước—dù là nghiên cứu một chủ đề, phân tích lượng thông tin lớn, điều hướng và chỉnh sửa một codebase lạ, hay biến ý tưởng cấp cao thành ứng dụng/công việc hoàn chỉnh. SpaceXAI nhấn mạnh hành vi tự kiểm tra được cải thiện trên các dự án dài hạn và hiệu năng mạnh hơn trong công việc tương tác và trực quan.

Sự khác biệt so với chatbot truyền thống là quan trọng.

Quy trình LLM thông thường trông như sau:

Prompt → Tạo câu trả lời

Grok 4.6 được thiết kế cho các quy trình gần với:

Mục tiêu → Lập kế hoạch → Nghiên cứu → Dùng công cụ → Sửa mã → Kiểm thử → Đánh giá → Tiếp tục

Định vị hiện tại của xAI nhấn mạnh khả năng của mô hình trong việc bám sát các dự án phức tạp lâu hơn, làm việc trên codebase, nghiên cứu chủ đề lạ, xây dựng ứng dụng và tự xác minh công việc của mình.

Điều này khiến Grok 4.6 đặc biệt liên quan đến thị trường agent lập trình và agent tự động đang phát triển nhanh.

Các tính năng chính của Grok 4.6 là gì?

Năng lực xử lý tác vụ dài hạn

Cải tiến quan trọng nhất của Grok 4.6 là tập trung vào tác vụ dài hạn.

Thay vì chỉ tối ưu cho phản hồi một lần, mô hình được thiết kế để duy trì tiến độ qua nhiều giai đoạn của một dự án.

Ví dụ điển hình bao gồm:

  • Xây dựng một ứng dụng
  • Gỡ lỗi một kho mã lớn
  • Nghiên cứu một chủ đề lạ
  • Sửa đổi nhiều thành phần
  • Chạy kiểm thử
  • Điều tra lỗi
  • Sửa lại triển khai
  • Kiểm tra kết quả cuối cùng

Đây là mục tiêu khác biệt cơ bản so với các benchmark tuân thủ hướng dẫn truyền thống.

Hiệu năng lập trình nâng cao

Lập trình là một trong những lĩnh vực cải thiện rõ rệt nhất của Grok 4.6.

Báo cáo benchmark hiện tại cho thấy:

  • 65,9% trên DeepSWE 1.1
  • 69,9% trên CursorBench 3.2
  • 61,3% trên FrontierCode 1.1 Extended

Những đánh giá này đặc biệt phù hợp vì chúng nhắm tới hành vi của coding agent thay vì chỉ tự động hoàn thành mã.

Mức cải thiện từ Grok 4.5 lên Grok 4.6 trên DeepSWE 1.1 đặc biệt đáng chú ý, tăng từ khoảng 54% lên 65,9% theo so sánh được báo cáo.

Đầu vào đa phương thức

Grok 4.6 hỗ trợ đầu vào văn bản và hình ảnh, cho phép nhà phát triển kết hợp thông tin trực quan với suy luận.

Ứng dụng tiềm năng bao gồm:

  • Gỡ lỗi bằng ảnh chụp màn hình
  • Phân tích giao diện người dùng
  • Diễn giải biểu đồ
  • Hiểu tài liệu
  • Nghiên cứu trực quan
  • Tác vụ lập trình dựa trên hình ảnh

Điều này khiến Grok 4.6 linh hoạt hơn so với mô hình chỉ văn bản.

Khả năng truy cập tìm kiếm là một phần quan trọng trong hệ sinh thái của Grok.

API hỗ trợ:

  • Tìm kiếm Web
  • Tìm kiếm trên X
  • Gọi hàm
  • Thực thi mã

Tài liệu API Grok 4.5 hiện tại của xAI xác nhận các khả năng công cụ này trong môi trường Grok API.

Với agent nghiên cứu, điều này có nghĩa là mô hình có thể chuyển từ kiến thức tiền huấn luyện tĩnh sang truy xuất thông tin hiện tại cộng suy luận.

Suy luận có thể cấu hình

API của Grok cho phép cấu hình mức nỗ lực suy luận.

Điều này giúp nhà phát triển cân bằng giữa:

tốc độ / chi phí ↔ độ sâu suy luận

Với tác vụ đơn giản, mức suy luận thấp có thể giảm tính toán không cần thiết.

Với tác vụ lập trình hoặc nghiên cứu phức tạp, mức suy luận cao có thể mang lại cách giải quyết cẩn trọng hơn.

Hiệu năng tiên phong với chi phí cạnh tranh

Giá của Grok 4.6 có lẽ là một trong những lợi thế thương mại mạnh nhất.

Giá API tiêu chuẩn được báo cáo là:

  • $2 / 1M token đầu vào
  • $6 / 1M token đầu ra

Đó là mức giá giống Grok 4.5, bất chấp những cải thiện đáng kể về năng lực.

Điều này tạo ra đề xuất chi phí/hiệu năng đặc biệt cạnh tranh cho một mô hình tiên phong.


Grok 4.6 thể hiện thế nào trên các benchmark?

Dữ liệu benchmark hữu ích nhất hiện nay tập trung quanh trí tuệ dạng agent và lập trình.

BenchmarkGrok 4.6Đo lường gì
Artificial Analysis Intelligence Index61Trí tuệ tổng quát của mô hình tiên phong
CursorBench 3.269,9%Hiệu năng agent lập trình
DeepSWE 1.165,9%Agent kỹ sư phần mềm
FrontierCode 1.1 Extended61,3%Lập trình nâng cao
GDPVal-AA v21.753 EloHiệu năng tác vụ công việc tri thức

Điểm 61 trên Artificial Analysis Intelligence Index được cho là đặt Grok 4.6 ngang mức GPT-5.6 Sol trên chỉ số này.

Điểm 1.753 Elo trên GDPVal-AA v2 cũng đáng chú ý vì GDPVal đánh giá các tác vụ công việc tri thức chuyên nghiệp chứ không chỉ là hỏi đáp học thuật.

Điểm rút ra quan trọng từ benchmark

Bằng chứng mạnh nhất cho Grok 4.6 không phải là một điểm MMLU đơn lẻ.

Hồ sơ benchmark của nó hướng tới:

lập trình + agent + công việc tri thức + thực thi dài hạn

Đó chính là nơi phát triển AI hiện đại đang tiến tới.

Với một website như CometAPI, đây là điểm khác biệt quan trọng cần giữ: Grok 4.6 nên được tiếp thị chủ yếu như một mô hình tiên phong thiên về tác tử (agentic), thay vì một chatbot chung chung khác.

Grok 4.6 so sánh với tiền nhiệm và đối thủ thế nào?

Grok 4.6 vs Grok 4.5

Tính năngGrok 4.5Grok 4.6
Trọng tâm chínhSuy luận chung + agentAgent dài hạn + lập trình
Ngữ cảnhTriển khai lớp 500K500K
Đầu vàoVăn bản + hình ảnhVăn bản + hình ảnh
Tìm kiếm web
Tìm kiếm trên X
Thực thi mã
Gọi hàm
Giá đầu vào$2/M$2/M
Giá đầu ra$6/M$6/M
DeepSWE 1.1~54%65,9%
Intelligence Index~5661

Điểm quan trọng là Grok 4.6 có vẻ không chỉ là thay thế theo bậc giá cho Grok 4.5. Đây là nâng cấp năng lực nhắm nhiều hơn vào quy trình agent dài hạn.

Tài liệu Grok 4.5 hiện tại của xAI liệt kê mô hình ở mức $2/$6 mỗi triệu token, với khả năng cấu hình suy luận và hỗ trợ công cụ.

Bảng so sánh: Grok 4.6 vs các đối thủ chính

Khía cạnhGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Ghi chú
AA Intelligence Index616162 / 63Điểm tổng hợp
Đầu vào / Đầu ra $/1M$2 / $6~$5 / $30~$5 / $25Grok rẻ hơn nhiều ở đầu ra
Cửa sổ ngữ cảnh500KLên đến 1M+Thường 1M
Thế mạnhAgent, hiệu quả lập trình, chi phíSuy luận rộng, lập trìnhDài hạn, an toàn
Tích hợp CursorGốc, mạnhGrok tối ưu cho Cursor
Hiệu quả lượtCao (ít bước hơn)Cạnh tranhBáo cáo cần nhiều bước hơnQuan trọng với agent
Khả dụngAPI + Cursor + đối tácChính thức + đối tácChính thức + đối tácCometAPI thống nhất truy cập

Dữ liệu lấy từ thông báo của SpaceXAI, Artificial Analysis và các thẻ mô hình công khai tính đến ngày 13 tháng 8 năm 2026.

So sánh Artificial Analysis hiện tại đặc biệt thú vị.

Grok 4.6 được cho là đạt 61 trên Intelligence Index, ngang mức GPT-5.6 Sol. Nhưng bài toán kinh tế lại rất khác.

Giá chính xác của các biến thể GPT cạnh tranh nên được kiểm tra đối chiếu với bảng giá hiện hành của nhà cung cấp trước khi xuất bản, nhưng quan sát thị trường cốt lõi là rõ ràng: Grok 4.6 cạnh tranh ở mức hiệu năng benchmark của mô hình tiên phong trong khi duy trì mức giá token tương đối quyết liệt.

Điều đó khiến Grok 4.6 đặc biệt hấp dẫn cho các ứng dụng mà nơi thực thi agent với khối lượng cao có thể khiến các mô hình tiên phong cao cấp trở nên đắt đỏ.

Hạn chế của Grok 4.6 là gì?

Ngữ cảnh 500K nhỏ hơn một số đối thủ 1M

Ngữ cảnh 500K của Grok 4.6 là lớn, nhưng không phải lớn nhất trên thị trường mô hình tiên phong.

Với kho mã rất lớn hoặc tập tài liệu khổng lồ, mô hình 1M có thể có lợi thế.

Mô hình độc quyền

Không giống MiMo-V2.5-Pro, Grok 4.6 không phải mô hình mở trọng số.

Nhà phát triển không thể tải xuống và triển khai độc lập.

So sánh benchmark cần thận trọng

Các benchmark lập trình khác nhau sử dụng bộ khung, prompt, công cụ và quy trình đánh giá khác nhau.

Ví dụ, SWE-Bench Pro được thiết kế riêng quanh các bài toán kỹ nghệ phần mềm dài hạn thực tế, và kết quả benchmark có thể thay đổi đáng kể tùy giàn agent.

Vì vậy, 69,9% CursorBench không nên được hiểu là “Grok 4.6 tốt hơn 69,9% so với mô hình khác.”

Cách diễn giải đúng là nó đạt điểm đó trong thiết lập đánh giá cụ thể của benchmark.

Chi phí agent có thể cao hơn so với gợi ý từ giá token

Mức $2/$6 hấp dẫn, nhưng một agent tự động có thể tiêu thụ lượng token khổng lồ thông qua:

  • Gọi công cụ
  • Tìm kiếm lặp lại
  • Thực thi mã
  • Thử nghiệm thất bại
  • Ngữ cảnh dài
  • Tự xác minh

Do đó, kinh tế đơn vị thực tế phụ thuộc vào chi phí cho mỗi tác vụ hoàn thành thành công, không chỉ chi phí trên mỗi triệu token.

Giá và truy cập

Giá chính thức (bậc tiêu chuẩn, dưới ~200K token trong prompt):

  • Đầu vào: $2,00 trên mỗi 1M token
  • Đầu vào lưu đệm: khoảng $0,50 trên mỗi 1M token
  • Đầu ra: $6,00 trên mỗi 1M token

Một biến thể nhanh hơn có giá gấp đôi các mức này. Mức giá có thể tăng gấp đôi với ngữ cảnh rất dài (≥200K). Rất khuyến nghị bật lưu đệm prompt cho vòng lặp agent để giữ chi phí thấp.

Khả dụng:

  • Cursor và Grok Build (gồm 2× mức sử dụng trong tuần đầu)
  • SpaceXAI API (grok-4.6)
  • Đối tác: OpenRouter, Vercel, Cloudflare và các bên khác
  • SuperGrok chat/apps (qua bộ chọn mô hình)

Khuyến nghị CometAPI: Với nhà phát triển đã dùng (hoặc dự định dùng) nhiều mô hình tiên phong, CometAPI cung cấp quyền truy cập liền mạch tới Grok 4.6 qua một điểm cuối tương thích OpenAI duy nhất (https://api.cometapi.com/v1). Bạn có bộ hóa đơn thống nhất, phân tích sử dụng, mức giá hiệu dụng cạnh tranh trên 500+ mô hình (bao gồm GPT, Claude, Gemini, DeepSeek và các biến thể Grok), và khả năng chuyển đổi mô hình chỉ với một dòng thay đổi. Điều này đặc biệt giá trị khi A/B test Grok 4.6 với các mô hình lập trình hoặc agent khác, hoặc khi xây dựng hệ thống production hưởng lợi từ định tuyến và dự phòng mô hình. Đăng ký tại cometapi.com để nhận API key miễn phí và khám phá danh mục mô hình trực tiếp.

Bạn có nên chuyển sang Grok 4.6?

Có, nếu:

  • Bạn làm việc nhiều trong Cursor hoặc xây dựng agent lập trình/công việc tri thức dài hạn và muốn độ tin cậy đa bước mạnh ở chi phí cạnh tranh.
  • Kinh tế token quan trọng—Grok 4.6 cung cấp trí tuệ gần tương đương GPT-5.6 Sol với mức giá token đầu ra vào khoảng một phần năm so với các lựa chọn tiên phong đắt nhất.
  • Bạn coi trọng hiệu quả lượt (ít bước và token hơn để hoàn thành tác vụ phức tạp).
  • Bạn muốn truy cập ngay một mô hình được huấn luyện rõ ràng cho các quy trình tương tác, trực quan và dạng agent phổ biến trong phát triển hiện đại.

Cân nhắc ở lại hoặc phối hợp với mô hình khác nếu:

  • Khối lượng công việc chính của bạn là lập trình thi đấu thuần túy hoặc các điểm mạnh cụ thể của mô hình đóng (ví dụ, một số kịch bản ngữ cảnh dài hoặc tinh chỉnh an toàn của Claude).
  • Bạn cần điểm cao nhất tuyệt đối trên mọi benchmark kỹ nghệ phần mềm riêng lẻ bất kể chi phí.
  • Bạn cần cửa sổ ngữ cảnh lớn hơn 500K cho tác vụ một lần gọi (một số đối thủ cung cấp 1M+).

Hầu hết các nhóm sẽ hưởng lợi khi đánh giá Grok 4.6 song song với stack hiện tại. Vì mô hình có sẵn qua các trình tổng hợp như CometAPI, chi phí chuyển đổi thấp—chỉ cần đổi tên mô hình và đo tỷ lệ hoàn thành tác vụ thực, độ trễ và chi phí trên khối lượng công việc của chính bạn.

Kết luận

Grok 4.6 đại diện cho một bước tiến đáng kể của SpaceXAI: trí tuệ cấp tiên phong trên các benchmark tổng hợp và dạng agent, cải thiện ý nghĩa với hiệu năng lập trình và công việc tri thức dài hạn, và tiếp tục giữ mức giá cạnh tranh vượt trội so với nhiều đối thủ đóng nguồn. Khả năng có sẵn gốc trong Cursor, đi cùng độ tin cậy đa bước mạnh, khiến mô hình đặc biệt hấp dẫn cho nhà phát triển xây dựng agent phần mềm và ứng dụng tương tác thực tế.

Dù bạn truy cập trực tiếp, qua Cursor/Grok Build, hay qua cổng thống nhất như CometAPI, Grok 4.6 đã sẵn sàng cho đánh giá production ngay hôm nay. Truy cập thông báo chính thức tại x.ai/news/grok-4-6 để xem đầy đủ chi tiết và thẻ mô hình, khám phá danh mục trực tiếp trên cometapi.com để so sánh song song với các mô hình hàng đầu khác, và bắt đầu xây dựng với các khả năng mới ngay lập tức.

Nguồn chính

Luôn xác minh bảng giá, giới hạn tốc độ và số liệu benchmark mới nhất trên các trang chính thức, vì bối cảnh AI thay đổi nhanh chóng.

0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm