Thông số kỹ thuật của Grok Imagine Image 2.0
| Hạng mục | Grok Imagine Image 2.0 |
|---|---|
| ID mô hình | grok-imagine-image-2.0 |
| Nhà cung cấp | xAI |
| Họ mô hình | Grok Imagine |
| Loại mô hình | Tạo sinh và chỉnh sửa hình ảnh |
| Phương thức đầu vào | Văn bản, Hình ảnh |
| Phương thức đầu ra | Hình ảnh |
| Điểm cuối tạo sinh | POST /v1/images/generations |
| Điểm cuối chỉnh sửa | POST /v1/images/edits |
| Độ phân giải đầu ra | 1K, 2K |
| Chế độ chất lượng | Thấp, Trung bình |
| Chất lượng mặc định | Trung bình |
| Tỷ lệ khung hình | 1:1, 3:4, 4:3, 9:16, 16:9, 2:3, 3:2, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1, auto |
| Số ảnh mỗi yêu cầu | Tối đa 10 |
| Ảnh tham chiếu | Được hỗ trợ cho chỉnh sửa hình ảnh |
| Định dạng phản hồi | URL, JSON Base64 |
| Tương thích API | API hình ảnh tương thích OpenAI |
| Ngày phát hành | August 7, 2026 |
| Trạng thái API | Khả dụng rộng rãi |
Tài liệu chính thức của xAI xác nhận rằng grok-imagine-image-2.0 hỗ trợ cả tạo sinh và chỉnh sửa hình ảnh, với độ phân giải 1K/2K và có thể cấu hình tỷ lệ khung hình cùng chất lượng.
Grok Imagine Image 2.0 là gì?
Grok Imagine Image 2.0 là mô hình tạo sinh và chỉnh sửa hình ảnh mới nhất trong họ Grok Imagine của xAI, được thiết kế xoay quanh khả năng tuân thủ hướng dẫn chính xác, xử lý chữ, kiểm soát bố cục và bảo toàn đặc trưng của ảnh tham chiếu.
xAI mô tả Image 2.0 được thiết kế cho “công việc sáng tạo thực sự.” Cải tiến lớn của nó không chỉ là chất lượng hình ảnh cao hơn; mô hình được tối ưu hóa đặc biệt để tuân theo prompt chi tiết, duy trì các yếu tố thị giác trong các lần chỉnh sửa lặp, và xử lý bố cục có chứa chữ và nhiều thành phần có cấu trúc.
Mô hình trở nên khả dụng rộng rãi vào August 7, 2026, ban đầu là Chế độ Chất lượng mới trên Grok Imagine và sau đó thông qua API.
Tính năng chính của Grok Imagine Image 2.0
Tuân thủ prompt chính xác
Grok Imagine Image 2.0 được thiết kế để giữ nguyên các hướng dẫn chi tiết trong các prompt tạo ảnh phức tạp. Điều này đặc biệt hữu ích khi prompt chỉ định nhiều đối tượng, quan hệ không gian, phong cách thị giác hoặc các ràng buộc bố cục.
Chữ và tạo bố cục mạnh mẽ
Một mục tiêu thiết kế rõ ràng của mô hình là cải thiện xử lý chữ và bố cục có cấu trúc. xAI nhấn mạnh khả năng lập kế hoạch chữ và bố cục cho các hình ảnh dày đặc, nhiều phần đồng thời giữ cho chữ nhỏ vẫn dễ đọc.
Điều này khiến mô hình đặc biệt phù hợp với:
- Poster
- Quảng cáo
- Infographic
- Bao bì sản phẩm
- Đồ họa mạng xã hội
- Đồ họa thuyết trình
- Banner tiếp thị
Chỉnh sửa ảnh từ ảnh
Mô hình hỗ trợ chỉnh sửa hình ảnh thông qua endpoint /v1/images/edits. Nhà phát triển có thể cung cấp một ảnh hiện có và một hướng dẫn chỉnh sửa, như thay đổi phong cách nghệ thuật hoặc thêm/bớt các yếu tố thị giác.
Bảo toàn ảnh tham chiếu
Image 2.0 được thiết kế để bảo toàn các yếu tố quan trọng từ ảnh tham chiếu trong suốt quá trình tạo sinh và chỉnh sửa. Điều này hữu ích để duy trì diện mạo nhân vật, nhận diện sản phẩm, bố cục hoặc phong cách thị giác trong các quy trình lặp.
Đầu ra 1K và 2K
API hỗ trợ cả độ phân giải đầu ra 1K và 2K. Nhà phát triển có thể chọn độ phân giải tùy theo nhu cầu bản nháp nhanh hay tài sản sản xuất chi tiết cao.
Tỷ lệ khung hình linh hoạt
Grok Imagine Image 2.0 hỗ trợ dải tỷ lệ khung hình rộng, bao gồm vuông, dọc, ngang, điện ảnh và định dạng ưu tiên di động. Điều này cho phép cùng một API tạo sinh phục vụ các kênh xuất bản khác nhau mà không buộc mọi đầu ra vào khung 1:1.
Tạo ảnh theo lô
API có thể tạo nhiều ảnh trong một yêu cầu, với tài liệu Imagine chính thức hỗ trợ tối đa 10 ảnh mỗi yêu cầu. Điều này hữu ích để tạo các biến thể sáng tạo cho quảng cáo, chụp ảnh sản phẩm, thumbnail và khám phá ý tưởng.
Hiệu năng điểm chuẩn của Grok Imagine Image 2.0
xAI báo cáo rằng Imagine Image 2.0 xếp hạng thứ hai trên cả bảng xếp hạng Text-to-Image và Image Edit Arena, dựa trên dữ liệu bảng xếp hạng tính đến August 7, 2026. Đây là các đánh giá Arena bên ngoài được xAI trích dẫn, không phải điểm chuẩn do nội bộ xây dựng.

Vì các thứ hạng này có thể thay đổi theo thời gian, nên chúng nên được trình bày kèm theo ngày thay vì như xếp hạng vĩnh viễn của mô hình.
Grok Imagine Image 2.0 so với Grok Imagine Image
| Tính năng | Grok Imagine Image 2.0 | Grok Imagine Image |
|---|---|---|
| ID mô hình | grok-imagine-image-2.0 | grok-imagine-image |
| Đầu vào | Văn bản + Hình ảnh | Văn bản + Hình ảnh |
| Đầu ra | Hình ảnh | Hình ảnh |
| 1K | Có | Có |
| 2K | Có | Có |
| Kiểm soát chất lượng | Thấp / Trung bình | Không được tài liệu hóa như cơ chế chất lượng 2.0 |
| Chữ | Được cải thiện | Thế hệ trước |
| Tuân thủ bố cục | Được cải thiện | Thế hệ trước |
| Chỉnh sửa hình ảnh | Có | Có |
| Giá | $0.04–$0.08/ảnh đầu ra tùy theo chất lượng/độ phân giải | $0.02/ảnh |
| Định vị | Mô hình sáng tạo thế hệ mới | Thế hệ Grok Imagine trước |
Mô hình grok-imagine-image cũ hiện có giá niêm yết $0.02 cho mỗi ảnh tạo sinh, trong khi Image 2.0 áp dụng mức giá phụ thuộc độ phân giải/chất lượng.
Grok Imagine Image 2.0 so với GPT Image 2.0
| Khía cạnh | Grok Imagine Image 2.0 | GPT Image 2 / ChatGPT Images 2.0 |
|---|---|---|
| Phát hành | Aug 7, 2026 | Apr 21, 2026 |
| Trọng tâm cốt lõi | Chỉnh sửa chính xác + đầu ra hữu ích trong thực tế (infographic, ảnh sản phẩm, bản dựng UI, tài sản trò chơi, bảng phân cảnh) | Tạo sinh độ trung thực cao + lập luận + tính nhất quán đa ảnh phức tạp |
| Xếp hạng Arena (Aug 2026) | #2 thế giới ở cả text-to-image và chỉnh sửa ảnh | #1 thế giới ở cả text-to-image và chỉnh sửa ảnh |
| Kết xuất văn bản | Cải thiện mạnh (chữ sắc nét, nhận thức bố cục) | Tốt nhất trong phân khúc (đặc biệt chữ nhỏ, hệ chữ phi Latin như tiếng Nhật/Hàn/Trung/Hindi/Bengali) |
| Nhiều ảnh / Tính nhất quán | Tối đa 5 ảnh tham chiếu; mẫu cho sản phẩm/chân dung, v.v. | Tối đa 8 ảnh nhất quán từ một prompt (với chế độ “Thinking”); tính liên tục nhân vật/đối tượng mạnh |
| Tính năng đặc biệt | Thay đổi kích thước thông minh/outpainting, tổng hợp đa tham chiếu gốc, lập kế hoạch định hướng thiết kế | “Thinking” mode (lập luận trước khi tạo sinh, có thể tìm kiếm web, tạo giải thích trực quan từ tệp) |
| Độ phân giải / Tỷ lệ | 1K/2K phổ biến; tỷ lệ linh hoạt qua Smart Resize | Tối đa 2K (API có tùy chọn cao hơn trong một số trường hợp); phạm vi rộng (ví dụ, 3:1 đến 1:3) |
| Điểm mạnh | Chỉnh sửa cục bộ chính xác, công việc sản phẩm/tham chiếu, quy trình sáng tạo thực tiễn | Tuân thủ prompt, thiết kế nhiều chữ, tính nhất quán đa cảnh, lập luận + kiến thức web |
Hai mô hình nhắm tới cùng một phân khúc nhưng nhấn mạnh các điểm mạnh hơi khác nhau.
Grok Imagine Image 2.0 đặc biệt hấp dẫn khi quy trình phụ thuộc vào tuân thủ prompt chính xác, bố cục kiểu poster, chữ, bảo toàn ảnh tham chiếu và chỉnh sửa hình ảnh lặp.
GPT Image phù hợp hơn khi ứng dụng đã xây trên hệ sinh thái đa phương thức rộng hơn của OpenAI và cần tạo ảnh như một phần của quy trình GPT lớn hơn.
Đối với API hình ảnh chuyên dụng, sự kết hợp của tạo sinh + chỉnh sửa + đầu ra 2K + chất lượng có thể cấu hình + hỗ trợ tỷ lệ khung hình rộng của Grok Imagine Image 2.0 khiến nó trở thành lựa chọn mạnh cho pipeline sáng tạo sản xuất.
Grok Imagine Image 2.0 so với Google Imagen
| Khả năng | Grok Imagine Image 2.0 | Google Imagen |
|---|---|---|
| Text-to-image | Có | Có |
| Chỉnh sửa hình ảnh | Có | Có, tùy thuộc mô hình/API |
| Đầu ra 2K | Có | Tùy thuộc mô hình |
| Tập trung chữ/bố cục | Mạnh | Mạnh |
| Quy trình ảnh tham chiếu | Có | Tùy thuộc mô hình |
| API tương thích OpenAI | Có | Không |
| Kiểm soát tỷ lệ khung hình | Rộng rãi | Tùy thuộc mô hình |
| Tạo nhiều ảnh | Tối đa 10/yêu cầu | Tùy thuộc mô hình |
Grok Imagine Image 2.0 có lợi thế tích hợp thực tiễn cho các nhà phát triển đã dùng SDK tương thích OpenAI, vì xAI cung cấp endpoint tạo sinh hình ảnh qua giao diện tương thích OpenAI.
Trường hợp sử dụng cho Grok Imagine Image 2.0
1. Sáng tạo cho marketing và quảng cáo
Tạo tác phẩm chiến dịch, banner quảng bá, quảng cáo sản phẩm và đồ họa mạng xã hội đồng thời chỉ định chính xác thứ bậc thị giác và vị trí văn bản.
2. Tạo poster và infographic
Sự nhấn mạnh vào chữ và bố cục khiến mô hình phù hợp cho poster, biểu đồ, đồ họa sự kiện và các tài sản hình ảnh thông tin dày đặc.
3. Trực quan hóa sản phẩm
Nhà phát triển có thể kết hợp ảnh tham chiếu sản phẩm với hướng dẫn để tạo môi trường, bố cục hoặc bối cảnh tiếp thị mới đồng thời bảo toàn các đặc trưng thị giác quan trọng của sản phẩm.
4. Đổi phong cách hình ảnh
API chỉnh sửa có thể biến đổi một ảnh hiện có sang phong cách nghệ thuật khác mà không cần tạo lại toàn bộ từ đầu.
5. Nội dung mạng xã hội
Hỗ trợ tỷ lệ khung hình rộng hữu ích khi tạo tài sản cho nguồn cấp di động, story, bài đăng ngang, thumbnail và các định dạng theo nền tảng khác.
6. Lặp sáng tạo
Vì chỉnh sửa ảnh có thể hoạt động trên kết quả hiện có, đội ngũ có thể sử dụng quy trình tạo → xem xét → chỉnh sửa → tinh chỉnh thay vì liên tục bắt đầu từ prompt trống.
Cách sử dụng API Grok Imagine Image 2.0 trên CometAPI
Đối với nhà phát triển đã dùng nhiều mô hình ảnh AI, CometAPI có thể cung cấp một lớp truy cập hợp nhất để tích hợp Grok Imagine Image 2.0 vào ứng dụng hiện có mà không cần tạo hẳn một quy trình quản lý mô hình tách biệt.
Quy trình tích hợp cơ bản:
- Tạo hoặc đăng nhập tài khoản CometAPI.
- Nhận khóa API CometAPI.
- Chọn
grok-imagine-image-2.0. - Gửi prompt văn bản hoặc yêu cầu chỉnh sửa ảnh qua endpoint hình ảnh được CometAPI hỗ trợ.
- Lưu URL ảnh hoặc dữ liệu ảnh trả về.
- So sánh kết quả với các mô hình ảnh khác có trên cùng nền tảng.