GPT-Image-1.5 API là gì?
GPT-Image-1.5 là thành viên mới nhất của gia đình GPT Image của OpenAI và là mô hình đứng sau trải nghiệm Images được làm mới của ChatGPT. Mô hình này được thiết kế để đưa tạo ảnh từ những thử nghiệm mang tính mới lạ thành công cụ sáng tạo đạt chuẩn sản xuất: tính chân thực cao hơn, kiểm soát tinh vi cho các chỉnh sửa lặp, và suy luận nhanh hơn để hỗ trợ quy trình tương tác và doanh nghiệp.
gpt-image-1.5 API là điểm cuối mô hình hình ảnh đa phương thức, nhận một hoặc nhiều đầu vào hình ảnh (định danh tệp hoặc bytes) cùng prompt văn bản và trả về ảnh được tạo hoặc ảnh đã chỉnh sửa. API hỗ trợ:
- Tạo ảnh từ văn bản (tạo từ prompt),
- Chỉnh sửa ảnh / in‑painting / dựng ghép (áp dụng hướng dẫn lên ảnh hiện có, cho phép nhiều ảnh đầu vào), và
- Quy trình chỉnh sửa nhiều lượt thông qua Responses API (cho phép UI “chỉnh sửa & lặp lại”).
API xử lý prompt hình ảnh khác với giới hạn DALL·E cũ: các mô hình GPT image chấp nhận prompt văn bản dài đáng kể (nguyên tắc 32k ký tự), giúp khả thi các hướng dẫn phức tạp, giàu ràng buộc.
Tính năng chính (thực tiễn)
- Khả năng chỉnh sửa tốt hơn / nhất quán qua nhiều lượt: giữ nguyên diện mạo nhân vật, ánh sáng và các thuộc tính thị giác chính trong các chỉnh sửa lặp. Điều này giúp “cùng một mô hình, chỉnh sửa lặp lại” đáng tin cậy hơn cho các quy trình như danh mục sản phẩm hoặc tài sản thương hiệu.
- Thông lượng nhanh hơn — cải thiện tốc độ gấp 4× so với GPT Image 1, nhằm giảm độ trễ cho các quy trình sáng tạo lặp.
- Tối ưu chi phí — chi phí vào/ra hình ảnh giảm khoảng 20% so với GPT Image 1, hạ chi phí mỗi lần lặp ảnh cho người dùng khối lượng lớn.
- Dựng ghép đa ảnh & tham chiếu phong cách — chấp nhận nhiều ảnh tham chiếu để dựng ghép cảnh hoặc chuyển phong cách/ánh sáng.
- Nút chỉnh chất lượng/độ trung thực — tham số API đánh đổi tốc độ và độ trung thực (dùng chất lượng thấp cho tạo hàng loạt; chất lượng cao cho tài sản sản xuất).
- Chỉnh sửa nhiều lượt / tích hợp Responses API — cho phép quy trình theo bước (yêu cầu thay đổi, rồi “tinh chỉnh” trong khi giữ trạng thái).
Khả năng kỹ thuật
- Giới hạn prompt văn bản (mô hình hình ảnh): lên tới 32,000 ký tự (lưu ý: OpenAI ghi nhận đây là mức cho phép độ dài văn bản cho các mô hình GPT image). Dùng cho prompt dài, nhiều ràng buộc.
- Đầu vào hình ảnh: chấp nhận File IDs (ưa dùng cho luồng nhiều lượt) hoặc bytes thô; có thể cung cấp nhiều ảnh để dựng ghép và tham chiếu.
- Đầu ra: PNG/JPEG hoặc hiện vật ảnh mặc định của nền tảng do API trả về (hoặc đính kèm trong ChatGPT). Đầu ra có thể gồm nhiều ảnh ứng viên và hỗ trợ các yêu cầu lặp để tinh chỉnh kết quả.
- Chế độ tạo: tạo ảnh từ văn bản, chỉnh sửa ảnh (inpaint/mở rộng theo hướng dẫn), và biến thể. Chỉnh sửa nhiều lượt hỗ trợ hướng dẫn kiểu “thêm/bớt/kết hợp”.
- Chỉnh sửa theo hướng dẫn: mô hình được tối ưu cho độ tuân thủ hướng dẫn (giữ các bất biến được chỉ định như “không đổi logo”, “giữ tư thế và ánh sáng”). Mẫu prompt‑engineering (lặp lại các bất biến rõ ràng ở mỗi lượt) giúp giảm lệch nghĩa.
Hiệu năng đánh giá (benchmark)
- Xếp hạng bảng tổng hợp: Một báo cáo tổng hợp ghi nhận GPT Image 1.5 dẫn đầu bảng xếp hạng text‑to‑image với ~1264 điểm trên bảng xếp hạng Artificial Analysis, vượt đối thủ kế tiếp với khoảng cách đo được.
- Chỉ số theo nhiệm vụ (chỉnh sửa & bảo toàn): bản tóm tắt của Microsoft Foundry về các chỉ số đánh giá cho thấy GPT-Image-1.5 đạt tỉ lệ thành công chỉnh sửa nhị phân gần như hoàn hảo (100% trong BinaryEval một lượt) và điểm giữ nguyên khuôn mặt mạnh (khoảng 90% theo thang AuraFace) trong bảng so sánh với đối thủ và các mô hình OpenAI trước đó. Các chỉ số so sánh này đặt GPT-Image-1.5 vượt trước một số đối thủ về khả năng bảo toàn và độ trung thực chỉnh sửa.

GPT-Image-1.5 so sánh với các mô hình cùng nhóm
- Vs. GPT Image 1 (thế hệ OpenAI trước): nhanh hơn (tới 4×), rẻ hơn (chi phí IO hình ảnh giảm ~20%), và độ trung thực chỉnh sửa mạnh hơn — nhắm tới việc chuyển từ “nguyên mẫu/demo” sang quy trình ảnh thân thiện sản xuất.
- Vs. Google’s Nano Banana Pro / Gemini image models: GPT-Image-1.5 và nhóm Nano Banana Pro / Gemini 3 của Google là các đối thủ sát sao — mỗi bên mạnh ở các lớp prompt khác nhau. Thông điệp của OpenAI nhấn mạnh độ trung thực chỉnh sửa và tốc độ lặp; phía Google được khen ngợi về tính chân thực cấp studio ở một số ví dụ.
- Vs. Qwen Image và các mô hình mở/đóng khác: GPT-Image-1.5 vượt Qwen Image ở vài chỉ số chỉnh sửa và bảo toàn trong đánh giá một lượt, nhưng khác biệt thu hẹp trong kịch bản nhiều lượt hoặc các bài thử theo miền cụ thể.
Những điểm mạnh của GPT-Image-1.5
- Hình ảnh sản phẩm thương mại điện tử: biến thể hàng loạt, thay nền, chuẩn hóa danh mục từ một ảnh duy nhất (giữ nguyên thương hiệu/logo).
- Sản xuất tài sản sáng tạo & marketing: lặp ý tưởng nhanh, mockup chân thực, chuyển phong cách có kiểm soát.
- Retouch ảnh & quy trình biên tập: thử đồ tóc/quần áo chân thực, retouch chọn lọc vẫn giữ bản sắc và ánh sáng.
- Tích hợp công cụ thiết kế: cắm vào nền tảng thiết kế hoặc CMS để tạo biến thể theo yêu cầu (tham số độ trung thực giúp kiểm soát chi phí).
- Pipeline dựng ghép nhiều bước: đầu vào đa ảnh cho phép dựng ghép và tạo theo tham chiếu cho các cảnh phức tạp.
Cách truy cập GPT Image 1.5 API
Bước 1: Đăng ký khóa API
Đăng nhập vào cometapi.com. Nếu bạn chưa là người dùng của chúng tôi, vui lòng đăng ký trước. Đăng nhập vào CometAPI console. Lấy khóa truy cập API. Nhấp “Add Token” tại mục API token trong trung tâm cá nhân, lấy token key: sk-xxxxx và gửi.
Bước 2: Gửi yêu cầu đến GPT Image 1.5 API
Chọn endpoint “gpt-image-1.5” để gửi yêu cầu API và thiết lập phần thân yêu cầu. Phương thức và phần thân yêu cầu được lấy từ tài liệu API trên trang web của chúng tôi. Trang web cũng cung cấp bài thử Apifox để bạn tiện sử dụng. Thay <YOUR_API_KEY> bằng khóa CometAPI thực tế từ tài khoản của bạn. base url là Images (https://api.cometapi.com/v1/images/generations) và [Chỉnh sửa Hình ảnh]
Chèn câu hỏi hoặc yêu cầu của bạn vào trường content — đó là phần mô hình sẽ phản hồi. Xử lý phản hồi API để lấy câu trả lời đã tạo.
Bước 3: Truy xuất và xác minh kết quả
Xử lý phản hồi API để lấy câu trả lời đã tạo. Sau khi xử lý, API sẽ trả về trạng thái tác vụ và dữ liệu đầu ra.
Xem thêm Gemini 3 Pro Preview API