GPT Image 2 là gì?
GPT Image 2 là mô hình tạo ảnh tối tân của OpenAI, được tích hợp trực tiếp vào ChatGPT dưới tên ChatGPT Images 2.0. Khác với các công cụ độc lập trước đây như DALL·E 3, nó kết hợp khả năng hiểu ngôn ngữ của GPT-series với tổng hợp hình ảnh tiên tiến. Mô hình tạo ra hình ảnh chính xác, hữu dụng, được tối ưu cho các tác vụ chuyên nghiệp thay vì chỉ phục vụ thử nghiệm nghệ thuật thuần túy.
Các khả năng chính
- Kết xuất văn bản gần như hoàn hảo: Đạt độ chính xác ở cấp độ ký tự khoảng ~99%, kết xuất văn bản dễ đọc, chính xác theo ngữ cảnh bằng tiếng Anh và các hệ chữ phi Latin. Xử lý các khối văn bản dài, menu, poster và đồ họa thông tin mà không gặp lỗi kiểu chữ lộn xộn thường thấy ở các mô hình trước.
- Dàn dựng phức tạp và độ trung thực bố cục: Tạo ra các đầu ra có cấu trúc như bản mẫu giao diện (UI mockup), sơ đồ mặt bằng, trực quan hóa dữ liệu, slide trình chiếu, bản đồ, trang manga và các lưới nhiều phần tử (ví dụ: lưới biểu tượng 10x10 hoặc poster sản phẩm).
- Hỗ trợ đa ngôn ngữ và văn hóa: Tạo văn bản chính xác và hình ảnh phù hợp văn hóa bằng nhiều ngôn ngữ.
- Chỉnh sửa ảnh và xử lý tham chiếu: Áp dụng chỉnh sửa cho ảnh được tải lên đồng thời giữ nguyên chi tiết, khuôn mặt và phong cách với độ nhất quán cao.
- Tạo theo lô: Tạo tối đa 8 ảnh nhất quán từ một prompt duy nhất, duy trì tính nhất quán về nhân vật và đối tượng trên toàn bộ tập.
- Tính chân thực ảnh và khả năng sử dụng: Kết quả trông tự nhiên hơn và sẵn sàng đưa vào sản xuất, ít tạo tác hơn, hệ thống biểu tượng tốt hơn và bố cục chuyên nghiệp.