GPT-Image-1.5 API คืออะไร?
GPT-Image-1.5 เป็นสมาชิกใหม่ล่าสุดของตระกูล GPT Image ของ OpenAI และเป็นโมเดลเบื้องหลังประสบการณ์ Images แบบใหม่ของ ChatGPT ออกแบบมาเพื่อยกระดับการสร้างภาพจากแค่การทดลองเชิงแปลกใหม่สู่เครื่องมือสร้างสรรค์ระดับพร้อมใช้งานจริง: ความสมจริงเชิงภาพที่สูงขึ้น ควบคุมรายละเอียดได้ละเอียดสำหรับการแก้ไขแบบวนซ้ำ และการประมวลผลที่เร็วขึ้นเพื่อรองรับเวิร์กโฟลว์แบบโต้ตอบและระดับองค์กร
gpt-image-1.5 API คือเอ็นด์พอยต์โมเดลภาพแบบมัลติโหมดที่รับอินพุตรูปภาพหนึ่งภาพหรือหลายภาพ (ตัวระบุไฟล์หรือไบต์) พร้อมพรอมป์ข้อความ และส่งคืนรูปภาพที่สร้างขึ้นหรือรูปภาพที่แก้ไขแล้ว รองรับ:
- การสร้างภาพจากข้อความ (สร้างจากพรอมป์),
- การแก้ไขภาพ / in-painting / คอมโพสิต (ปรับใช้คำสั่งกับภาพที่มีอยู่ รองรับหลายภาพอ้างอิง), และ
- เวิร์กโฟลว์การแก้ไขแบบหลายเทิร์น ผ่าน Responses API (ทำให้ UI แบบ “ปรับ & วนซ้ำ” เป็นไปได้)
API จัดการพรอมป์ภาพแตกต่างจากข้อจำกัดเดิมของ DALL·E: โมเดลภาพของ GPT รองรับพรอมป์ข้อความที่ยาวกว่ามาก (แนวทาง 32k-character) ทำให้คำสั่งที่ซับซ้อนและมีข้อจำกัดมากเป็นไปได้
คุณสมบัติหลัก (เชิงปฏิบัติ)
- การแก้ไขได้ดีขึ้น / ความสอดคล้องข้ามหลายเทิร์น: รักษาลักษณะตัวละคร แสง และคุณลักษณะภาพสำคัญระหว่างการแก้ไขแบบวนซ้ำ ทำให้ “โมเดลเดียว แก้ไขซ้ำๆ” เชื่อถือได้มากขึ้นสำหรับเวิร์กโฟลว์อย่างแคตตาล็อกสินค้า หรือทรัพย์สินแบรนด์
- อัตราการประมวลผลที่เร็วขึ้น — เร็วขึ้น 4× เมื่อเทียบกับ GPT Image 1 มุ่งลดเวลาแฝงสำหรับเวิร์กโฟลว์สร้างสรรค์ที่ต้องการการโต้ตอบ
- การปรับต้นทุนให้เหมาะสม — ต้นทุนอินพุต/เอาต์พุตภาพลดลงราว 20% เทียบกับ GPT Image 1 ลดต้นทุนต่อภาพสำหรับผู้ใช้ปริมาณสูง
- การคอมโพสิตหลายภาพ & อ้างอิงสไตล์ — รองรับภาพอ้างอิงหลายภาพเพื่อคอมโพสิตฉากหรือถ่ายทอดสไตล์/แสง
- ตัวปรับคุณภาพ/ความเที่ยงตรง — พารามิเตอร์ API สำหรับปรับสมดุลระหว่างความเร็วกับความคมชัด (ใช้คุณภาพต่ำสำหรับการสร้างจำนวนมาก; คุณภาพสูงสำหรับทรัพย์สินผลิตจริง)
- การแก้ไขหลายเทิร์น / ผสานกับ Responses API — รองรับเวิร์กโฟลว์แบบเป็นขั้นตอน (ขอเปลี่ยนแปลง แล้ว “ปรับแก้” โดยคงสถานะไว้)
ความสามารถทางเทคนิค
- ขีดจำกัดพรอมป์ข้อความ (โมเดลภาพ): สูงสุด 32,000 อักขระ (หมายเหตุ: OpenAI ระบุว่าเป็นขีดจำกัดความยาวข้อความสำหรับโมเดลภาพของ GPT) ใช้สำหรับพรอมป์ยาวที่มีข้อกำหนดเข้มงวด
- อินพุตภาพ: รองรับ File ID (แนะนำสำหรับโฟลว์หลายเทิร์น) หรือไบต์ดิบ; สามารถส่งหลายภาพเพื่อคอมโพสิตและใช้อ้างอิงได้
- เอาต์พุต: PNG/JPEG หรืออาร์ติแฟ็กต์ภาพตามค่าปริยายของแพลตฟอร์มที่ส่งคืนโดย API (หรือเป็นไฟล์แนบภายใน ChatGPT) เอาต์พุตสามารถมีหลายภาพตัวเลือกและรองรับการร้องขอแบบวนซ้ำเพื่อปรับผลลัพธ์
- โหมดการสร้าง: สร้างจากข้อความ แก้ไขภาพ (inpaint/ขยายด้วยคำสั่ง) และสร้างตัวแปร รองรับการแก้ไขหลายเทิร์นด้วยคำสั่งแบบ “เพิ่ม/ลบ/ผสม”
- การแก้ไขที่ตระหนักรู้ต่อคำสั่ง: โมเดลถูกปรับให้รักษาความสอดคล้องกับคำสั่ง (คงสิ่งที่ระบุห้ามเปลี่ยน เช่น “อย่าเปลี่ยนโลโก้”, “คงท่าโพสและแสง”) รูปแบบพรอมป์วิศวกรรม (ย้ำ invariants ที่ชัดเจนทุกครั้ง) ช่วยลดการลื่นไถลทางความหมาย
ผลการทดสอบตามเกณฑ์มาตรฐาน
- อันดับบนกระดานผู้นำ: รายงานสรุปหนึ่งฉบับอ้างว่า GPT Image 1.5 นำตารางจัดอันดับการสร้างภาพจากข้อความด้วย ~1264 points บนกระดานของ Artificial Analysis นำหน้ารุ่นถัดไปอย่างมีนัยสำคัญ
- ตัวชี้วัดระดับงาน (การแก้ไข & การคงสภาพ): สรุปจาก Microsoft Foundry แสดงให้เห็นว่า GPT-Image-1.5 ทำได้เกือบสมบูรณ์ในการแก้ไขแบบทวิภาค (100% บน BinaryEval แบบเทิร์นเดียว) และมีคะแนนคงใบหน้าสูง (ประมาณ 90% บนมาตรการ AuraFace) ในตารางเปรียบเทียบกับคู่แข่งและโมเดล OpenAI ก่อนหน้า ตัวชี้วัดดังกล่าวจัดให้ GPT-Image-1.5 อยู่เหนือคู่แข่งบางรายในด้านการคงสภาพและความเที่ยงตรงของการแก้ไข

เปรียบเทียบ GPT-Image-1.5 กับคู่แข่ง
- เทียบกับ GPT Image 1 (รุ่นก่อนของ OpenAI): เร็วกว่า (สูงสุด 4×), ถูกกว่า (ต้นทุน IO ของภาพลดลงราว 20%) และความเที่ยงตรงการแก้ไขดีกว่า — มุ่งย้ายจาก “ต้นแบบ/เดโม” ไปสู่เวิร์กโฟลว์ภาพที่ “พร้อมใช้งานจริง”
- เทียบกับ Nano Banana Pro / Gemini image models ของ Google: GPT-Image-1.5 และตระกูล Nano Banana Pro / Gemini 3 ของ Google เป็นคู่แข่งใกล้เคียง — ต่างมีจุดแข็งในคลาสพรอมป์ที่ต่างกัน ข้อความจาก OpenAI เน้นความเที่ยงตรงในการแก้ไขและความเร็วในการวนซ้ำ; ข้อเสนอของ Google ได้รับคำชมเรื่องความสมจริงระดับสตูดิโอในบางตัวอย่าง
- เทียบกับ Qwen Image และโมเดลเปิด/ปิดอื่นๆ: GPT-Image-1.5 เหนือกว่า Qwen Image บนตัวชี้วัดด้านการแก้ไขและการคงสภาพหลายรายการในการประเมินแบบเทิร์นเดียว แต่ความแตกต่างแคบลงในงานหลายเทิร์นหรือโดเมนเฉพาะอื่นๆ
จุดแข็งของ GPT-Image-1.5
- ภาพสินค้าอีคอมเมิร์ซ: สร้างตัวแปรจำนวนมาก เปลี่ยนพื้นหลัง แคตตาล็อกสินค้าที่สอดคล้องจากภาพเดียว (รักษาแบรนด์/โลโก้)
- การผลิตสื่อสร้างสรรค์ & การตลาด: วนไอเดียรวดเร็ว ม็อกอัปสมจริง ถ่ายโอนสไตล์แบบควบคุมได้
- การรีทัชภาพ & เวิร์กโฟลว์เชิงบรรณาธิการ: ลองเปลี่ยนเสื้อผ้า/ทรงผมอย่างสมจริง รีทัชแบบเฉพาะส่วนโดยคงเอกลักษณ์และแสง
- การผสานกับเครื่องมือออกแบบ: เชื่อมต่อแพลตฟอร์มออกแบบหรือ CMS เพื่อสร้างภาพตัวแปรตามต้องการ (ตัวปรับความเที่ยงตรงช่วยควบคุมต้นทุน)
- ไปป์ไลน์คอมโพสิตหลายขั้นตอน: อินพุตหลายภาพช่วยคอมโพสิตและการสร้างภาพอิงอ้างอิงสำหรับฉากซับซ้อน
วิธีเข้าถึง GPT Image 1.5 API
ขั้นตอนที่ 1: ลงทะเบียนรับ API Key
เข้าสู่ระบบที่ cometapi.com หากคุณยังไม่เป็นผู้ใช้ของเรา โปรดลงทะเบียนก่อน ลงชื่อเข้าใช้ CometAPI console รับคีย์สิทธิ์การเข้าถึง API คลิก “Add Token” ที่โทเค็น API ในศูนย์ส่วนบุคคล รับคีย์โทเค็น: sk-xxxxx และส่ง
ขั้นตอนที่ 2: ส่งคำขอไปยัง GPT Image 1.5 API
เลือกเอ็นด์พอยต์ “gpt-image-1.5” เพื่อส่งคำขอ API และตั้งค่าบอดี้ของคำขอ วิธีการและบอดี้คำขอสามารถดูได้จากเอกสาร API บนเว็บไซต์ของเรา เว็บไซต์ของเรายังมีการทดสอบผ่าน Apifox เพื่อความสะดวกของคุณ แทนที่ <YOUR_API_KEY> ด้วย CometAPI key จริงจากบัญชีของคุณ base url is Images (https://api.cometapi.com/v1/images/generations) and [Image Editing]
ใส่คำถามหรือคำขอของคุณลงในฟิลด์ content—นี่คือสิ่งที่โมเดลจะตอบกลับ . ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น
ขั้นตอนที่ 3: ดึงและตรวจสอบผลลัพธ์
ประมวลผลการตอบกลับของ API เพื่อรับคำตอบที่สร้างขึ้น หลังการประมวลผล API จะตอบกลับด้วยสถานะงานและข้อมูลผลลัพธ์
ดูเพิ่มเติม Gemini 3 Pro Preview API