ข้อมูลจำเพาะทางเทคนิคของ Grok Imagine Image 2.0
| รายการ | Grok Imagine Image 2.0 |
|---|---|
| รหัสรุ่น | grok-imagine-image-2.0 |
| ผู้ให้บริการ | xAI |
| ตระกูลโมเดล | Grok Imagine |
| ประเภทโมเดล | การสร้างและแก้ไขภาพ |
| โหมดอินพุต | ข้อความ, ภาพ |
| โหมดเอาต์พุต | ภาพ |
| ปลายทางการสร้างภาพ | POST /v1/images/generations |
| ปลายทางการแก้ไขภาพ | POST /v1/images/edits |
| ความละเอียดเอาต์พุต | 1K, 2K |
| โหมดคุณภาพ | ต่ำ, ปานกลาง |
| คุณภาพเริ่มต้น | ปานกลาง |
| อัตราส่วนภาพ | 1:1, 3:4, 4:3, 9:16, 16:9, 2:3, 3:2, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1, auto |
| จำนวนภาพต่อคำขอ | สูงสุด 10 |
| ภาพอ้างอิง | รองรับสำหรับการแก้ไขภาพ |
| รูปแบบการตอบกลับ | URL, JSON แบบ Base64 |
| ความเข้ากันได้ของ API | API รูปภาพที่เข้ากันได้กับ OpenAI |
| วันที่เปิดตัว | 7 สิงหาคม 2026 |
| สถานะ API | พร้อมให้ใช้งานทั่วไป |
เอกสารอย่างเป็นทางการของ xAI ยืนยันว่า grok-imagine-image-2.0 รองรับทั้งการสร้างภาพและการแก้ไขภาพ พร้อมความละเอียด 1K/2K และสามารถกำหนดอัตราส่วนภาพและคุณภาพได้
Grok Imagine Image 2.0 คืออะไร?
Grok Imagine Image 2.0 คือโมเดลสร้างและแก้ไขภาพล่าสุดจาก xAI ในตระกูล Grok Imagine ที่ออกแบบมาเพื่อการปฏิบัติตามคำสั่งอย่างแม่นยำ การจัดตัวอักษร การควบคุมเลย์เอาต์ และการคงลักษณะของภาพอ้างอิง
xAI ระบุว่า Image 2.0 ถูกออกแบบมาสำหรับ “งานสร้างสรรค์จริง” จุดเด่นไม่ได้เป็นเพียงคุณภาพภาพที่สูงขึ้น แต่โมเดลได้รับการปรับให้เหมาะสมกับการปฏิบัติตามพรอมต์ละเอียด การคงองค์ประกอบภาพระหว่างการแก้ไขแบบวนซ้ำ และการจัดการองค์ประกอบที่มีตัวอักษรและองค์ประกอบเชิงโครงสร้างหลายส่วน
โมเดลนี้พร้อมให้ใช้งานทั่วไปเมื่อวันที่ 7 สิงหาคม 2026 เริ่มแรกในฐานะโหมดคุณภาพใหม่บน Grok Imagine และตามมาด้วยการให้บริการผ่าน API
คุณสมบัติหลักของ Grok Imagine Image 2.0
ปฏิบัติตามพรอมต์อย่างแม่นยำ
Grok Imagine Image 2.0 ถูกออกแบบมาให้คงคำสั่งโดยละเอียดในพรอมต์การสร้างภาพที่ซับซ้อน ซึ่งมีประโยชน์อย่างยิ่งเมื่อพรอมต์ระบุวัตถุหลายชิ้น ความสัมพันธ์เชิงพื้นที่ สไตล์ภาพ หรือข้อจำกัดเชิงองค์ประกอบ
การจัดตัวอักษรและการสร้างเลย์เอาต์ที่แข็งแกร่ง
หนึ่งในเป้าหมายการออกแบบที่ชัดเจนคือการปรับปรุงการจัดการตัวอักษรและเลย์เอาต์ที่มีโครงสร้าง xAI เน้นความสามารถในการวางแผนตัวอักษรและเลย์เอาต์สำหรับภาพที่หนาแน่นหลายส่วน พร้อมคงความอ่านได้ของตัวอักษรขนาดเล็ก
สิ่งนี้ทำให้โมเดลเหมาะอย่างยิ่งกับ:
- โปสเตอร์
- โฆษณา
- อินโฟกราฟิก
- บรรจุภัณฑ์ผลิตภัณฑ์
- กราฟิกสำหรับโซเชียลมีเดีย
- งานศิลป์สำหรับงานนำเสนอ
- แบนเนอร์การตลาด
การแก้ไขภาพแบบ Image-to-Image
โมเดลรองรับการแก้ไขภาพผ่านปลายทาง /v1/images/edits นักพัฒนาสามารถส่งภาพที่มีอยู่และคำสั่งแก้ไข เช่น เปลี่ยนสไตล์ศิลป์ หรือเพิ่ม/ลบองค์ประกอบภาพ
การคงลักษณะของภาพอ้างอิง
Image 2.0 ถูกออกแบบมาเพื่อคงองค์ประกอบสำคัญจากภาพอ้างอิงระหว่างการสร้างและการแก้ไข ซึ่งมีประโยชน์สำหรับการรักษาลักษณะตัวละคร เอกลักษณ์ของผลิตภัณฑ์ องค์ประกอบภาพ หรือสไตล์ภาพในเวิร์กโฟลว์แบบวนซ้ำ
เอาต์พุต 1K และ 2K
API รองรับความละเอียดเอาต์พุตทั้ง 1K และ 2K นักพัฒนาสามารถเลือกตามความต้องการ ไม่ว่าจะเป็นดราฟต์ที่เร็วขึ้นหรือสินทรัพย์เพื่อการผลิตที่มีรายละเอียดสูง
อัตราส่วนภาพที่ยืดหยุ่น
Grok Imagine Image 2.0 รองรับอัตราส่วนภาพหลากหลาย ทั้งสี่เหลี่ยมจัตุรัส แนวตั้ง แนวนอน จอภาพยนตร์ และรูปแบบที่เน้นมือถือ ช่วยให้ API การสร้างภาพเดียวกันรองรับช่องทางเผยแพร่ที่แตกต่าง โดยไม่ต้องบังคับให้ออกสู่ผืนผ้าใบ 1:1 เสมอไป
การสร้างภาพแบบแบตช์
API สามารถสร้างภาพหลายภาพในคำขอเดียว โดยตามเอกสาร Imagine อย่างเป็นทางการรองรับสูงสุด 10 ภาพต่อคำขอ ซึ่งมีประโยชน์ในการสร้างตัวเลือกเชิงสร้างสรรค์สำหรับโฆษณา ภาพผลิตภัณฑ์ ภาพขนาดย่อ และการสำรวจคอนเซ็ปต์
ประสิทธิภาพตามเกณฑ์มาตรฐานของ Grok Imagine Image 2.0
xAI รายงานว่า Imagine Image 2.0 อยู่ในอันดับที่สองทั้งในกระดานจัดอันดับ Text-to-Image และ Image Edit Arena โดยอ้างอิงข้อมูลบนกระดานจัดอันดับ ณ วันที่ 7 สิงหาคม 2026 ซึ่งเป็นการประเมินจากภายนอกที่ xAI อ้างถึง ไม่ใช่คะแนนเกณฑ์มาตรฐานที่จัดทำเองภายใน

เนื่องจากการจัดอันดับเหล่านี้สามารถเปลี่ยนแปลงได้ตามเวลา จึงควรนำเสนอพร้อมวันที่กำกับ ไม่ใช่ในฐานะการจัดอันดับถาวรของโมเดล
Grok Imagine Image 2.0 เทียบกับ Grok Imagine Image
| คุณสมบัติ | Grok Imagine Image 2.0 | Grok Imagine Image |
|---|---|---|
| Model ID | grok-imagine-image-2.0 | grok-imagine-image |
| อินพุต | ข้อความ + ภาพ | ข้อความ + ภาพ |
| เอาต์พุต | ภาพ | ภาพ |
| 1K | ใช่ | ใช่ |
| 2K | ใช่ | ใช่ |
| การควบคุมคุณภาพ | ต่ำ / ปานกลาง | ไม่ได้ระบุว่าเป็นการควบคุมคุณภาพแบบเดียวกับ 2.0 |
| การจัดตัวอักษร | ปรับปรุง | รุ่นก่อนหน้า |
| การตามเลย์เอาต์ | ปรับปรุง | รุ่นก่อนหน้า |
| การแก้ไขภาพ | ใช่ | ใช่ |
| ราคา | $0.04–$0.08/ภาพเอาต์พุต ขึ้นอยู่กับคุณภาพ/ความละเอียด | $0.02/ภาพ |
| การวางตำแหน่ง | โมเดลสร้างสรรค์รุ่นใหม่ | รุ่นก่อนหน้าของ Grok Imagine |
รุ่น grok-imagine-image เก่ามีราคาที่ระบุอยู่ที่ $0.02 ต่อภาพที่สร้าง ในขณะที่ Image 2.0 ใช้การคิดราคาแบบขึ้นกับความละเอียด/คุณภาพ
Grok Imagine Image 2.0 เทียบกับ GPT Image 2.0
| แง่มุม | Grok Imagine Image 2.0 | GPT Image 2 / ChatGPT Images 2.0 |
|---|---|---|
| วันเปิดตัว | 7 ส.ค. 2026 | 21 เม.ย. 2026 |
| โฟกัสหลัก | การแก้ไขอย่างแม่นยำ + เอาต์พุตที่ใช้ได้จริง (อินโฟกราฟิก ภาพผลิตภัณฑ์ โมเดล UI แอสเซ็ตเกม สตอรีบอร์ด) | การสร้างภาพความเที่ยงตรงสูง + การให้เหตุผล + ความสอดคล้องหลายภาพที่ซับซ้อน |
| การจัดอันดับ Arena (ส.ค. 2026) | อันดับที่ 2 ของโลก ทั้ง text-to-image และการแก้ไขภาพ | อันดับที่ 1 ของโลก ทั้ง text-to-image และการแก้ไขภาพ |
| การเรนเดอร์ข้อความ | การปรับปรุงที่แข็งแกร่ง (ตัวอักษรคมชัด รับรู้เลย์เอาต์) | ระดับแนวหน้า (โดยเฉพาะข้อความขนาดเล็ก และสคริปต์ที่ไม่ใช่อักษรละติน เช่น ญี่ปุ่น/เกาหลี/จีน/ฮินดี/เบงกาลี) |
| หลายภาพ/ความสอดคล้อง | รองรับภาพอ้างอิงสูงสุด 5 ภาพ; เทมเพลตสำหรับผลิตภัณฑ์/ภาพใบหน้า/ฯลฯ | สูงสุด 8 ภาพที่สอดคล้องกันจากพรอมต์เดียว (พร้อมโหมด “Thinking”); ความต่อเนื่องของตัวละคร/วัตถุที่แข็งแกร่ง |
| คุณลักษณะพิเศษ | Smart resize/outpainting, การประกอบหลายอ้างอิงแบบเนทีฟ, การวางแผนเชิงออกแบบ | “Thinking” mode (ให้เหตุผลก่อนสร้าง สามารถค้นเว็บ สร้างสื่ออธิบายภาพจากไฟล์) |
| ความละเอียด/อัตราส่วน | 1K/2K ทั่วไป; อัตราส่วนยืดหยุ่นผ่าน Smart Resize | สูงถึง 2K (ในบางกรณีผ่าน API อาจสูงกว่า); ช่วงกว้าง (เช่น 3:1 ถึง 1:3) |
| จุดแข็ง | การแก้ไขเฉพาะจุดอย่างแม่นยำ งานอ้างอิงผลิตภัณฑ์/บุคคล เวิร์กโฟลว์สร้างสรรค์ที่ใช้งานได้จริง | การปฏิบัติตามพรอมต์ การออกแบบที่มีข้อความหนาแน่น ความสอดคล้องหลายฉาก การให้เหตุผล + ความรู้จากเว็บ |
ทั้งสองโมเดลอยู่ในหมวดหมู่คล้ายกัน แต่เน้นจุดแข็งที่แตกต่างกันเล็กน้อย
Grok Imagine Image 2.0 เหมาะอย่างยิ่งเมื่อเวิร์กโฟลว์ต้องพึ่งการปฏิบัติตามพรอมต์อย่างแม่นยำ เลย์เอาต์สไตล์โปสเตอร์ การจัดตัวอักษร การคงลักษณะของภาพอ้างอิง และการแก้ไขภาพแบบวนซ้ำ
GPT Image เหมาะกว่าเมื่อแอปพลิเคชันสร้างบนระบบมัลติโหมดของ OpenAI อยู่แล้ว และต้องการการสร้างภาพเป็นส่วนหนึ่งของเวิร์กโฟลว์ GPT ที่กว้างกว่า
สำหรับ API สร้างภาพเฉพาะทาง Grok Imagine Image 2.0 ที่ผสานการสร้าง + แก้ไข + เอาต์พุต 2K + คุณภาพที่กำหนดได้ + การรองรับอัตราส่วนภาพกว้าง ให้ทางเลือกที่แข็งแกร่งสำหรับสายการผลิตเชิงสร้างสรรค์
Grok Imagine Image 2.0 เทียบกับ Google Imagen
| ความสามารถ | Grok Imagine Image 2.0 | Google Imagen |
|---|---|---|
| ข้อความสู่ภาพ | ใช่ | ใช่ |
| การแก้ไขภาพ | ใช่ | ใช่ ทั้งนี้ขึ้นอยู่กับโมเดล/API |
| เอาต์พุต 2K | ใช่ | ขึ้นอยู่กับโมเดล |
| โฟกัสตัวอักษร/เลย์เอาต์ | แข็งแกร่ง | แข็งแกร่ง |
| เวิร์กโฟลว์ภาพอ้างอิง | ใช่ | ขึ้นอยู่กับโมเดล |
| API เข้ากันกับ OpenAI | ใช่ | ไม่ |
| การควบคุมอัตราส่วนภาพ | กว้างขวาง | ขึ้นอยู่กับโมเดล |
| การสร้างหลายภาพ | สูงสุด 10/คำขอ | ขึ้นอยู่กับโมเดล |
Grok Imagine Image 2.0 มีข้อได้เปรียบด้านการผสานรวมในทางปฏิบัติสำหรับนักพัฒนาที่ใช้ SDK ที่เข้ากันได้กับ OpenAI อยู่แล้ว เนื่องจาก xAI เปิดเผยปลายทางการสร้างภาพผ่านอินเทอร์เฟซที่เข้ากันได้กับ OpenAI
กรณีใช้งานของ Grok Imagine Image 2.0
1. งานสร้างสรรค์ด้านการตลาดและโฆษณา
สร้างงานแคมเปญ แบนเนอร์โปรโมชัน โฆษณาผลิตภัณฑ์ และกราฟิกสำหรับโซเชียล โดยระบุลำดับชั้นภาพและตำแหน่งข้อความอย่างแม่นยำ
2. การสร้างโปสเตอร์และอินโฟกราฟิก
โฟกัสด้านตัวอักษรและเลย์เอาต์ทำให้เหมาะกับโปสเตอร์ ชาร์ต กราฟิกงานอีเวนต์ และสินทรัพย์ภาพที่มีข้อมูลหนาแน่น
3. การทำภาพผลิตภัณฑ์
นักพัฒนาสามารถผสานภาพอ้างอิงของผลิตภัณฑ์กับคำสั่ง เพื่อสร้างสภาพแวดล้อม องค์ประกอบ หรือฉากการตลาดใหม่ โดยคงลักษณะสำคัญของผลิตภัณฑ์
4. การปรับสไตล์ภาพ
API สำหรับแก้ไขสามารถแปลงภาพที่มีอยู่ให้เป็นสไตล์ศิลป์อื่นได้ โดยไม่ต้องสร้างภาพใหม่ทั้งภาพตั้งแต่ต้น
5. คอนเทนต์โซเชียลมีเดีย
การรองรับอัตราส่วนภาพที่กว้างมีประโยชน์เมื่อสร้างสินทรัพย์สำหรับฟีดมือถือ สตอรี่ โพสต์แนวนอน ภาพขนาดย่อ และรูปแบบเฉพาะแพลตฟอร์มอื่นๆ
6. การทำซ้ำเชิงสร้างสรรค์
เนื่องจากการแก้ไขภาพสามารถทำงานบนผลลัพธ์ที่มีอยู่ ทีมจึงสามารถใช้เวิร์กโฟลว์ สร้าง → ตรวจสอบ → แก้ไข → ปรับแต่ง แทนการเริ่มจากพรอมต์ว่างซ้ำๆ
วิธีใช้ Grok Imagine Image 2.0 API บน CometAPI
สำหรับนักพัฒนาที่ใช้งานโมเดลสร้างภาพ AI หลายตัวอยู่แล้ว CometAPI สามารถมอบชั้นการเข้าถึงแบบรวม เพื่อผสาน Grok Imagine Image 2.0 เข้ากับแอปพลิเคชันที่มีอยู่โดยไม่ต้องสร้างเวิร์กโฟลว์จัดการโมเดลแยกต่างหาก
ลำดับการผสานพื้นฐานคือ:
- สร้างบัญชีหรือเข้าสู่ระบบ CometAPI
- ขอรับคีย์ CometAPI
- เลือก
grok-imagine-image-2.0 - ส่งพรอมต์ข้อความหรือคำขอแก้ไขภาพผ่านปลายทางภาพที่ CometAPI รองรับ
- จัดเก็บ URL ของภาพที่ส่งกลับหรือข้อมูลภาพ
- เปรียบเทียบผลลัพธ์กับโมเดลสร้างภาพอื่นๆ ที่มีบนแพลตฟอร์มเดียวกัน