ข้อกำหนดทาง技术ของ MiniMax H3 Max
| ข้อกำหนด | MiniMax H3 Max |
|---|---|
| รหัสรุ่น | minimax-h3-max |
| ตระกูลรุ่น | MiniMax H3 |
| ประเภทรุ่น | โมเดลวิดีโอเชิงกำเนิด |
| แหล่งที่มาของโมเดล | ผ่านการฝึกภายหลังจากน้ำหนักแบบเปิดของ MiniMax H3 |
| การฝึกภายหลัง | fal Research |
| การเพิ่มประสิทธิภาพหลัก | การยึดตามพรอมป์, ความสวยงาม, ปริมาณงานการอนุมาน |
| อินพุต | ข้อความ, ภาพ; การรองรับอ้างอิงสู่วิดีโอมีให้ใช้งานผ่านตระกูล H3 Max |
| เอาต์พุต | วิดีโอพร้อมเสียงที่ซิงโครไนซ์/เสียงแบบเนทีฟ |
| ระยะเวลา | 5–15 วินาที |
| ความละเอียด | 480p และ 768p; ความพร้อมใช้งานของการปรับแต่ง 1080p ขึ้นอยู่กับเอ็นด์พอยต์ปัจจุบัน |
| อัตราเฟรม | 24 FPS |
| เสียง | เสียงสเตริโอที่ซิงโครไนซ์ |
| ข้อความสู่วิดีโอ | ใช่ |
| ภาพสู่วิดีโอ | ใช่ |
| เฟรมแรกถึงเฟรมสุดท้าย | รองรับผ่านภาพสู่วิดีโอเมื่อระบุเฟรมสุดท้าย |
| อ้างอิงสู่วิดีโอ | มีให้ใช้งานผ่านตระกูล/API ของ H3 Max |
| อัตราส่วนภาพ | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| เอ็นด์พอยต์ API หลัก | api.cometapi.com/v1/videos |
| โมเดลฐาน | MiniMax H3 |
MiniMax H3 Max เป็นรุ่นที่ผ่านการฝึกภายหลังของ MiniMax H3 ไม่ใช่รุ่นสืบทอดที่พัฒนาขึ้นแยกต่างหากซึ่งมีเพดานความสามารถสูงกว่า fal Research ระบุว่าได้ทำการฝึกภายหลังกับน้ำหนักแบบเปิดของ H3 โดยใช้ข้อมูลเพิ่มเติมที่เน้นการยึดตามพรอมป์และความสวยงาม ขณะเดียวกันทีมอนุมานได้ร่วมออกแบบสแตกการให้บริการให้สอดคล้องกับโมเดลที่ได้
ความแตกต่างนี้มีความสำคัญเมื่อเปรียบเทียบ H3 Max กับ MiniMax H3 มาตรฐาน H3 เองเป็นระบบวิดีโอแบบออมนีโมดัลเพื่อการใช้งานทั่วไป รองรับความเข้าใจข้อความ ภาพ วิดีโอ และเสียง และการสร้างวิดีโอพร้อมเสียงสเตริโอแบบเนทีฟ เอกสาร H3 แบบโอเพนซอร์สของ MiniMax ระบุผลลัพธ์ยาว 4–15 วินาที และความละเอียดสูงสุดถึง 2K ผ่านรุ่นย่อยของ H3
ในทางกลับกัน H3 Max มุ่งเน้นจุดปฏิบัติการที่ต่างออกไป: การสร้างที่รวดเร็ว การยึดตามพรอมป์ที่แข็งแรง และคุณภาพภาพที่ความละเอียด 480p/768p fal รายงานว่าสามารถสร้างคลิป 768p ยาว 5 วินาทีได้ในเวลาไม่ถึงสามวินาทีบนโครงสร้างพื้นฐานของตน
MiniMax H3 Max คืออะไร?
MiniMax H3 Max เป็นโมเดลสร้างวิดีโอด้วย AI ที่สร้างขึ้นผ่านการฝึกภายหลังจากโมเดล MiniMax H3 ที่มีน้ำหนักแบบเปิด fal Research อธิบายว่าโมเดลนี้ได้รับการปรับจูนเฉพาะทางเพื่อการยึดตามพรอมป์และความสวยงามที่แข็งแรงขึ้น โดยสแตกอนุมานได้รับการปรับให้เหมาะกับปริมาณงานสูง
โมเดลรองรับการสร้างข้อความสู่วิดีโอและภาพสู่วิดีโอ โดยเอ็นด์พอยต์ภาพสู่วิดีโอยังรองรับการสร้างแบบเฟรมแรกถึงเฟรมสุดท้ายเมื่อมีการส่งภาพปลายทาง API ตระกูล H3 Max ยังเปิดใช้ความสามารถอ้างอิงสู่วิดีโอ
ดังนั้นลักษณะที่โดดเด่นที่สุดไม่ได้อยู่ที่จำนวนพารามิเตอร์ที่มากขึ้นหรือหน้าต่างบริบทที่ยาวกว่า แต่คือการผสานระหว่าง คุณภาพวิดีโอ การยึดตามพรอมป์ และเวลาแฝงในการสร้างที่ต่ำ
คุณสมบัติหลักของ MiniMax H3 Max
- พื้นฐานจาก MiniMax H3 ที่ผ่านการฝึกภายหลัง: H3 Max สืบทอดจากน้ำหนักแบบเปิดของ MiniMax H3 ไม่ใช่โมเดลวิดีโอที่ไม่เกี่ยวข้อง fal Research เพิ่มข้อมูลสำหรับการฝึกภายหลังที่มุ่งเน้นการยึดตามพรอมป์และความสวยงาม
- การสร้างวิดีโอที่รวดเร็ว: fal รายงานว่าสร้างคลิป 5 วินาที 768p ได้ภายในประมาณ 2.78 วินาทีบนโครงสร้างพื้นฐานของตน ช่วยลดเวลารอในการสร้างวิดีโอแบบวนซ้ำได้อย่างมาก
- การยึดตามพรอมป์ที่แข็งแรง: กระบวนการฝึกภายหลังมุ่งเน้นการทำตามคำสั่งที่ละเอียดได้ดียิ่งขึ้น รวมถึงองค์ประกอบฉาก การกระทำ การเคลื่อนไหวของกล้อง และสไตล์ภาพ
- ข้อความสู่วิดีโอและภาพสู่วิดีโอ: นักพัฒนาสามารถสร้างวิดีโอจากพรอมป์ข้อความโดยตรง หรือใช้ภาพเป็นเฟรมเริ่มต้นได้ เอ็นด์พอยต์ภาพยังสามารถรับเฟรมสุดท้ายเพื่อการสร้างแบบเฟรมแรกถึงเฟรมสุดท้าย
- เสียงแบบเนทีฟที่ซิงโครไนซ์: H3 Max สร้างวิดีโอพร้อมเสียงที่ซิงโครไนซ์ เหมาะสำหรับฉากสั้นที่ต้องการบทสนทนา เสียงสภาพแวดล้อม หรือการประสานภาพและเสียง
- รองรับอัตราส่วนภาพหลายแบบ: รองรับฟอร์แมตแนวนอน แนวตั้ง สี่เหลี่ยม และแบบภาพยนตร์ รวมถึง 21:9, 16:9, 4:3, 1:1, 3:4 และ 9:16
ผลการทดสอบเชิงเปรียบเทียบของ MiniMax H3 Max
| การประเมิน | ผลลัพธ์ของ MiniMax H3 Max | ประเภทการประเมิน | ขนาดตัวอย่าง / ความเชื่อมั่น | สิ่งที่วัด |
|---|---|---|---|---|
| Design Arena – ภาพสู่วิดีโอ | 1,341 Elo | คะแนน Elo จากความชอบของมนุษย์ | การเปรียบเทียบแบบอารีนา | ความชอบโดยรวมของผู้ใช้ต่อคุณภาพวิดีโอที่สร้าง |
| Artificial Analysis – ภาพสู่วิดีโอ + เสียง | 1,201 Elo | คะแนน Elo จากความชอบของมนุษย์ | 2,177 ตัวอย่าง; ±11 ที่ช่วงความเชื่อมั่น 95% | ความชอบต่อการสร้างภาพสู่วิดีโอพร้อมเสียง |
| fal Human Preference Evaluation – คุณภาพโดยรวม | #1 ในบรรดาโมเดลที่ประเมิน | การประเมินแบบตัวต่อตัวโดยมนุษย์ | เปรียบเทียบกับโมเดลวิดีโอชั้นนำ 12 รายการ | คุณภาพภาพโดยรวม |
| fal Human Preference Evaluation – ความเข้าใจพรอมป์ | #1 ในบรรดาโมเดลที่ประเมิน | การประเมินแบบตัวต่อตัวโดยมนุษย์ | เปรียบเทียบกับโมเดลวิดีโอชั้นนำ 12 รายการ | ความแม่นยำในการทำตามพรอมป์ของวิดีโอที่สร้าง |
| fal Human Preference Evaluation – ความสวยงาม | #1 ในบรรดาโมเดลที่ประเมิน | การประเมินแบบตัวต่อตัวโดยมนุษย์ | เปรียบเทียบกับโมเดลวิดีโอชั้นนำ 12 รายการ | ความสุนทรียะทางภาพและคุณภาพที่รับรู้ |
| ความเร็วในการสร้าง – วิดีโอ 5 วินาที 768p | <3 วินาที | การวัดความเร็วการอนุมาน | โครงสร้างพื้นฐานของ fal | ความเร็วการสร้างแบบครบกระบวนการ |
| ความเร็วในการสร้าง เทียบกับ MiniMax H3 ทางการ | ~35× ปริมาณงานสูงกว่า | การเปรียบเทียบปริมาณงานตามที่ผู้ให้บริการรายงาน | โครงสร้างพื้นฐานของ fal | ปริมาณงานการอนุมานสัมพัทธ์ |
ผลลัพธ์เชิงปริมาณสาธารณะที่แข็งแรงที่สุดคือคะแนน Design Arena 1,341 Elo และคะแนน Artificial Analysis 1,201 Elo อย่างไรก็ตาม ทั้งสองเป็นการวัดคะแนน Elo จากความชอบของมนุษย์ ไม่ใช่ตัวชี้วัดความแม่นยำแบบดั้งเดิม ผลของ Artificial Analysis รายงานช่วงความเชื่อมั่น 95% ที่ ±11 จาก 2,177 ตัวอย่าง
สำหรับเนื้อหา CometAPI แนวทางที่ปลอดภัยที่สุดคือแยกให้ชัดเจนระหว่าง:
หลักฐานด้านความสามารถ: การยึดตามพรอมป์ ความสวยงาม การสร้างภาพและเสียง และการกำหนดเงื่อนไขด้วยภาพ/วิดีโอ
หลักฐานด้านประสิทธิภาพ: เวลาแฝงในการสร้างตามที่ผู้ให้บริการรายงาน และการประเมินความชอบโดยบุคคลที่สาม
หลีกเลี่ยงการนำเสนอผล "#1" จากความชอบของมนุษย์ว่าเป็นตำแหน่งอันดับโดยรวมที่เป็นวัตถุวิสัย
เปรียบเทียบ MiniMax H3 Max กับ MiniMax H3
| ความสามารถ | MiniMax H3 Max | MiniMax H3 |
|---|---|---|
| ที่มา | น้ำหนักแบบเปิดของ H3 + การฝึกภายหลังโดย fal | MiniMax H3 ดั้งเดิม |
| โฟกัสหลัก | การยึดตามพรอมป์ + ความสวยงาม + ความเร็ว | การสร้างวิดีโอแบบออมนีโมดัลเพื่อการใช้งานทั่วไป |
| ระยะเวลาผลลัพธ์โดยทั่วไป | 5–15 วินาที | 4–15 วินาที |
| ผลลัพธ์มาตรฐาน | 480p / 768p | สูงสุดถึง 2K ผ่านรุ่น H3 ที่มีเอกสารกำกับ |
| เสียงแบบเนทีฟ | มี | มี |
| ข้อความสู่วิดีโอ | มี | มี |
| ภาพสู่วิดีโอ | มี | มี |
| เวิร์กโฟลว์เฟรมแรก/เฟรมสุดท้าย | รองรับ | รองรับ |
| เวิร์กโฟลว์อ้างอิง | มีเอ็นด์พอยต์อ้างอิงของ H3 Max ให้ใช้งาน | ความสามารถอ้างอิงสู่วิดีโอที่กว้างขวาง |
| ความเร็วในการสร้าง | ปรับให้เหมาะสำหรับปริมาณงานสูง | การอนุมานมาตรฐานของ H3 |
| จุดแตกต่างที่เอกสารระบุชัดเจนที่สุด | การสร้างแบบวนซ้ำที่รวดเร็ว | ขีดความสามารถ/เพดานความละเอียดที่กว้างกว่า |
ความแตกต่างที่สำคัญที่สุดคือจุดปฏิบัติการ ไม่ใช่การกำเนิดของโมเดล H3 มาตรฐานถูกออกแบบมาเป็นระบบออมนีโมดัลที่กว้างกว่าและรองรับเอาต์พุตสูงสุดถึง 2K ตามเอกสารของ MiniMax ขณะที่ H3 Max พัฒนาโดยเน้นการสร้างที่รวดเร็วและการยึดตามพรอมป์ที่ความละเอียดที่รองรับ
กรณีการใช้งานที่เป็นตัวอย่างของ MiniMax H3 Max
การวนซ้ำเชิงสร้างสรรค์อย่างรวดเร็ว
H3 Max เหมาะกับเวิร์กโฟลว์ที่ผู้สร้างต้องสร้าง ตรวจสอบ และปรับแก้คลิปสั้นซ้ำๆ เวลาแฝงที่ต่ำทำให้สามารถทดสอบพรอมป์หลายรูปแบบได้จริง โดยไม่ต้องรอเป็นนาทีในแต่ละรอบ
วิดีโอสำหรับโซเชียลมีเดีย
ด้วยรูปแบบระยะเวลาสั้น การรองรับอัตราส่วนแนวตั้ง เสียงที่ซิงโครไนซ์ และการสร้างที่รวดเร็ว H3 Max เหมาะสำหรับคอนเทนต์โซเชียลฟอร์มสั้นและแนวคิดโฆษณา
การแสดงภาพผลิตภัณฑ์
ภาพสู่วิดีโอสามารถทำให้ภาพนิ่งของผลิตภัณฑ์มีชีวิตด้วยลำดับโปรโมชันสั้นๆ โดยยังคงให้ภาพต้นทางชี้นำองค์ประกอบและรูปลักษณ์
การพัฒนาคอนเซ็ปต์เชิงภาพยนตร์
พรอมป์ที่ละเอียดซึ่งอธิบายการเคลื่อนไหวกล้อง การกระทำของตัวแบบ สภาพแวดล้อม แสง และสไตล์ภาพ สามารถใช้ต้นแบบช็อตเชิงภาพยนตร์ก่อนเข้าสู่เวิร์กโฟลว์การผลิตที่มีค่าใช้จ่ายสูงกว่า
ทรานซิชันจากเฟรมแรกถึงเฟรมสุดท้าย
เมื่อมีการระบุภาพเปิดและภาพปิด H3 Max สามารถใช้สร้างลำดับทรานซิชันที่ควบคุมได้ แทนการพึ่งพาการสร้างข้อความสู่วิดีโอที่ไร้ข้อจำกัดเพียงอย่างเดียว
วิธีเข้าถึง API ของ MiniMax H3 Max ด้วย CometAPI
CometAPI สามารถใช้เป็นชั้น API แบบรวมสำหรับผสานโมเดล AI ที่รองรับ โดยไม่ต้องดูแลการผสานเฉพาะผู้ให้บริการสำหรับแต่ละโมเดล
ขั้นตอนที่ 1: สร้างคีย์ API ของ CometAPI
ลงชื่อเข้าใช้ CometAPI และสร้างโทเค็น API จากคอนโซลสำหรับนักพัฒนา
ขั้นตอนที่ 2: เลือก minimax-h3-max
ใช้ minimax-h3-max เป็นตัวระบุโมเดลเมื่อโมเดลนี้พร้อมในบัญชี CometAPI ของคุณ
ขั้นตอนที่ 3: ส่งคำขอสร้างวิดีโอ
ส่งพรอมป์และพารามิเตอร์การสร้างที่รองรับผ่านอินเทอร์เฟซวิดีโอ API ของ CometAPI ขึ้นอยู่กับสคีมาที่ CometAPI เปิดใช้งานในปัจจุบัน พารามิเตอร์อาจรวมถึงระยะเวลา ความละเอียด อัตราส่วนภาพ อินพุตภาพ และตัวควบคุมการสร้างวิดีโออื่นๆ
ก่อนเผยแพร่ตัวอย่างการผสาน ให้ตรวจสอบหน้ารายการโมเดลของ CometAPI และเอกสาร API ปัจจุบันเพื่อดูเอ็นด์พอยต์ที่แน่นอน ชื่อพารามิเตอร์ ความละเอียดที่รองรับ และพฤติกรรมการจัดการงานแบบอะซิงโครนัส รายละเอียดเหล่านี้สามารถเปลี่ยนแปลงได้โดยอิสระจากโมเดล H3 Max ที่อยู่เบื้องหลัง