TL;DR
DeepSeek-V4.1-Flash คือโมเดล Flash แบบมัลติโมดัลรุ่นปัจจุบันที่ให้บริการผ่าน DeepSeek API ภายใต้รหัสโมเดล deepseek-flash รองรับบริบท 1M โทเค็น เอาต์พุตสูงสุด 384K และรับอินพุตภาพได้ ภายใต้คู่มือ Vision ปัจจุบัน แต่ละภาพใช้โทเค็นสูงสุด 1024 หลังการปรับขนาดอัตโนมัติ
จุดเด่นที่สุดยังคงเป็นวิชั่นเชิงเอเจนต์: ตรวจสอบสกรีนช็อต แผนภูมิ อินเทอร์เฟซ และเอกสารจากภาพ ก่อนดำเนินการต่อด้วยโค้ดหรือเครื่องมือ ผลการทดสอบเบนช์มาร์กในบทความส่วนหลังมาจากการเปิดตัว Vision-Exp ที่เลิกใช้แล้ว และควรอ่านเป็นหลักฐานเชิงประวัติศาสตร์จากผู้ให้บริการ ไม่ใช่เบนช์มาร์กล่าสุดของ DeepSeek-V4.1-Flash
ปัจจุบัน CometAPI ยังคงใช้ deepseek-v4-flash-vision-exp เป็นรหัสโมเดลในแคตตาล็อก ขณะที่ API โดยตรงของ DeepSeek แนะนำให้ใช้ deepseek-flash และให้บริการคำขอด้วย DeepSeek-V4.1-Flash เริ่มจากคำขอแบบข้อความบวกภาพ แล้วทดสอบเส้นทางจริงกับสกรีนช็อตและงานด้านภาพของคุณเอง
Key Takeaways
- เส้นทางปัจจุบัน: DeepSeek-V4.1-Flash คือโมเดล Flash แบบมัลติโมดัลที่ทำงานอยู่ ชื่อเดิม
deepseek-v4-flash-vision-expถูกยอมรับเฉพาะในฐานะนามแฝงเพื่อความเข้ากันได้บน API ของ DeepSeek - พื้นที่ข้อความขนาดใหญ่: บริบท 1M โทเค็น และเอาต์พุตสูงสุด 384K รองรับเอกสารยาว ที่เก็บโค้ด ประวัติเครื่องมือ และภาพในบทสนทนาเดียว
- การคำนวณภาพปัจจุบัน: DeepSeek ปรับขนาดภาพอัตโนมัติและจำกัดสูงสุด 1024 โทเค็นต่อภาพ ภาพที่มีพิกเซลรวมต่ำกว่าประมาณ 544×544 จะถูกขยายขึ้น; ขนาดใหญ่กว่านั้นจะถูกปรับลงสู่ประมาณ 1300×1300 พิกเซลรวม
- วิชั่นเน้นเอเจนต์: การเปรียบเทียบทางการเน้นเวิร์กโฟลว์สกรีนช็อต แผนภูมิ เบราว์เซอร์ โค้ด และเครื่องมือเชิงภาพ มากกว่าการสร้างภาพ
- รองรับอินเทอร์เฟซกว้าง: DeepSeek จัดทำเอกสารอินเทอร์เฟซ API ที่รองรับ: Chat Completions, Messages ที่เข้ากันได้กับ Anthropic และ Responses API ตัวอย่าง CometAPI ด้านล่างใช้ Chat Completions
- ควรระวังในการผลิต: นามแฝงของเส้นทาง การปรับขนาดภาพอัตโนมัติ และผลเบนช์มาร์กที่ไวต่อฮาร์เนส ยังทำให้การทดสอบเฉพาะงานเป็นสิ่งจำเป็น
What Is DeepSeek-V4-Flash-Vision?
เอกสารปัจจุบันของ DeepSeek ระบุว่า deepseek-flash คือ DeepSeek-V4.1-Flash ที่รองรับอินพุตข้อความและภาพ และให้เอาต์พุตเป็นข้อความ โมเดล Vision-Exp รุ่นก่อนถูกเลิกใช้; ชื่อโมเดลเก่าเป็นนามแฝงเพื่อความเข้ากันได้และถูกส่งต่อไปยังโมเดล Flash ปัจจุบัน
กรณีใช้งานเป้าหมายคือเอเจนต์แบบมัลติโมดัล เอเจนต์เชิงภาพสามารถตรวจสอบแอปที่เรนเดอร์ ระบุปุ่มหรือความล้มเหลวในเลย์เอาต์ ให้เหตุผลกับการกระทำถัดไป เรียกใช้เครื่องมือ แล้วตรวจสอบสกรีนช็อตถัดไป รูปแบบเดียวกันนี้ใช้กับการวิเคราะห์แผนภูมิ การประกันคุณภาพเชิงภาพ การดึงข้อมูลเอกสาร และเอเจนต์โค้ดที่ต้องเปรียบเทียบดีไซน์อ้างอิงกับหน้าที่เรนเดอร์
หมายเหตุการตั้งชื่อ: สำหรับ API โดยตรงของ DeepSeek ให้ใช้ deepseek-flash; ปัจจุบันแมปไปที่ DeepSeek-V4.1-Flash ชื่อเดิม deepseek-v4-flash และ deepseek-v4-flash-vision-exp ยังถูกยอมรับโดย DeepSeek แต่อินสแตนซ์ของโมเดลนั้นถูกเลิกใช้ และคำขอจะถูกให้บริการโดย DeepSeek-V4.1-Flash ขณะที่ CometAPI ยังคงแสดง deepseek-v4-flash-vision-exp เป็นรูตในแคตตาล็อกของตน
Technical Specifications
| Specification (official docs) | Current value |
|---|---|
| Official model ID | deepseek-flash |
| Status | เส้นทาง API Flash แบบมัลติโมดัลที่ใช้งานอยู่; โมเดล Vision-Exp เดิมเลิกใช้แล้ว |
| Inputs / output | อินพุตข้อความ + ภาพ; เอาต์พุตข้อความ |
| Context window | 1,048,576 โทเค็น (1M) |
| Maximum output | สูงสุด 384K โทเค็น |
| Legacy Vision-Exp checkpoint listing | 305B พารามิเตอร์บนที่เก็บทางการของ Hugging Face |
| Legacy Vision-Exp text backbone | 43 เลเยอร์; hidden size 4,096; attention heads 64 |
| Legacy Vision-Exp MoE routing | 256 experts แบบกำหนดเส้นทาง; เลือก 6 ต่อโทเค็น; 1 shared expert |
| Legacy Vision-Exp vision encoder | 32 เลเยอร์; ความกว้าง 1,024; 16 เฮด; patch size 14 |
| Image representation | สูงสุด 1024 โทเค็นต่อภาพบน DeepSeek API ปัจจุบัน |
| Image formats | JPEG, PNG, GIF, WebP |
| Image input methods | Base64 data URL, external URL, DeepSeek Files API file_id |
| API styles | Chat Completions, Messages ที่เข้ากันได้กับ Anthropic, Responses |
| Reasoning modes | โหมดคิดและไม่คิด; ระดับความพยายามต่ำ สูง สูงสุด |
| License | MIT สำหรับที่เก็บโมเดลทางการ |
ฟิลด์สถาปัตยกรรมข้างต้นมาจากการกำหนดค่าทางการ อินเทอร์เฟซที่เก็บระบุเช็คพอยต์ 305B พารามิเตอร์ แต่ DeepSeek ไม่เผยแพร่จำนวนพารามิเตอร์ที่ใช้งานแยกสำหรับโมเดลวิชั่นครบชุด รายงานค่าที่เก็บจึงปลอดภัยกว่าแทนการสันนิษฐานว่าจำนวนพารามิเตอร์ที่ใช้งานของ V4-Flash เฉพาะข้อความ ถูกถ่ายโอนอย่างไม่เปลี่ยนแปลงหลังเพิ่มสแตกด้านภาพ
How DeepSeek-V4-Flash-Vision-Exp's Legacy Architecture Works
V4-Flash Text Backbone
ฝั่งภาษาเก็บธีมการออกแบบ V4 ที่ทำให้งานเอเจนต์บริบทยาวเป็นไปได้ เอกสารที่เก็บทางการบันทึกองค์ประกอบสถาปัตยกรรม V4: การกำหนดเส้นทางแบบ Mixture-of-Experts แบบ sparse, DFlash attention, Hyper-Connections และ DSpark สิ่งนี้ทำให้รุ่นที่ปล่อยใช้งานตรวจสอบได้มากกว่าโมเดลแบบ API-only แม้ว่าการดีพลอยในเครื่องยังคงต้องการทรัพยากรระดับนี้
Vision Encoder and Aligner
สำหรับเช็คพอยต์ Vision-Exp ที่เลิกใช้ การกำหนดค่าที่เผยแพร่ใช้เอนโค้ดเดอร์ภาพ 32 เลเยอร์ patch size 14 ความกว้างวิชั่น 1,024 เฮดวิชั่น 16 และการแทนภาพ 384 โทเค็น รายละเอียดสถาปัตยกรรมเหล่านี้อธิบายเช็คพอยต์เชิงประวัติ ไม่ควรสมมุติว่าเป็นการบันทึกสแต็กการให้บริการของ DeepSeek-V4.1-Flash ปัจจุบัน
Current 1024-Token Image Limit
กฎการแปลงโทเค็นของวิชั่น ปัจจุบันของ DeepSeek ปรับขนาดภาพที่ต่ำกว่าประมาณ 544×544 พิกเซลรวมให้ใหญ่ขึ้น และปรับภาพที่ใหญ่ลงโดยรักษาอัตราส่วนเดิม อินพุตขนาดใหญ่ถูกปรับสู่พื้นที่พิกเซลประมาณภาพ 1300×1300 ส่งผลให้ขีดสูงสุดเป็น 1024 โทเค็นต่อภาพ ภาพ 2000×2000 และ 5000×5000 จึงใช้จำนวนโทเค็นภาพเท่ากันหลังการปรับขนาด
ข้อปฏิบัติ: ครอปบริเวณที่มีป้ายข้อความเล็ก โค้ด หรือคอนโทรล UI ก่อนส่งภาพ ความละเอียดต้นฉบับที่สูงขึ้นเพียงอย่างเดียวไม่สามารถฝ่าเพดาน 1024 โทเค็นปัจจุบันได้
Legacy Vision-Exp Benchmark Performance
การประเมินจากการ์ดโมเดลทางการ ของ DeepSeek เปรียบเทียบโมเดลวิชั่นกับ DeepSeek-V4-Flash-0731 และ Claude Opus 4.8 ในงานเอเจนต์ข้อความและเอเจนต์แบบมัลติโมดัล โมเดลวิชั่นโดยรวมดีขึ้นเมื่อเทียบกับโมเดล Flash เฉพาะข้อความ ขณะเดียวกันยังคงแข่งขันได้กับคู่แข่งที่เน้นศักยภาพ แม้จะไม่ได้เหนือกว่าในทุกมิติอย่างสม่ำเสมอ
การเปรียบเทียบเบนช์มาร์กทางการสำหรับการประเมินเอเจนต์ข้อความและมัลติโมดัล ที่มา: การเปิดตัวทางการของ DeepSeek
| Official benchmark | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2* | 39.4 |
| Agents' Last Exam | 27.3 | 25.2* | 25.7 |
| Chartography | 64.3 | - | 65.0 |
| ZeroBench (Pass@5) | 35.0 | - | 34.0 |
* ใน ApexBench และ Agents' Last Exam V4-Flash เฉพาะข้อความ ไม่ได้คำนึงถึงองค์ประกอบมัลติโมดัลในอินพุต DeepSeek ประเมินงานเอเจนต์ข้อความด้วย DeepSeek Harness โหมด minimal ระดับความพยายาม reasoning สูงสุด อุณหภูมิ 1.0 และ top_p 0.95
หมายเหตุเบนช์มาร์ก: นี่คือผลการเปิดตัวที่รายงานโดย DeepSeek ไม่ใช่การทำซ้ำโดยอิสระ คะแนนเอเจนต์ไวต่อฮาร์เนส คำนิยามเครื่องมือ งบประมาณโทเค็น และนโยบายการลองใหม่เป็นพิเศษ จึงควรตีความเป็นทิศทางมากกว่าหลักฐานความเท่าเทียมทั่วไปในทุกมิติของวิชั่น การให้เหตุผล หรือความเสถียร
What the Benchmark Results Mean
ผลที่ชัดที่สุดคือการปรับปรุงจาก V4-Flash เฉพาะข้อความเมื่อหลักฐานเชิงภาพมีความสำคัญ ApexBench เพิ่มจาก 26.2 เป็น 36.5 และโมเดลวิชั่นเพิ่มผลลัพธ์ Chartography และ ZeroBench ที่แข่งขันได้ ซึ่งโมเดลเฉพาะข้อความไม่ได้รายงาน โมเดลยังปรับปรุงในงานเอเจนต์ข้อความหลายรายการ รวมถึง Terminal Bench 2.1, NL2Repo, DeepSWE, Toolathlon-Verified และ DSBench-Hard แม้ว่า Cybergym จะต่ำลงเล็กน้อย
เมื่อเทียบกับ Opus 4.8 ผลลัพธ์คละกัน Vision-Exp สูงกว่าใน DeepSWE, Agents' Last Exam และ ZeroBench ในตารางนี้ ขณะที่โมเดลคู่แข่งสูงกว่าใน Terminal Bench, NL2Repo, Cybergym, Toolathlon, DSBench-Hard, ApexBench และ Chartography ดังนั้นข้ออ้างเบนช์มาร์กมัลติโมดัล ของ DeepSeek จึงเป็นเชิงทิศทางมากกว่าหลักฐานพิสูจน์ความเท่าเทียมทั่วไปในทุกมิติของวิชั่น การให้เหตุผล หรือความน่าเชื่อถือ
DeepSeek-V4.1-Flash vs DeepSeek-V4-Flash-Vision-Exp vs Claude Opus 4.8 vs Gemini 3.7 Flash
| Dimension | DeepSeek Vision-Exp | DeepSeek V4 Flash | Claude Opus 4.8 | Gemini 3.7 Flash |
|---|---|---|---|---|
| Status | Experimental | Public beta / เส้นทาง Flash ปัจจุบัน | Generally available | Generally available |
| Input modalities | ข้อความ, ภาพ | ข้อความ | ข้อความ, ภาพ, เอกสาร | ข้อความ, ภาพ, วิดีโอ, เสียง, PDF |
| Output | ข้อความ | ข้อความ | ข้อความ / ข้อมูลเชิงโครงสร้าง / โค้ด | ข้อความ |
| Context | 1M | 1M | สูงสุด 1M ขึ้นกับแพลตฟอร์ม | 1,048,576 |
| Max output | 384K | 384K | 128K | 65,536 |
| Main strength | เอเจนต์เชิงภาพต้นทุนต่ำ | เอเจนต์ข้อความ throughput สูง | เอเจนต์งานซับซ้อนอัตโนมัติสูง | มัลติโมดัลหลากหลายความสามารถ |
| Best first test | สกรีนช็อต, แผนภูมิ, UI, โค้ดเชิงภาพ | โค้ดและอัตโนมัติข้อความ | งานระยะยาวยากที่สุด | มีเดียหลากหลายและเวิร์กโฟลว์เครื่องมือของ Google |
เลือก Vision-Exp เมื่อจำเป็นต้องเพิ่มการรับรู้ภาพในลูปเอเจนต์ราคาประหยัด เลือก V4 Flash เมื่ออินพุตทั้งหมดเป็นข้อความและให้ความสำคัญกับ throughput มากกว่าความเข้าใจภาพ Opus 4.8 ยังเป็นตัวเลือกที่เน้นศักยภาพในมุมมองของ DeepSeek ขณะที่ Gemini 3.7 Flash เป็นทางเลือกมัลติโมดัลที่กว้างขึ้นเมื่อวิดีโอ เสียง PDF และเครื่องมือ Google มีความสำคัญ
What Can DeepSeek-V4-Flash-Vision Do?
- Screenshot-to-code และการรีวิว UI - เปรียบเทียบหน้าที่เรนเดอร์กับดีไซน์ ระบุปัญหาเลย์เอาต์หรือการเข้าถึง และสร้างคำแนะนำการใช้งาน
- เอเจนต์เบราว์เซอร์เชิงภาพ - ใช้สกรีนช็อตเป็นการสังเกตเมื่อข้อมูล DOM หรือ accessibility-tree ไม่ครบ แล้วเลือกการกระทำเครื่องมือถัดไป
- การวิเคราะห์แผนภูมิและแดชบอร์ด - อธิบายแนวโน้ม ระบุความผิดปกติ และเชื่อมโยงเมตริกที่เห็นได้ชัดกับเวิร์กโฟลว์ข้อความหรือเครื่องมือที่ใหญ่กว่า
- ความเข้าใจเอกสารจากภาพ - ดึงข้อมูลจากฟอร์มสแกน ไดอะแกรม สไลด์ ตาราง และสกรีนช็อตก่อนประมวลผลเชิงโครงสร้าง
- เอเจนต์โค้ดแบบมัลติโมดัล - รวมซอร์สโค้ด สกรีนช็อตบั๊ก สถานะ IDE และผลลัพธ์ที่เรนเดอร์ไว้ในลูปดีบักเดียว
- การประกันคุณภาพเชิงภาพ - เปรียบเทียบสกรีนช็อตผลิตภัณฑ์ข้ามอุปกรณ์ ตรวจจับองค์ประกอบที่หายไป และสร้างรายงานข้อบกพร่องเชิงโครงสร้าง
- การเปรียบเทียบหลายภาพ - ประเมินลำดับสกรีนช็อตหรือดีไซน์ทางเลือกในคำขอเดียว ภายใต้ข้อจำกัดขนาดคำขอและจำนวนภาพ
ตัวอย่างเอเจนต์เชิงภาพอย่างเป็นทางการจากหน้าการเปิดตัวของ DeepSeek (ภาพ GIF แบบเคลื่อนไหวใน Word) ที่มา: การเปิดตัวทางการของ DeepSeek
Pricing and Availability
DeepSeek คิดค่าใช้ภาพรวมกับโทเค็นอินพุตข้อความ ตารางราคาทางการใช้เรตช่วงพีคและนอกพีค ขณะที่หน้ารุ่นโมเดลของ CometAPI เผยราคาเส้นทางปัจจุบันเพียงค่าเดียว ตัวเลขไม่ควรถูกสรุปเป็นราคาเดียวเพราะเส้นทางที่ถูกที่สุดเปลี่ยนตามช่วงเวลาเวลาของ DeepSeek
| Route / source | Cache-hit input | Cache-miss input | Output | Condition |
|---|---|---|---|---|
| DeepSeek official - off-peak | $0.003 | $0.15 | $0.60 | ทุกชั่วโมงนอกช่วงพีค รวมวันหยุดสุดสัปดาห์และวันหยุดนักขัตฤกษ์จีน |
| DeepSeek official - peak | $0.006 | $0.30 | $1.20 | 01:00-04:00 และ 06:00-10:00 UTC จันทร์-ศุกร์ ยกเว้นวันหยุดนักขัตฤกษ์จีน |
| CometAPI current route | Not listed separately | $0.352 | $1.056 | ราคาของรูตแบบรวมปัจจุบัน |
ราคาทั้งหมดเป็น USD ต่อ 1M โทเค็น อัตรา Flash ปัจจุบันของ DeepSeek คือ $0.003/$0.15/$0.60 สำหรับ cache-hit input/cache-miss input/เอาต์พุต ในช่วงนอกพีค และ $0.006/$0.30/$1.20 ในช่วงพีค ปัจจุบัน CometAPI แสดง $0.352 ต่อ 1M โทเค็นอินพุต และประมาณ $1.06 ต่อ 1M โทเค็นเอาต์พุตสำหรับรูตความเข้ากันได้ ภาพใช้โทเค็นอินพุตสูงสุด 1024 ต่อภาพบน API ปัจจุบันของ DeepSeek; ตรวจสอบราคาสดของเส้นทางก่อนใช้งานจริงเสมอ
หมายเหตุราคา: ราคาของโมเดลสามารถเปลี่ยนแปลงได้ เชื่อมโยงตัวเลขกับหน้าราคาสดและตรวจสอบอีกครั้งทันที ก่อนเผยแพร่หรือเปิดใช้จริง
How to Use DeepSeek-V4-Flash-Vision with CometAPI
ขณะนี้ CometAPI แสดง deepseek-v4-flash-vision-exp ผ่านเอ็นด์พอยต์ /v1/chat/completions ที่เข้ากันได้กับ OpenAI ดังนั้นตัวอย่างของ CometAPI ด้านล่างคงรหัสโมเดลนี้ไว้ สำหรับ API โดยตรงของ DeepSeek ให้ใช้ deepseek-flash แทน
Step 1: Create an API Key
- สร้างหรือเข้าสู่ระบบบัญชี CometAPI
- เปิดคอนโซลโทเค็น API และสร้างกุญแจ
- เก็บไว้ในตัวแปรสภาพแวดล้อม COMETAPI_KEY ห้ามวางกุญแจโปรดักชันในโค้ดฝั่งไคลเอนต์หรือคอมมิตลงซอร์สคอนโทรล
export COMETAPI_KEY="your-cometapi-key"
Step 2: Send a Base64 Image with cURL
Base64 มีประโยชน์สำหรับไฟล์โลคัลและงานฝั่งเซิร์ฟเวอร์ที่มีภาพอยู่ในหน่วยความจำแล้ว แทนที่ placeholder ด้วยไบต์ภาพที่เข้ารหัส โดยไม่เพิ่มช่องว่างหรือขึ้นบรรทัดใหม่
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Read this dashboard and return the three most important findings."
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64;<BASE64_DATA>"
}
}
]
}
],
"max_tokens": 1200
}'
Step 3: Analyze a Local Image with Python
OpenAI Python SDK สามารถเรียก CometAPI ได้โดยเปลี่ยน base URL ใช้ extra_body สำหรับการควบคุมการคิดเฉพาะของ DeepSeek เมื่อ SDK ของคุณไม่เปิดเผยตัวเลือกนั้นโดยตรง
import base64
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
with open("dashboard.png", "rb") as image_file:
encoded = base64.b64encode(image_file.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Analyze the chart. Return JSON with keys: trend, "
"anomalies, evidence, and confidence."
),
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{encoded}"
},
},
],
}
],
max_tokens=1500,
extra_body={
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
},
)
print(response.choices[0].message.content)
Step 4: Use a Public Image URL with JavaScript
URL ภาพช่วยให้คำขอ JSON เล็กลง แต่ URL ต้องเข้าถึงได้สาธารณะโดยโมเดลต้นทาง หลีกเลี่ยงลิงก์ชั่วคราว ส่วนตัว หรือที่ต้องพิสูจน์ตัวตน เว้นแต่แอปของคุณจะแปลงภาพเป็น Base64 ก่อน
const response = await fetch(
"https://api.cometapi.com/v1/chat/completions",
{
method: "POST",
headers: {
Authorization: `Bearer ${process.env.COMETAPI_KEY}`,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "deepseek-v4-flash-vision-exp",
messages: [
{
role: "user",
content: [
{
type: "text",
text: "Identify the UI issue and propose a concrete CSS fix.",
},
{
type: "image_url",
image_url: {
url: "https://example.com/screenshot.png",
},
},
],
},
],
max_tokens: 1200,
}),
}
);
if (!response.ok) {
throw new Error(`CometAPI request failed: ${response.status}`);
}
const data = await response.json();
console.log(data.choices[0].message.content);
Step 5: Send Multiple Images
วางบล็อก image_url หลายรายการในข้อความผู้ใช้เดียว แล้วบอกโมเดลว่าจะติดป้ายกำกับอย่างไร ป้ายกำกับที่ชัดเจนช่วยลดการอ้างอิงข้ามภาพโดยไม่ตั้งใจ
{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Compare Image A and Image B. List every visible regression."
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-a.png"}
},
{
"type": "image_url",
"image_url": {"url": "https://example.com/image-b.png"}
}
]
}
],
"max_tokens": 1800
}
Input Methods and Limits
| Limit | Official DeepSeek value |
|---|---|
| Supported formats | JPEG, PNG, GIF, WebP |
| External URL length | สูงสุด 8,192 อักขระ |
| Request body | 48 MiB |
| Single image via Base64 / URL | 32 MiB |
| Single image via DeepSeek Files API | 64 MiB |
| Maximum images per request | 600 |
| Total image size | 64 MiB เมื่อไม่มี file_id; สูงสุด 200 MiB เมื่อรวม file_id |
| Maximum dimension | 8,192 px ต่อด้าน; 4,096 px เมื่อคำขอมีภาพ 15+ |
| Image message role | เฉพาะข้อความจากผู้ใช้ |
DeepSeek API ทางการยังรองรับการอ้างอิงภาพแบบ reusable ผ่าน file_id ด้วย Files API เส้นทางด่วนของ CometAPI ที่บันทึกไว้ที่นี่ใช้บล็อก image_url พร้อม URL สาธารณะหรือ Base64 data URL ตรวจสอบการอัปโหลดไฟล์เฉพาะผู้ให้บริการและการส่งต่อ file_id ก่อนพึ่งพาเวิร์กโฟลว์นั้นผ่านรูตรวม
How to Prompt the Model Effectively
พรอมป์เอเจนต์เชิงภาพที่เชื่อถือได้ควรระบุว่าภาพคืออะไร หลักฐานอะไรที่ต้องตรวจ สิ่งที่ต้องทำ และสัญญาเอาต์พุตที่ต้องปฏิบัติ พรอมป์คลุมเครือเช่น describe this image ให้เสรีภาพมากเกินไปและทำให้ผลลัพธ์ตรวจสอบได้ยาก
- บริบท - ระบุสกรีนช็อต แผนภูมิ เอกสาร หรืออินเทอร์เฟซและบทบาทในเวิร์กโฟลว์
- งาน - ระบุการตัดสินใจ การวินิจฉัย การเปรียบเทียบ หรือการดึงข้อมูลที่สำคัญ
- หลักฐาน - ต้องการหลักฐานที่มองเห็นได้ ป้ายกำกับ พิกัด ค่า หรือข้อความ UI ที่อ้างอิงได้
- ข้อจำกัด - ห้ามสมมุติสิ่งที่ไม่รองรับ และบอกโมเดลว่าควรทำอย่างไรเมื่อรายละเอียดอ่านไม่ออก
- เอาต์พุต - กำหนดคีย์ JSON เช็กลิสต์ ระดับความรุนแรง หรือโครงสร้างที่ตรวจด้วยเครื่องได้
You are reviewing a web application screenshot.
Task: identify layout, accessibility, and state-consistency defects.
Evidence: cite the visible element, label, position, or color that supports each finding.
Constraints: do not infer hidden DOM state; mark unreadable text as uncertain.
Output: return JSON with arrays named critical, major, minor, and follow_up_checks.
Production Best Practices
- ครอปก่อนอัปโหลด เมื่อข้อความเล็กหรือคอนโทรลสำคัญ เพดานโทเค็นภาพหมายถึงพื้นหลังที่ไม่เกี่ยวข้องกินความละเอียดเชิงภาพไปโดยเปล่าประโยชน์
- ทดสอบระดับความพยายามคิด แทนการเปิดสูงสุดในทุกคำขอ OCR ง่ายหรือการจัดหมวดหมู่มักไม่ต้องใช้ reasoning สูง
- ต้องการหลักฐานในทุกผลเชิงโครงสร้าง ช่วยให้ปฏิเสธข้ออ้างเชิงภาพที่หลอนง่ายขึ้นโดยอัตโนมัติ
- แยกการรับรู้กับการกระทำในระบบอัตโนมัติความเสี่ยงสูง ให้โมเดลบรรยายสถานะ ตรวจสอบ แล้วค่อยให้เลเยอร์เครื่องมือควบคุมกระทำ
- ป้องกัน URL ภาพ เพราะ URL สาธารณะอาจเผยสกรีนช็อตที่อ่อนไหว โปรดให้ Base64 ฝั่งเซิร์ฟเวอร์สำหรับข้อมูลส่วนตัวและใช้นโยบายการเก็บข้อมูลของคุณเอง
- เบนช์มาร์กแบบ end-to-end ด้วยการจับภาพ พรอมป์ เครื่องมือ การลองใหม่ และเกณฑ์ความสำเร็จเดียวกับที่ใช้ในโปรดักชัน
- ติดตามการเปลี่ยนแปลงเชิงทดลอง โดยตรึงพรอมป์และข้อมูลประเมิน เอ็นด์พอยต์ -exp อาจเปลี่ยนเร็วกว่าโมเดล GA ที่สุกงอม
- บันทึก request ID และความล้มเหลว เพื่อแยกแยะความผิดพลาดของผู้ให้บริการ โมเดล และการพาร์สในแอป
Limitations
ข้อจำกัดสำคัญที่สุดคือความโปร่งใสของเส้นทาง: ชื่อ Vision-Exp เดิมอาจยังถูกยอมรับ แม้ว่าคำขอจะถูกให้บริการโดย DeepSeek-V4.1-Flash บันทึกผู้ให้บริการ รหัสโมเดลที่ร้องขอ เมทาดาต้าของโมเดลที่ส่งกลับ และ request ID; ใช้เกตการประเมินอย่างชัดเจนก่อนมอบหมายการกระทำอัตโนมัติ คะแนนเปิดตัวเชิงประวัติไม่สามารถแทนที่การทดสอบซ้ำได้บนเส้นทางที่ตั้งใจ
ข้อจำกัดที่สองคือรายละเอียดเชิงภาพ การปรับขนาดอัตโนมัติและเพดาน 1024 โทเค็นภาพปัจจุบันทำให้ต้นทุนคาดการณ์ได้ แต่ยังอาจกดทับข้อความเล็ก เส้นจุดในแผนภูมิ หรือองค์ประกอบอินเทอร์เฟซหนาแน่น ครอป แบ่งเป็นไทล์ หรือซูมบริเวณที่เกี่ยวข้อง และเก็บภาพต้นฉบับให้มนุษย์ตรวจ
โมเดลส่งคืนข้อความเท่านั้น มันสามารถวิเคราะห์ภาพและเสนอรหัสหรือการกระทำเชิงโครงสร้าง แต่ไม่สร้างหรือแก้ไขภาพ และรับภาพเฉพาะในข้อความผู้ใช้ เอกสารทางการระบุว่าการใส่ภาพในข้อความ system หรือ assistant จะได้ 400
สุดท้าย การดีพลอยในเครื่องต้องโครงสร้างพื้นฐานมหาโหด ที่เก็บทางการระบุโมเดล 305B พารามิเตอร์และให้โค้ดอ้างอิงสำหรับ inference แทนรันไทม์เบาแบบ turnkey สำหรับทีมส่วนใหญ่ การประเมินผ่าน API ที่มีการจัดการคือจุดเริ่มต้นที่เป็นจริง
Common Errors and Fixes
| Symptom | Likely cause | Recommended fix |
|---|---|---|
| 400: model does not support image | รหัสโมเดลผิด | ใช้ deepseek-v4-flash-vision-exp |
| 400 for message content | วางภาพใน system หรือ assistant message | ย้ายบล็อกภาพไปไว้ในข้อความผู้ใช้ |
| Image download failure | URL ส่วนตัวหมดอายุหรือช้า | ใช้ Base64 หรือ URL สาธารณะที่เสถียร |
| Fine details are missed | การปรับลงอัตโนมัติ / เพดาน 384 โทเค็น | ครอปหรือแบ่งไทล์บริเวณที่เกี่ยวข้อง |
| Unexpectedly high cost | เอาต์พุตยาว การลองใหม่ หรือหลายเทิร์น | กำหนดเพดาน max_tokens และบันทึกการใช้งานต่อเทิร์น |
| Inconsistent agent result | ความแปรปรวนของฮาร์เนสหรือสถานะเครื่องมือ | ตรึงพรอมป์ เครื่องมือ การลองใหม่ และรูบริกประเมิน |
FAQ
Is DeepSeek-V4-Flash-Vision the same as DeepSeek-V4-Flash?
ไม่ใช่ Vision-Exp เพิ่มอินพุตภาพและการเทรนมัลติโมดัล เส้นทาง Flash เฉพาะข้อความไม่มีความสามารถการรับรู้ภาพเดียวกัน
What model ID should I use?
ใช้ deepseek-flash บน API โดยตรงของ DeepSeek บน CometAPI ใช้รหัสแคตตาล็อก deepseek-v4-flash-vision-exp ตราบที่รูตนั้นยังพร้อมใช้งาน
Can it analyze multiple images?
ได้ DeepSeek ระบุว่าสูงสุด 600 ภาพต่อคำขอ ภายใต้ข้อจำกัดขนาดคำขอและมิติภาพ ข้อจำกัดในทางปฏิบัติอาจต่ำกว่าในแอปเพราะเวลาแฝงและความชัดเจนของพรอมป์ลดลงเมื่อจำนวนภาพเพิ่ม
How many tokens does an image use?
บน API ปัจจุบันของ DeepSeek ภาพถูกปรับขนาดและแปลงเป็นโทเค็นด้วยขีดสูงสุด 1024 โทเค็นต่อภาพ หลายภาพถูกนับแยกกัน
Does it support image generation?
ไม่ รองรับอินพุตข้อความและภาพ และส่งคืนข้อความ
Is it ready for production?
พร้อม แต่ต้องหลังการประเมินเฉพาะเส้นทาง ใช้การมอนิเตอร์ แผนสำรอง การทดสอบยอมรับเฉพาะงาน และการบันทึกเส้นทางโมเดล เพราะนามแฝงเดิมอาจชี้ไปที่ DeepSeek-V4.1-Flash
Should I use CometAPI or DeepSeek's direct API?
CometAPI มีประโยชน์เมื่อใช้กุญแจเดียว เลเยอร์บิลลิงเดียว และสลับโมเดลง่าย เข้าถึง DeepSeek โดยตรงอาจดีกว่าเมื่อคุณต้องใช้ฟีเจอร์เฉพาะผู้ให้บริการ เช่น Files API ที่เป็นทางการหรืออัตราช่วงนอกพีค ทดสอบทั้งสองเส้นทางกับงานเดียวกัน
Conclusion
DeepSeek-V4.1-Flash เป็นเส้นทาง Flash แบบมัลติโมดัลที่ทำงานอยู่บน API ของ DeepSeek ณ ปัจจุบัน บริบท 1M เอาต์พุตสูงสุด 384K อินเทอร์เฟซกว้าง และเพดาน 1024 โทเค็นต่อภาพ ทำให้เหมาะกับความเข้าใจสกรีนช็อต การวิเคราะห์แผนภูมิ โค้ดเชิงภาพ และอัตโนมัติบนเบราว์เซอร์หรือ GUI สถาปัตยกรรม Vision-Exp และเบนช์มาร์กเปิดตัวในบทความนี้คงไว้เพื่อบริบทเชิงประวัติ
การตัดสินใจควรขับเคลื่อนด้วยงานจริง หลักฐานเบนช์มาร์กสาธารณะสำหรับโมเดล Vision-Exp ที่เลิกใช้เป็นหลักรายงานจากผู้ขาย นามแฝงเส้นทางปัจจุบันอาจซ่อนว่าโมเดลใดให้บริการคำขอ และการปรับขนาดภาพอาจจำกัดรายละเอียดละเอียด ทดสอบเส้นทางผู้ให้บริการที่แน่นอนบนภาพตัวแทน วัดต้นทุนต่อภารกิจสำเร็จ แทนที่จะดูราคาโทเค็นเพียงอย่างเดียว และรักษาเส้นทางสำรองจนกว่าเส้นทางจะพิสูจน์ความเสถียรในฮาร์เนสโปรดักชันของคุณ
