GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Nghiên cứu CometAPI

DeepSeek V4.1 Flash là gì? Kiến trúc, Tính năng & Giá

Giải thích DeepSeek V4.1 Flash: MoE 552B với Causal-Encoder-Decoder, tiết kiệm bộ nhớ đệm KV, điểm chuẩn, định giá API, thị giác tích hợp sẵn & so sánh V4 Flash/V4 Pro.

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 10, 2026 15 phút đọc
DeepSeek V4.1 Flash là gì? Kiến trúc, Tính năng & Giá
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

DeepSeek V4.1 Flash thay thế bản beta ngắn ngủi bằng bản phát hành sản xuất được xây dựng quanh tính toán bất đối xứng, đa phương thức gốc, điểm chuẩn tác tử mạnh hơn và giá API giảm mạnh.

TL;DR

DeepSeek V4.1 Flash hiện là một API chính thức và mô hình trọng số mở, không còn là endpoint beta sắp hết hạn. DeepSeek cho biết đây là một mô hình Mixture-of-Experts với 552B tham số sử dụng kiến trúc Causal-Encoder-Decoder mới. Chỉ 8B tham số được kích hoạt khi xử lý đầu vào, trong khi 16B được kích hoạt trong quá trình sinh đầu ra. Thiết kế bất đối xứng đó nhằm tiêu tốn ít tính toán hơn cho prompt dài mà không làm suy yếu giai đoạn sinh tự hồi quy.

Tên model API sản xuất là deepseek-flash. Model hỗ trợ cửa sổ ngữ cảnh 1M token, tối đa 384K token đầu ra, chế độ thinking và non-thinking, xuất JSON, tool calls, Responses API, API tương thích Anthropic và đầu vào thị giác gốc. Bảng điểm chuẩn chính thức của DeepSeek cho thấy mức tăng đáng kể so với cả V4 Flash 0731 và V4 Pro 0813 trong các tác vụ lập trình, tác tử, an ninh mạng và đa phương thức.

Thay đổi về giá cũng quan trọng không kém. Vào giờ cao điểm, V4.1 Flash có chi phí $0.006 cho mỗi triệu token đầu vào cache-hit, $0.30 cho mỗi triệu token đầu vào cache-miss và $1.20 cho mỗi triệu token đầu ra. Giá ngoài giờ cao điểm giảm một nửa.

Key Takeaways

  • DeepSeek V4.1 Flash là model đã phát hành với trọng số mở; định danh tạm thời deepseek-v4.1-flash-expires-on-0910 không còn là tham chiếu sản xuất chính xác.
  • Thiết kế MoE 552B của model kích hoạt 8B tham số cho đầu vào và 16B cho đầu ra, tạo hồ sơ hiệu năng khác so với kiến trúc 284B tổng/13B kích hoạt của V4 Flash.
  • Đa phương thức gốc là một phần của model chính thay vì nhánh Vision Exp riêng biệt.
  • So sánh chính thức cho thấy V4.1 Flash vượt V4 Pro 0813 trên đa số điểm chuẩn tác tử và lập trình đã chọn, dù không dẫn đầu tất cả các điểm chuẩn kiến thức hoặc terminal trước mọi đối thủ tiên phong.
  • Bộ đệm KV toàn cục giảm xuống 890 byte mỗi token, nhỏ hơn khoảng 3.9 lần so với V4 Flash và xấp xỉ một phần tư so với trước.
  • Giá API giờ cao điểm là $0.006 cho đầu vào cache-hit, $0.30 cho đầu vào cache-miss và $1.20 cho đầu ra trên mỗi triệu token; ngoài giờ cao điểm thấp hơn 50%.

What Is DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash là model nền tảng tập trung vào hiệu suất (ra mắt tháng 9/2026) cho suy luận, lập trình, tác tử và hiểu đa phương thức. Thông báo chính thức mô tả đây là mô hình MoE 552B tham số, cải thiện năng lực đồng thời giảm lượng tính toán và bộ nhớ cần cho xử lý đầu vào.

Thay đổi quan trọng nằm ở kiến trúc. V4 Flash trước đây dùng ngân sách tham số kích hoạt như nhau trong suốt quá trình suy luận. V4.1 Flash tách biệt tải công việc đầu vào và đầu ra: 8B tham số kích hoạt khi mã hóa prompt và 16B tham số khi sinh câu trả lời. DeepSeek gọi thiết kế này là Causal-Encoder-Decoder.

DateStatusModel ID
Sep 8Beta giới hạndeepseek-v4.1-flash-expires-on-0910
Sep 10Phát hành sản xuấtdeepseek-flash

DeepSeek V4.1 Flash Specification:

SpecificationDeepSeek V4.1 Flash
Release statusPhát hành API chính thức và mô hình trọng số mở
ArchitectureMixture-of-Experts với cấu trúc Causal-Encoder-Decoder
Total parameters552B
Activated parameters8B cho đầu vào; 16B cho đầu ra
Context window1M token
Maximum output384K token
Input modalitiesVăn bản và hình ảnh
Output modalityVăn bản
Production API model namedeepseek-flash
Thinking modesThinking và non-thinking
API featuresXuất JSON, tool calls, Responses API, Anthropic API, prefix completion, FIM completion
Open weightsPhát hành trên Hugging Face

How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder

Các model ngôn ngữ thuần decoder truyền thống dùng gần như cùng một ngăn lớn cho cả xử lý prompt và sinh token. DeepSeek V4.1 Flash phân bổ dung lượng kích hoạt khác nhau cho các giai đoạn đó.

Trong giai đoạn đầu vào, model xử lý prompt với dấu chân 8B tham số kích hoạt. Giai đoạn này có thể xem xét ngữ cảnh văn bản hoặc hình ảnh đã cung cấp một cách hiệu quả vì câu trả lời đầy đủ chưa được sinh ra. Trong giai đoạn đầu ra, model kích hoạt 16B tham số và tiếp tục sinh tự hồi quy từng token. Thiết kế do đó tiết kiệm tính toán ở phần mã hóa prompt trong khi vẫn giữ dung lượng kích hoạt lớn hơn cho suy luận và sinh phản hồi.

DeepSeek chưa công bố mọi chi tiết triển khai trong thông báo, nên mô tả an toàn nhất là theo chức năng: kiến trúc bất đối xứng, giai đoạn đầu vào và đầu ra dùng ngân sách tham số kích hoạt khác nhau, và hệ thống giảm bộ nhớ suy luận cùng chi phí.

KV Cache Reduction

Kết quả bộ nhớ có thể đo được. DeepSeek báo cáo 890 byte bộ đệm KV toàn cục mỗi token cho V4.1 Flash, so với 3,514 byte cho V4 Flash, 48,068 byte cho V3.2 và 389,120 byte cho V1. Con số của V4.1 xấp xỉ nhỏ hơn 3.9 lần so với V4 Flash.

DeepSeek V4.1 Flash là gì? Kiến trúc, Tính năng & Giá

Đối với tác tử ngữ cảnh dài, điều này quan trọng vượt ra khỏi một điểm chuẩn đơn lẻ. Bộ đệm KV nhỏ hơn giảm áp lực HBM trong khi yêu cầu đang hoạt động và hạ lượng trạng thái phải chuyển tới lưu trữ chậm hơn. DeepSeek cho biết V4.1 Flash cần xấp xỉ một phần tư HBM và một phần tám dung lượng SSD so với model trước cho khối lượng công việc bộ đệm tương đương.

DeepSeek V4.1 Flash Features

Native Multimodal Input

V4.1 Flash chấp nhận hình ảnh như một phần của API model chính. Điều này thay thế sự tách biệt trước đó giữa V4 Flash chỉ văn bản và endpoint thử nghiệm V4 Flash Vision. Nhà phát triển nay có thể xây dựng các workflow hiểu tài liệu, phân tích biểu đồ, diễn giải ảnh chụp màn hình và tác tử thị giác với cùng một họ model sản xuất.

Long-Context Reasoning

Đặc tả API chính thức giữ nguyên cửa sổ ngữ cảnh 1M token và cho phép tới 384K token đầu ra. Điều đó khiến model phù hợp với lập trình ở quy mô kho mã, phân tích đa tài liệu, phiên tác tử dài và các workflow cần bảo toàn lịch sử công cụ lớn.

Production API Features

Model hỗ trợ chế độ thinking và non-thinking, xuất JSON có cấu trúc, tool calls, Responses API, giao diện tương thích Anthropic, chat-prefix completion và FIM completion ở chế độ non-thinking. Những khả năng này giúp V4.1 Flash trở thành thay thế sản xuất trực tiếp cho nhiều tác vụ tác tử và lập trình của V4 Flash.

Open Weights

DeepSeek đã phát hành trọng số V4.1 Flash và một báo cáo kỹ thuật. Bản phát hành nâng cao khả năng tái lập, nhưng model vẫn cực lớn: thông báo của DeepSeek đề nghị các tổ chức quan tâm đến triển khai quy mô lớn nên lên kế hoạch khoảng 2,000 GPU cộng một cụm lưu trữ.

DeepSeek V4.1 Flash Benchmark Performance

Kết quả chính thức thay đổi đánh giá trước đó rằng V4.1 không có bằng chứng điểm chuẩn. DeepSeek nay cung cấp một bảng rộng bao trùm kiến thức, toán học, lập trình, tác tử terminal, an ninh mạng, tự động hóa và tác vụ tác tử đa phương thức.

DeepSeek V4.1 Flash là gì? Kiến trúc, Tính năng & Giá

BenchmarkDeepSeek V4.1 FlashV4 Pro 0813V4 Flash 0731
GPQA Diamond90.992.489.9
Codeforces rating347133483289
MathArena Apex65.665.358.6
Terminal-Bench 2.190.687.982.7
DeepSWE v1.174.262.754.4
NL2Repo-Bench65.461.554.2
CyberGym88.183.376.7
Automation-Bench54.843.237.7

Qua tám điểm chuẩn đã chọn này, V4.1 Flash vượt V4 Pro 0813 ở bảy bài và vượt V4 Flash 0731 ở cả tám. Các mức tăng lớn nhất xuất hiện ở kỹ nghệ phần mềm và tác tử: DeepSWE tăng 11.5 điểm so với V4 Pro và 19.8 so với V4 Flash, trong khi Automation-Bench tăng lần lượt 11.6 và 17.1 điểm.

Kết quả vẫn cần được diễn giải thận trọng. V4.1 Flash thấp hơn V4 Pro ở GPQA Diamond, và biểu đồ chính thức đầy đủ cho thấy Claude Opus 5 và GPT-5.6 Sol vẫn dẫn trước ở Terminal-Bench 3.0. Kết luận hữu ích là V4.1 Flash cải thiện đáng kể cân bằng giữa hiệu suất và năng lực của DeepSeek; bảng điểm chuẩn không chứng minh vị thế dẫn đầu phổ quát trên mọi tác vụ.

DeepSeek V4.1 Flash API Pricing

DeepSeek áp dụng tính phí theo giờ cao điểm và ngoài giờ. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC, từ thứ Hai đến thứ Sáu; tất cả khoảng thời gian khác, bao gồm cuối tuần, dùng mức ngoài giờ. Tài liệu giá hiện tại nêu rằng giá ngoài giờ bằng một nửa giá giờ cao điểm.

Price per 1M tokensV4.1 Flash ngoài giờV4.1 Flash cao điểmV4 Pro 0813 ngoài giờV4 Pro 0813 cao điểm
Cache-hit input$0.003$0.006$0.022$0.044
Cache-miss input$0.15$0.30$0.66$1.32
Output$0.60$1.20$1.98$3.96

DeepSeek V4.1 Flash là gì? Kiến trúc, Tính năng & Giá

Khoản tiết kiệm là đáng kể. Với khối lượng 100 triệu token đầu vào cache-miss và 10 triệu token đầu ra, V4.1 Flash tốn khoảng $21 ngoài giờ hoặc $42 giờ cao điểm. Cùng mức token theo giá công bố của V4 Pro 0813 tốn khoảng $85.80 ngoài giờ hoặc $171.60 giờ cao điểm. Trong ví dụ này, V4.1 Flash rẻ hơn khoảng 75.5%.

Bộ nhớ đệm prompt càng tăng lợi thế cho tác tử tái sử dụng lặp lại chỉ dẫn hệ thống, ngữ cảnh kho mã hoặc tài liệu. Đơn giá cache-hit của V4.1 thấp hơn 50 lần so với cache-miss ở cả hai khung tính phí.

DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro

DimensionDeepSeek V4.1 FlashDeepSeek V4 FlashDeepSeek V4 Pro
Total parameters552B284B1.6T
Activated parameters8B input / 16B output13B49B
Architecture focusHiệu quả bất đối xứng đầu vào/đầu raV4 MoE nhẹDung lượng tối đa của V4
Native visionBiến thể Vision Exp riêngKhông
Context window1M1M1M
Maximum output384K384K384K
API status on DeepSeekModel sản xuất hiện tạiNgừng; tên cũ chuyển hướng tới V4.1 FlashDự kiến chuyển hướng sang V4.1 Flash từ 14/09/2026
Best fitTác tử tổng quát, lập trình, thị giác, thông lượng caoChỉ để tương thích di trúKhối lượng công việc Pro hiện có trong giai đoạn chuyển tiếp

V4.1 Flash có tổng tham số lớn hơn V4 Flash nhưng có thể rẻ hơn khi phục vụ vì giai đoạn đầu vào chỉ kích hoạt 8B tham số và dùng bộ đệm KV nhỏ hơn nhiều. So với V4 Pro, nó kích hoạt ít tham số hơn đáng kể trong khi vượt Pro trên hầu hết điểm chuẩn tác tử và lập trình đã chọn ở trên.

API Access and Migration

Tên model sản xuất của DeepSeek là deepseek-flash. Ứng dụng hiện có có thể giữ base URL tương thích OpenAI https://api.deepseek.com hoặc base URL tương thích Anthropic https://api.deepseek.com/anthropic.

  1. Cập nhật tên model thành deepseek-flash.
  2. Giữ nguyên base URL và phương thức xác thực của DeepSeek.
  3. Kiểm thử lại chế độ thinking, tool calls, đầu vào thị giác, độ trễ và mức dùng token với prompt sản xuất.
  4. Theo dõi alias kế thừa: deepseek-v4-flashdeepseek-v4-flash-vision-exp nay chuyển hướng tới V4.1 Flash, trong khi deepseek-v4-pro dự kiến chuyển hướng tới V4.1 Flash từ 14/09/2026 cho tới khi V4.1 Pro ra mắt.

Với người dùng CometAPI, DeepSeek V4.1 API in CometAPI hiện đã hoạt động cùng với DeepSeek V4 Flash API. Trước khi chuyển lưu lượng sản xuất, hãy xác nhận tên model cuối cùng, giá và ánh xạ alias trên bảng điều khiển CometAPI, vì nhà cung cấp bên thứ ba có thể khác với cách đặt tên và mức tính phí chính thức của DeepSeek.

Who Should Use DeepSeek V4.1 Flash?

V4.1 Flash phù hợp mạnh với tác tử lập trình, phân tích kho mã, tự động hóa terminal, workflow tài liệu đa phương thức, trợ lý ngữ cảnh dài và hệ thống sử dụng công cụ với khối lượng lớn. Các mức tăng điểm chuẩn tập trung vào chính các khối lượng công việc hưởng lợi nhiều nhất từ bộ đệm cache nhỏ hơn và giá token thấp hơn.

Các đội đã dùng V4 Flash nên coi đây là ứng viên di trú trực tiếp. Các đội dùng V4 Pro nên thử nghiệm cẩn thận, nhưng dữ liệu điểm chuẩn và giá của chính DeepSeek hiện khiến V4.1 Flash trở thành mặc định kinh tế hơn cho nhiều khối lượng công việc cấp Pro.

Tự lưu trữ là quyết định khác. Trọng số mở không khiến một model 552B trở nên nhẹ. Tổ chức nên so sánh chi phí triển khai GPU lớn và cụm lưu trữ với việc dùng API được lưu trữ trước khi cam kết suy luận nội bộ.

Limitations and Open Questions

  • Kết quả điểm chuẩn đến từ thiết lập đánh giá chính thức của DeepSeek; cần tái lập độc lập để đo hiệu năng qua các bộ harness và môi trường công cụ khác nhau.
  • Hỗ trợ đa phương thức gốc đã được xác nhận, nhưng đội ứng dụng nên xác thực định dạng ảnh hỗ trợ, cách tính token và hành vi thị giác trên API trực tiếp.
  • Alias model kế thừa nay thay đổi model phía sau một tên hiện có, điều này có thể thay đổi đầu ra mà không cần đổi mã ứng dụng.
  • V4.1 Flash giảm yêu cầu hạ tầng so với các model DeepSeek trước, nhưng triển khai trọng số mở vẫn cần tài nguyên tính toán và lưu trữ đáng kể.
  • Endpoint V4.1 chuyên dụng và giá cuối cùng của CometAPI nên được xác nhận trong bảng điều khiển trực tiếp trước khi dùng sản xuất.

Final Verdict

DeepSeek V4.1 Flash là cập nhật lớn về kiến trúc và sản phẩm. Mô hình MoE 552B kết hợp giai đoạn đầu vào kích hoạt 8B, giai đoạn đầu ra kích hoạt 16B, thị giác gốc, cửa sổ ngữ cảnh 1M token và bộ đệm KV nén mạnh. Những lựa chọn thiết kế đó chuyển hóa thành điểm chuẩn tác tử và lập trình mạnh hơn với giá API thấp hơn nhiều so với V4 Pro 0813.

Thay đổi thực dụng nhất là hợp nhất. V4.1 Flash đưa văn bản, thị giác, suy luận, sử dụng công cụ và vận hành ngữ cảnh dài vào một tên model sản xuất. Với hầu hết tích hợp DeepSeek mới, deepseek-flash nay là điểm khởi đầu hợp lý; V4 Pro trở thành đối chứng di trú thay vì lựa chọn mặc định cho công việc khó.

FAQ

DeepSeek V4.1 Flash đã phát hành chính thức chưa?

Có. Model khả dụng qua API của DeepSeek dưới tên deepseek-flash, và DeepSeek đã phát hành trọng số mở cùng báo cáo kỹ thuật.

Có còn cần ID model beta tạm thời V4.1 không?

Không. deepseek-v4.1-flash-expires-on-0910 là định danh beta ngắn hạn. Ứng dụng sản xuất nên dùng deepseek-flash.

DeepSeek V4.1 Flash có bao nhiêu tham số?

Model có tổng 552B tham số. Nó kích hoạt 8B tham số trong xử lý đầu vào và 16B trong sinh đầu ra.

DeepSeek V4.1 Flash hỗ trợ ảnh không?

Có. Đầu vào thị giác là gốc trong model sản xuất, vì vậy không còn cần endpoint V4 Flash Vision Exp riêng.

V4.1 Flash có tốt hơn V4 Pro không?

Nó dẫn V4 Pro 0813 ở hầu hết so sánh đã công bố về lập trình, tác tử, tự động hóa và an ninh mạng, nhưng V4 Pro vẫn dẫn ở GPQA Diamond. Các đội nên đánh giá cả hai với prompt riêng trước khi di trú.

API có giá bao nhiêu?

Ở giờ cao điểm, mức giá trên mỗi triệu token là $0.006 cho đầu vào cache-hit, $0.30 cho đầu vào cache-miss và $1.20 cho đầu ra. Ngoài giờ cao điểm rẻ hơn một nửa các mức này.

Chuyện gì xảy ra với các tên model V4 cũ?

Các tên deepseek-v4-flashdeepseek-v4-flash-vision-exp nay chuyển hướng đến V4.1 Flash. DeepSeek cho biết deepseek-v4-pro cũng sẽ chuyển hướng tới V4.1 Flash từ 14/09/2026 cho đến khi V4.1 Pro phát hành.

Tôi có thể dùng DeepSeek V4.1 Flash qua CometAPI không?

Có. CometAPI hiện cung cấp DeepSeek V4.1 API endpoint trực tiếp. Trước khi đưa lưu lượng sản xuất, hãy xác nhận tên model chính xác, giá và tính năng được hỗ trợ trong bảng điều khiển CometAPI, vì nhà cung cấp bên thứ ba có thể dùng quy ước đặt tên hoặc mức tính phí khác với API chính thức của DeepSeek.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 10, 2026
Cập nhật lần cuối Sep 10, 2026
0 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm