GPT-5.6 Luna price down 80%, Terra down 20% →

DeepSeek V4 Flash 0731 & DeepSeek Harness: Hướng dẫn về bước đột phá trong lập trình tác tử (2026)

CometAPI
AnnaAug 9, 2026
DeepSeek V4 Flash 0731 & DeepSeek Harness: Hướng dẫn về bước đột phá trong lập trình tác tử (2026)

TLDR DeepSeek-V4-Flash-0731 (ra mắt ngày 31 tháng 7, 2026) là phiên bản chính thức, sẵn sàng sản xuất của mô hình Mixture-of-Experts hiệu quả của DeepSeek (284B tổng số tham số / 13B tham số kích hoạt, cửa sổ ngữ cảnh 1M token). Thông qua hậu huấn luyện có chủ đích, phiên bản này mang lại bước nhảy vọt về lập trình tác tử, sử dụng công cụ và kỹ thuật phần mềm nhiều bước. Mô hình hỗ trợ gốc Responses API và OpenAI Codex. DeepSeek Harness là framework tác tử đi kèm (chế độ tối giản đã được dùng trong các đánh giá chính thức; bản đầy đủ sẽ sớm phát hành) được thiết kế để biến mô hình thành một tác tử tự động đáng tin cậy.

Kết hợp lại, chúng mang đến một trong những tỷ lệ hiệu năng/chi phí mạnh nhất trong hệ sinh thái AI tác tử có trọng số mở và truy cập qua API tính đến tháng 8/2026.

Điểm chính

  • Bước nhảy tác tử lớn nhờ hậu huấn luyện: Cùng kiến trúc 284B/13B như bản xem trước tháng 4, nhưng điểm số tăng mạnh (ví dụ, Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
  • Vượt DeepSeek-V4-Pro (Preview) trên nhiều benchmark tác tử dù số tham số kích hoạt ít hơn nhiều.
  • Cạnh tranh với các mô hình độc quyền hàng đầu (tiệm cận Claude Opus 4.8 trên nhiều tác vụ tác tử) với chi phí chỉ bằng một phần nhỏ.
  • Ngữ cảnh gốc 1M, giải mã suy đoán (DSpark), ba mức nỗ lực suy luận (thấp/cao/tối đa), giấy phép MIT, trọng số mở.
  • Hỗ trợ chính thức Responses API và Codex (CLI, desktop, tiện ích mở rộng VS Code).
  • DeepSeek Harness (chế độ tối giản đã dùng trong các đánh giá) là framework tác tử chính thức đang ở closed beta; bản phát hành công khai dự kiến sớm. DeepSeek Harness cung cấp lớp runtime cho tác tử; model + harness = tác tử sản xuất.
  • Lý tưởng cho tác tử lập trình khối lượng lớn, tự động hóa terminal, dùng công cụ và quy trình ngữ cảnh dài.
  • Truy cập các mô hình DeepSeek với chi phí hợp lý và công cụ thống nhất qua CometAPI (endpoint tương thích OpenAI, giá cạnh tranh, định tuyến đa mô hình).

Có gì mới trong DeepSeek V4 Flash 0731?

Trạng thái phát hành chính thức đã thay đổi

Thay đổi sản phẩm quan trọng nhất là DeepSeek V4 Flash 0731 nay là bản phát hành chính thức của DeepSeek V4 Flash trên API, ở public beta. Change log ngày 31/7 của DeepSeek nói rằng lập trình viên có thể tiếp tục gọi cùng tên model, deepseek-v4-flash, để truy cập phiên bản mới nhất. Điều này quan trọng cho việc chuyển đổi vì tránh phải dùng slug model mới và cho phép nhóm thử nghiệm cập nhật phía sau logic định tuyến hiện có.

DeepSeek cũng nói bản cập nhật chỉ nâng cấp API V4 Flash. API V4 Pro và các model trên ứng dụng/web không thay đổi bởi đợt phát hành 31/7, và DeepSeek cho biết bản phát hành chính thức của V4 Pro sẽ sớm theo sau. Nói cách khác, đây không phải làm mới toàn bộ họ DeepSeek V4, mà là cập nhật có mục tiêu cho Flash.

Kiến trúc giữ nguyên, hậu huấn luyện thay đổi

Kiến trúc cốt lõi giữ nguyên: mô hình Mixture-of-Experts (MoE) với 284 tỷ tham số tổng và chỉ 13 tỷ tham số kích hoạt mỗi token, thiết kế attention lai tối ưu cho ngữ cảnh dài, và cửa sổ ngữ cảnh gốc 1 triệu token. Một module giải mã suy đoán (DSpark) được gắn kèm để tạo nhanh hơn. Mô hình chỉ xử lý văn bản, hỗ trợ điều chỉnh mức nỗ lực suy luận (low / high / max), gọi công cụ, đầu ra có cấu trúc, và phát hành theo giấy phép MIT thoáng.

Sự khác biệt này quan trọng. Nhiều cập nhật mô hình cải thiện vì kích thước lớn hơn. Bản cập nhật này thú vị hơn vì DeepSeek tuyên bố bước nhảy tác tử lớn mà không tăng footprint tham số. V4 Flash vẫn là mô hình MoE 284B tổng/13B kích hoạt, nhỏ hơn nhiều khi suy luận so với thiết kế 1.6T tổng/49B kích hoạt của V4 Pro.

Điểm số lập trình tác tử tăng vọt

Bảng chính thức của DeepSeek cho thấy cải thiện lớn trên các tác vụ terminal, xây dựng repository, an ninh mạng, kỹ thuật phần mềm, dùng công cụ, tự động hóa và full-stack. Mức tăng tuyệt đối lớn nhất so với bản Flash preview cũ là trên DeepSWE: 54.4 so với 7.3, tăng 47.1 điểm. Cybergym tăng 38.0 điểm, DSBench-Hard tăng 33.8 điểm, và DSBench-FullStack tăng 31.7 điểm.

Đó là lý do V4 Flash 0731 được bàn luận ít như một “mô hình nhanh” thông thường và nhiều hơn như ứng viên mặc định cho tác tử lập trình. Giá trị không chỉ là chat rẻ — mà là suy luận tác tử rẻ, ngữ cảnh dài, thân thiện công cụ.

Hỗ trợ Responses API và Codex đã đến

Change log ngày 31/7 của DeepSeek nói bản V4 Flash chính thức hỗ trợ gốc định dạng Responses API và được điều chỉnh đặc biệt cho Codex. Hướng dẫn Responses API của DeepSeek cho biết định dạng này được thêm để đáp ứng nhu cầu từ Codex, dùng base URL https://api.deepseek.com, và hiện hỗ trợ deepseek-v4-flash.

Điều này quan trọng vì quy trình phát triển kiểu Codex không phải các phiên chat đơn giản. Chúng cần input và output có cấu trúc, mục suy luận, gọi công cụ, thao tác thay đổi file, sự kiện streaming, thống kê sử dụng và tích hợp với client tác tử lập trình. Hỗ trợ của DeepSeek không sao chép hoàn hảo mọi khả năng của OpenAI Responses API, nhưng đủ để biến V4 Flash trở thành ứng viên thay thế thiết thực cho các thử nghiệm tác tử lập trình.

Điểm chuẩn hiệu năng cho bản V4-Flash chính thức

Những lưu ý về benchmark mà lập trình viên không nên bỏ qua

Kết quả đánh giá chính thức (DeepSeek báo cáo trên model card) cho thấy bước nhảy lớn so với bản xem trước và, đáng chú ý, vượt qua cả V4-Pro Preview lớn hơn nhiều trên các tác vụ tập trung vào tác tử. Các đánh giá cho benchmark tác tử lập trình dùng chế độ tối giản của DeepSeek Harness (sẽ phát hành) ở mức nỗ lực suy luận tối đa, temperature = 1.0, top_p = 0.95.

Điều này kéo theo hai hệ quả. Thứ nhất, kết quả là một phần của mô hình và harness. Nếu runtime tác tử của bạn có công cụ, quyền shell, quản lý ngữ cảnh, retry, quy tắc patch hoặc xử lý lỗi khác, bạn có thể không đạt cùng điểm. Thứ hai, khả năng tái lập độc lập còn hạn chế cho đến khi DeepSeek phát hành đủ harness và thiết lập đánh giá để các nhóm bên ngoài chạy thử nghiệm tương đương.

Bảng benchmark chính thức của DeepSeek

BenchmarkV4-Flash-0731V4-Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents’ Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
DSBench-FullStack †68.737.041.861.871.6
DSBench-Hard †59.625.831.154.571.7

Trên chín benchmark này, V4 Flash 0731 đạt trung bình 55.2. V4 Flash preview cũ trung bình 29.6, và V4-Pro Preview trung bình 34.9. Tức là V4 Flash 0731 cao hơn khoảng 25.6 điểm so với Flash preview và 20.3 điểm so với V4-Pro Preview trên bảng này.

Tín hiệu từ bên thứ ba

ARC Prize báo cáo V4 Flash 0731 ở mức nỗ lực tối đa đạt 89.0% trên ARC-AGI-1 Semi-Private và 61.4% trên ARC-AGI-2 Semi-Private, với chi phí liệt kê lần lượt $0.02 và $0.04 mỗi tác vụ. Đây không phải benchmark tác tử lập trình, nhưng củng cố nhận định rằng mô hình cạnh tranh trên tác vụ suy luận khi chạy ở mức nỗ lực cao.

Mức tăng đặc biệt ấn tượng trên DeepSWE (vòng lặp tác tử kỹ thuật phần mềm) và Cybergym. Các phép đo độc lập (ví dụ, Artificial Analysis) báo cáo Terminal-Bench thấp hơn một chút nhưng vẫn mạnh, khoảng 79%, xác nhận xu hướng cải thiện đồng thời nhắc rằng số liệu dùng harness của nhà cung cấp thường lạc quan.

Ngữ cảnh bổ sung từ các đánh giá V4 trước đó và bộ tổng hợp bên thứ ba cho thấy hiệu năng kiến thức và lập trình mạnh ở chế độ suy luận tối đa (GPQA Diamond ~88–91%, LiveCodeBench dải cao 80–90 tùy nguồn). Hậu huấn luyện 0731 đã mở khóa độ tin cậy tác tử mà bản preview thiếu.

DeepSeek-V4-Flash nay hỗ trợ Responses API và Codex

Bổ sung mang tính chiến lược là hỗ trợ gốc cho Responses API của OpenAI. Tài liệu chính thức của DeepSeek xác nhận Responses API hiện hỗ trợ deepseek-v4-flash (hỗ trợ Pro dự kiến đầu tháng 8/2026). Base URL vẫn là https://api.deepseek.com.

Đây là nâng cấp lớn về trải nghiệm nhà phát triển. Trước khi có Responses API và hỗ trợ Codex, DeepSeek V4 Flash đã có thể gọi như một model văn bản, nhưng tác tử lập trình phải tự bắc cầu nhiều chi tiết tích hợp. Giờ đây mô hình có thể được dùng trong quy trình kỳ vọng ngữ nghĩa kiểu Responses.

Hỗ trợ Responses API bao gồm gì

Responses API của DeepSeek tạo phản hồi theo định dạng OpenAI Responses API tại /responses. Responses API hỗ trợ model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, tools, tool choice, reasoning effort, text format và usage reporting. API là stateless, vì vậy client cần gửi toàn bộ lịch sử hội thoại cho tương tác nhiều lượt.

Các chi tiết tương thích quan trọng mang tính thực tiễn:

  • deepseek-v4-flash hiện là model duy nhất được hỗ trợ cho Responses API.
  • Thông điệp developer được coi như system.
  • Hỗ trợ function tools, streaming, điều chỉnh nỗ lực suy luận và tìm kiếm web phía server.
  • Kiểu công cụ tùy chỉnh chỉ hỗ trợ cho apply_patch, điều quan trọng với khả năng tương thích Codex.
  • Không hỗ trợ input hình ảnh và file; phần hình ảnh được thay bằng văn bản giữ chỗ.
  • previous_response_id, conversation, store, background mode, metadata và một số tính năng quản lý ngữ cảnh không được hỗ trợ.
  • Tham số không được hỗ trợ có thể bị bỏ qua im lặng, nên client sản xuất cần kiểm thử hành vi mong đợi một cách tường minh.

Với lập trình viên, điểm mấu chốt là hỗ trợ Responses API không chỉ là chi tiết cú pháp. Nó cho phép DeepSeek V4 Flash vận hành trong làn giao thức mà các tác tử lập trình hiện đại sử dụng, đặc biệt khi cần biểu diễn nhất quán lời gọi hàm, sự kiện streaming, mục suy luận và áp dụng bản vá.

Thiết kế stateless (client quản lý lịch sử hội thoại). Ví dụ (Python):

from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful coding assistant.",
    input="Refactor this Python function for better readability...",
    reasoning={"effort": "max"}
)
print(response.output_text)

Chi tiết đầy đủ và hướng dẫn tích hợp Codex: DeepSeek API Docs – Responses APITích hợp với Codex.

Hỗ trợ Codex nghĩa là gì

Hướng dẫn tích hợp Codex của DeepSeek cho biết Codex giao tiếp với model qua Responses API, nay đã được DeepSeek hỗ trợ gốc. Điều này cho phép tích hợp trực tiếp với Codex (hệ sinh thái tác tử lập trình của OpenAI — CLI, ứng dụng desktop ChatGPT và tiện ích mở rộng Codex cho VS Code).

Lập trình viên có thể cấu hình nhà cung cấp tùy chỉnh một lần qua script thiết lập hoặc chỉnh ~/.codex/config.toml và file danh mục model. Sau khi cấu hình, client Codex nhận diện DeepSeek-V4-Flash và có thể dùng khả năng gọi công cụ, apply_patch, tìm kiếm web và suy luận của mô hình.

DeepSeek V4 Flash so với DeepSeek V4 Pro

AspectV4-Flash-0731V4-Pro (typical / Preview)
Total / Active Params284B / 13B~1.6T / 49B
Context Window1M tokens1M tokens
StrengthsLập trình tác tử, terminal, chi phí, tốc độSuy luận sâu nhất, kiến thức, tác vụ khó nhất
Agent Benchmark EdgeThắng trên bộ tác tử 0731 đã công bốMạnh hơn về kiến thức thuần & đa file phức tạp ở các đánh giá trước
Typical API Pricing~$0.14 in / $0.28 out (cache thấp hơn nhiều khi cache hit)Cao hơn đáng kể (lịch sử 3–12×)
Best ForTác tử khối lượng lớn, vòng lặp lập trình sản xuất, ứng dụng nhạy chi phíNghiên cứu tiền tuyến, năng lực tối đa cho tác vụ đơn lẻ
Open WeightsYes (MIT)Yes (MIT)

Nhà phát triển nên dùng cái nào trước?

Trên các benchmark tác tử cụ thể phát hành cùng 0731, bản Flash nhỏ hơn vượt Pro Preview trên toàn bộ bảng. Với truy xuất kiến thức thuần hoặc các bài suy luận khó nhất, Pro vẫn nhỉnh hơn trong nhiều đánh giá độc lập và trước đó. Thực tế, nhiều đội hiện mặc định dùng Flash cho phần lớn khối lượng tác tử và chỉ chuyển các tác vụ khó nhất sang Pro (hoặc model tiền tuyến khác).

Chiến lược định tuyến đó là nơi CometAPI có thể giúp. Thay vì cố định một model cho mọi tác vụ, dùng CometAPI để tập trung lựa chọn model, ghi log, theo dõi chi phí và chính sách fallback. Ví dụ:

  • Dùng V4 Flash cho tóm tắt repository, lập kế hoạch refactor, bản nháp code review, sinh test, trích xuất có cấu trúc, QA ngữ cảnh dài và các vòng lặp tác tử lặp lại.
  • Nâng cấp lên V4 Pro hoặc model cao cấp khác khi tác vụ có rủi ro kinh doanh cao, yêu cầu mơ hồ, code sản xuất mong manh hoặc lặp lại thất bại.
  • Theo dõi chỉ số sau cùng quan trọng: số bản sửa được chấp nhận trên mỗi đô la, số tác vụ thành công mỗi giờ, hoặc phút review của con người được tiết kiệm.

DeepSeek Harness là gì?

DeepSeek Harness là framework/runtime tác tử chính thức mà DeepSeek đang xây dựng để biến các model của họ thành tác tử tự động đáng tin cậy. Công ty diễn đạt đơn giản: Model + Harness = Agent.

Các đánh giá chính thức của V4-Flash-0731 đã dùng “chế độ tối giản” của DeepSeek Harness. Sản phẩm đầy đủ vẫn đang triển khai (tuyển dụng và thử nghiệm sớm diễn ra cuối tháng 7–đầu tháng 8/2026). Nhóm do Cui Tianyi dẫn dắt (nền tảng hệ thống giao dịch định lượng), và mô tả công việc nhấn mạnh tích hợp sâu với DeepSeek-V4 như prefix caching, quản lý ngữ cảnh dài, tối ưu KV-cache, chuỗi dùng công cụ, phục hồi lỗi và retry tự động.

Harness không phải wrapper kiểu LangChain chung chung. Nó được đồng thiết kế với model để quản lý ngữ cảnh, điều phối công cụ, thu thập bằng chứng và vòng lặp sửa chữa khai thác hiệu quả riêng của V4 (sparse attention, caching, chế độ suy luận). Cộng đồng và bên thứ ba cũng có harness, nhưng Harness chính thức hướng tới liên kết model–runtime chặt nhất.

Khi phát hành đầy đủ, dự kiến sẽ cung cấp:

  • Vòng lặp tác tử có cấu trúc cho lập trình và tự động hóa.
  • Cổng an toàn và luồng phê duyệt.
  • Xử lý ngữ cảnh hiệu quả cho tác vụ dài hơi.
  • Quan sát và tạo artefact.

Cho đến khi bản đầy đủ ra mắt, lập trình viên đã có thể đạt kết quả mạnh bằng cách ghép V4-Flash-0731 với các framework tác tử hiện có hoặc dùng hướng đi Responses API + Codex.

Giá, khả dụng và triển khai thực tế

  • Giá API chính thức (xấp xỉ): $0.14 / 1M input tokens (cache miss), ~$0.0028–0.03 khi cache hit, $0.28 / 1M output tokens. Giới hạn đồng thời cao.
  • Trọng số mở theo MIT trên Hugging Face; bản GGUF lượng tử hóa phổ biến rộng rãi cho chạy cục bộ/tự lưu trữ (cần VRAM đáng kể — toàn chính xác rất lớn).
  • Giải mã suy đoán (DSpark) và attention lai giúp suy luận ngữ cảnh dài tương đối hiệu quả.
  • Engine suy luận hỗ trợ: vLLM, SGLang và các engine khác có hướng dẫn.

Với nhiều đội, con đường sản xuất dễ nhất là gateway tương thích OpenAI. CometAPI cung cấp truy cập hợp nhất tới các model DeepSeek (bao gồm dòng V4) cùng hàng trăm model khác qua một endpoint (https://api.cometapi.com/v1). Lợi ích gồm định tuyến đa model đơn giản, giá cạnh tranh hoặc chiết khấu so với nhà cung cấp trực tiếp, phân tích sử dụng và khả năng chuyển giữa Flash, Pro và model khác mà không đổi code ứng dụng. Điều này đặc biệt hữu ích cho hệ thống tác tử cần fallback hoặc định tuyến theo độ khó/chi phí.

Tại thời điểm bài viết, DeepSeek V4 Flash trên CometAPI có giá đầu vào khởi điểm $0.12 mỗi 1M token, giá đầu ra $0.24 mỗi 1M token trong bảng so sánh, uptime 100.0% trong 24 giờ và thời gian phản hồi quan sát 2941 ms. DeepSeek cũng cảnh báo giá API tổng thể có thể tăng trong tương lai gần. Vì giá nhà cung cấp có thể thay đổi, ngôn ngữ khuyến nghị khi công bố là: hãy kiểm tra danh mục trực tiếp của CometAPI và giá chính thức của DeepSeek trước khi chốt ngân sách sản xuất.

Khuyến nghị thực tế cho lập trình viên và đội ngũ

  1. Bắt đầu với Flash-0731 cho lập trình tác tử — Tỷ lệ hiệu năng/chi phí hiện rất xuất sắc cho workflow terminal, repository và đa công cụ. Dùng mức nỗ lực suy luận tối đa + vòng lặp kiểu Harness cho tác vụ khó nhất.
  2. Với suy luận cục bộ, tải từ Hugging Face và làm theo hướng dẫn vLLM/SGLang chính thức bật DSpark.
  3. Tích hợp qua Responses API nếu bạn đã dùng Codex hoặc muốn ngữ nghĩa gọi công cụ hiện đại.
  4. Tự lưu trữ hoặc dùng trọng số lượng tử hóa để tối đa kiểm soát chi phí và quyền riêng tư dữ liệu.
  5. Định tuyến thông minh — dùng Flash cho khối lượng lớn, Pro (hoặc model lớn khác) cho phần đuôi dài các vấn đề siêu khó.
  6. Cân nhắc CometAPI để truy cập đa model đơn giản, đặc biệt nếu stack của bạn đã pha trộn DeepSeek với nhà cung cấp khác.

Kết luận

DeepSeek-V4-Flash-0731 đánh dấu khoảnh khắc then chốt trong AI tác tử hiệu quả. Bằng cách mang lại hiệu năng tác tử cạnh tranh tiền tuyến từ một MoE tương đối nhỏ (13B kích hoạt) thông qua hậu huấn luyện tập trung, và ghép với Harness mục đích riêng cùng khả năng tương thích API hiện đại (Responses + Codex), DeepSeek đã đặt lại kỳ vọng cho tác tử lập trình và tự động hóa chi phí hợp lý.

Dù bạn tự lưu trữ trọng số mở, gọi API chính thức, hay định tuyến qua gateway hợp nhất như CometAPI, V4-Flash-0731 + hệ sinh thái Harness đang phát triển cung cấp nền tảng hiệu năng cao, tiết kiệm chi phí cho thế hệ tác tử AI tiếp theo.

Câu hỏi thường gặp

DeepSeek V4 Flash 0731 là gì?

DeepSeek V4 Flash 0731 là bản public beta chính thức của DeepSeek V4 Flash trên DeepSeek API, công bố trong change log ngày 31/7/2026. Nó thay thế bản preview trong khi vẫn giữ nguyên tên model trên API, deepseek-v4-flash.

DeepSeek V4 Flash 0731 có gì mới?

Thay đổi chính là hiệu năng benchmark tác tử mạnh hơn, hỗ trợ gốc Responses API, điều chỉnh cho Codex, và bản V4 Flash chính thức được hậu huấn luyện lại. DeepSeek nói kiến trúc và kích thước mô hình giữ nguyên so với bản preview.

DeepSeek V4 Flash 0731 có hỗ trợ Codex không?

Có. Hướng dẫn Codex của DeepSeek cho biết chỉ deepseek-v4-flash hiện hỗ trợ tích hợp Codex. Nó hoạt động qua Responses API và có thể cấu hình cho Codex CLI, ứng dụng desktop ChatGPT và tiện ích Codex cho VS Code.

DeepSeek Harness là gì?

DeepSeek Harness là framework tác tử của DeepSeek để biến mô hình ngôn ngữ thành tác tử lập trình hoặc workflow tự động. Các báo cáo công khai mô tả harness là lớp quản lý công cụ, ngữ cảnh, file, thực thi lệnh và quy trình nhiều bước. DeepSeek đã dùng chế độ tối giản của Harness trong thiết lập benchmark V4 Flash 0731.

Tôi có thể truy cập DeepSeek V4 Flash qua CometAPI như thế nào?

Dùng endpoint tương thích OpenAI của CometAPI với model ID deepseek-v4-flash. Trang model của CometAPI cung cấp ví dụ cURL, Python và JavaScript cho /v1/chat/completions, cùng thông số model, giá và uptime.

DeepSeek V4 Flash có tốt hơn DeepSeek V4 Pro không?

Trong bảng benchmark ngày 31/7, V4 Flash 0731 vượt V4-Pro Preview trên các benchmark tác tử được liệt kê. Điều đó không có nghĩa Flash luôn tốt hơn Pro. V4 Pro lớn hơn và vẫn mạnh hơn trên nhiều tác vụ nặng kiến thức và suy luận khó trong model card. Hãy dùng Flash làm mặc định cho workflow tác tử nhạy chi phí và Pro như tuyến nâng cấp.

77 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm