TLDR DeepSeek-V4-Flash-0731 (dikeluarkan 31 Julai 2026) ialah versi rasmi yang sedia produksi bagi model Mixture-of-Experts yang cekap daripada DeepSeek (284B jumlah / 13B parameter aktif, konteks 1M token). Melalui latih lanjut berfokus, ia mencapai lonjakan besar dalam pengkodan agenik, penggunaan alat, dan kejuruteraan perisian berbilang langkah. Ia menyokong API Responses dan OpenAI Codex secara natif. DeepSeek Harness ialah rangka kerja ejen pengiring (mod minimal sudah digunakan dalam penilaian rasmi; keluaran penuh akan datang) yang direka untuk menjadikan model sebagai ejen autonomi yang boleh dipercayai.
Digabungkan, kedua-duanya menawarkan salah satu nisbah kos-prestasi terkuat dalam AI agenik dengan pemberat terbuka dan boleh diakses API setakat Ogos 2026.
Intipati Utama
- Lonjakan agenik utama melalui latih lanjut sahaja: Seni bina 284B/13B yang sama seperti pratonton April, tetapi skor jauh lebih tinggi (cth., Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
- Mengatasi DeepSeek-V4-Pro (Preview) pada pelbagai penanda aras ejen walaupun jauh lebih sedikit parameter diaktifkan.
- Berdaya saing dengan model proprietari teratas (hampir dengan Claude Opus 4.8 pada beberapa tugasan ejen) pada kos yang jauh lebih rendah.
- Konteks asli 1M, pencahaya spekulatif (DSpark), tiga tahap usaha penaakulan (rendah/tinggi/maks), lesen MIT, pemberat terbuka.
- Sokongan rasmi untuk Responses API dan Codex (CLI, desktop, sambungan VS Code).
- DeepSeek Harness (mod minimal sudah digunakan dalam penilaian) ialah rangka kerja ejen rasmi dalam beta tertutup; keluaran umum dijangka tidak lama lagi. DeepSeek Harness menyediakan lapisan masa jalan ejen; model + harness = ejen produksi.
- Ideal untuk ejen pengkodan volum tinggi, automasi terminal, penggunaan alat, dan aliran kerja konteks panjang.
- Akses model DeepSeek secara mampu milik dan dengan peralatan bersatu melalui CometAPI (titik akhir serasi OpenAI, harga kompetitif, perutean multi-model).
Apa Yang Baharu dalam DeepSeek V4 Flash 0731?
Status Keluaran Rasmi Berubah
Perubahan produk terpenting ialah DeepSeek V4 Flash 0731 kini keluaran rasmi DeepSeek V4 Flash pada API, dalam beta awam. Log perubahan 31 Julai DeepSeek mengatakan pembangun boleh terus memanggil nama model yang sama, deepseek-v4-flash, untuk mengakses versi terkini. Itu penting untuk migrasi kerana ia mengelakkan slug model baharu dan membenarkan pasukan menguji kemas kini di sebalik logik perutean sedia ada.
DeepSeek juga menyatakan kemas kini ini hanya menaik taraf API V4 Flash. API V4 Pro dan model aplikasi/web tidak berubah oleh keluaran 31 Julai, dan DeepSeek berkata keluaran rasmi V4 Pro akan menyusul tidak lama lagi. Dengan kata lain, ini bukan penyegaran penuh keluarga DeepSeek V4. Ia ialah kemas kini berfokus untuk Flash.
Seni Bina Kekal Sama, Latih Lanjut Berubah
Seni bina teras kekal tidak berubah: model Mixture-of-Experts (MoE) dengan 284 bilion jumlah parameter dan hanya 13 bilion diaktifkan setiap token, reka bentuk perhatian hibrid yang dioptimumkan untuk konteks panjang, dan tetingkap konteks asli 1 juta token. Modul pencahaya spekulatif (DSpark) dilampirkan untuk penjanaan lebih pantas. Model ini berasaskan teks sahaja, menyokong tahap usaha penaakulan boleh laras (rendah / tinggi / maks), panggilan alat, output berstruktur, dan dikeluarkan di bawah lesen MIT yang permisif.
Perbezaan itu penting. Banyak kemas kini model bertambah baik kerana model menjadi lebih besar. Kemas kini ini lebih menarik kerana DeepSeek mendakwa lonjakan agenik besar tanpa menambah jejak parameter model. V4 Flash kekal model Mixture-of-Experts 284B jumlah, 13B aktif, yang jauh lebih kecil pada waktu inferens berbanding reka bentuk V4 Pro 1.6T jumlah, 49B aktif.
Skor Pengkodan Agenik Melonjak
Jadual rasmi DeepSeek menunjukkan peningkatan besar pada tugasan terminal, pembinaan repositori, siber, kejuruteraan perisian, penggunaan alat, automasi, dan pengkodan full-stack. Lonjakan mutlak terbesar berbanding pratonton Flash lama ialah pada DeepSWE: 54.4 berbanding 7.3, peningkatan 47.1 mata. Cybergym bertambah 38.0 mata, DSBench-Hard 33.8 mata, dan DSBench-FullStack 31.7 mata.
Inilah sebabnya V4 Flash 0731 dibincangkan kurang sebagai “model pantas” biasa dan lebih sebagai calon model lalai untuk ejen pengkodan. Nilai tambahnya bukan sekadar sembang murah. Ia ialah inferens ejen yang murah, ber-konteks panjang, dan mesra alat.
Sokongan Responses API dan Codex Hadir
Log perubahan 31 Julai DeepSeek menyatakan V4 Flash rasmi menyokong format Responses API secara natif dan disesuaikan khusus untuk Codex. Panduan Responses API DeepSeek menyatakan format itu ditambah untuk memenuhi permintaan Codex, menggunakan URL asas https://api.deepseek.com, dan kini menyokong deepseek-v4-flash.
Ini penting kerana aliran kerja gaya Codex bukan sesi sembang mudah. Ia memerlukan item input dan output berstruktur, item penaakulan, panggilan alat, operasi perubahan fail, acara penstriman, pelaporan penggunaan, dan integrasi dengan klien ejen pengkodan. Sokongan DeepSeek bukan klon sempurna semua keupayaan OpenAI Responses API, tetapi sudah memadai untuk menjadikan V4 Flash calon gantian yang jauh lebih praktikal bagi eksperimen ejen pengkodan.
Penanda Aras Prestasi untuk Versi Rasmi V4-Flash
Sangkalan Penanda Aras yang Pembangun Tidak Patut Abaikan
Keputusan penilaian rasmi (dilaporkan oleh DeepSeek pada kad model) menunjukkan lonjakan besar berbanding pratonton dan, luar biasa, berbanding V4-Pro Preview yang jauh lebih besar pada tugasan berpusatkan ejen. Penilaian untuk penanda aras ejen kod menggunakan mod minimal DeepSeek Harness (akan dikeluarkan) pada usaha penaakulan maksimum, temperature = 1.0, top_p = 0.95.
Itu mempunyai dua implikasi. Pertama, keputusan model sebahagiannya ialah hasil model-dan-harness. Jika masa jalan ejen anda mempunyai alat, keizinan shell, pengurusan konteks, percubaan semula, peraturan tampalan, atau pengendalian kegagalan yang berbeza, anda mungkin tidak mendapat skor yang sama. Kedua, pembiakan bebas adalah terhad sehingga DeepSeek mengeluarkan cukup komponen harness dan set penilaian untuk pasukan luar menjalankan ujian setanding.
Jadual Penanda Aras Rasmi DeepSeek
| Penanda Aras | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Merentasi sembilan penanda aras ini, V4 Flash 0731 berpurata 55.2. Pratonton V4 Flash lama berpurata 29.6, dan V4-Pro Preview berpurata 34.9. Ini bermakna V4 Flash 0731 kira-kira 25.6 mata lebih tinggi daripada pratonton Flash dan 20.3 mata lebih tinggi daripada V4-Pro Preview pada jadual ini.
Isyarat Pihak Ketiga
ARC Prize melaporkan V4 Flash 0731 pada usaha maksimum mencatat 89.0% pada ARC-AGI-1 Semi-Private dan 61.4% pada ARC-AGI-2 Semi-Private, dengan kos yang disenaraikan sebanyak $0.02 dan $0.04 per tugasan. Ini bukan penanda aras ejen pengkodan, tetapi ia menyokong pandangan lebih luas bahawa model ini berdaya saing pada tugasan penaakulan apabila dijalankan pada usaha lebih tinggi.
Peningkatan sangat ketara pada DeepSWE (gelung ejen kejuruteraan perisian) dan Cybergym. Pengukuran bebas (cth., Artificial Analysis) melaporkan angka Terminal-Bench yang sedikit lebih rendah tetapi masih kukuh sekitar 79%, mengesahkan arah penambahbaikan sambil mengingatkan pengguna bahawa nombor vendor-harness cenderung optimistik.
Konteks tambahan daripada penilaian V4 terdahulu dan pengumpul pihak ketiga menunjukkan prestasi pengetahuan dan pengkodan yang kuat dalam mod penaakulan maksimum (GPQA Diamond ~88–91%, LiveCodeBench tinggi 80-an–90-an bergantung sumber). Latih lanjut 0731 secara khusus membuka kebolehpercayaan ejen yang kurang pada pratonton.
DeepSeek-V4-Flash Kini Menyokong Responses API dan Codex
Penambahan yang strategik penting ialah sokongan asli untuk OpenAI’s Responses API. Dokumentasi rasmi DeepSeek mengesahkan bahawa Responses API kini menyokong deepseek-v4-flash (sokongan Pro dijangka awal Ogos 2026). URL asas kekal https://api.deepseek.com.
Ini ialah peningkatan pengalaman pembangun yang besar. Sebelum sokongan Responses API dan Codex, DeepSeek V4 Flash sudah boleh dipanggil sebagai model teks, tetapi ejen pengkodan perlu menjambatani lebih banyak butiran integrasi sendiri. Kini model boleh digunakan dalam aliran kerja yang menjangkakan semantik gaya Responses.
Apa yang Termasuk dalam Sokongan Responses API
Responses API DeepSeek mencipta respons model dalam format OpenAI Responses API di /responses. Responses API menyokong model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, tools, pilihan alat, usaha penaakulan, format teks, dan pelaporan penggunaan. API ini tidak berkeadaan (stateless), jadi klien perlu menghantar keseluruhan sejarah perbualan untuk interaksi berbilang giliran.
Butiran keserasian terpenting adalah praktikal:
deepseek-v4-flashkini satu-satunya model yang disokong untuk Responses API.- Mesej
developerdilayan sebagai mesejsystem. - Fungsi alat, penstriman, usaha penaakulan boleh laras dan carian web sisi pelayan disokong.
- Jenis alat tersuai hanya disokong untuk
apply_patch, yang penting untuk keserasian Codex. - Input imej dan fail tidak disokong; bahagian input imej diganti dengan teks pemegang tempat.
previous_response_id,conversation,store, mod latar belakang, metadata, dan beberapa ciri pengurusan konteks tidak disokong.- Parameter yang tidak disokong mungkin diabaikan secara senyap, jadi klien produksi harus menguji tingkah laku yang dijangka secara eksplisit.
Bagi pembangun, perkara utama ialah sokongan Responses API bukan sekadar butiran sintaks. Ia membolehkan DeepSeek V4 Flash berada dalam lorong protokol yang digunakan oleh ejen pengkodan moden, terutamanya apabila panggilan fungsi, acara penstriman, item penaakulan, dan aplikasi tampalan perlu diwakili secara konsisten.
Reka bentuk tidak berkeadaan (klien mengurus sejarah perbualan). Contoh (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Butiran penuh dan panduan integrasi Codex: DeepSeek API Docs – Responses API dan Integrate with Codex.
Maksud Sokongan Codex
Panduan integrasi Codex DeepSeek menyatakan Codex berkomunikasi dengan model melalui Responses API, yang kini disokong DeepSeek secara natif. Ini membolehkan integrasi terus dengan Codex (ekosistem ejen pengkodan OpenAI — CLI, aplikasi desktop ChatGPT, dan sambungan IDE Codex untuk VS Code).
Pembangun boleh mengkonfigurasi penyedia tersuai sekali melalui skrip setup atau dengan mengedit ~/.codex/config.toml dan fail katalog model. Selepas konfigurasi, klien Codex mengenali DeepSeek-V4-Flash dan boleh menggunakan kebolehan panggilan alat, apply_patch, carian web, dan penaakulan.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspek | V4-Flash-0731 | V4-Pro (tipikal / Preview) |
|---|---|---|
| Jumlah / Parameter Aktif | 284B / 13B | ~1.6T / 49B |
| Tetingkap Konteks | 1M token | 1M token |
| Kekuatan | Pengkodan agenik, terminal, kos, kelajuan | Penaakulan terdalam, pengetahuan, tugasan paling sukar |
| Keunggulan Penanda Aras Ejen | Menang pada set ejen 0731 yang diterbitkan | Lebih kuat pada pengetahuan tulen & multi-fail kompleks dalam penilaian terdahulu |
| Harga API Tipikal | ~$0.14 masuk / $0.28 keluar (cache jauh lebih rendah) | Jauh lebih tinggi (sejarahnya 3–12×) |
| Terbaik Untuk | Ejen volum tinggi, gelung pengkodan produksi, aplikasi sensitif kos | Penyelidikan terdepan, kebolehan maksimum bagi tugasan tunggal |
| Pemberat Terbuka | Ya (MIT) | Ya (MIT) |
Mana Yang Patut Pembangun Gunakan Dahulu?
Pada penanda aras ejen khusus yang dikeluarkan bersama 0731, model Flash yang lebih kecil mengatasi Pro preview merentasi keseluruhan jadual. Untuk pengambilan pengetahuan tulen atau masalah penaakulan paling sukar, Pro masih mempunyai kelebihan dalam banyak penilaian bebas dan terdahulu. Dalam praktik, ramai pasukan kini menjadikan Flash lalai bagi majoriti beban kerja agenik dan hanya merutekan tugasan paling menuntut kepada Pro (atau model terdepan lain).
Strategi perutean itu ialah di mana CometAPI boleh membantu. Daripada mengekod satu model untuk semua beban kerja, gunakan CometAPI untuk memusatkan pemilihan model, pembalakan, penjejakan kos, dan dasar pemulihan. Contohnya:
- Gunakan V4 Flash untuk ringkasan repositori, perancangan refaktor, draf semakan kod, ujian terjana, pengekstrakan berstruktur, QA konteks panjang, dan gelung ejen berulang.
- Naik taraf ke V4 Pro atau model premium lain apabila tugasan mempunyai risiko perniagaan tinggi, keperluan samar, kod produksi rapuh, atau percubaan berulang gagal.
- Jejaki metrik terakhir yang penting: pembaikan diterima per dolar, tugasan berjaya sejam, atau minit semakan manusia dijimatkan.
Apakah DeepSeek Harness?
DeepSeek Harness ialah rangka kerja ejen / lapisan masa jalan rasmi yang dibangunkan DeepSeek untuk menjadikan modelnya ejen autonomi yang boleh dipercayai. Syarikat merumuskan persamaan mudah: Model + Harness = Ejen.
Penilaian rasmi V4-Flash-0731 sudah menggunakan “mod minimal” DeepSeek Harness. Produk penuh masih digulung keluar (pengambilan dan ujian awal aktif sekitar akhir Julai–awal Ogos 2026). Pasukan diketuai oleh Cui Tianyi (latar belakang sistem perdagangan kuantitatif), dan huraian kerja menekankan integrasi mendalam dengan ciri DeepSeek-V4 seperti cache awalan, pengurusan konteks panjang, pengoptimuman KV-cache, perantaian penggunaan alat, pemulihan ralat, dan percubaan semula automatik.
Harness bukan pembalut generik gaya LangChain. Ia direka bersama dengan model supaya pengurusan konteks, orkestrasi alat, pengumpulan bukti, dan gelung pembaikan mengeksploitasi kecekapan khusus V4 (perhatian jarang, caching, mod penaakulan). Projek komuniti dan harness pihak ketiga juga wujud, tetapi Harness rasmi menyasar gandingan model–masa jalan paling rapat.
Apabila dikeluarkan sepenuhnya, ia dijangka menyediakan:
- Gelung ejen berstruktur untuk pengkodan dan automasi.
- Pagar keselamatan dan aliran kelulusan.
- Pengendalian konteks yang cekap untuk tugasan jangka panjang.
- Kebolehcerapan dan penghasilan artifak.
Sehingga keluaran penuh, pembangun sudah boleh mencapai keputusan kukuh dengan memadankan V4-Flash-0731 dengan rangka kerja ejen sedia ada atau menggunakan laluan Responses API + Codex.
Harga, Ketersediaan, dan Penerapan Praktikal
- Harga API rasmi (anggaran): $0.14 / 1M token input (cache miss), ~$0.0028–0.03 pada cache hit, $0.28 / 1M token output. Had kebersamaan tinggi.
- Pemberat terbuka di bawah MIT di Hugging Face; versi GGUF dikuantum tersedia meluas untuk penggunaan setempat/hos sendiri (memerlukan VRAM besar — ketepatan penuh adalah besar).
- Pencahaya spekulatif (DSpark) dan perhatian hibrid memastikan inferens konteks panjang agak cekap.
- Enjin inferens disokong: vLLM, SGLang, dan lain-lain dengan resipi didokumenkan.
Bagi ramai pasukan, laluan produksi paling mudah ialah gerbang serasi OpenAI. CometAPI menawarkan akses bersatu ke model DeepSeek (termasuk siri V4) bersama ratusan model lain melalui satu titik akhir (https://api.cometapi.com/v1). Manfaat termasuk perutean multi-model dipermudah, harga kompetitif atau diskaun berbanding penyedia langsung, analitik penggunaan, dan keupayaan menukar antara Flash, Pro, dan model lain tanpa mengubah kod aplikasi. Ini amat berguna untuk sistem agenik yang mungkin melakukan fallback atau perutean mengikut kesukaran/kos.
Pada masa artikel ini, DeepSeek V4 Flash CometAPI menyenaraikan harga input bermula $0.12 per 1M token, harga output $0.24 per 1M token dalam jadual perbandingan, 100.0% masa hidup sepanjang 24 jam, dan respons diperhati 2941 ms. DeepSeek juga memberi amaran bahawa harga API keseluruhan mungkin meningkat dalam masa terdekat. Oleh kerana harga penyedia boleh berubah, bahasa penerbitan yang selamat ialah: semak katalog langsung CometAPI dan harga rasmi DeepSeek sebelum membuat bajet produksi.
Syor Praktikal untuk Pembangun dan Pasukan
- Mulakan dengan Flash-0731 untuk pengkodan agenik — Nisbah kos/prestasi kini cemerlang bagi aliran kerja terminal, repositori, dan multi-alat. Gunakan usaha penaakulan maksimum + gelung gaya Harness untuk tugasan paling sukar.
- Untuk inferens setempat, muat turun dari Hugging Face dan ikuti resipi rasmi vLLM/SGLang yang mengaktifkan DSpark.
- Integrasi melalui Responses API jika anda sudah menggunakan Codex atau mahukan semantik panggilan alat moden.
- Hos sendiri atau gunakan pemberat dikuantum untuk kawalan kos maksimum dan privasi data.
- Rute dengan pintar — Flash untuk volum, Pro (atau model besar lain) untuk hujung panjang masalah ultra-sukar.
- Pertimbangkan CometAPI untuk akses multi-model dipermudah, terutama jika timbunan anda sudah mencampur DeepSeek dengan penyedia lain.
Kesimpulan
DeepSeek-V4-Flash-0731 mewakili detik penting dalam AI agenik yang cekap. Dengan menyampaikan prestasi agen setara barisan hadapan daripada MoE yang relatif padat (13B aktif) melalui latih lanjut berfokus, dan dengan memasangkannya dengan Harness yang dibina khas serta keserasian API moden (Responses + Codex), DeepSeek telah menetapkan semula jangkaan untuk ejen pengkodan dan automasi yang berkesan kos.
Sama ada anda menghos pemberat terbuka sendiri, memanggil API rasmi, atau merutekan melalui gerbang bersatu seperti CometAPI, V4-Flash-0731 + ekosistem Harness yang berkembang menawarkan asas berprestasi tinggi dan kos efektif untuk generasi seterusnya ejen AI.
Soalan Lazim
Apakah DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 ialah keluaran beta awam rasmi DeepSeek V4 Flash pada DeepSeek API, diumumkan dalam log perubahan 31 Julai 2026. Ia menggantikan versi pratonton sambil mengekalkan nama model API yang sama, deepseek-v4-flash.
Apa yang baharu dalam DeepSeek V4 Flash 0731?
Perubahan utama ialah prestasi penanda aras agenik yang lebih kukuh, sokongan native Responses API, penyesuaian Codex, dan binaan V4 Flash rasmi yang dilatih semula. DeepSeek mengatakan seni bina dan saiz model kekal sama seperti versi pratonton.
Adakah DeepSeek V4 Flash 0731 menyokong Codex?
Ya. Panduan Codex DeepSeek menyatakan hanya deepseek-v4-flash yang kini menyokong integrasi Codex. Ia berfungsi melalui Responses API dan boleh dikonfigurasi untuk Codex CLI, aplikasi desktop ChatGPT, dan sambungan IDE Codex untuk VS Code.
Apakah DeepSeek Harness?
DeepSeek Harness ialah rangka kerja ejen DeepSeek untuk menukar model bahasa kepada ejen autonomi pengkodan atau aliran kerja. Laporan awam menerangkan harness sebagai lapisan yang mengurus alat, konteks, fail, pelaksanaan perintah, dan aliran kerja berbilang langkah. DeepSeek menggunakan mod minimal Harness dalam set penanda aras V4 Flash 0731.
Bagaimanakah saya boleh mengakses DeepSeek V4 Flash melalui CometAPI?
Gunakan titik akhir serasi OpenAI CometAPI dengan ID model deepseek-v4-flash. Halaman model CometAPI menyediakan contoh cURL, Python, dan JavaScript untuk /v1/chat/completions, serta spesifikasi model, harga, dan maklumat masa hidup.
Adakah DeepSeek V4 Flash lebih baik daripada DeepSeek V4 Pro?
Untuk jadual penanda aras 31 Julai, V4 Flash 0731 mengatasi V4-Pro Preview merentasi penanda aras ejen yang disenaraikan. Itu tidak bermakna Flash sentiasa lebih baik daripada Pro. V4 Pro lebih besar dan kekal lebih kuat pada banyak tugasan berat pengetahuan dan penaakulan sukar dalam kad model. Gunakan Flash sebagai lalai untuk aliran kerja ejen sensitif kos dan Pro sebagai laluan eskalasi.
