TLDR Ngày 27 tháng 9 năm 2026, MiniMax lặng lẽ nhưng chính thức ra mắt M3.1-Flash-Preview trong MiniMax Code (và qua Token Plan). Đây là một mô hình lập trình đa phương thức tiên tiến với cửa sổ ngữ cảnh đầy đủ 1 triệu token, hỗ trợ gốc đầu vào văn bản/ảnh/video, cùng bộ điều khiển mức nỗ lực suy luận năm cấp (low → max). Định vị rõ ràng cho các quy trình phát triển hàng ngày—từ sửa lỗi đến triển khai, kiểm thử và bàn giao—mô hình ưu tiên tốc độ và hiệu quả chi phí, với chế độ suy nghĩ luôn bật.
Hiện khả dụng giới hạn trong Token Plan + MiniMax Code (hỗ trợ API qua Subscription Key); giá công khai đầy đủ và open weights chưa được công bố. CometAPI đã hiển thị mô hình (minimax-m3.1-flash-preview) với mức giá cạnh tranh, giúp truy cập hợp nhất trở nên đơn giản.
Những điểm chính
- 1M-token context + đa phương thức gốc — Xử lý các codebase lớn, phiên agent dài, tài liệu, hình ảnh và video trong một cửa sổ.
- Five-level reasoning effort (low / medium / high / xhigh / max, mặc định max) — Đánh đổi độ trễ và mức sử dụng token để suy luận sâu hơn theo nhu cầu. Thinking không thể tắt.
- Tập trung cho lập trình hàng ngày — Tối ưu rõ ràng cho vòng kín định vị lỗi → triển khai → kiểm thử → bàn giao trong MiniMax Code.
- Hạn chế bản Preview — Xác nhận trong MiniMax Code và Token Plan; gọi API cần Subscription Key. Chưa có model card độc lập, benchmark công khai, open weights, hay bảng giá pay-as-you-go độc lập tại thời điểm ra mắt.
- Khuyến nghị CometAPI — Truy cập qua một endpoint tương thích OpenAI (model ID: minimax-m3.1-flash-preview) với giá giảm, phù hợp cho đội nhóm đã dùng danh mục 500+ mô hình của CometAPI.
MiniMax M3.1-Flash-Preview là gì?
MiniMax M3.1-Flash-Preview là phiên bản mới nhất trong dòng mô hình M-series của MiniMax. Tài liệu chính thức mô tả đây là “mô hình lập trình đa phương thức tiên tiến với 1M context window và độ sâu suy nghĩ có thể điều chỉnh.” Mô hình lần đầu được các nhà phát triển phát hiện trong trình chọn mô hình của MiniMax Code và được xác nhận chính thức bởi tài khoản @MiniMaxAgent trên X vào ngày 27 tháng 9 năm 2026:
“MiniMax’s latest text model, M3.1-Flash-Preview, debuts today on MiniMax Code. Built for everyday development, it’s fast, reliable, and ready for real work, from quick bug fixes to full features.”
Khác với một mô hình chat tổng quát, mô hình này được thiết kế riêng cho công việc kỹ nghệ phần mềm và các quy trình agentic. Thông điệp sản phẩm của MiniMax nhấn mạnh các tác vụ nhà phát triển trong đời thực: sửa lỗi nhanh, triển khai tính năng, xử lý trường hợp biên, kiểm thử hồi quy và xác minh thay đổi. Ký hiệu “Flash” cho thấy trọng tâm vào tốc độ và tính thực dụng hằng ngày so với flagship MiniMax-M3 nặng hơn, đồng thời vẫn kế thừa ngữ cảnh lớn và thế mạnh lập trình của họ M3.
Mô hình hỗ trợ:
- Tối đa 1.000.000 token ngữ cảnh — phù hợp với toàn bộ codebase, tài liệu dài và phiên agent nhiều bước.
- Đầu vào đa phương thức gốc (văn bản, hình ảnh và video).
- Suy luận agentic, gọi công cụ và thực thi nhiệm vụ có cấu trúc.
- Suy nghĩ luôn bật, có thể điều chỉnh qua thanh trượt nỗ lực năm cấp.
Thinking được trả về riêng (dưới dạng reasoning_content ở chế độ tương thích OpenAI hoặc thinking blocks ở chế độ tương thích Anthropic), giúp câu trả lời cuối cùng sạch để hiển thị hoặc dùng downstream.
Ngữ cảnh 1M token + Định hướng lập trình
Thông số kỹ thuật nổi bật là cửa sổ ngữ cảnh 1.000.000 token. Điều này ngang với MiniMax-M3 và lớn hơn phần lớn các mô hình lập trình cạnh tranh. Tài liệu chính thức nhấn mạnh mức độ phù hợp với:
- Toàn bộ kho mã
- Phiên agent nhiều bước dài
- Tài liệu và kho tri thức lớn
- Đầu vào đa phương thức (văn bản + hình ảnh + video) trong cùng một ngữ cảnh
Khả năng ngữ cảnh dài này, kết hợp với đa phương thức gốc, cho phép các quy trình vốn trước đây cần quản lý ngữ cảnh nặng nề hoặc hệ thống truy xuất bên ngoài. Nhà phát triển có thể giữ các codebase lớn, bản thiết kế, ảnh chụp màn hình lỗi và tài liệu liên quan trong cùng một cuộc hội thoại.
Mô hình được tối ưu rõ ràng cho kịch bản Agent và lập trình: gọi công cụ, output có cấu trúc và tác vụ kỹ thuật nhiều lượt. Số liệu tốc độ xuất cho các mô hình liên quan (M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS) gợi ý các biến thể Flash nhắm tới đầu trên của phổ độ trễ/thông lượng, dù con số TPS chính xác của M3.1-Flash-Preview chưa được công bố.
Nỗ lực suy luận 5 cấp
Một trong những tính năng thực tiễn nhất là độ sâu suy nghĩ có thể điều chỉnh được kiểm soát bởi tham số effort (tương thích Anthropic) hoặc reasoning_effort (tương thích OpenAI). Năm cấp độ gồm:
| Level | Trường hợp sử dụng điển hình | Đánh đổi |
|---|---|---|
| low | Sửa cú pháp đơn giản, tra cứu nhanh | Độ trễ & mức dùng token thấp nhất |
| medium | Refactor thường lệ, tính năng nhỏ | Cân bằng |
| high | Logic phức tạp, thay đổi nhiều file | Phân tích sâu hơn |
| xhigh | Gỡ lỗi khó, quyết định kiến trúc | Tăng compute & độ trễ |
| max | Vấn đề mơ hồ hoặc rủi ro cao (mặc định) | Suy luận tối đa |
Thinking luôn bật với M3.1-Flash-Preview; cố gắng tắt sẽ trả về lỗi 400. Cấp nỗ lực cao hơn tạo ra nhiều token suy luận nội bộ và tăng độ trễ, cho phép nhà phát triển điều chỉnh tinh theo độ khó nhiệm vụ và ràng buộc chi phí—mức độ chi tiết vốn kém linh hoạt hơn trên các mô hình M-series trước đây.
Trong MiniMax Code, điều khiển này xuất hiện dưới dạng thanh trượt hoặc bộ chọn đơn giản; qua API, nó được truyền trong phần thân yêu cầu. Thiết kế này phản ánh xu hướng ngành ngày càng minh bạch “ngân sách suy luận” để người dùng khớp hành vi mô hình với độ khó tác vụ và chi phí.
Quy trình phát triển hằng ngày
MiniMax định vị M3.1-Flash-Preview đúng trong vòng lặp công việc hằng ngày của nhà phát triển thay vì mô hình nghiên cứu thuần túy hay agent tầm nhìn dài. Thông điệp và vị trí sản phẩm chính thức nhấn mạnh trải nghiệm vòng kín trong MiniMax Code, Sửa lỗi → Triển khai → Kiểm thử → Bàn giao:
- Định vị lỗi — Dán stack trace, ảnh chụp màn hình lỗi hoặc phần mã liên quan; mô hình có thể suy luận trên ngữ cảnh lớn để xác định nguyên nhân gốc.
- Triển khai — Tạo hoặc chỉnh sửa mã trên nhiều file trong khi giữ ngữ cảnh toàn dự án.
- Kiểm thử & xác minh — Gợi ý hoặc viết test, chạy kiểm thử hồi quy và phân tích tác động.
- Bàn giao — Tạo diff sạch, thông điệp commit hoặc tài liệu sẵn sàng review.
Kết hợp ngữ cảnh 1M, đầu vào đa phương thức (ví dụ ảnh chụp giao diện lỗi) và mức nỗ lực có thể điều chỉnh khiến mô hình đặc biệt hiệu quả cho các tác vụ tần suất cao, nhạy độ trễ vốn chiếm phần lớn ngày làm việc của kỹ sư. Các ưu đãi ra mắt trong thời gian giới hạn (nhân đôi điểm check-in hằng ngày từ 28/9–7/10 theo UTC+8 và reset quota Token Plan) khuyến khích thử nghiệm thực tế.
Tình trạng khả dụng hiện tại và hạn chế bản Preview
Đã xác nhận vào cuối tháng 9/2026:
- Có thể chọn trong MiniMax Code (trình chọn mô hình cạnh M3, M2.7, v.v.).
- Khả dụng qua Token Plan / Subscription Key.
- Được ghi trong trang tham chiếu API chính thức của MiniMax với ví dụ tương thích OpenAI và Anthropic.
- Có thể điều khiển độ sâu suy nghĩ qua
reasoning_efforthoặc trường tương đương. - Hoạt động khuyến mãi: reset quota Token Plan và nhân đôi điểm check-in (28/9 – 7/10) dùng được cho mô hình mới.
Đường dẫn API đã xác nhận: Tài liệu chính thức liệt kê tên mô hình MiniMax-M3.1-Flash-Preview và cung cấp cả endpoint tương thích Anthropic (https://api.minimax.io/anthropic) và tương thích OpenAI (https://api.minimax.io/v1). Cần Subscription Key (Token Plan). Ví dụ tham số gồm output_config.effort hoặc reasoning_effort. Thinking được trả về riêng (thinking blocks hoặc reasoning_content).
Vẫn hạn chế hoặc chưa xác nhận:
- Bộ benchmark công khai độc lập đầy đủ và model card với số tham số.
- Trang giá pay-as-you-go độc lập với mức minh bạch như MiniMax-M3.
- Open weights (chưa công bố cho bản Preview).
Tình trạng Preview nghĩa là tính năng, quota và giá có thể thay đổi. Nhà phát triển nên coi hiệu năng hiện tại là mang tính tham khảo hơn là cuối cùng.
Cách truy cập MiniMax M3.1-Flash-Preview
1. Trong MiniMax Code (dễ nhất cho dùng tương tác)
Tải hoặc mở MiniMax Code (ứng dụng desktop cho macOS và Windows). Chọn M3.1-Flash-Preview từ trình chọn mô hình và điều chỉnh mức nỗ lực suy nghĩ. Khuyến mãi check-in hằng ngày có thể nhân đôi credit miễn phí đến đầu tháng 10/2026.
2. API chính thức của MiniMax (Token Plan)
- Lấy Subscription Key từ console của MiniMax.
- Dùng SDK Anthropic hoặc OpenAI bằng cách thay
base_urlvà đặtmodel="MiniMax-M3.1-Flash-Preview". - Truyền mức effort mong muốn.
3. Qua CometAPI (khuyến nghị cho đội dùng đa mô hình)
CometAPI đã liệt kê minimax-m3.1-flash-preview trong danh mục (với giá giảm 20% tại thời điểm viết). Vì CometAPI cung cấp endpoint tương thích OpenAI (https://api.cometapi.com/v1), các codebase hiện tại chỉ cần đổi base_url và API key. Điều này đặc biệt tiện cho đội nhóm đã định tuyến GPT, Claude, Gemini, MiniMax-M3 và các mô hình khác qua một khóa duy nhất, muốn quan sát, thanh toán và logic dự phòng nhất quán.
Ví dụ (Python / OpenAI SDK qua CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactor this function for clarity..."}],
# reasoning_effort or equivalent may be supported depending on gateway mapping
)
Danh mục hợp nhất của CometAPI cũng bao gồm MiniMax-M3, dòng M2.7 và các mô hình video H3 mới, cho phép chuyển đổi liền mạch giữa sinh văn bản và đa phương thức dưới một quan hệ thanh toán.
