요약 2026년 9월 27일, MiniMax는 MiniMax Code(및 Token Plan)를 통해 M3.1-Flash-Preview를 조용히 그러나 공식적으로 출시했다. 이는 100만 토큰 전체 컨텍스트 윈도우, 텍스트/이미지/비디오 입력에 대한 네이티브 지원, 새로운 5단계 추론 노력 제어(low → max)를 갖춘 최전선 멀티모달 코딩 모델이다. 버그 수정부터 구현, 테스트, 딜리버리까지의 일상 개발 워크플로에 명확히 포지셔닝되어 있으며, 항상 생각을 켜 둔 상태에서 속도와 비용 효율을 우선시한다.
현 시점에서 이용 가능성은 Token Plan + MiniMax Code(Subscription Key를 통한 API 지원)로 제한된다. 전체 공개 가격표와 오픈 웨이트는 아직 게시되지 않았다. CometAPI는 이미 해당 모델(minimax-m3.1-flash-preview)을 경쟁력 있는 요금으로 제공하고 있어 통합 접근이 용이하다.
핵심 요점
- 100만 토큰 컨텍스트 + 네이티브 멀티모달 — 하나의 윈도우에서 대규모 코드베이스, 긴 에이전트 세션, 문서, 이미지, 비디오를 처리.
- 5단계 reasoning effort(low / medium / high / xhigh / max, 기본값 max) — 필요에 따라 지연시간과 토큰 사용량을 희생해 더 깊은 숙고를 수행. 생각은 비활성화할 수 없음.
- 일상 코딩 집중 — MiniMax Code 내에서 버그 로컬라이제이션 → 구현 → 테스트 → 딜리버리의 폐루프에 최적화.
- 프리뷰 제한 — MiniMax Code와 Token Plan에서 확인됨; API 호출에는 Subscription Key 필요. 독립 모델 카드, 공개 벤치마크, 오픈 웨이트, 단독 종량제 요금은 출시 시점에 발표되지 않음.
- CometAPI 권장 — 단일 OpenAI 호환 엔드포인트(모델 ID: minimax-m3.1-flash-preview)로 접근, 할인 요금 제공. 이미 CometAPI의 500+ 모델 카탈로그를 사용하는 팀에 적합.
MiniMax M3.1-Flash-Preview란?
MiniMax M3.1-Flash-Preview는 MiniMax의 M 시리즈 대규모 언어 모델의 최신작이다. 공식 문서는 이를 “1M 컨텍스트 윈도우와 조절 가능한 사고 깊이를 갖춘 최전선 멀티모달 코딩 모델”로 설명한다. 개발자들이 MiniMax Code의 모델 선택기에서 처음 발견했으며, 2026년 9월 27일 X의 공식 @MiniMaxAgent 계정이 정식으로 확인했다:
“MiniMax의 최신 텍스트 모델, M3.1-Flash-Preview가 오늘 MiniMax Code에서 데뷔합니다. 일상 개발을 위해 제작되었으며, 빠르고 신뢰할 수 있고 실제 업무—빠른 버그 수정부터 완전한 기능 구현까지—에 준비되어 있습니다.”
일반적인 챗 모델과 달리, 본 모델은 소프트웨어 엔지니어링과 에이전트형 워크플로에 특화되어 있다. MiniMax의 제품 메시지는 실무 개발자 작업에 초점을 맞춘다: 빠른 버그 수정, 기능 구현, 경계 사례 처리, 회귀 테스트, 변경 검증. “Flash”라는 명칭은 더 무거운 MiniMax-M3 플래그십 대비 속도와 일상 실용성에 집중한다는 신호이며, 동시에 M3 패밀리의 대형 컨텍스트와 코딩 강점을 계승한다.
모델은 다음을 지원한다:
- 최대 1,000,000 토큰 컨텍스트 — 전체 코드베이스, 장문 문서, 다단계 에이전트 세션에 적합
- 네이티브 멀티모달 입력(텍스트, 이미지, 비디오)
- 에이전트형 추론, 도구 호출, 구조화된 작업 실행
- 5단계 노력 슬라이더로 조절 가능한 항상-온 딥 시킹
생각(Thinking) 콘텐츠는 별도로 반환된다(OpenAI 호환 모드에서는 reasoning_content, Anthropic 호환 모드에서는 thinking 블록), 최종 답변은 표시나 후속 사용을 위해 깔끔하게 유지된다.
100만 토큰 컨텍스트 + 코딩 지향
주요 기술 사양은 1,000,000-토큰 컨텍스트 윈도우다. 이는 MiniMax-M3와 동일하며 대부분의 경쟁 코딩 모델보다 훨씬 크다. 공식 문서는 다음 용도를 강조한다:
- 전체 코드 리포지토리
- 긴 다단계 에이전트 세션
- 대형 문서와 지식 베이스
- 동일 컨텍스트 내 멀티모달 입력(텍스트 + 이미지 + 비디오)
이런 롱 컨텍스트 능력과 네이티브 멀티모달이 결합되어, 과거에는 무거운 컨텍스트 관리나 외부 검색 시스템이 필요했던 워크플로를 가능하게 한다. 개발자는 대규모 코드베이스, 디자인 목업, 오류 스크린샷, 관련 문서를 한 대화에 유지할 수 있다.
모델은 에이전트와 코딩 시나리오에 명시적으로 최적화되었다: 도구 호출, 구조화된 출력, 멀티턴 엔지니어링 작업. 관련 모델의 출력 속도 수치(M3 ≈ 100+ TPS, M2.7-highspeed ≈ 100 TPS)는 Flash 변종이 지연시간/처리량 스펙트럼의 상단을 목표로 함을 시사하지만, M3.1-Flash-Preview 자체의 정확한 TPS 수치는 아직 공개되지 않았다.
5단계 추론 노력
가장 실용적인 새로운 기능 중 하나는 effort(Anthropic 호환) 또는 reasoning_effort(OpenAI 호환) 파라미터로 제어하는 조절 가능한 사고 깊이다. 다섯 수준은 다음과 같다:
| Level | Typical Use Case | Trade-off |
|---|---|---|
| low | 간단한 구문 수정, 빠른 조회 | 최저 지연시간 및 토큰 사용량 |
| medium | 일상적인 리팩터링, 소규모 기능 | 균형형 |
| high | 복잡한 로직, 다중 파일 변경 | 더 깊은 분석 |
| xhigh | 어려운 디버깅, 아키텍처 의사결정 | 더 높은 연산 및 지연 |
| max | 고위험 또는 모호한 문제(기본값) | 최대 숙고 |
M3.1-Flash-Preview에서는 생각이 항상 켜져 있다; 이를 비활성화하려 하면 400 오류가 반환된다. 높은 effort 수준은 내부 추론 토큰을 더 많이 생성하고 지연을 증가시키며, 이전 M 시리즈보다 더 세밀한 제어를 제공해 개발자가 작업 난이도와 비용 제약에 맞춰 행동을 조정할 수 있게 한다.
MiniMax Code에서는 이 제어가 간단한 슬라이더 또는 선택기로 나타난다; API에서는 요청 본문으로 전달된다. 이는 “추론 예산” 노브를 노출해 사용자가 작업 난이도와 비용을 매칭하도록 하는 업계의 성장 추세와 궤를 같이한다.
일상 개발 워크플로
MiniMax는 M3.1-Flash-Preview를 순수 연구나 장기 에이전트 모델이 아니라, 일상 개발자 루프에 정확히 포지셔닝한다. 공식 메시지와 제품 배치는 MiniMax Code 내부의 폐루프 경험, Bug Fixing → Implementation → Testing → Delivery를 강조한다:
- 버그 로컬라이제이션 — 스택 트레이스, 오류 스크린샷, 관련 코드 섹션을 붙여넣으면, 모델이 큰 컨텍스트에서 근본 원인을 식별.
- 구현 — 프로젝트 전반 컨텍스트를 유지하면서 여러 파일에 걸친 코드 생성 또는 편집.
- 테스트 및 검증 — 테스트 제안/작성, 회귀 검사 실행, 영향 분석.
- 딜리버리 — 리뷰 준비가 된 깔끔한 diff, 커밋 메시지, 문서화 출력.
1M 컨텍스트, 멀티모달 입력(예: 실패하는 UI의 스크린샷), 조절 가능한 effort의 조합은 대부분의 엔지니어링 데이를 지배하는 고빈도, 지연 민감 작업에 특히 효과적이다. 출시를 동반한 한시적 프로모션(9월 28일–10월 7일 UTC+8 기간의 일일 체크인 크레딧 2배, Token Plan 쿼터 리셋)은 실사용 테스트를 더욱 장려한다.
현재 이용 가능성 및 프리뷰 제한
2026년 9월 말 기준 확인됨:
- MiniMax Code 내에서 선택 가능(M3, M2.7 등과 함께 모델 선택기에 표시).
- Token Plan / Subscription Key로 제공.
- 공식 MiniMax API 레퍼런스 페이지에 OpenAI 호환 및 Anthropic 호환 예시 문서화.
reasoning_effort또는 동등 필드로 생각 깊이 제어 가능.- 프로모션: Token Plan 쿼터 리셋 및 더블 체크인 포인트(9월 28일 – 10월 7일), 신규 모델에 사용 가능.
확인된 API 경로: 공식 문서는 모델명 MiniMax-M3.1-Flash-Preview를 기재하고, Anthropic 호환(https://api.minimax.io/anthropic)과 OpenAI 호환(https://api.minimax.io/v1) 엔드포인트를 제공한다. Subscription Key(Token Plan)가 필요하다. 예시 파라미터로 output_config.effort 또는 reasoning_effort가 포함된다. 생각 콘텐츠는 별도로 반환된다(thinking 블록 또는 reasoning_content).
아직 제한되었거나 미확인:
- 독립적인 공개 벤치마크 모음과 파라미터 수를 포함한 모델 카드
- MiniMax-M3와 동일 수준의 투명성을 갖춘 단독 종량제 가격 페이지
- 오픈 웨이트(본 프리뷰에 대해 미발표)
프리뷰 상태란 기능, 할당량, 가격이 변경될 수 있음을 의미한다. 개발자는 현재 성능을 최종판이 아닌 참고판으로 간주해야 한다.
MiniMax M3.1-Flash-Preview에 접근하는 방법
1. MiniMax Code 내(인터랙티브 사용에 가장 쉬움)
MiniMax Code를 다운로드하거나 연다(macOS 및 Windows 데스크톱 앱 제공). 모델 선택기에서 M3.1-Flash-Preview를 선택하고 추론 레벨을 조정한다. 일일 체크인 프로모션으로 2026년 10월 초까지 무료 크레딧을 두 배로 받을 수 있다.
2. 공식 MiniMax API(Token Plan)
- MiniMax 콘솔에서 Subscription Key를 발급받는다.
base_url을 변경하고model="MiniMax-M3.1-Flash-Preview"를 설정해 Anthropic 또는 OpenAI SDK를 사용한다.- 원하는 effort 레벨을 전달한다.
3. CometAPI를 통해(멀티 모델 팀에 권장)
CometAPI는 이미 카탈로그에 minimax-m3.1-flash-preview를 게시했으며(작성 시점 기준 20% 할인 요금 표기), OpenAI 호환 엔드포인트(https://api.cometapi.com/v1)를 노출하므로 기존 코드베이스는 base_url과 API 키만 변경하면 된다. 이는 GPT, Claude, Gemini, MiniMax-M3 및 기타 모델을 단일 키로 라우팅하고 일관된 관측·빌링·폴백 로직을 원하는 팀에 특히 편리하다.
예시(Python / OpenAI SDK via CometAPI):
from openai import OpenAI
client = OpenAI(
api_key="YOUR_COMETAPI_KEY",
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="minimax-m3.1-flash-preview",
messages=[{"role": "user", "content": "Refactor this function for clarity..."}],
# reasoning_effort or equivalent may be supported depending on gateway mapping
)
CometAPI의 통합 카탈로그에는 MiniMax-M3, M2.7 시리즈, 신규 H3 비디오 모델도 포함되어 있으며, 하나의 빌링 관계 아래에서 텍스트와 멀티모달 생성 간을 원활히 전환할 수 있다.
