MiMo-V2.5-Pro의 기술 사양
| 사양 | MiMo-V2.5-Pro |
|---|---|
| 모델 ID | mimo-v2.5-pro |
| 제공사 | Xiaomi MiMo |
| 모델 유형 | 에이전틱 대형 언어 모델 |
| 아키텍처 | 희소 Mixture-of-Experts |
| 총 파라미터 수 | 1.02T |
| 활성 파라미터 수 | 42B |
| 컨텍스트 윈도우 | 1M tokens |
| 출력 | 텍스트 |
| 어텐션 아키텍처 | 하이브리드 SWA + 글로벌 어텐션 |
| 학습 토큰 수 | 27T |
| 기본 모델 최대 컨텍스트 | 256K |
| Pro 최대 컨텍스트 | 1M |
| 라이선스 | MIT |
1.02T 총 파라미터와 42B 활성 파라미터의 차이는 중요합니다. MiMo-V2.5-Pro는 MoE 모델로, 각 토큰은 사용 가능한 파라미터의 일부만 활성화합니다. 이는 조밀한 1T-파라미터 모델과 비교할 때 추론 연산 프로파일을 크게 변화시키지만, 전체 모델은 여전히 막대한 메모리와 배포 요구사항을 가집니다.
MiMo-V2.5-Pro의 주요 기능은 무엇인가요?
1. 조 단위 규모의 희소 MoE 아키텍처
MiMo-V2.5-Pro는 1.02T 총 파라미터와 42B 활성 파라미터를 포함합니다.
아키텍처는 **384개의 라우팅되는 전문가(Experts)**로 구성되며, 토큰당 8개 전문가가 활성화됩니다. 모델은 70개의 트랜스포머 레이어로 이루어져 있으며, 밀집 레이어 1개와 MoE 레이어 69개로 구성됩니다.
이는 표준 MiMo-V2.5보다 훨씬 큰 표현 용량을 제공하면서도, 매 토큰마다 1.02T 전체 파라미터를 모두 활성화하는 연산 비용을 피합니다.
핵심 요약은 다음과 같습니다:
MiMo-V2.5-Pro는 총 용량 기준으로 조 단위 파라미터 모델이지만, 토큰당 연산은 42B 활성 파라미터 경로에 의해 결정됩니다.
2. 100만 토큰 컨텍스트
모델은 최대 1M 토큰의 컨텍스트를 지원합니다.
이는 자율 에이전트에 특히 중요한 역량으로, 장기간 실행되는 워크플로가 다음과 같은 내용을 축적할 수 있기 때문입니다:
- 도구 출력
- 소스 코드
- 검색 결과
- 문서
- 중간 추론 상태
- 사용자 지시사항
- 실행 로그
더 이상 이전 컨텍스트를 반복적으로 요약해 버리지 않고, 훨씬 더 큰 작업 이력을 유지할 수 있습니다.
Xiaomi의 장문맥 평가는 입력 토큰 32K에서 1M까지 모델을 구체적으로 테스트합니다.
3. 하이브리드 슬라이딩 윈도우 및 글로벌 어텐션
MiMo-V2.5-Pro는 SWA 대 글로벌 어텐션 비율을 6:1로 사용하며, 128토큰 슬라이딩 윈도우를 채택합니다.
아키텍처는 다음을 포함합니다:
- SWA 레이어 60개
- 글로벌 어텐션 레이어 10개
- 128토큰 SWA 윈도우
Xiaomi에 따르면, 이 설계는 학습 가능한 attention-sink 바이어스를 통해 장문맥 성능을 유지하면서 KV 캐시 저장량을 거의 7배 줄입니다.
이는 모델에서 가장 기술적으로 중요한 부분 중 하나입니다.
1M 컨텍스트 윈도우는 모든 레이어가 전체 시퀀스에 대해 풀 어텐션을 수행한다면 비용이 많이 듭니다. 하이브리드 어텐션은 각 레이어가 전역적으로 주의를 기울여야 하는 정보량을 줄이는 동시에, 장거리 관계를 위해 전용 글로벌 어텐션 레이어를 유지합니다.
4. 다중 토큰 예측
MiMo-V2.5-Pro에는 경량 MTP 모듈 3개가 포함됩니다.
다중 토큰 예측은 모델이 여러 미래 토큰을 예측하도록 하여, 추측형 디코딩과 유사한 방식으로 추론 가속에 활용할 수 있게 합니다.
Xiaomi는 설명된 배포 구성에서 MTP 아키텍처가 추론 중 출력 속도를 최대 3배 높일 수 있다고 보고합니다.
이는 에이전트에 특히 중요합니다. 에이전트는 긴 경로에서 대량의 중간 출력을 생성할 수 있으므로, 토큰 생성 속도의 향상은 전체 작업 지연 시간에 의미 있는 영향을 줄 수 있습니다.
5. 에이전틱 강화학습
MiMo-V2.5-Pro의 후처리 학습 파이프라인에는 다음이 포함됩니다:
- 지도 미세조정
- 대규모 에이전틱 강화학습
- 다중 교사 온-폴리시 증류(MOPD)
학습 목적은 단지 정적 벤치마크 질의응답에 국한되지 않고, 복잡한 에이전트 행동에 명시적으로 초점을 맞춥니다.
이 때문에 모델의 가장 강력한 평가는 코딩, 터미널 상호작용, 장문맥 추론, 에이전트 벤치마크에 집중되어 있습니다.
6. 27T 토큰 프리트레이닝
MiMo-V2.5-Pro는 약 27조(27T) 토큰으로 프리트레이닝되었으며, FP8 혼합 정밀도와 기본 32K 시퀀스 길이를 사용한 뒤 1M 컨텍스트 윈도우를 지원하도록 확장되었습니다.
프리트레이닝 규모와 조 단위 파라미터 MoE 아키텍처의 결합은 MiMo-V2.5-Pro를 현재의 최전선급 모델로 확고히 위치시킵니다.
벤치마크에서 MiMo-V2.5-Pro의 성능은?
공개된 평가 결과는 일반적 추론 벤치마크와 실용적인 코딩/에이전트 평가를 모두 포함하고 있어 특히 유용합니다.
| 벤치마크 | MiMo-V2.5-Pro 결과 | 평가 유형 |
|---|---|---|
| SWE-Bench Verified | 78.9 | 소프트웨어 엔지니어링 |
| SWE-Bench Pro | 57.2 | 소프트웨어 엔지니어링 |
| Terminal-Bench 2.0 | 68.4 | 터미널 에이전트 |
| GSM8K | 99.6 | 수학적 추론 |
| GPQA Diamond | 66.7 | 대학원 수준 추論 |
| MMLU-Pro | 68.5 | 일반 추론 |
| MMLU | 89.4 | 일반 지식/추론 |
| MMLU-Redux | 92.8 | 일반 지식/추론 |
| HumanEval+ | 75.6 | 코드 생성 |
| MBPP+ | 74.1 | Python 프로그래밍 |
| LiveCodeBench v6 | 39.6 | 경쟁적 코딩 |
| ARC-Challenge | 97.2 | 추론 |
| AIME 2024/2025 | 37.3 | 경시 수학 |
결과는 소프트웨어 엔지니어링과 수학적 추론에서 특히 강력한 프로파일을 보여줍니다. SWE-Bench Verified의 78.9와 Terminal-Bench 2.0의 68.4는 자율 코딩 시스템을 구축하는 개발자에게 특히 의미가 있습니다.
장문맥 성능
표준 벤치마크보다 장문맥 결과가 더 흥미롭습니다.
GraphWalks 평가에서 MiMo-V2.5-Pro는 극단적인 컨텍스트 길이에서도 측정 가능한 성능을 유지합니다:
| 컨텍스트 | BFS | Parents |
|---|---|---|
| 512K | 0.56 | 0.92 |
| 1M | 0.37 | 0.62 |
Xiaomi에 따르면, 이전 MiMo-V2-Pro는 128K를 넘어가면 급격히 악화되어 1M에서 두 하위 작업 모두 0.00에 도달하는 반면, V2.5-Pro는 전체 1M 컨텍스트에서도 0이 아닌 성능을 유지합니다.
이는 의미 있는 차이입니다. MiMo-V2.5-Pro의 1M 컨텍스트는 단지 이론적 최대치가 아니라, 공개된 장문맥 평가에서 그 창 깊은 영역까지 유용한 성능을 입증합니다.
실세계 에이전트 사례
| 작업 | 보고된 결과 |
|---|---|
| PKU SysY 컴파일러 | 4.3 hours |
| 컴파일러 작업 중 도구 호출 | 672 |
| 통과한 컴파일러 테스트 케이스 | 233/233 |
| 풀스택 비디오 편집기 | 11.5 hours |
| 비디오 편집기용 생성된 코드 | 8,192 lines |
| 인간 개입 | 보고 없음 |
| 장기 호라이즌 도구 호출 | 거의 1,000 |
이들은 표준화된 벤치마크 점수라기보다 Xiaomi가 보고한 데모입니다.
MiMo-V2.5-Pro vs MiMo-V2.5
두 모델은 동일한 세대이지만 서로 다른 워크로드를 목표로 합니다.
| 사양 | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| 총 파라미터 수 | 310B | 1.02T |
| 활성 파라미터 수 | 15B | 42B |
| 컨텍스트 | 1M | 1M |
| 레이어 수 | 48 | 70 |
| 라우팅되는 전문가 수 | 256 | 384 |
| 토큰당 전문가 수 | 8 | 8 |
| 풀 어텐션 레이어 | 9 | 10 |
| SWA 레이어 | 39 | 60 |
| 주된 초점 | 옴니모달 에이전트 | 복잡한 에이전트/코딩 |
| 비디오/오디오/이미지 이해 | 예 | 주로 언어/에이전트 중심 |
| 장기 호라이즌 에이전트 성능 | 강력 | 플래그십 |
따라서 선택은 단순히 "Pro가 더 낫다"가 아닙니다.
애플리케이션에 네이티브 이미지, 비디오, 오디오 이해가 필요하다면 MiMo-V2.5가 더 자연스러운 선택입니다. 워크로드가 복잡한 추론, 소프트웨어 엔지니어링, 터미널 상호작용, 장시간 동작하는 에이전트에 집중된다면 MiMo-V2.5-Pro가 더 적합합니다.
MiMo-V2.5-Pro의 한계
1. 텍스트 전용 모델 입력
mimo-v2.5와 달리, Pro 모델의 공식 사양은 입력 모달리티로 Text를 명시합니다. V2.5 제품군의 멀티모달 모델로 마케팅해서는 안 됩니다.
2. 자체 호스팅을 위한 높은 연산 요구사항
이 모델은 약 1T 총 파라미터 / 42B 활성 파라미터를 가지므로, 로컬 배포는 일반적인 소형 오픈 모델보다 훨씬 더 높은 요구사항을 갖습니다.
3. 에이전트 성능은 프레임워크에 의존
Xiaomi의 약 1,000회 도구 호출 주장은 적절한 에이전트 프레임워크 사용과 명시적으로 연계됩니다. 모델만으로 동일한 장기 호라이즌 성능을 보장하지는 않습니다.
4. 추론 콘텐츠 처리
생각 모드와 도구 호출을 사용하는 다중 턴 에이전트 애플리케이션은 reasoning_content를 올바르게 보존해야 합니다. 잘못 처리하면 API 오류가 발생할 수 있습니다.
최적의 활용 사례
대규모 소프트웨어 엔지니어링
- 리포지토리 마이그레이션
- 리팩터링
- 디버깅
- 테스트 생성
- 컴파일러 개발
- 풀스택 애플리케이션 개발
자율 코딩 에이전트
MiMo-V2.5-Pro는 다음을 반복적으로 수행해야 하는 에이전트에 특히 적합합니다:
검토 → 수정 → 실행 → 테스트 → 진단 → 수정
장문서 추론
1M 컨텍스트는 다음에 유용합니다:
- 법률 계약
- 기술 사양
- 대규모 연구 컬렉션
- 엔터프라이즈 문서
복잡한 비즈니스 에이전트
도구 호출 + 웹 검색 + 구조화 출력은 다음을 지원할 수 있습니다:
- 리서치 에이전트
- 데이터 처리 에이전트
- 엔터프라이즈 워크플로 자동화
- 다단계 의사결정 시스템
CometAPI에서 MiMo-V2.5-Pro API 사용 방법
관련 CometAPI 모델 ID는 다음과 같습니다:
mimo-v2.5-pro
개발자에게는 API 집계 레이어가 특히 유용하여, 독립적인 제공자 통합 없이도 MiMo-V2.5-Pro를 다른 고급 추론/에이전트 모델과 비교 테스트할 수 있습니다.
1단계: CometAPI API 키 받기
CometAPI 계정을 생성하거나 로그인한 후 API 콘솔에서 API 키를 발급받으세요.
환경 변수로 설정합니다:
export COMETAPI_KEY="YOUR_COMETAPI_KEY"
2단계: API 클라이언트 구성
Xiaomi는 OpenAI 및 Anthropic 프로토콜과 호환되는 API를 제공하므로 마이그레이션이 비교적 간단합니다. 프로덕션 통합에서는 mimo-v2.5-pro에 대한 최신 CometAPI 엔드포인트/스키마를 사용하세요. 특히 도구 호출, 스트리밍, 구조화 출력, 장문맥 요청 같은 고급 기능이 필요하다면 이를 준수해야 합니다.
3단계: MiMo-V2.5-Pro를 도구에 연결
모델은 외부 도구에 연결될 때 훨씬 더 유용해집니다.
예시:
┌── Web Search
│
User → MiMo-V2.5-Pro ├── GitHub
│
├── Terminal
│
├── Database
│
└── Internal APIs
↓
Tool Results
↓
MiMo-V2.5-Pro
↓
Final Result
이 아키텍처는 단순한 챗봇 통합보다 모델의 의도된 사용 방식과 훨씬 더 잘 부합합니다.