MiMo-V2.5의 기술 사양
| 사양 | MiMo-V2.5 |
|---|---|
| 모델 ID | mimo-v2.5 |
| 제공자 | Xiaomi MiMo |
| 모델 유형 | 네이티브 옴니모달 파운데이션 모델 |
| 아키텍처 | 스파스 전문가 혼합(MoE) |
| 총 파라미터 수 | 310B |
| 활성화 파라미터 | 15B |
| 컨텍스트 윈도우 | 1M 토큰 |
| 최대 출력 | 128K 토큰 |
| 입력 모달리티 | 텍스트, 이미지, 비디오, 오디오 |
| 출력 | 텍스트 |
| 비전 인코더 | 729M-파라미터 ViT |
| 오디오 인코더 | 261M-파라미터 오디오 트랜스포머 |
| 도구 호출, 웹 검색, 구조화된 출력, 스트리밍, 컨텍스트 캐싱 | 예 |
| 라이선스 | MIT |
310B/15B 아키텍처는 특히 중요합니다. MiMo-V2.5는 전통적인 의미에서 15B 모델이 아닙니다. 15B는 토큰당 활성화되는 파라미터 수이며, 전체 MoE는 310B 파라미터로 구성됩니다. 이 모델은 256개의 라우팅되는 전문가를 사용하며 토큰당 8개의 전문가를 활성화합니다.
MiMo-V2.5란 무엇인가?
MiMo-V2.5는 옴니모달 지각과 에이전트형 애플리케이션을 중심으로 구축된 Xiaomi의 차세대 멀티모달 모델입니다.
일반적인 텍스트 전용 LLM과 달리, MiMo-V2.5는 이미지, 비디오, 오디오, 텍스트를 네이티브하게 이해합니다. Xiaomi는 이를 장문 컨텍스트와 멀티모달 에이전트 시나리오, 즉 모델이 정보를 지각하고 추론한 뒤 도구를 사용하거나 행동을 수행해야 하는 상황에 포지셔닝합니다.
또한 개발자에게 중요한 현재 버전 관련 사항이 있습니다. Xiaomi는 2026년 6월 30일자로 기존 MiMo-V2 모델을 사용 중단(Deprecated)했으며, V2.5 시리즈로의 마이그레이션을 권장합니다.
따라서 새로운 통합에는 mimo-v2.5가 적절한 모델 ID이며, 이전의 mimo-v2-pro, mimo-v2-omni, mimo-v2-flash는 해당하지 않습니다.
MiMo-V2.5의 주요 특징은 무엇인가?
네이티브 옴니모달 이해
MiMo-V2.5의 결정적 특징은 멀티모달리티가 모델 내부에 직접 통합되어 있다는 점입니다.
이 모델은 다음을 입력으로 받습니다:
- 텍스트
- 이미지
- 비디오
- 오디오
이는 각 모달리티를 독립적으로 처리한 뒤 텍스트 LLM에 결과를 전달하는 대신, 여러 정보 유형을 통합적으로 추론하는 애플리케이션을 개발할 수 있게 합니다. Xiaomi는 이를 네이티브 풀모달 지각이라고 설명합니다.
실용적인 예로는 오디오 트랙과 텍스트 질문이 함께 주어진 긴 비디오를 입력받아 이벤트를 식별하고, 발생한 일을 설명하며, 구조화된 답변을 생성하는 비디오 분석 에이전트를 들 수 있습니다.
1M-토큰 컨텍스트 윈도우
MiMo-V2.5는 100만 토큰 컨텍스트와 최대 128K 출력 토큰을 지원합니다.
이는 모델을 다음과 같은 분야에서 특히 흥미롭게 만듭니다:
- 대규모 문서 분석
- 장시간 비디오 이해
- 리포지토리 수준 코딩
- 장기 리서치 세션
- 다단계 에이전트
- 장시간 대화
- 대규모 엔터프라이즈 지식 베이스
1M 컨텍스트는 단순한 마케팅 수치가 아닙니다. Xiaomi는 긴 비디오 추적, 장문의 문서 분석, 장기적 시간 추론을 목표 워크로드로 명시하고 있습니다.
에이전트형 도구 사용
MiMo-V2.5는 함수 호출, 웹 검색, 구조화된 출력, 스트리밍을 지원합니다.
이는 단순 텍스트 생성에 제한된 모델에 비해 에이전트 애플리케이션에 훨씬 더 유용합니다.
전형적인 워크플로는 다음과 같습니다:
인지 → 추론 → 검색 → 도구 호출 → 결과 분석 → 계속
이는 리서치 에이전트, 코딩 어시스턴트, 고객 지원 에이전트, 멀티모달 자동화에 특히 유용합니다.
스파스 MoE 효율성
MiMo-V2.5는 310B 파라미터의 스파스 MoE 아키텍처를 사용하면서 토큰당 활성화 파라미터는 15B에 불과합니다.
백본은 48개 레이어로 구성되며, 이 중 39개는 슬라이딩 윈도우 어텐션 레이어이고 9개는 전역 어텐션 레이어입니다. 이러한 하이브리드 설계는 매우 긴 컨텍스트를 보다 계산 효율적으로 처리하게 합니다.
개발자에게 중요한 점은 활성화 파라미터 수를 전체 메모리 요구 사항으로 해석해서는 안 된다는 것입니다. 310B-파라미터 모델의 자가 호스팅은 여전히 상당한 인프라를 필요로 합니다.
하이브리드 슬라이딩 윈도우 어텐션
MiMo-V2.5는 슬라이딩 윈도우 어텐션과 전역 어텐션을 결합합니다.
아키텍처는 128-토큰 SWA 윈도우를 사용하며, 39개의 SWA 레이어와 9개의 전역 어텐션 레이어로 구성됩니다.
이러한 아키텍처 선택은 1M-토큰 컨텍스트 기능과 특히 밀접한 관련이 있습니다. 모든 레이어에서 전역 어텐션을 유지하면 장문 컨텍스트 추론 비용이 크게 증가하기 때문입니다.
다중 토큰 예측
MiMo-V2.5에는 약 329M 파라미터 규모의 3개 MTP 레이어가 포함됩니다. MTP 설계는 추측적 디코딩을 통해 추론 효율을 개선하고 보다 효율적인 강화학습 훈련을 지원하기 위한 것입니다.
벤치마크에서 MiMo-V2.5의 성능은?
MiMo-V2.5는 코딩, 터미널 에이전트, 리서치 에이전트, 멀티모달 에이전트 작업에 대한 벤치마크 결과를 공개했습니다. 현재 Hugging Face 모델 카드는 다음과 같은 결과를 보고합니다:
| 벤치마크 | MiMo-V2.5 | 평가 초점 |
|---|---|---|
| SWE-Bench Pro | 56.1 | 소프트웨어 공학 |
| Terminal-Bench 2.0 | 65.8 | 터미널/에이전트 작업 |
| Claw-Eval General | 62.1 Pass³% | 일반 에이전트 역량 |
| Claw-Eval Multimodal | 23.8 Pass³% | 멀티모달 에이전트 역량 |
| Claw-Eval Multi-Turn | 63.2 Pass³% | 멀티 턴 에이전트 |
| ResearchClawBench | 16.91 | 리서치 에이전트 작업 |
이 수치는 신중히 해석할 필요가 있습니다.
56.1 SWE-Bench Pro 결과는 의미 있는 소프트웨어 엔지니어링 역량을 시사하며, 65.8 Terminal-Bench 2.0 결과는 터미널과 개발 환경과 상호작용하는 에이전트에 특히 중요합니다.
동시에, 일반 Claw-Eval 점수(62.1)와 멀티모달 점수(23.8) 간의 차이는 유용한 경고입니다. 강력한 일반 에이전트 성능이 모든 멀티모달 에이전트 작업에서 같은 수준의 성능을 자동으로 의미하지는 않습니다.
프로덕션 평가에서는 단일 리더보드 수치에 의존하기보다 자체 워크로드에 대한 테스트가 필요합니다.
MiMo-V2.5와 MiMo-V2.5-Pro는 어떻게 비교되나?
MiMo-V2.5와 MiMo-V2.5-Pro는 동일한 V2.5 세대에 속하지만 최적화 목표가 다릅니다.
| 사양 | MiMo-V2.5 | MiMo-V2.5-Pro |
|---|---|---|
| 총 파라미터 수 | 310B | 1.02T |
| 활성화 파라미터 | 15B | 42B |
| 컨텍스트 | 1M | 1M |
| 멀티모달 입력 | 텍스트/이미지/비디오/오디오 | 에이전트 중심 |
| 주요 포지셔닝 | 옴니모달 에이전트 | 복잡한 에이전트 및 코딩 |
| 라우팅되는 전문가 수 | 256 | 384 |
| 토큰당 전문가 수 | 8 | 8 |
| LLM 레이어 수 | 48 | 70 |
| MTP 레이어 수 | 3 | 3 |
구분은 명확합니다:
네이티브 멀티모달 이해와 효율적인 범용 에이전트에는 MiMo-V2.5를 선택하세요. 가장 어려운 추론, 코딩, 장기적 에이전트 워크로드에는 MiMo-V2.5-Pro를 선택하세요.
Xiaomi의 모델 선택 가이드는 이미지, 오디오, 비디오 콘텐츠 이해에는 mimo-v2.5를, 복잡한 추론과 장문 문서 처리에는 mimo-v2.5-pro를 권장합니다.
MiMo-V2.5의 활용 사례
멀티모달 AI 에이전트
MiMo-V2.5는 문서, 이미지, 비디오, 오디오를 점검한 뒤 수행할 행동을 결정해야 하는 에이전트의 중심 모델로 사용할 수 있습니다.
장문 컨텍스트 문서 분석
1M-토큰 컨텍스트는 다음을 분석하는 데 적합합니다:
- 대규모 법률 문서 컬렉션
- 기술 문서
- 연구 아카이브
- 대규모 코드베이스
- 엔터프라이즈 지식 베이스
코딩 에이전트
모델의 에이전트 벤치마크와 도구 사용 기능은 리포지토리를 점검하고, 버그를 추론하며, 도구를 실행하고, 해법을 반복하는 코딩 어시스턴트에 적합합니다.
비디오 이해
MiMo-V2.5는 비디오 생성을 주요 목적처럼 취급하지 않고, 이해를 위한 입력 모달리티로 활용합니다.
잠재적 활용 예는 다음과 같습니다:
- 비디오 요약
- 장시간 비디오 질의응답
- 비디오 검색
- 이벤트 감지
- 교육용 비디오 분석
- 보안 영상 분석
오디오-비주얼 어시스턴트
이 모델은 오디오와 시각 정보를 모두 입력으로 받기 때문에, 음성 지시와 시각적 문맥을 함께 해석할 수 있는 어시스턴트를 구축할 수 있습니다.
장기 실행 자율 에이전트
긴 컨텍스트와 에이전트형 학습의 결합은 모델이 단일 응답으로 작업을 끝내는 대신 많은 중간 단계를 거치며 상태를 유지해야 하는 워크플로에 적합합니다.
MiMo-V2.5의 한계
MiMo-V2.5의 사양은 인상적이지만, 몇 가지 실무적 한계에 주의할 필요가 있습니다.
첫째, 1M 컨텍스트가 모든 애플리케이션에서 최대 윈도우에서 최적의 성능을 보장한다는 뜻은 아닙니다. 장문 컨텍스트 추론은 여전히 상당한 메모리, 대역폭, 지연 시간을 수반합니다.
둘째, 이 모델은 매우 큰 MoE 시스템입니다. 토큰당 활성화 파라미터는 15B에 불과하지만 전체 모델은 약 310B 파라미터로 구성되어, 소형 밀집(dense) 모델을 실행하는 것보다 자가 호스팅이 훨씬 더 까다롭습니다.
셋째, 멀티모달 벤치마크 성능은 작업에 따라 크게 달라질 수 있습니다. Claw-Eval 결과는 일반 에이전트 점수보다 훨씬 낮은 멀티모달 점수를 보여주며, 애플리케이션별 테스트의 필요성을 강화합니다.
마지막으로, 이 모델의 생태계는 GPT, Claude, Gemini 등 성숙한 생태계에 비해 아직 새롭습니다. 따라서 미션 크리티컬한 프로덕션에 사용하기 전, 도구 체인, 공급자 호환성, 구조화된 출력 동작, 도구 호출 신뢰성을 평가해야 합니다.
CometAPI에서 MiMo-V2.5 API 사용 방법
MiMo-V2.5는 확립된 LLM 에코시스템과 호환되는 API 패턴을 따르므로 API 집계 플랫폼에 특히 적합합니다. Xiaomi 자체도 OpenAI 및 Anthropic 호환 API 액세스를 제공합니다.
CometAPI를 사용하면, 다른 지원 모델에 사용되는 것과 동일한 기본 워크플로를 따라 통합할 수 있습니다.
1단계: CometAPI API 키 받기
CometAPI 계정을 생성하거나 로그인하여 API 키를 발급받습니다.
import os
COMETAPI_KEY = os.environ["COMETAPI_KEY"]
2단계: MiMo-V2.5 모델 구성
모델을 다음으로 설정하세요:
mimo-v2.5
그리고 CometAPI의 호환 API 엔드포인트를 사용합니다.
정확한 엔드포인트와 요청 스키마는 배포 전에 최신 CometAPI 모델/API 문서를 확인해야 합니다.
3단계: 멀티모달 및 에이전트 워크플로 구축
mimo-v2.5의 더 흥미로운 활용은 일반 텍스트 채팅이 아닙니다. 개발자는 멀티모달 추론을 외부 도구와 결합해 다음과 같은 워크플로를 만들 수 있습니다:
사용자 입력 → 이미지/비디오/오디오 이해 → 추론 → 도구 호출 → 결과 분석 → 다음 행동
이는 자율 연구 에이전트, 코딩 에이전트, 멀티모달 고객 지원 시스템, 장문 컨텍스트 엔터프라이즈 어시스턴트에 특히 매력적입니다.
왜 CometAPI를 통해 MiMo-V2.5를 사용해야 하나요?
MiMo-V2.5는 멀티 모델 API 환경에서 특히 유용합니다. 개발자는 각 공급자별로 별도의 인프라 스택을 구축하지 않고도 GPT, Claude, Gemini, DeepSeek 또는 다른 에이전트 모델과 비교하고자 할 수 있기 때문입니다.
애플리케이션에 다음이 필요할 때 CometAPI가 유용합니다:
- 통합 API 레이어
- 다수의 AI 모델 패밀리에 대한 접근
- 쉬운 모델 전환
- API 키 중앙 관리
- 빠른 모델 비교
- 실험과 프로덕션을 위한 단일 통합 레이어
에이전트 성능과 추론 비용을 비교 평가하는 팀에게, MiMo-V2.5는 가장 비싼 플래그십 모델이 자동으로 최선의 선택이라고 가정하기보다 함께 테스트해 볼 가치가 있습니다.