GPT-6.1 Sol are now live on CometAPI →
ai-model/CometAPI 리서치

MiMo-V2.5란? 사양, 벤치마크, 기능, 가격 및 API 액세스

Xiaomi MiMo-V2.5의 사양, 아키텍처, 공식 벤치마크, 가격, MiMo-V2.5-Pro 비교, 사용 사례, 제한 사항 및 CometAPI 액세스를 탐색하세요.

CometAPI
Deon GoodwinAI 모델 및 API 리서치 팀
업데이트됨 Oct 5, 2026 10 분 읽기
MiMo-V2.5란? 사양, 벤치마크, 기능, 가격 및 API 액세스
이 패턴 사용

첫 API 호출하기.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

요약

Xiaomi의 표준 V2.5 모델은 네이티브 텍스트·이미지·비디오·오디오 이해를 100만 토큰 컨텍스트 윈도우, 도구 사용, 희소 전문가 혼합(MoE) 효율성과 결합한다. 멀티모달 입력과 작업 완료당 비용이 중요한 경우 더 적합하다. Pro 변형은 더 크고 까다로운 코딩 및 장기 호라이즌 에이전트 작업에서 강하지만, 텍스트 입력 중심이며 Xiaomi 공시 요금 기준 토큰당 약 3배의 비용이 든다.

실무적 선택은 단순하다: 멀티모달 에이전트, 문서·미디어 분석, 대량 자동화에는 표준 모델을 선택하고, 난이도 높은 소프트웨어 엔지니어링이나 지속적인 자율 실행이 병목이라면 Pro를 선택하라.

핵심 요점

  • 표준 모델은 총 310B 파라미터를 사용하며 토큰당 15B를 활성화한다.
  • 텍스트, 이미지, 비디오, 오디오를 입력으로 받아 텍스트를 반환한다.
  • API는 1M 컨텍스트, 최대 128K 출력, 도구 호출, 웹 검색, 스트리밍, 구조화된 출력, 컨텍스트 캐싱을 지원한다.
  • 게시자 보고 결과에는 Terminal-Bench 2.0에서 65.8, SWE-Bench Pro에서 56.1이 포함된다.
  • Xiaomi의 현재 MiMo-V2.5-Pro 모델 카드에는 총 1.02T, 활성 42B 파라미터가 기재되어 있다. 게시자 기재 SWE-Bench Pro 점수는 MiMo-V2.5가 56.1, Pro가 57.2이며, 이는 특정 코딩 워크플로에 대한 보장이 아닌 구식의 게시자 보고 비교다.
  • 현재 Xiaomi 요금에서 표준 입력/출력 비용은 백만 토큰당 $0.14/$0.28이고, Pro는 $0.435/$0.87이다.
  • CometAPI의 두 API는 공식 비캐시 가격 대비 20% 낮게 책정되어 있다.
    정보 확인일: 2026년 9월 28일. 가격, 벤치마크, 한도, 가용성, 요청 형식은 변경될 수 있다. Xiaomi는 공식 mimo-v2.5 및 mimo-v2.5-pro API 모델명이 2026년 10월 21일 10:00(베이징 시간)에 사용 중단될 예정이며 자동 대체가 없다고 공지했다. 배포 전 마이그레이션 계획을 수립하고 라이브 라우트를 확인하라.

API 수명 주기 참고: 공식 Xiaomi 플랫폼은 10월 21일에 두 V2.5 모델 ID를 퇴역시킬 계획이다. 이 통지는 Xiaomi의 API 플랫폼에 관한 것이며, 별도의 서드파티 게이트웨이는 따로 확인하라. Xiaomi 모델 사용 중단 공지

표준 모델이란 무엇인가

MiMo-V2.5는 멀티모달 지각과 에이전트 작업을 위한 Xiaomi MiMo의 효율 지향 기반 모델이다. 하나의 아키텍처에서 네이티브 텍스트, 이미지, 비디오, 오디오 입력을 제공하고 텍스트 출력을 생성한다.

Xiaomi의 모델 릴리스 로그는 MiMo-V2.5 시리즈 공개 베타를 2026년 4월 23일로 기록한다. 가중치는 이후 MIT 라이선스로 공개되었다. MiMo-V2.5는 총 310B 파라미터를 가지지만 각 토큰에 대해 약 15B만 활성화한다. 즉, 모든 전문가를 동시에 실행하지 않고도 큰 전문가 풀을 활용한다.

MiMo-V2.5-Pro는 다른 워크로드를 목표로 한다. 이는 가장 어려운 코딩, 터미널, 장기 실행 에이전트 작업을 위해 설계된 조 단위 파라미터의 텍스트 입력 모델이다. 두 변형은 최대 1M 컨텍스트를 공유하지만, 모달리티, 활성 연산량, 가격에서 크게 다르다.

MiMo-V2.5 사양과 기능

공식 아키텍처 세부 정보값의미
아키텍처희소 MoE선택적 활성화를 통한 큰 전문가 용량
총/활성 파라미터310B / 15B활성 연산은 총 용량에 비해 훨씬 낮음
트랜스포머 레이어48: 1 개의 dense + 47 개의 MoE대부분 레이어가 라우팅된 전문가를 사용
라우팅 전문가 수256; 토큰당 8개 활성310B 전부를 dense로 실행하지 않고 특화
어텐션39개 SWA + 9개 글로벌 레이어로컬 효율과 장거리 정보 흐름의 균형
SWA 윈도우128 토큰장문맥 캐시 압력을 줄임
컨텍스트/최대 출력1M / 128K 토큰긴 문서와 확장된 트레이스 지원
입력/출력텍스트, 이미지, 비디오, 오디오 / 텍스트4가지 입력 유형의 네이티브 지각
비전 인코더729M ViT; 28 레이어이미지와 비디오 이해
오디오 인코더261M 트랜스포머; 24 레이어네이티브 오디오 이해
다중 토큰 예측3 모듈; 약 329M 파라미터추측(decoding) 효율을 지원
학습 규모약 48T 토큰폭넓은 텍스트·멀티모달 학습 파이프라인
API 기능도구, 웹, 스트리밍, 구조화 출력, 캐싱프로덕션 지향의 에이전트 기본기능
라이선스MIT상업적 사용 및 수정 허용

운영 범위에는 1M 컨텍스트와 128K 출력이 포함되며, 게시된 한도는 분당 100 요청, 분당 1000만 토큰이다. 제공자 수준 한도는 계정과 통합 경로에 따라 다를 수 있다.

MiMo-V2.5란? 사양, 벤치마크, 기능, 가격 및 API 액세스

Xiaomi MiMo의 공식 아키텍처 다이어그램. 공식 아키텍처 자료.

MiMo-V2.5 아키텍처는 어떻게 동작하는가

희소 전문가: 총 용량이 활성 연산을 의미하지는 않는다

핵심 효율 포인트는 총 310B, 활성 15B 설계다. 라우터가 각 토큰에 대해 256명의 전문가 중 8명을 선택한다. 이는 전통적인 15B dense 모델보다 훨씬 큰 파라미터 풀에 접근하면서도 매번 310B 전체를 실행하지 않는다.

이는 셀프 호스팅을 쉽게 만들지는 않는다. 전체 가중치는 여전히 저장 및 배포되어야 하므로, 메모리 용량, 인터커넥트 대역폭, 전문가 라우팅, 서빙 소프트웨어가 중요한 제약으로 남는다.

긴 컨텍스트를 위한 하이브리드 어텐션

백본은 슬라이딩-윈도우 어텐션과 글로벌 어텐션을 5:1의 SWA 대 글로벌 비율로 교차 배치한다. 39개의 로컬 레이어가 캐시 성장을 제어하고, 9개의 글로벌 레이어가 장거리 정보 흐름을 보존한다. Xiaomi는 전부 글로벌 설계 대비 거의 6배의 KV 캐시 감소를 보고했다.

1M 토큰의 최대치는 용량이지 정확도 보장이 아니다. 검색 품질, 지연시간, 도구 상태 증가, 먼 증거에 대한 어텐션은 여전히 워크로드별 평가가 필요하다.

네이티브 인코더와 에이전트 기능

729M 파라미터의 비전 트랜스포머가 이미지와 비디오 입력을, 261M 파라미터의 오디오 트랜스포머가 오디오를 처리한다. 프로젝터가 두 스트림을 언어 백본으로 매핑하여 하나의 에이전트가 스크린샷, 비디오 구간, 오디오 트랙, 텍스트 지시, 도구 결과를 결합할 수 있게 한다.

3개의 다중 토큰 예측 모듈이 추측 디코딩과 강화학습 효율을 지원한다. 모델은 약 48T 토큰으로 학습되었고, 포스트 트레이닝 중 컨텍스트를 점진적으로 1M까지 확장했다.

오픈 가중치는 MIT 라이선스를 사용한다. 상용 배포가 가능하지만, 인프라 비용과 서드파티 의존성은 별도 검토가 필요하다.

MiMo-V2.5 벤치마크: 코딩, 에이전트, 멀티모달 결과

벤치마크 참고:

아래 수치는 게시자 보고값이다. 이는 방향성 있는 증거일 뿐 특정 저장소, 미디어 형식, 도구 스택, 지연시간 목표, 안전 정책에 대한 보장이 아니다.

코딩 및 에이전트 결과

MiMo-V2.5란? 사양, 벤치마크, 기능, 가격 및 API 액세스

공식 Xiaomi MiMo 코딩 및 에이전트 벤치마크 차트.

공식 코딩 벤치마크보고 점수의사결정 시그널
MiMo Coding Bench71.8폭넓은 코딩-에이전트 역량
Claw-Eval Text62.3일반 텍스트-에이전트 완성도
Terminal-Bench 2.065.8대화형 터미널 실행
SWE-Bench Pro56.1실무 소프트웨어 엔지니어링
Claw-Eval Multi-Turn63.2더 긴 다단계 에이전트 작업
ResearchClawBench16.91자율 연구 워크플로

결과: 가장 강한 사례는 고립된 코드 완성보다 실용적 도구 사용이다. 65.8의 Terminal-Bench 결과는 터미널 지향 에이전트를 뒷받침하고, SWE-Bench Pro 56.1은 저장소 수준의 유용한 능력을 시사한다. 훨씬 낮은 연구 점수는 증거 수집과 인용 동작을 별도로 테스트해야 함을 상기시킨다.

멀티모달 결과

MiMo-V2.5란? 사양, 벤치마크, 기능, 가격 및 API 액세스

공식 Xiaomi MiMo 이미지, 비디오, 멀티모달-에이전트 벤치마크 차트.

공식 멀티모달 벤치마크보고 점수테스트한 능력
CharXiv RQ81.0차트와 문서 추론
MMMU-Pro77.9전문가 수준 멀티모달 추론
HR-Bench 4K88.5고해상도 이미지 이해
OmniDocBench87.2문서 이해
Claw-Eval Multimodal23.8멀티모달 에이전트 완성도
Video-MME87.7비디오 이해
DailyOmni83.5일상적 오디오비주얼 추론
VideoHolmes64.0시계열 비디오 추론

결과: 문서, 고해상도 이미지, 비디오 이해가 가장 두드러진 강점이다. 23.8의 멀티모달-에이전트 점수는 지각 점수보다 훨씬 낮으므로, 미디어 이해와 도구의 신뢰할 수 있는 작동이 모두 필요한 시스템은 종단 간로 평가해야 한다.

MiMo-V2.5 vs MiMo-V2.5-Pro: 다차원 비교

공식 아키텍처 비교MiMo-V2.5MiMo-V2.5-Pro
Official Pro specifications
Official Pro benchmarks
실무적 함의
총 파라미터310B1.02TPro는 총 용량이 3배 이상
활성 파라미터15B42BPro는 약 2.8배 더 많은 활성 파라미터 사용
레이어/라우팅 전문가48 / 25670 / 384Pro는 더 큰 서빙 타깃
모델 카드 컨텍스트 상한1M1M둘 다 최대 1M 토큰을 기재; 워크로드 크기에서 검색과 지연시간을 테스트
공식 API 최대 출력128K128K현재 Xiaomi API 모델 페이지 둘 다 128K를 기재; 제공자별 한도는 다를 수 있음
네이티브 입력텍스트, 이미지, 비디오, 오디오텍스트MiMo-V2.5가 문서상 멀티모달 선택지; Pro 엔드포인트로 미디어 전송 전 정확히 확인
SWE-Bench Pro56.157.2Pro가 1.1포인트 우위
Terminal-Bench 2.065.868.4Pro가 2.6포인트 우위
주된 적합성효율적 멀티모달 에이전트복잡한 코딩과 장기 호라이즌 에이전트워크로드별 테스트로 선택; 모델 수준 격차는 일반적 품질 우위를 증명하지 않음

비교 결과: Pro의 벤치마크 상 우위는 두 개의 공유 코딩-에이전트 테스트에서 온건하며, 표준 변형은 네이티브 이미지·비디오·오디오 입력을 추가하고 활성 파라미터가 훨씬 적다. Pro는 멀티모달 입력과 낮은 단가보다 어려운 작업 완료의 소폭 향상이 더 가치 있을 때 정당화된다.

MiMo-V2.5와 MiMo-V2.5-Pro의 비용은?

가격 기준: 2026-05-27공식 표준 API공식 Pro APICometAPI의 MiMo-V2.5 APICometAPI의 MiMo-V2.5-Pro API
입력, 캐시 미스 / MTok$0.14$0.435$0.112$0.348
출력 / MTok$0.28$0.87$0.224$0.696
입력, 캐시 히트 / MTok$0.0028$0.0036라이브 과금 확인라이브 과금 확인
공식 비캐시 대비 할인기준기준20%20%

공식 요금에서 Pro는 표준 대비 비캐시 입력과 출력 모두 약 3.1배 비싸다. 위 제공자 가격은 각 비캐시 쌍을 20% 낮추지만, 변형 간 상대 격차는 사실상 변하지 않는다.

토큰당 가격이 총비용은 아니다. 도구 재시도, 컨텍스트 크기, 출력 길이, 지연시간, 실패 작업 복구, 인간 검토가 작업 완료당 비용을 결정한다. 기본 프로덕션 모델을 선택하기 전에 대표 워크로드 샘플을 실행하라.

MiMo-V2.5는 무엇에 가장 적합한가?

  • 멀티모달 에이전트: 스크린샷, 문서, 비디오, 오디오, 지시, 도구를 하나의 워크플로로 결합.
  • 장문서 분석: 리포지토리, 계약, 연구 아카이브, 로그, 지원 이력 처리.
  • 미디어 이해: 비디오 요약, 이벤트 추출, 차트 해석, 오디오비주얼 질의 응답.
  • 코딩 및 터미널 에이전트: 파일 검사, 명령 실행, 코드 수정, 테스트 결과 반복.
  • 대량 자동화: 희소 활성화와 낮은 토큰 가격을 활용한 반복 생산 작업.

한계와 위험

  • 토큰당 활성 파라미터는 15B지만, 셀프 호스팅에는 여전히 전체 310B 가중치 시스템이 필요하다.
  • 멀티모달 출력은 텍스트다; 이미지, 음성, 비디오 생성은 다른 모델이 필요하다.
  • 1M 컨텍스트 상한이 윈도우 전반에 걸친 균일한 검색 정확도를 보장하지는 않는다.
  • 게시자 벤치마크는 커스텀 도구, 리포지토리, 프롬프트, 안전 제약으로 그대로 이전되지 않을 수 있다.
  • 제공자 모달리티 노출은 기본 오픈 가중치 모델의 전체 능력과 다를 수 있다.

프로덕션 게이트:

대표 작업에서 정확도, 도구 호출 완성, 지연시간, 토큰 소모, 모달리티 처리, 폴백 동작을 검증한 후 트래픽을 커밋하라.

API 예시

다음 Python 예시는 OpenAI 호환 CometAPI 엔드포인트와 표준 모델 ID를 사용한다. 배포 전에 현재 엔드포인트와 지원 요청 스키마를 확인하라.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["COMETAPI_KEY"],
    base_url="https://api.cometapi.com/v1",
    max_retries=0,
)

response = client.chat.completions.create(
    model="mimo-v2.5",
    max_tokens=256,
    messages=[
        {
            "role": "user",
            "content": "이 기술 보고서의 주요 발견을 요약해 주세요.",
        }
    ],
)

print(response.choices[0].message.content)

의사결정 가이드

워크로드 시그널시작 권장전환 시점
이미지, 비디오, 오디오가 1급 입력인 경우표준멀티모달 전처리가 허용되지 않는 한 전환하지 말 것
대량 문서 또는 혼합 미디어표준추론 실패가 비용을 지배할 때만 Pro
어려운 리포지토리 엔지니어링둘 다 테스트Pro의 완료 향상이 3.1배 단가를 상쇄할 때 선택
긴 자율 터미널 트래젝터리Pro향상이 측정되지 않으면 표준으로 복귀
대량의 일상 자동화표준실패하거나 고가치 작업만 상향 라우팅

권장 라우팅:

멀티모달과 대량 작업에는 기본적으로 표준을 사용하고, 어려운 텍스트 우선 코딩이나 장기 작업만 Pro로 라우팅하라. 이렇게 하면 총비용을 통제하면서 역량을 보존할 수 있다.

결론

표준 모델은 단지 작은 Pro가 아니다. 네이티브 멀티모달 입력, 1M 컨텍스트, 강한 도구 지향 벤치마크, 15B 활성 파라미터, 훨씬 낮은 토큰 가격이라는 별도의 최적화 지점이다.

Pro는 어려운 소프트웨어 엔지니어링과 지속적 자율 실행을 위한 특화 옵션이다. 추가 용량은 측정 가능한, 그러나 보편적이지는 않은 향상을 만든다. 따라서 가장 강한 배포 패턴은 모든 요청에 하나를 고정하기보다 워크로드 기반 라우팅이다.

FAQ

표준 모델은 오픈 소스인가?

가중치가 MIT 라이선스로 공개되어 있으며, 라이선스 조건에 따라 상업적 사용, 수정, 파인튜닝, 재배포가 허용된다.

파라미터는 얼마나 되는가?

희소 MoE는 총 310B 파라미터를 포함하며, 토큰당 15B를 활성화한다. 활성 파라미터는 저장 크기가 아니라 토큰당 연산을 설명한다.

이미지, 비디오, 오디오를 지원하는가?

예. 표준 변형은 텍스트, 이미지, 비디오, 오디오를 입력으로 받고 텍스트를 반환한다. Pro 변형의 공식 사양은 텍스트 입력을 기재한다.

최대 컨텍스트 윈도우는?

두 모델 카드 모두 최대 1M 토큰 컨텍스트 윈도우를 명시한다. Xiaomi의 현재 API 페이지는 MiMo-V2.5와 MiMo-V2.5-Pro의 최대 출력을 128K로 기재한다. 실제 사용 가능한 한도는 엔드포인트, 제공자, 계정, 요청 형식에 따라 달라질 수 있으므로, 그 상한에 의존하기 전에 배포된 라우트를 확인하라.

현재 공식 Pro API 페이지는 1M 컨텍스트와 128K 최대 출력을 별도로 확인한다: MiMo-V2.5-Pro API 사양

코딩 에이전트에는 어떤 변형이 더 나은가?

Pro가 공유 코딩 및 터미널 벤치마크에서 더 높은 결과를 보고하지만 격차는 온건하다. 대상 리포지토리에서 둘 다 테스트하고 작업 완료, 지연시간, 총비용에 따라 선택하라.

멀티모달 에이전트에는 어떤 변형이 더 나은가?

표준 변형이 자연스러운 선택이다. 네이티브로 이미지, 비디오, 오디오 입력을 수용한다. Pro는 텍스트 입력 중심이다.

프로덕션 팀은 어떻게 선택해야 하는가?

표준으로 시작해 실패를 측정하고, 그 중 Pro의 이점을 얻는 텍스트 우선 난이도 높은 작업만 라우팅하라. 토큰당 가격이 아니라 작업 완료당 비용으로 비교하라.

학습 계속하기

이 글을 다음 결정과 연결하세요.

모든 주제 보기
게시일 Oct 5, 2026
최종 업데이트 Oct 5, 2026
0 회 조회
명확성, 출처 표기 및 최신 API 용어에 대해 검토되었습니다.

더 보기