TL;DR
Meta выпустила Muse Spark 1.2 как ориентированное на кодирование обновление Muse Spark 1.1. Он предназначен для генерации кода, сложной отладки, понимания репозиториев и сквозных разработческих рабочих процессов, а не для радикального пересмотра общей спецификации. Модель сохраняет контекстное окно на 1M токенов и принимает вход в виде текста, изображений, видео и PDF, возвращая текст.
Главная часть релиза — связь модели с Muse Code. Meta совместно обучала модель с Muse Code, используя траектории агентов, целевую кондиционировку, компактацию контекста, поведение субагентов и сам набор инструментов кодирования. Это делает Muse Spark 1.2 особенно убедительным внутри собственного окружения кодирования Meta, но также означает, что самые сильные показатели запуска следует рассматривать как результат связки «модель плюс агентная система».
В кодовой оценке Meta Muse Spark 1.2 в паре с Muse Code набрал 82.9% на Terminal-Bench 2.1 и 59.3% на DeepSWE 1.1. Текущая страница модели Artificial Analysis сообщает об оценке Intelligence Index — 57, заменяющей стартовый показатель 54 под более ранней версией индекса. Последний рейтинг GDPval-AA v2 составляет 1 623 Elo, что ставит модель на 15-е место из 213 оценённых. Таким образом, Muse Spark 1.2 остаётся конкурентоспособным в кодинге и агентной работе, но не является общим лидером; Claude Opus 5 опережает его как по ключевым кодовым бенчмаркам Meta, так и в текущем рейтинге GDPval-AA v2.
Ключевые выводы
- Обновление с фокусом на код: Muse Spark 1.2 концентрирует прирост в генерации, отладке, понимании кодовой базы и длинных разработческих рабочих процессах.
- Контекст 1M токенов: в API заявлено контекстное окно 1 048 576 токенов для задач масштаба репозитория и длительных сессий агента.
- Мультимодальный ввод: размещённая модель принимает текст, изображения, видео и PDF-документы и возвращает текст.
- Оптимизация под агентную систему: модель обучена работать с планированием, инструментарием, компактацией и шаблонами субагентов Muse Code.
- Сильные, но зависящие от «обвязки» результаты в коде: Meta сообщает 82.9% на Terminal-Bench 2.1 и 59.3% на DeepSWE 1.1 с Muse Code.
- Конкурентные цены API: стандарт — $1.25 за 1M входных токенов и $4.25 за 1M выходных, с гораздо более дешёвым уровнем Contributor при других условиях работы с данными.
- Важная оговорка: число параметров, архитектура и объём обучающих токенов публично не раскрыты.
Что такое Muse Spark 1.2?
Muse Spark 1.2 — кодинг-оптимизированная мультимодальная модель рассуждений Meta Superintelligence Labs. Meta описывает её как обновление Muse Spark 1.1 с улучшениями в генерации кода, сложной отладке, понимании кодовой базы и полноценной разработческой работе. Релиз вышел вместе с бета-версией Muse Code — терминальным кодовым агентом для планирования изменений, написания кода, запуска инструментов, координации постоянных субагентов и валидации результатов в больших репозиториях.
Эта позиционировка важна. Muse Spark 1.2 не продвигается как просто более хороший чат-бот или более крупная универсальная модель. Она спроектирована под условия, делающие софтверных агентов сложными: требования, разбросанные по множеству файлов, накопившийся вывод терминала, повторяющиеся провалы тестов, изменяющиеся планы, длинные сессии и необходимость сохранять исходную цель после множества промежуточных шагов.
Характеристики Muse Spark 1.2
| Specification | Muse Spark 1.2 |
|---|---|
| Developer | Meta Superintelligence Labs |
| Release date | August 5, 2026 |
| API model ID | muse-spark-1.2 |
| Model type | Proprietary multimodal reasoning and coding model |
| Primary focus | Coding agents, debugging, repository understanding, long-horizon development |
| Context window | 1,048,576 tokens |
| Input modalities | Text, image, video, PDF |
| Output modality | Text |
| Reasoning setting in Meta evaluation | xhigh |
| Tool profile | Tool calling and agent-oriented workflows |
| Standard price | $1.25/M input; $0.15/M cached input; $4.25/M output |
| Public parameter count | Not disclosed |
| Public architecture details | Not disclosed |
| Launch deployment | Muse Code and Meta Model API |
Specification note: Документация модели Meta предоставляет позиционирование, контекст и цены; документация размещённого API — поддерживаемые входные и выходные модальности. Ограничения развёртывания могут отличаться от теоретических возможностей базовой модели.
Что нового в Muse Spark 1.2?
Больше обучения на коде
Meta заявляет о существенном увеличении вычислительных затрат обучения на кодовых задачах с расширением разнообразия учебных сред. Практическая цель — не только генерировать корректные фрагменты, но и повысить точность с первой попытки, когда агент должен изучить незнакомый репозиторий, найти релевантные файлы, внести изменения, запустить сборку или тесты и доработать результат по обратной связи.
Это делает обновление более актуальным для продакшн-инжиниринга, чем прирост в одноходовой генерации кода. Реальные репозитории содержат конвенции фреймворков, скрытую связанность, неполную документацию, хрупкие тесты и требования, которые нельзя удовлетворить, редактируя одну изолированную функцию. Muse Spark 1.2 училась именно на таком широком спектре задач.
Совместное обучение с Muse Code
Meta совместно обучала Muse Spark 1.2 с Muse Code, чтобы модель лучше соответствовала инструментарию и рантайму агента. Обучение включало траектории «обвязки» с отбором по отклонениям и оптимизацию «рецептов» для целей, компактации контекста и субагентов. Это более продуманный подход, чем прикрутить общую модель к командной оболочке после обучения.
Польза — совместимость: модель узнаёт, как выглядит обратная связь инструментов, когда нужно пересмотреть план, как общаются фоновые работники и какое состояние должно пережить сжатие контекста. Компромисс — переносимость. Модель, настроенная под одну «обвязку», сможет работать и в другой, но её лучшие результаты могут зависеть от подсказок, инструментов, памяти и цикла управления, с которыми она тренировалась.
Дальнобойный кодинг
Muse Spark 1.2 обучалась на генерации целых репозиториев и длинных проектах, включая авто-исследовательские пайплайны. Meta выделяет три поведения: планирование для последовательной работы, целевую кондиционировку для удержания агента на исходной цели и компактацию контекста, чтобы сохранять критичные знания по мере роста сессии.
Эти механизмы адресуют типичные провалы кодовых агентов: система становится локально продуктивной, но теряется глобально. Она может исправить тест, ломая требование, повторить прежнее исследование или забыть, почему было принято то или иное решение. Дальнобойное обучение призвано сделать прогресс накопительным, а не эпизодическим.
Самоулучшение с Muse Spark 1.1
Meta также использовала Muse Spark 1.1 для генерации сложных кодовых сред и шаблонов следования инструкциям. Более ранняя модель оценивала кандидатов-решений относительно сгенерированных требований, создавая масштабируемые обучающие данные для Muse Spark 1.2. Это следует понимать как модель-помощник в генерации задач и их оценке, а не как неограничённую само-модификацию развёрнутой модели.
Мультимодальная работа с репозиториями
Окно на 1M токенов и мультимодальные входы важны, потому что многие задачи разработки не ограничиваются текстом. Агенту может понадобиться сравнить фронтенд со скриншотом, изучить PDF-спецификацию, интерпретировать запись UI или сохранять визуальные требования при редактировании кода. Демонстрация релиза, где Muse Code интерпретирует видеооблет дома и создаёт страницу маркетинга и бронирования, иллюстрирует этот путь от восприятия к реализации.
Muse Spark 1.2 vs Muse Spark 1.1: что действительно изменилось?
| Muse Spark 1.1 | Muse Spark 1.2 | |
|---|---|---|
| Context | 1M | 1M |
| Standard Input | $1.25 | $1.25 |
| Standard Output | $4.25 | $4.25 |
| Intelligence Index | 53 current | 57 current |
| Terminal-Bench | 78% AA | 80% AA |
| Coding focus | High | Higher |
| Muse Code co-training | No | Yes |
| Long-horizon training | Yes | Expanded |
| Open weights | No | No |
Как Muse Spark 1.2 работает с Muse Code
Muse Spark 1.2 — это модель; Muse Code — агентный продукт, превращающий вызовы модели в устойчивую инженерную работу. Muse Code запускает основного агента вместе с асинхронными фоновыми агентами, которые остаются активными на протяжении сессии. Эти работники могут собирать контекст, выполнять следующие шаги и передавать релевантные находки обратно основному агенту, не пересоздаваясь на каждую задачу.
В рантайме также ведётся локальный журнал событий. Каждый вызов модели, запуск инструмента, подтверждение и правка добавляются в единую историю, позволяя агенту продолжить после сбоя вместо перезапуска задачи. Встроенные навыки, такие как /plan, /grill и /goal, добавляют планирование с подтверждением, стресс-тестирование планов и выполнение, ориентированное на цель.

Рисунок 1. Muse Code превращает Muse Spark 1.2 в устойчивую систему планирования, исполнения и валидации. Источник: Meta launch description
Интерпретация: устойчивость Muse Code, журнал событий, инструменты и оркестрация субагентов — это системные возможности. Их не следует приписывать одной базовой модели.
Результаты бенчмарков Muse Spark 1.2
Следующие результаты представлены Meta. Оценки по кодингу измеряют полные системы «модель + агент», а последующие мультимодальные сводные показатели — конфигурации Meta Model API с инструментами и без. Их не следует смешивать с независимыми метриками Artificial Analysis, приведёнными далее.
Результаты кодовых бенчмарков
| Meta coding benchmarks | Muse Spark 1.2 result | Leading comparison in Meta's chart | Evaluation scope | How to read it |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% with Muse Code | Claude Opus 5: 86.7% with Claude Code | Terminal tasks in selected coding agents | Vendor-reported system result |
| DeepSWE 1.1 | 59.3% with Muse Code | Claude Opus 5: 65.0%; GPT-5.6 Terra: 64.8% | 113 tasks, 91 repositories, five languages | Vendor-reported system result |
| Meta Internal Coding Bench | 70.6% | Claude Opus 5: 79.4% | 440 private tasks derived from Meta pull requests | Private and not independently reproducible |
Методология оценки Meta использует Muse Code для Muse Spark 1.2, Claude Code для Claude Opus 5, Codex для GPT-5.6 Terra и Grok Build для Grok 4.5. Более высокая оценка может отражать совокупность модели, агентного цикла, подсказок, инструментов и дизайна памяти. Корректная формулировка: «Muse Spark 1.2 в Muse Code набрал 82.9%», а не «базовая модель набрала 82.9%».
Результаты мультимодальных бенчмарков
Августовская мультимодальная оценка Meta сообщает композит по десяти бенчмаркам в областях визуального восприятия, визуальных знаний, пространственного и UI-рассуждения и понимания графиков. Наибольший прирост наблюдается, когда Muse Spark 1.2 может использовать инструменты.
| Meta multimodal evaluation | Direct response | With tools | Tool uplift | Interpretation |
|---|---|---|---|---|
| Muse Spark 1.2 | 59.8 | 72.0 | +12.2 | Stronger in the tool-enabled configuration |
| Muse Spark 1.1 | 60.2 | 69.1 | +8.9 | Slightly higher without tools, lower with tools |
Официальная мультимодальная методология усредняет BabyVision, PerceptionBench, ZeroBench, WorldVQA, SimpleVQA, ERQA, OmniSpatial, CharXiv Reasoning, ChartMuseum и ChartQAPro поровну. Сравнение полезно для измерения «прироста от инструментов» внутри фреймворка Meta; это не независимый воспроизводимый бенчмарк.
Независимые результаты бенчмарков
В текущей версии Artificial Analysis Intelligence Index v4.1.1 Muse Spark 1.2 получает 57, против 53 у Muse Spark 1.1 и оценочных 44 у оригинального Muse Spark. Его последний рейтинг GDPval-AA v2 — 1 623 Elo, что соответствует 15-му месту среди 213 оценённых моделей. Muse Spark 1.2 также лидирует в текущем бенчмарке AA-LCR для длинного контекста со счётом 83.3%, что указывает на сильные стороны в агентной работе с знаниями, кодовых рабочих процессах и рассуждениях на длинном контексте.
| Evaluation | Score | Environment | What it tells you |
|---|---|---|---|
| Meta Terminal-Bench 2.1 | 82.90% | Muse Code | Model + Meta's optimized agent |
| Artificial Analysis Terminal-Bench 2.1 | 80% | AA harness | More independent cross-model signal |
| Meta DeepSWE 1.1 | 59.30% | Muse Code | Long-horizon coding |
| Meta Internal Coding | 70.60% | Meta internal | Internal engineering tasks |

Источник: Artificial Analysis
Данные о надёжности требуют аккуратной интерпретации. AA-Omniscience растёт с 18 до 22, а уровень галлюцинаций падает с 38% до 28%, но доля попыток также снижается — с 82% до 67%. Точность падает с 41% до 38%. Иными словами, Muse Spark 1.2 чаще воздерживается при неуверенности, что снижает ложные утверждения, но приводит к меньшему числу попыток ответа.
Научные рассуждения сравнительно без изменений. CritPt растёт с 15% до 18%, при этом SciCode снижается с 58% до 56%, а Humanity's Last Exam — с 45% до 44%. Эта картина согласуется с позиционированием Meta: Muse Spark 1.2 — специализированное обновление для кодинга и агентности, а не равномерный скачок во всех доменах рассуждений.
Цены Muse Spark 1.2
Meta предлагает доступ уровней Standard и Contributor. Стандартная модель стоит $1.25 за 1M входных токенов, $0.15 за 1M кэшированных входных токенов и $4.25 за 1M выходных токенов. Вариант Contributor существенно дешевле, но Meta заявляет, что его данные могут использоваться для улучшения продуктов.
| Tier | Input / 1M | Cached input / 1M | Output / 1M | Data treatment |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | Not used to improve Meta products |
| Contributor | $0.10 | $0.002 | $0.20 | May be used to improve Meta products |
Pricing source: официальная страница модели Meta. Командам следует изучить применимые продуктовые и дата-условия перед отправкой проприетарного кода, учётных данных, клиентских данных или внутренних документов по маршруту Contributor.
Низкие цены за токен не означают автоматически минимальную стоимость завершённой задачи. Artificial Analysis оценивает около $0.40 за задачу Intelligence Index для Muse Spark 1.2 против $0.29 для Muse Spark 1.1. Рост обусловлен более высоким расходом токенов, особенно на профессиональную агентную работу. Поэтому командам следует измерять стоимость за принятый pull request, решённый issue или проверяемый результат, а не сравнивать лишь прайс-листы.
Muse Spark 1.2 vs другие передовые кодовые модели
Наиболее релевантный набор сравнения включает Claude Opus 5, GPT-5.6 Terra, Grok 4.5 и Kimi K3. Эти модели пересекаются в кодировании, инструментах, длинном контексте и профессиональных агентных рабочих процессах, но различаются по развёртыванию, широте модальностей, экосистеме и приоритетам цена/производительность.
| Model | Context | Inputs | Terminal-Bench 2.1 signal | Deployment | Best fit |
|---|---|---|---|---|---|
| Muse Spark 1.2 | 1M | Text, image, video, PDF | 82.9% with Muse Code | Meta hosted API | Muse Code, long-running repository work, lower API price |
| Claude Opus 5 | 1M | Text, image, documents | 86.7% with Claude Code | Hosted API | Maximum coding reliability and complex agent judgment |
| GPT-5.6 Terra | ~1.05M | Text, image | 81.8% with Codex | Hosted API | Balanced coding, productivity, and broad tool workflows |
| Grok 4.5 | 500K | Text, image | 81.6% with Grok Build | Hosted API | Coding combined with xAI tools and current information |
| Kimi K3 | 1M | Text, image, video | Not shown in Meta chart | Hosted and open-weight options | Long-horizon work and deployment flexibility |
Где у Muse Spark 1.2 самые явные преимущества
Muse Spark 1.2 наиболее дифференцирован, когда приложение может использовать постоянный журнал событий, дизайн субагентов и специфичную для модели тренировку Muse Code. Его стандартная цена API также агрессивна относительно премиальных передовых кодовых моделей. Для команд, ценящих тесно интегрированную агентную систему, эта комбинация может быть важнее небольшой разницы на одном бенчмарке.
Где Claude Opus 5 остаётся сильнее
Claude Opus 5 лидирует во всех трёх кодовых диаграммах Meta, где он присутствует. Это более безопасный выбор, когда цена неудачного изменения высока и максимальная надёжность сквозного кодинга важнее цены за токен. Muse Spark 1.2 сокращает разрыв, особенно в терминальных задачах, но не устраняет его.
Где у GPT-5.6 Terra своё место
GPT-5.6 Terra близок к Muse Spark 1.2 на Terminal-Bench и впереди на DeepSWE в оценке Meta. Его преимущество — широта: команды, уже использующие инструментарий OpenAI для response, search, file, shell, computer и MCP, могут предпочесть модель, лучше вписывающуюся в существующий продакшн-стек, даже если другая модель чуть дешевле.
Когда Grok 4.5 или Kimi K3 могут быть лучше
Grok 4.5 — сильная альтернатива для рабочих процессов, сочетающих кодирование с актуальной информацией и экосистемой инструментов xAI. Kimi K3 более привлекателен, когда важны дальнобойная работа, развёртывание с открытыми весами или контроль со стороны провайдера. Практический выбор зависит от полного рантайма: подсказки, инструменты, память, требования безопасности и стратегия верификации могут менять результат не меньше, чем базовая модель.
Что умеет Muse Spark 1.2?
Инжиниринг масштаба репозитория
Контекст на 1M токенов может вместить значительный объём исходного кода, документации, вывода тестов, истории задач и состояния агента. Подходящие задачи включают многофайловые фичи, обновления фреймворков, рефакторинги на уровне репозитория, миграции API, ремонт тестов, ревью pull request-ов и анализ архитектуры. Длинный контекст наиболее полезен в паре с извлечением и компактацией, а не при бездумной загрузке всего репозитория.
Сложная отладка
Muse Spark 1.2 может изучать код, запускать инструменты, читать ошибки, формировать гипотезы, вносить правки и перезапускать тесты. Обучение с фокусом на код призвано улучшить этот цикл, где сложность — не в предложении правдоподобной правки, а в выявлении корневой причины и проверке отсутствия регрессий.
Долгоживущие кодовые агенты
Длительные проекты — центральный кейс. Журнал событий и фоновые агенты Muse Code позволяют продолжать работу через множество вызовов модели и шагов инструментов. Это полезно для апгрейдов, оптимизации производительности, генерации документации, модернизации тестов и фич, которые нельзя безопасно завершить одним ответом.
Автоматизированные технические исследования
Meta тестировала Muse Spark 1.2 на оптимизации GPU-ядёр при более чем 1 000 вызовов инструментов и до 24 часов. Агент писал, компилировал, профилировал и уточнял реализации Triton относительно эталонов. Более широкий вывод — модель спроектирована для итеративной технической работы, где эксперименты направляют следующий шаг.
Мультимодальная разработка
Ввод изображений, видео и PDF расширяет контур разработки за пределы исходников. Команда может использовать модель для сравнения UI со скриншотом, извлечения требований из продуктового документа, интерпретации записи взаимодействия или генерации реализации по визуальной ссылке. Человеческая проверка остаётся необходимой для доступности, соответствия бренду, безопасности и фактов, встроенных в визуальный контент.
Когда НЕ стоит использовать Muse Spark 1.2?
Не выбирайте его в первую очередь для:
- простой чат
- базовое дополнение кода
- низколатентный автокомплит
- общеписательские задачи
- задачи, где критична максимальная надёжность по бенчмаркам
- строго регулируемые нагрузки, если условия данных Contributor не подходят
Ограничения Muse Spark 1.2
- Не раскрытая архитектура: Meta не опубликовала число параметров, топологию модели, маршрутизацию экспертов или объём обучающих токенов.
- Зависимость стартовых результатов от «обвязки»: самые сильные показатели получены в паре Muse Spark 1.2 с Muse Code, тогда как конкуренты используют иные кодовые продукты.
- Частный внутренний бенчмарк: Meta Internal Coding Bench нельзя независимо воспроизвести или аудировать внешними разработчиками.
- Неравномерный прирост возможностей: независимая оценка показывает значительно большие улучшения в агентной работе, чем в научных рассуждениях.
- Компромисс с воздержанием: более низкий уровень галлюцинаций сопровождается более низкой долей попыток и слегка меньшей точностью в AA-Omniscience.
- Выбор политики данных: самый дешёвый уровень Contributor может использовать присланные данные для улучшения продуктов Meta и может не подходить для чувствительного кода.
- Длинный контекст — не идеальная память: лимит 1M токенов не гарантирует равномерного извлечения, внимания или точности на каждой позиции.
- Размещение при запуске: пакет релиза предоставляет доступ через API и Muse Code, а не выгружаемые веса модели.
Как получить доступ к Muse Spark 1.2
Разработчики могут использовать Muse Spark 1.2 через Muse Code или Meta Model API. Стандартный идентификатор модели API — muse-spark-1.2; более дешёвый маршрут contributor использует muse-spark-1.2-contributor. Размещённый API Meta предоставляет совместимый с OpenAI базовый URL, позволяя многим существующим клиентам chat-completions адаптироваться с другим ключом, базовым URL и именем модели.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODEL_API_KEY"],
base_url="https://api.meta.ai/v1",
)
response = client.chat.completions.create(
model="muse-spark-1.2",
messages=[
{"role": "user", "content": "Review this repository plan and identify the highest-risk implementation steps."}
],
)
print(response.choices[0].message.content)
Implementation note: Уточняйте активное имя модели, право доступа, лимиты скорости, поддерживаемые параметры и региональную доступность в документации API Meta перед развёртыванием. Не размещайте API-ключ прямо в исходном коде.
Для сравнительного тестирования CometAPI уже предоставляет унифицированный доступ к Claude Opus 5, GPT-5.6, Grok 4.5 и Kimi K3, что упрощает A/B-тестирование и переключение провайдеров. Muse Spark 1.2 также скоро будет доступен на CometAPI.
Стоит ли использовать Muse Spark 1.2?
Muse Spark 1.2 стоит протестировать, если работа доминирует задачами масштаба репозитория, длительным исполнением, повторяющейся обратной связью от инструментов и координацией нескольких агентов. Его сильнейший аргумент — сочетание специализированной под код модели, целевого устойчивого агента, мультимодального контекста на 1M токенов и низких стандартных цен API.
Это не универсальный лидер бенчмарков. Claude Opus 5 остаётся впереди в ключевых кодовых оценках Meta, GPT-5.6 Terra очень конкурентоспособен в кодинге и широких производственных инструментах, а независимые данные показывают, что приросты Muse Spark 1.2 сосредоточены, а не равномерны. Лучший процесс выбора — исходя из нагрузки: тестируйте каждую модель в реальном агентном рантайме, измеряйте долю завершённых задач с верификацией и включайте человеческую проверку для чувствительных с точки зрения безопасности или высокоэффектных изменений.
Итог:
Muse Spark 1.2 — самое сильное на данный момент ориентированное на код обновление Muse от Meta. Его реальный дифференциатор — не один бенчмарк, а то, насколько тесно модель, Muse Code, постоянные субагенты, длинный контекст и петля проверки спроектированы для совместной работы.
