TL;DR
Meta opublikowała Muse Spark 1.2 jako aktualizację skoncentrowaną na programowaniu względem Muse Spark 1.1. Model jest przeznaczony do generowania kodu, złożonego debugowania, rozumienia repozytoriów oraz kompleksowych przepływów pracy deweloperów, a nie jako szeroka zmiana specyfikacji. Utrzymuje okno kontekstu 1M tokenów i przyjmuje wejście tekstowe, obraz, wideo oraz PDF, zwracając tekst.
Najważniejszą częścią wydania jest relacja między modelem a Muse Code. Meta współtrenowała model z Muse Code, wykorzystując trajektorie agenta, warunkowanie na cel, kompaktowanie kontekstu, zachowanie podagentów oraz sam zestaw narzędzi do kodowania. Sprawia to, że Muse Spark 1.2 jest szczególnie atrakcyjny w środowisku programistycznym Meta, ale oznacza też, że najsilniejsze wyniki premierowe należy odczytywać jako rezultaty systemu model+agent.
W ocenie kodowania Meta Muse Spark 1.2 sparowany z Muse Code uzyskał 82,9% na Terminal-Bench 2.1 i 59,3% na DeepSWE 1.1. Bieżąca strona modelu Artificial Analysis raportuje wynik Intelligence Index 57, zastępując wynik premierowy 54 pod wcześniejszą wersją indeksu. Jego najnowsza ocena GDPval-AA v2 to 1 623 Elo, co plasuje go na 15. miejscu spośród 213 ocenianych modeli. Muse Spark 1.2 pozostaje więc konkurencyjny w pracach związanych z kodowaniem i agentami, ale nie jest liderem ogólnym; Claude Opus 5 wyprzedza go zarówno na czołowych benchmarkach kodowania Meta, jak i w aktualnym rankingu GDPval-AA v2.
Najważniejsze wnioski
- Aktualizacja z naciskiem na kodowanie: Muse Spark 1.2 koncentruje zyski w generowaniu, debugowaniu, rozumieniu baz kodu i długotrwałych przepływach pracy deweloperów.
- Kontekst 1M tokenów: API podaje okno kontekstu 1 048 576 tokenów dla pracy w skali repozytorium i trwałych sesji agentów.
- Wejście multimodalne: Udostępniany model przyjmuje tekst, obrazy, wideo i dokumenty PDF i zwraca tekst.
- Optymalizacja pod system agenta: Model trenowano do pracy z planowaniem, narzędziami, kompaktowaniem i wzorcami podagentów Muse Code.
- Mocne, lecz zależne od oprawy wyniki w kodowaniu: Meta raportuje 82,9% na Terminal-Bench 2.1 i 59,3% na DeepSWE 1.1 z Muse Code.
- Konkurencyjna ekonomika API: Standardowe ceny to $1.25 za milion tokenów wejściowych i $4.25 za milion tokenów wyjściowych, a znacznie tańsza warstwa Contributor działa na innych zasadach danych.
- Ważne zastrzeżenie: Nie ujawniono publicznie liczby parametrów, architektury ani liczby tokenów treningowych.
Czym jest Muse Spark 1.2?
Muse Spark 1.2 to zoptymalizowany pod kodowanie multimodalny model rozumowania od Meta Superintelligence Labs. Meta opisuje go jako aktualizację Muse Spark 1.1 z usprawnieniami w generowaniu kodu, złożonym debugowaniu, rozumieniu baz kodu i kompletnych przepływach pracy deweloperów. Premiera została sparowana z Muse Code beta, agentem terminalowym do planowania zmian, pisania kodu, uruchamiania narzędzi, koordynowania trwałych podagentów i walidowania wyników w dużych repozytoriach.
To pozycjonowanie ma znaczenie. Muse Spark 1.2 nie jest reklamowany głównie jako lepszy chatbot ani większy model ogólnego przeznaczenia. Został zaprojektowany wokół warunków, które utrudniają pracę agentów programistycznych: wymagania rozproszone po wielu plikach, skumulowane logi terminala, wielokrotne niepowodzenia testów, zmieniające się plany, długie sesje i potrzeba zachowania pierwotnego celu po wielu krokach pośrednich.
Specyfikacje Muse Spark 1.2
| Specification | Muse Spark 1.2 |
|---|---|
| Developer | Meta Superintelligence Labs |
| Release date | August 5, 2026 |
| API model ID | muse-spark-1.2 |
| Model type | Proprietary multimodal reasoning and coding model |
| Primary focus | Coding agents, debugging, repository understanding, long-horizon development |
| Context window | 1,048,576 tokens |
| Input modalities | Text, image, video, PDF |
| Output modality | Text |
| Reasoning setting in Meta evaluation | xhigh |
| Tool profile | Tool calling and agent-oriented workflows |
| Standard price | $1.25/M input; $0.15/M cached input; $4.25/M output |
| Public parameter count | Not disclosed |
| Public architecture details | Not disclosed |
| Launch deployment | Muse Code and Meta Model API |
Uwaga do specyfikacji: Dokumentacja modelu Meta dostarcza pozycjonowanie modelu, kontekst i ceny; dokumentacja hostowanego API podaje obsługiwane tryby wejścia i wyjścia. Ograniczenia wdrożenia mogą różnić się od teoretycznych możliwości modelu podstawowego.
Co nowego w Muse Spark 1.2?
Więcej treningu kodowania
Meta twierdzi, że znacząco zwiększyła nakłady obliczeniowe na zadania kodowania, poszerzając jednocześnie różnorodność środowisk treningowych. Celem praktycznym jest nie tylko generowanie poprawnych fragmentów, lecz także poprawa skuteczności pierwszego podejścia, gdy agent musi przejrzeć nieznane repozytorium, zidentyfikować odpowiednie pliki, wprowadzić zmianę, uruchomić build lub testy oraz poprawić pracę po otrzymaniu informacji zwrotnej.
To sprawia, że aktualizacja jest bardziej relewantna dla inżynierii produkcyjnej niż zysk w jednorazowym generowaniu kodu. Prawdziwe repozytoria zawierają konwencje frameworków, ukryte sprzężenia, niekompletne dokumentacje, kruche testy i wymagania, których nie da się spełnić, edytując jeden izolowany fragment funkcji. Muse Spark 1.2 jest explicite trenowany pod ten szerszy zakres zadań.
Współtrenowanie z Muse Code
Meta współtrenowała Muse Spark 1.2 z Muse Code, aby lepiej dopasować model do zestawu narzędzi i runtime’u agenta. Trening obejmował trajektorie harness wyselekcjonowane poprzez odrzucanie, a także optymalizację recept dla celów, kompaktowania kontekstu i podagentów. To bardziej przemyślane podejście niż doczepienie modelu ogólnego do wrappera wiersza poleceń po treningu.
Korzyścią jest kompatybilność: model uczy się, jak wygląda informacja zwrotna z narzędzi, kiedy należy zrewidować plan, jak komunikują się pracownicy w tle i który stan musi przetrwać kompresję kontekstu. Kompromisem jest transferowalność. Model dostrojony do jednego harnessu może działać gdzie indziej, ale jego najlepszy wynik może zależeć od promptów, narzędzi, systemu pamięci i pętli sterowania, które widział podczas treningu.
Kodowanie długohoryzontowe
Muse Spark 1.2 był trenowany na generowaniu całych repozytoriów i długich projektach, w tym na przepływach auto-research. Meta podkreśla trzy zachowania: planowanie sekwencjonujące pracę, ukierunkowanie na cel, aby utrzymać agenta przy pierwotnym zamiarze, oraz kompaktowanie kontekstu, by zachować kluczową wiedzę wraz z rozrostem sesji.
Te mechanizmy adresują typowy tryb awarii agentów kodujących: system staje się produktywny lokalnie, ale gubi się globalnie. Może naprawić test, jednocześnie łamiąc wymaganie, powtarzać wcześniejsze badania lub zapominać, dlaczego podjęto dany wybór projektowy. Trening długohoryzontowy ma sprawić, by postęp był kumulatywny, a nie epizodyczny.
Samodoskonalenie z Muse Spark 1.1
Meta wykorzystała też Muse Spark 1.1 do generowania wymagających środowisk kodowania i szablonów podążania za instrukcjami. Wcześniejszy model oceniał kandydackie rozwiązania względem wygenerowanych wymagań, tworząc skalowalne dane treningowe dla Muse Spark 1.2. Najlepiej rozumieć to jako wspomagane przez model generowanie i ocenę zadań, a nie nieograniczoną samomodyfikację modelu wdrożonego.
Multimodalna praca z repozytoriami
Okno 1M tokenów i wejścia multimodalne mają znaczenie, ponieważ wiele zadań deweloperskich nie jest wyłącznie tekstowych. Agent może potrzebować porównać frontend ze zrzutem ekranu, przejrzeć specyfikację PDF, zinterpretować nagranie interfejsu lub utrzymać wymagania wizualne podczas edycji kodu. Demonstracja wydania, w której Muse Code interpretuje wideo przelotu domowego i tworzy stronę marketingowo-rezerwacyjną, ilustruje ten przepływ od percepcji do implementacji.
Muse Spark 1.2 a Muse Spark 1.1: Co faktycznie się zmieniło?
| Muse Spark 1.1 | Muse Spark 1.2 | |
|---|---|---|
| Context | 1M | 1M |
| Standard Input | $1.25 | $1.25 |
| Standard Output | $4.25 | $4.25 |
| Intelligence Index | 53 current | 57 current |
| Terminal-Bench | 78% AA | 80% AA |
| Coding focus | High | Higher |
| Muse Code co-training | No | Yes |
| Long-horizon training | Yes | Expanded |
| Open weights | No | No |
Jak Muse Spark 1.2 współpracuje z Muse Code
Muse Spark 1.2 to model; Muse Code to produkt agenta, który zamienia wywołania modelu w trwałą pracę inżynierii oprogramowania. Muse Code uruchamia głównego agenta oraz asynchronicznych agentów w tle, którzy pozostają aktywni przez całą sesję. Ci pracownicy mogą zbierać kontekst, wykonywać kolejne kroki i przekazywać istotne ustalenia głównemu agentowi bez tworzenia ich na nowo do każdego zadania.
Runtime utrzymuje też lokalny dziennik zdarzeń. Każde wywołanie modelu, wykonanie narzędzia, zatwierdzenie i edycja są dopisywane do jednej historii, co pozwala agentowi wznowić pracę po awarii zamiast zaczynać zadanie od nowa. Wbudowane umiejętności, takie jak /plan, /grill i /goal, dodają planowanie z zatwierdzeniami, stres-testowanie planu i wykonanie zorientowane na cel.

Figura 1. Muse Code przekształca Muse Spark 1.2 w trwały system planowania, wykonania i walidacji. Źródło: Meta launch description
Interpretacja: Trwałość Muse Code, dziennik zdarzeń, narzędzia i orkiestracja podagentów to możliwości systemu. Nie należy przypisywać ich samemu modelowi bazowemu.
Wyniki benchmarków Muse Spark 1.2
Poniższe wyniki raportuje Meta. Wyniki kodowania mierzą kompletne systemy model+agent, natomiast późniejszy złożony wynik multimodalny uwzględnia konfiguracje Meta Model API z narzędziami i bez. Nie należy ich łączyć z niezależnymi metrykami Artificial Analysis, które pojawiają się dalej.
Wyniki benchmarków kodowania
| Meta coding benchmarks | Muse Spark 1.2 result | Leading comparison in Meta's chart | Evaluation scope | How to read it |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 82.9% with Muse Code | Claude Opus 5: 86.7% with Claude Code | Terminal tasks in selected coding agents | Vendor-reported system result |
| DeepSWE 1.1 | 59.3% with Muse Code | Claude Opus 5: 65.0%; GPT-5.6 Terra: 64.8% | 113 tasks, 91 repositories, five languages | Vendor-reported system result |
| Meta Internal Coding Bench | 70.6% | Claude Opus 5: 79.4% | 440 private tasks derived from Meta pull requests | Private and not independently reproducible |
Metodologia oceny Meta używa Muse Code dla Muse Spark 1.2, Claude Code dla Claude Opus 5, Codex dla GPT-5.6 Terra, oraz Grok Build dla Grok 4.5. Wyższy wynik może więc odzwierciedlać łącznie model, pętlę agenta, prompty, narzędzia i projekt pamięci. Trafne sformułowanie brzmi: Muse Spark 1.2 w Muse Code uzyskał 82,9%, a nie sam model bazowy uzyskał 82,9%.
Wyniki benchmarków multimodalnych
Sierpniowa ocena multimodalna Meta raportuje złożony wynik z dziesięciu benchmarków obejmujących percepcję wizualną, wiedzę wizualną, rozumowanie przestrzenne i UI oraz rozumienie wykresów. Największy przyrost pojawia się, gdy Muse Spark 1.2 może korzystać z narzędzi.
| Meta multimodal evaluation | Direct response | With tools | Tool uplift | Interpretation |
|---|---|---|---|---|
| Muse Spark 1.2 | 59.8 | 72.0 | +12.2 | Mocniejszy w konfiguracji z narzędziami |
| Muse Spark 1.1 | 60.2 | 69.1 | +8.9 | Nieco wyższy bez narzędzi, niższy z narzędziami |
Oficjalna metodologia multimodalna uśrednia BabyVision, PerceptionBench, ZeroBench, WorldVQA, SimpleVQA, ERQA, OmniSpatial, CharXiv Reasoning, ChartMuseum i ChartQAPro z równymi wagami. Porównanie jest użyteczne do pomiaru zysku z narzędzi w ramach Meta; nie jest to niezależnie replikowany benchmark.
Niezależne wyniki benchmarków
W bieżącym Artificial Analysis Intelligence Index v4.1.1 Muse Spark 1.2 uzyskuje 57, względem 53 dla Muse Spark 1.1 i szacunkowych 44 dla oryginalnego Muse Spark. Jego najnowsza ocena GDPval-AA v2 to 1 623 Elo, co plasuje go na 15. miejscu spośród 213 ocenianych modeli. Muse Spark 1.2 prowadzi również w bieżącym benchmarku długiego kontekstu AA-LCR ze wynikiem 83,3%, wskazując, że jego mocne strony obejmują pracę agentową, przepływy kodowania i rozumowanie w długim kontekście.
| Evaluation | Score | Environment | What it tells you |
|---|---|---|---|
| Meta Terminal-Bench 2.1 | 82.90% | Muse Code | Model + Meta's optimized agent |
| Artificial Analysis Terminal-Bench 2.1 | 80% | AA harness | More independent cross-model signal |
| Meta DeepSWE 1.1 | 59.30% | Muse Code | Long-horizon coding |
| Meta Internal Coding | 70.60% | Meta internal | Internal engineering tasks |

Źródło:Artificial Analysis
Dane dot. wiarygodności wymagają ostrożnej interpretacji. AA-Omniscience rośnie z 18 do 22, a wskaźnik halucynacji spada z 38% do 28%, ale jednocześnie maleje odsetek podejmowanych prób z 82% do 67%. Trafność spada z 41% do 38%. Innymi słowy, Muse Spark 1.2 częściej powstrzymuje się, gdy jest niepewny, co redukuje fałszywe twierdzenia, ale także skutkuje mniejszą liczbą podjętych odpowiedzi.
Rozumowanie naukowe pozostaje względnie płaskie. CritPt rośnie z 15% do 18%, podczas gdy SciCode spada z 58% do 56%, a Humanity’s Last Exam z 45% do 44%. Wzorzec ten wspiera pozycjonowanie Meta: Muse Spark 1.2 to specjalistyczna aktualizacja w obszarze kodowania i pracy agentowej, a nie jednolity skok we wszystkich dziedzinach rozumowania.
Cennik Muse Spark 1.2
Meta oferuje dostęp Standard i Contributor. Model Standard kosztuje $1.25 za milion tokenów wejściowych, $0.15 za milion cache’owanych tokenów wejściowych i $4.25 za milion tokenów wyjściowych. Wariant Contributor jest dramatycznie tańszy, ale Meta informuje, że jego dane mogą być używane do ulepszania produktów.
| Tier | Input / 1M | Cached input / 1M | Output / 1M | Data treatment |
|---|---|---|---|---|
| Standard | $1.25 | $0.15 | $4.25 | Not used to improve Meta products |
| Contributor | $0.10 | $0.002 | $0.20 | May be used to improve Meta products |
Źródło cen: Oficjalna strona modelu Meta. Zespoły powinny przejrzeć właściwe warunki produktu i danych, zanim wyślą przez ścieżkę Contributor zastrzeżony kod, poświadczenia, dane klientów lub dokumenty wewnętrzne.
Niskie ceny tokenów nie oznaczają automatycznie najniższego kosztu ukończonego zadania. Artificial Analysis szacuje około $0.40 za zadanie Intelligence Index dla Muse Spark 1.2, w górę z $0.29 dla Muse Spark 1.1. Wzrost jest napędzany wyższym zużyciem tokenów, zwłaszcza w profesjonalnej pracy agentowej. Zespoły powinny więc mierzyć koszt za zaakceptowany pull request, rozwiązany issue lub zweryfikowalny rezultat, zamiast porównywać tylko ceny katalogowe.
Muse Spark 1.2 vs inne czołowe modele do kodowania
Najbardziej relewantny zestaw porównań obejmuje Claude Opus 5, GPT-5.6 Terra, Grok 4.5 i Kimi K3. Modele te pokrywają się w kodowaniu, narzędziach, długim kontekście i profesjonalnych przepływach pracy agentów, ale różnią się wdrożeniem, zakresem modalności, ekosystemem oraz priorytetami ceny do wydajności.
| Model | Context | Inputs | Terminal-Bench 2.1 signal | Deployment | Best fit |
|---|---|---|---|---|---|
| Muse Spark 1.2 | 1M | Text, image, video, PDF | 82.9% with Muse Code | Meta hosted API | Muse Code, long-running repository work, lower API price |
| Claude Opus 5 | 1M | Text, image, documents | 86.7% with Claude Code | Hosted API | Maximum coding reliability and complex agent judgment |
| GPT-5.6 Terra | ~1.05M | Text, image | 81.8% with Codex | Hosted API | Balanced coding, productivity, and broad tool workflows |
| Grok 4.5 | 500K | Text, image | 81.6% with Grok Build | Hosted API | Coding combined with xAI tools and current information |
| Kimi K3 | 1M | Text, image, video | Not shown in Meta chart | Hosted and open-weight options | Long-horizon work and deployment flexibility |
Gdzie Muse Spark 1.2 ma najczytelniejszą przewagę
Muse Spark 1.2 najbardziej się wyróżnia, gdy aplikacja może wykorzystać trwały dziennik zdarzeń, projekt podagentów i specyficzny trening modelu w Muse Code. Jego standardowa cena API jest również agresywna względem premiumowych czołowych modeli do kodowania. Dla zespołów ceniących ściśle zintegrowany system agenta kombinacja ta może mieć większe znaczenie niż niewielka różnica na pojedynczym benchmarku.
Gdzie Claude Opus 5 pozostaje silniejszy
Claude Opus 5 prowadzi we wszystkich trzech wykresach kodowania Meta, w których występuje. Pozostaje bezpieczniejszym wyborem, gdy koszt nieudanej zmiany jest wysoki, a maksymalna niezawodność end-to-end w kodowaniu liczy się bardziej niż cena tokenów. Muse Spark 1.2 zmniejsza dystans, zwłaszcza w zadaniach terminalowych, ale go nie niweluje.
Gdzie pasuje GPT-5.6 Terra
GPT-5.6 Terra plasuje się blisko Muse Spark 1.2 na Terminal-Bench i wyżej na DeepSWE w ocenie Meta. Jego przewagą jest szerokość: zespoły już korzystające z narzędzi OpenAI do odpowiedzi, wyszukiwania, plików, shell, komputera i MCP mogą preferować model, który lepiej pasuje do istniejącego stosu produkcyjnego, nawet gdy inny model jest nieco tańszy.
Kiedy Grok 4.5 lub Kimi K3 może być lepszy
Grok 4.5 to silna alternatywa dla przepływów pracy łączących kodowanie z aktualnymi informacjami i ekosystemem narzędzi xAI. Kimi K3 jest atrakcyjniejszy, gdy liczy się wydajność długohoryzontowa, wdrożenie z otwartymi wagami lub większa kontrola nad dostawcą. Wybór praktyczny zależy od pełnego runtime’u: prompty, narzędzia, pamięć, wymagania bezpieczeństwa i strategia weryfikacji potrafią zmienić wyniki równie mocno jak sam model bazowy.
Co potrafi Muse Spark 1.2?
Inżynieria oprogramowania w skali repozytorium
Kontekst 1M tokenów może pomieścić znaczną ilość kodu źródłowego, dokumentacji, wyników testów, historii issue i stanu agenta. Odpowiednie zadania to funkcje obejmujące wiele plików, aktualizacje frameworków, refaktoryzacje w skali repozytorium, migracje API, naprawa testów, przegląd pull requestów i analiza architektury. Długi kontekst jest najkorzystniejszy w parze z wyszukiwaniem i kompaktowaniem, a nie ładowaniem repozytorium bez rozróżnienia.
Złożone debugowanie
Muse Spark 1.2 potrafi przejrzeć kod, uruchamiać narzędzia, czytać błędy, formułować hipotezy, wprowadzać poprawki i ponownie testować. Trening z naciskiem na kodowanie ma ulepszyć tę pętlę, w której trudność polega nie na zaproponowaniu wiarygodnej poprawki, lecz na identyfikacji przyczyny źródłowej i weryfikacji, że łatka nie wprowadza regresji.
Długotrwale działające agenty kodujące
Trwałe projekty to kluczowy przypadek użycia. Dziennik zdarzeń i agenci w tle w Muse Code pozwalają kontynuować pracę w wielu wywołaniach modelu i krokach narzędziowych. Przydaje się to do aktualizacji, strojenia wydajności, generowania dokumentacji, unowocześniania testów i “plastryzacji” funkcji, których nie można bezpiecznie zamknąć w jednej odpowiedzi.
Zautomatyzowane badania techniczne
Meta sprawdzała Muse Spark 1.2 na optymalizacji jąder GPU przy ponad 1 000 wywołań narzędzi i do 24 godzin. Agent pisał, kompilował, profilował i udoskonalał implementacje Triton względem referencyjnych baseline’ów. Szersza lekcja jest taka, że model jest zaprojektowany do iteracyjnej pracy technicznej, w której eksperymenty prowadzą do kolejnych działań.
Rozwój multimodalny
Wejścia obraz, wideo i PDF poszerzają pętlę wytwórczą poza kod źródłowy. Zespół może użyć modelu do porównania UI ze zrzutem ekranu, wyciągnięcia wymagań z dokumentu produktowego, interpretacji nagrania interakcji czy wygenerowania implementacji z odniesienia wizualnego. Przegląd ludzki pozostaje konieczny pod kątem dostępności, spójności marki, bezpieczeństwa i faktów osadzonych w treściach wizualnych.
Kiedy NIE używać Muse Spark 1.2?
Nie wybieraj go głównie do:
- prostego czatu
- podstawowego uzupełniania kodu
- autouzupełniania o niskich opóźnieniach
- pisania ogólnego
- zadań, gdzie maksymalna niezawodność benchmarków ma kluczowe znaczenie
- wysoko regulowanych obciążeń, jeśli warunki danych Contributor są nieodpowiednie
Ograniczenia Muse Spark 1.2
- Nieujawniona architektura: Meta nie opublikowała liczby parametrów, topologii modelu, routingu ekspertów ani liczby tokenów treningowych.
- Wyniki premierowe zależne od harnessu: Najsilniejsze wyniki łączą Muse Spark 1.2 z Muse Code, podczas gdy konkurenci używają innych produktów do kodowania.
- Prywatny benchmark wewnętrzny: Meta Internal Coding Bench nie może zostać niezależnie odtworzony ani audytowany przez zewnętrznych deweloperów.
- Nierówne przyrosty możliwości: Niezależna ocena pokazuje większe poprawy w pracy agentowej niż w rozumowaniu naukowym.
- Kompromis z abstynencją: Niższemu wskaźnikowi halucynacji towarzyszy niższy odsetek podejmowanych prób i nieco niższa trafność na AA-Omniscience.
- Wybór polityki danych: Najtańsza warstwa Contributor może wykorzystywać przesłane dane do ulepszania produktów Meta i może nie nadawać się do wrażliwego kodu.
- Długi kontekst to nie perfekcyjna pamięć: Limit 1M tokenów nie gwarantuje jednolitego pozyskiwania, uwagi ani dokładności na każdej pozycji.
- Premiera w trybie hostowanym: Pakiet wydaniowy zapewnia dostęp do API i Muse Code, a nie do pobieralnych wag modelu.
Jak uzyskać dostęp do Muse Spark 1.2
Deweloperzy mogą korzystać z Muse Spark 1.2 poprzez Muse Code lub Meta Model API. Standardowy identyfikator modelu API to muse-spark-1.2; tańsza ścieżka contributor używa muse-spark-1.2-contributor. Hostowane API Meta udostępnia bazowy adres zgodny z OpenAI, pozwalając dostosować wiele istniejących klientów chat-completions przez zmianę klucza, base URL i nazwy modelu.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODEL_API_KEY"],
base_url="https://api.meta.ai/v1",
)
response = client.chat.completions.create(
model="muse-spark-1.2",
messages=[
{"role": "user", "content": "Review this repository plan and identify the highest-risk implementation steps."}
],
)
print(response.choices[0].message.content)
Uwaga implementacyjna: Zweryfikuj aktualną nazwę modelu, uprawnienia konta, limity szybkości, obsługiwane parametry i dostępność regionalną w dokumentacji API Meta przed wdrożeniem. Nie umieszczaj klucza API bezpośrednio w kodzie źródłowym.
Do testów równoległych CometAPI już zapewnia ujednolicony dostęp do Claude Opus 5, GPT-5.6, Grok 4.5 i Kimi K3, co może uprościć testy A/B i przełączanie dostawców. Muse Spark 1.2 będzie też wkrótce dostępny w CometAPI.
Czy warto używać Muse Spark 1.2?
Warto testować Muse Spark 1.2, gdy obciążenie pracy jest zdominowane przez kodowanie w skali repozytorium, długotrwałe wykonanie, powtarzalną informację zwrotną z narzędzi i koordynację wielu agentów. Jego najsilniejszym argumentem jest połączenie modelu wyspecjalizowanego w kodowaniu, dedykowanego trwałego agenta, multimodalnego kontekstu 1M tokenów i niskiej standardowej ceny API.
Nie jest to uniwersalny lider benchmarków. Claude Opus 5 pozostaje z przodu w czołowych ewaluacjach kodowania Meta, GPT-5.6 Terra jest wysoko konkurencyjny w kodowaniu i ogólnych narzędziach produkcyjnych, a niezależne dane pokazują, że zyski Muse Spark 1.2 są skoncentrowane, a nie jednolite. Najlepszy proces wyboru jest więc oparty na obciążeniu: testuj każdy model w faktycznym runtime agenta, mierz weryfikowalne ukończenie zadań i uwzględnij przegląd ludzki dla zmian wrażliwych na bezpieczeństwo lub o wysokim wpływie.
Bottom line:
Muse Spark 1.2 to jak dotąd najsilniejsza aktualizacja Muse zorientowana na kodowanie od Meta. Jego prawdziwym wyróżnikiem nie jest jeden wynik benchmarku, lecz to, jak ściśle model, Muse Code, trwali podagenci, długi kontekst i pętla weryfikacji zostały zaprojektowane, by działać razem.
