TL;DR
TurboFieldfare informuje o uruchomieniu tekstowej konfiguracji Gemma 4 26B z około 2 GB pamięci w czasie działania dzięki utrzymywaniu we wspólnej pamięci rdzenia modelu i pamięci podręcznej KV 4K oraz strumieniowemu ładowaniu trasowanych ekspertów z SSD. To wyspecjalizowana konfiguracja niskiej pamięci dla Apple Silicon — nie uniwersalne minimalne wymaganie dla Gemma 4 26B.
Gemma 4 26B A4B to model Mixture-of-Experts o 25,2 mld parametrów, aktywujący około 3,8 mld parametrów na token. Google udostępnia również hostowany dostęp przez Gemini API pod identyfikatorem modelu gemma-4-26b-a4b-it.
TurboFieldfare obniża rezydentną pamięć przez utrzymywanie w pamięci tylko współdzielonego rdzenia modelu, pamięci podręcznej KV oraz ostatnio używanych ekspertów. Pozostali trasowani eksperci są ładowani z SSD przy generowaniu każdego tokena.
Zgłaszany wynik 2 GB wiąże się z kilkoma ograniczeniami:
- Używa pamięci podręcznej KV 4K, a nie pełnego okna kontekstu 256K modelu.
- Lokalna instalacja modelu nadal wymaga około 14,3 GB przestrzeni SSD.
- Wydajność zależy od szybkości SSD, zachowania pamięci podręcznej i sprzętu Apple Silicon.
- Aktualny runtime obsługuje wyłącznie wnioskowanie tekstowe.
Trasa lokalna jest projektowana pod kątem pracy offline, prywatności na urządzeniu i kontroli nad sprzętem. Hostowane API Google zapewnia wejście tekstowe i obrazowe, zarządzaną infrastrukturę oraz łatwiejsze skalowanie.
Ten przewodnik wyjaśnia konfigurację 2 GB, a następnie porównuje wnioskowanie lokalne z API Google pod względem pamięci, szybkości, kontekstu, prywatności, gotowości produkcyjnej i całkowitego kosztu.
Gemma 4 26B API vs lokalnie w skrócie
| Wymiar | Oficjalne Gemini API | TurboFieldfare lokalny runtime |
|---|---|---|
| Model | gemma-4-26b-a4b-it | Gemma 4 26B A4B IT |
| Architektura | 25,2 mld parametrów łącznie, około 3,8 mld aktywnych | Ten sam bazowy model MoE, przepakowany i skwantyzowany |
| Okno kontekstu | Do 256K tokenów | Konfigurowalne; wynik 2 GB używa pamięci KV 4K |
| Modalności wejścia | Tekst i obrazy | Tylko tekst |
| Wyjście | Tekst | Tekst |
| Tryb rozumowania | Obsługiwany | Zależny od runtime |
| Instrukcje systemowe | Obsługiwane | Obsługiwane przez lokalne formatowanie czatu |
| Wywoływanie funkcji | Obsługiwane przez API | Wywołania narzędzi muszą być zatwierdzane i wykonywane przez klienta |
| Aktualna cena bezpośrednia | Darmowy poziom; brak obecnie płatnego tieru Gemma 4 | Brak opłat za tokeny, ale obowiązują koszty sprzętu i operacyjne |
| Obsługa danych | Treści z darmowego poziomu mogą być użyte do ulepszania produktów Google | Prompty mogą pozostać na urządzeniu |
| Lokalna pamięć modelu | Nie wymagana | Około 14,3 GB |
| Zgłaszana pamięć runtime | Zarządzana przez Google | Około 2 GB dla wag i pamięci KV 4K |
| Infrastruktura | Zarządzana przez Google | Zarządzana przez dewelopera |
| Gotowość produkcyjna | Hostowane, podlega limitom i dostępności | Wymaga bezpieczeństwa, monitoringu, planowania pojemności i failoveru |
Zgodnie z oficjalną kartą modelu Gemma 4, wariant 26B A4B używa 128 trasowanych ekspertów, aktywuje ośmiu trasowanych ekspertów na token i obejmuje jednego współdzielonego eksperta.
Szybkie informacje o Gemma 4 26B A4B
Gemma 4 (wydana ~kwiecień 2026 przez Google DeepMind na licencji Apache 2.0) obejmuje modele gęste (E2B, E4B, 12B, 31B) i ten wariant Mixture-of-Experts (MoE): około 25,2 mld parametrów łącznie, ale tylko ~3,8 mld aktywnych na token (A4B). Każdy token jest kierowany do niewielkiego podzbioru ekspertów (zwykle 8 aktywnych z 128 + 1 współdzielony). Daje to jakość zbliżoną do 31B przy koszcie obliczeniowym klasy ~4B, z oknem kontekstu 256K i obsługą multimodalną (tekst + obraz).
Ważne rozróżnienie: Wszystkie ~26 mld parametrów wciąż muszą być dostępne do trasowania. Konwencjonalne runtime’y (Ollama, llama.cpp, LM Studio, vLLM itp.) ładują pełne skwantyzowane wagi do RAM/VRAM.
Co oznacza lokalna Gemma 4 na 2 GB?
Wynik 2 GB pochodzi z TurboFieldfare, niezależnego runtime’u w Swift i Metal zbudowanego specjalnie dla Gemma 4 26B A4B na Apple Silicon.
TurboFieldfare nie utrzymuje całej lokalnej instalacji modelu w zunifikowanej pamięci. Utrzymuje w pamięci 1,35 GB współdzielonego rdzenia modelu i pamięci podręcznej KV w FP16, a trasowani eksperci wymagani dla każdego tokena są strumieniowani z SSD.
Projekt podaje następującą referencyjną konfigurację:
| Lokalny pomiar runtime | Zgłaszana wartość | Prawidłowa interpretacja |
|---|---|---|
| Pamięć runtime | Około 2 GB | Wagi i pamięć KV 4K w ramach opublikowanej konfiguracji |
| Zainstalowane dane modelu | Około 14,3 GB | Wymagana przestrzeń SSD po przepakowaniu |
| Wstępny transfer | Około 15 GB | Dane pobrane i przepakowane podczas instalacji |
| Zweryfikowany sprzęt bazowy | 8 GB M2 MacBook Air | Cały komputer nadal wymaga 8 GB pamięci |
| Szybkość dekodowania M2 | 5,1–6,3 tokenów na sekundę | Pomiar społeczności na 8 GB M2 MacBook Air |
| Szybkość dekodowania M5 Pro | 31–35 tokenów na sekundę | Pomiar społeczności na 24 GB M5 Pro |
| Obsługiwane wejście | Tekst | Obrazy, audio i wideo nie są obsługiwane |
| Lokalny interfejs API | Eksperymentalny serwer zgodny z OpenAI | Przeznaczony do dostępu pętli zwrotnej, nie do wystawiania w internecie |
To są pomiary społeczności runtime, a nie oficjalne benchmarki Google. Długość promptu, długość generacji, wydajność SSD, zachowanie pamięci ekspertów i konfiguracja sprzętu mogą zmieniać wynik.
Precyzyjne podsumowanie brzmi:
TurboFieldfare uruchamia skwantyzowaną, tylko-tekstową konfigurację Gemma 4 26B A4B, używając około 2 GB na wagi i pamięć KV 4K dzięki strumieniowaniu trasowanych ekspertów z SSD.
Nie należy tego streszczać jako:
Gemma 4 26B potrzebuje tylko 2 GB RAM.
Takie krótsze twierdzenie pomija wymóg 14,3 GB przestrzeni, ograniczoną konfigurację kontekstu, zależność od SSD, metodę kwantyzacji oraz pamięć wciąż potrzebną przez macOS i inne aplikacje.
Jakie są standardowe wymagania lokalnego wnioskowania
Google publikuje przybliżone wymagania pamięci dla konwencjonalnego wnioskowania Gemma 4 26B A4B:
| Precyzja | Przybliżona pamięć |
|---|---|
| BF16 | 57,7 GB |
| SFP8 | 28,8 GB |
| Q4_0 | 14,4 GB |
Te wartości obejmują szacunkowe 20% narzutu ładowania modelu. Nie obejmują dodatkowej pamięci wymaganej przez framework wnioskowania ani pamięci podręcznej KV.
Zobacz przegląd Gemma 4 i tabelę pamięci po aktualne oficjalne szacunki.
Jak 2 GB ma się do standardowych wymagań pamięci?
TurboFieldfare osiąga znacznie niższą pamięć rezydentną, ponieważ nie utrzymuje pełnego skwantyzowanego modelu rezydentnie w pamięci. Łączy:
- Czterobitowe wagi modelu.
- Ograniczoną pamięć ekspertów w pamięci.
- Strumieniowanie trasowanych ekspertów z SSD.
- Pamięć KV 4K w opublikowanej konfiguracji.
- Niestandardowe jądra wnioskowania w Swift i Metal.
To tworzy inny kompromis niż konwencjonalne wdrożenie w pełni rezydentne.
W pełni rezydentny model Q4 wymaga istotnie więcej pamięci, ale unika wielokrotnego ładowania danych ekspertów z pamięci masowej. TurboFieldfare zmniejsza presję na pamięć, ale uzależnia wydajność od przepustowości SSD, trafień w pamięci podręcznej, długości kontekstu i generacji sprzętu.
Działa to dlatego, że model jest MoE. Modele gęste nie mogą tego sensownie wykorzystać — każda waga uczestniczy w każdym przebiegu. To trick inżynieryjny wykorzystujący architekturę, a nie fundamentalna zmiana rozmiaru modelu. Wydajność jest użyteczna dla zadań wsadowych/asynchronicznych na Macach z małą pamięcią, ale nie do czatu w czasie rzeczywistym na najsłabszym sprzęcie. Obecnie wyłącznie na Mac/Apple Silicon i specyficzne dla modelu.
Czy konfiguracja 2 GB może używać pełnego okna 256K?
Oficjalny model Gemma 4 26B A4B obsługuje okno kontekstu do 256K tokenów. Opisana konfiguracja TurboFieldfare ~2 GB używa jednak pamięci KV 4K.
To odrębne miary:
- Oficjalna zdolność modelu: do 256K tokenów.
- Opublikowany lokalny wynik pamięci: pamięć KV 4K.
- Praktyczny lokalny kontekst: determinowany dostępnością pamięci, ustawieniami runtime, długością promptu i akceptowalną latencją.
Pamięć podręczna KV rośnie wraz z wydłużaniem promptu i generowanej odpowiedzi. Zwiększanie lokalnej konfiguracji do 32K, 128K lub 256K tokenów zwiększy użycie pamięci i może również wpływać na czas prefill i szybkość generacji.
Zespoły oceniające analizę długich dokumentów powinny przetestować docelowy kontekst, zamiast zakładać, że wynik 2 GB dotyczy pełnego okna kontekstu modelu.
Jak szybka jest Gemma 4 26B na Apple Silicon?
TurboFieldfare podaje dwa referencyjne zakresy szybkości dekodowania:
- 8 GB M2 MacBook Air: 5,1–6,3 tokenów na sekundę.
- 24 GB M5 Pro: 31–35 tokenów na sekundę.
Te wyniki pokazują, jak silnie sprzęt wpływa na lokalne wnioskowanie. Nie należy ich traktować jako uniwersalnych gwarancji wydajności.
Oszacuj maksymalną miesięczną produkcję
Maksymalna miesięczna liczba tokenów wyjściowych = tokeny dekodowane na sekundę × 60 × 60 × 24 × 30
Na podstawie zgłaszanych szybkości dekodowania:
| Wynik sprzętowy | Teoretyczna produkcja 24/7 | Produkcja przy 50% wykorzystaniu |
|---|---|---|
| M2 przy 5,1 tok/s | 13,2 mln tokenów/miesiąc | 6,6 mln tokenów/miesiąc |
| M2 przy 6,3 tok/s | 16,3 mln tokenów/miesiąc | 8,2 mln tokenów/miesiąc |
| M5 Pro przy 31 tok/s | 80,4 mln tokenów/miesiąc | 40,2 mln tokenów/miesiąc |
| M5 Pro przy 35 tok/s | 90,7 mln tokenów/miesiąc | 45,4 mln tokenów/miesiąc |
To szacunki tylko dla dekodowania. Rzeczywiste aplikacje spędzają czas także na:
- Wstępnym przetwarzaniu promptu (prefill).
- Kolejkowaniu żądań.
- Ładowaniu modelu i restartach.
- Nieudanych lub odrzuconych odpowiedziach.
- Aktywności systemu operacyjnego.
- Monitoringu i utrzymaniu.
- Planowanych i nieplanowanych przestojach.
Na przykład wytworzenie czterech milionów tokenów wyjściowych przy 5,1 tokena na sekundę wymaga około 9,1 dnia nieprzerwanego dekodowania. Wygenerowanie 20 milionów tokenów wymagałoby około 45,4 dnia, co czyni to obciążenie niemożliwym do realizacji na jednym M2 w ciągu 30-dniowego miesiąca.
Realistyczny lokalny model kosztowy musi zatem uwzględniać przepustowość oraz stały koszt sprzętu.
Czy istnieje oficjalne API dla Gemma 4 26B?
Tak.
Google udostępnia Gemma 4 26B przez Gemini API. Oficjalny identyfikator modelu to:
gemma-4-26b-a4b-it
Hostowany endpoint obsługuje generowanie tekstu, rozumienie obrazów, instrukcje systemowe, konfigurowalne rozumowanie, wywoływanie funkcji i konwersacje wieloturowe. To najszybszy sposób oceny modelu bez pobierania wag i uruchamiania serwera wnioskowania.
Google udostępnia najnowsze przykłady w dokumentacji Gemma w Gemini API.
Wywołaj Gemma 4 26B w Pythonie
Zainstaluj SDK Google Gen AI:
pip install -U google-genai
Ustaw klucz Gemini API w środowisku i wyślij żądanie:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemma-4-26b-a4b-it",
contents="Explain mixture-of-experts routing in simple terms.",
)
print(response.text)
Ten przykład potwierdza podstawowy dostęp do API. Nie weryfikuje limitów produkcyjnych, latencji, wydajności długiego kontekstu ani wymogów przetwarzania danych dla Twojej aplikacji.
Ile kosztuje API Gemma 4 26B?
Google obecnie wymienia wejście, wyjście i cache kontekstu dla Gemma 4 jako darmowe w darmowym poziomie Gemini API. Płatny tier dla Gemma 4 nie jest obecnie wymieniony.
Uwaga dot. danych darmowego poziomu: Google stwierdza, że treści przesłane w ramach darmowego poziomu mogą być użyte do ulepszania produktów. Nie wysyłaj treści poufnych, regulowanych ani należących do klientów, dopóki Twój zespół nie przeanalizuje odpowiednich zasad użycia i retencji danych.
Uwaga dot. cen: Dostęp darmowego poziomu nie powinien być traktowany jako stałe zobowiązanie cenowe dla produkcji. Dostępność, limity, zasady danych i opcje płatne mogą się zmieniać.
Sprawdź oficjalny cennik Gemini API przed podjęciem decyzji produkcyjnej.
Aktualne ceny tworzą nietypowe porównanie:
- Oficjalne API może nie mieć bezpośredniego kosztu tokenów w limitach darmowego poziomu.
- Wnioskowanie lokalne nie generuje rachunku za tokeny u dostawcy, ale wymaga sprzętu, energii, pamięci masowej, utrzymania i czasu inżynieryjnego.
- Zewnętrzni dostawcy hostowani mogą oferować inną pojemność, ceny, zasady retencji i warunki handlowe.
Dla samej Gemma 4 26B używaj oficjalnej dokumentacji Gemma w Gemini API i weryfikuj bieżące limity na stronie cen Gemini API.
CometAPI obecnie nie wymienia Gemma 4 26B jako dostępnego modelu. Zespoły, które chcą również ocenić hostowane alternatywy Gemini, mogą przejrzeć aktualnie wymienione modele, takie jak Gemini 3.6 Flash, Gemini 3 Flash i inne opcje w katalogu modeli Google w CometAPI.
Czy lokalna Gemma 4 jest tańsza niż API?
Przy obecnych cenach oficjalne Gemini API może być tańsze w bezpośrednich kategoriach finansowych, ponieważ Gemma 4 jest dostępna za darmo w darmowym poziomie.
Jednak bezpośrednia cena za token to tylko część decyzji.
Przykładowy koszt lokalnego sprzętu
Załóżmy, że zespół kupuje maszynę Apple Silicon za 1200 USD i amortyzuje ją przez 24 miesiące.
Miesięczna amortyzacja sprzętu 1200 USD ÷ 24 miesiące = 50 USD miesięcznie
Jeśli maszyna skutecznie generuje cztery miliony tokenów wyjściowych miesięcznie:
Amortyzacja sprzętu na 1 mln tokenów wyjściowych 50 USD ÷ 4 = 12,50 USD za 1 mln tokenów wyjściowych
Arytmetyka jest poprawna, ale to nie jest pełny koszt całkowity. Nie uwzględnia:
- Energii elektrycznej.
- Zużycia i wymiany SSD.
- Czasu konfiguracji i inżynierii.
- Monitoringu i utrzymania.
- Nieudanych generacji i ponowień.
- Weryfikacji manualnej.
- Zapasowej pojemności.
- Przestojów i failoveru.
- Kosztu alternatywnego użycia maszyny do wnioskowania.
Zakłada też, że sprzęt może wytworzyć docelową liczbę tokenów w dostępnych ramach czasu operacyjnego.
Porównuj koszt na zaakceptowane zadanie
Bardziej użyteczny wzór na koszt lokalny to:
Lokalny koszt na zaakceptowane zadanie = amortyzacja sprzętu
- energia elektryczna
- przechowywanie i utrzymanie
- czas inżynieryjny
- nieudane generacje i ponowienia
- weryfikacja manualna ÷ zaakceptowane zadania
Dla płatnej usługi hostowanej:
Koszt hostowany na zaakceptowane zadanie = opłaty za tokeny wejściowe
- opłaty za tokeny wyjściowe
- opłaty za cache, narzędzia lub żądania
- ponowienia
- weryfikacja manualna ÷ zaakceptowane zadania
Najniższa deklarowana cena za token nie zawsze daje najniższy koszt aplikacji. Trasa z wolniejszymi odpowiedziami, niepoprawnym wyjściem strukturalnym lub wysokim odsetkiem ponowień może kosztować więcej na zaakceptowany wynik.
Czy lokalny serwer zgodny z OpenAI można użyć w produkcji?
TurboFieldfare zawiera eksperymentalny serwer zgodny z OpenAI, który nasłuchuje pod adresem:
http://127.0.0.1:8080/v1
Obsługuje Chat Completions, strumieniowanie, deklaracje funkcji i ponowne użycie prefiksu promptu. Jednak projekt stwierdza, że serwer powinien pozostać na interfejsie loopback, ponieważ nie zapewnia zdalnej autentykacji ani TLS.
Domyślnie należy go traktować jako lokalny endpoint deweloperski.
Wdrożenie produkcyjne wymagałoby dodatkowej warstwy serwującej z:
- Uwierzytelnianiem i autoryzacją.
- TLS dla ruchu opuszczającego hosta.
- Limitami rozmiaru żądań i odpowiedzi.
- Kolejkowaniem i kontrolą współbieżności.
- Nadzorem procesów i automatycznymi restartami.
- Sprawdzaniem gotowości modelu.
- Monitorowaniem presji pamięci.
- Metrykami SSD i pamięci ekspertów.
- Monitorowaniem latencji i przepustowości.
- Logowaniem z poszanowaniem prywatności.
- Obsługą przeciążenia.
- Trasą awaryjną na wypadek lokalnej awarii.
Lokalny serwer może zwracać generowane przez model wywołania narzędzi, ale aplikacja musi każde działanie sprawdzić, autoryzować i wykonać. Model nie powinien wykonywać narzędzi bezpośrednio.
Dla Gemma 4 26B oficjalną trasą hostowaną jest Gemini API Google. Jeśli aplikacja używa także innych hostowanych modeli, szybki start CometAPI pokazuje, jak wspierane modele można podłączyć przez interfejs zgodny z OpenAI. Może to zapewnić osobną hostowaną trasę awaryjną, ale nie należy przedstawiać jej jako trasy CometAPI dla Gemma 4, dopóki model nie pojawi się w żywym katalogu.
Decyzja o wdrożeniu Gemma 4 26B
API (hostowane, Gemini API, inne)
- Ceny około 0,07 USD / 1 mln tokenów wejściowych i 0,30–0,34 USD / 1 mln tokenów wyjściowych (różne w zależności od dostawcy; niektórzy nieco wyżej).
- Zerowy koszt sprzętu i konfiguracji, wysoka szybkość/przepustowość, łatwe skalowanie, dostępne funkcje multimodalne i pełny zestaw możliwości.
-
Trwający koszt per-token, dane opuszczają Twoją maszynę, limity stawek/kwoty, możliwa zmienność latencji.
Standardowo lokalnie
- Jednorazowy koszt sprzętu + energii elektrycznej; prywatność i możliwość pracy offline.
- Wymaga wystarczającej pamięci RAM/VRAM (zwykle 18–32+ GB użyteczne) lub akceptuje niskie szybkości/przerzucanie.
-
Pełna kontrola, brak opłat per-token po konfiguracji, ale zarządzasz kwantyzacją, serwowaniem, aktualizacjami i sprzętem.
Lokalnie w stylu TurboFieldfare
- Uruchamia pełnozakresowy 26B MoE na maszynach, które inaczej by nie dały rady (nawet 8 GB Mac).
- Prywatność/offline + niemal zerowy koszt krańcowy, ale wolniej niż dobrze wyposażone GPU czy dobre API, dziś tylko Mac, skupione na tekście, wymaga specjalizowanego runtime’u.
Użyj trasy hybrydowej, gdy:
- Prywatne obciążenia powinny pozostać lokalnie.
- Ruch publiczny lub skokowy wymaga hostowanej pojemności.
- Aplikacja potrzebuje failoveru.
- Różne zadania korzystają z różnych modeli.
- Chcesz porównywać trasy przez spójny interfejs API.
Prosta ścieżka decyzji:
Must the workload remain offline or on-device?
├── Yes → Test the local Apple Silicon runtime
└── No
├── Need image input or fast setup? → Start with the Gemini API
├── Need paid capacity or an SLA? → Evaluate hosted providers
└── Need privacy plus burst capacity? → Use a hybrid route
Oficjalne API vs lokalnie vs hosting stron trzecich
| Wymaganie | Oficjalne Gemini API | TurboFieldfare lokalnie | Hostowane API stron trzecich |
|---|---|---|---|
| Szybka wstępna konfiguracja | Silna | Średnia | Silna |
| Wejście tekstowe | Tak | Tak | Zależne od dostawcy |
| Wejście obrazów | Tak | Nie | Zależne od dostawcy |
| Praca offline | Nie | Tak | Nie |
| Dane pozostają na urządzeniu | Nie | Tak | Nie |
| Aktualna cena bezpośrednia za tokeny | Darmowy poziom | Brak opłat dostawcy per-token | Zależne od dostawcy |
| Płatny tier produkcyjny | Obecnie brak dla Gemma 4 | Samodzielnie zarządzany | Zależne od dostawcy |
| Ruch skokowy | Podlega limitom dostawcy | Ograniczony lokalną pojemnością | Zwykle silniejszy |
| Pełne 256K kontekstu modelu | Obsługiwane przez model | Nie pokazane w konfiguracji 2 GB | Zależne od dostawcy |
| Uwierzytelnianie i TLS | Zarządzane | Musi zostać dodane | Zwykle zarządzane |
| Własność infrastruktury | Deweloper | Dostawca | |
| Umowa serwisowa | Nie wynika z darmowego poziomu | Samodzielnie zarządzana | Zależne od dostawcy |
| Kontrola runtime’u | Ograniczona | Wysoka | Zależne od dostawcy |
Przed wyborem trasy zewnętrznej zweryfikuj, że dokładny model jest aktualnie dostępny, zamiast zakładać wsparcie. Gemma 4 26B powinna być dostępna przez oficjalne Gemini API Google, chyba że inny dostawca wyraźnie wymienia ten sam identyfikator modelu. Dla innych hostowanych modeli Gemini katalog modeli Google w CometAPI pokazuje aktualnie wspierane opcje, a dokumentacja CometAPI wyjaśnia, jak wywoływać te modele przez endpoint zgodny z OpenAI.
Hybrydowe wdrożenie może być najbardziej praktycznym długoterminowym rozwiązaniem: lokalne wnioskowanie dla prywatnych lub offline’owych zadań tekstowych, oficjalny endpoint do szybkiej oceny multimodalnej i hostowana trasa dla pojemności produkcyjnej lub failoveru.
Jak ocenić API vs lokalne dla Gemma 4 26B
Uruchom to samo obciążenie przez każdą trasę wdrożenia.
Praktyczny zestaw ewaluacyjny może obejmować:
- Dziesięć zadań kodowania, ekstrakcji lub transformacji.
- Pięć zadań rozumowania z obiektywnymi odpowiedziami.
- Pięć zadań długiego kontekstu przy różnych długościach kontekstu.
- Pięć zadań rozumienia obrazów dla tras obsługujących obrazy.
- Pięć zadań wywoływania funkcji z autoryzacją po stronie klienta.
- Pięć zadań wyjścia strukturalnego z rygorystyczną walidacją JSON.
Zapisuj:
- Czas do pierwszego tokena.
- Łączny czas ukończenia.
- Czas prefill promptu.
- Tokeny dekodowane na sekundę.
- Szczytowe lokalne użycie pamięci.
- Przeczytane bajty z SSD.
- Czas w kolejce.
- Zachowanie współbieżności.
- Długość kontekstu.
- Poprawność wyjścia strukturalnego.
- Poprawność wywołań narzędzi.
- Odsetek zaakceptowanych zadań.
- Czas korekty manualnej.
- Odsetek awarii i ponowień.
- Lokalny koszt operacyjny.
- Opłaty za tokeny i żądania w hostingu.
Używaj tych samych szablonów promptów, limitów wyjścia, temperatur i zasad akceptacji.
Nie porównuj krótkiego lokalnego żądania tekstowego z długim hostowanym żądaniem multimodalnym i nie przedstawiaj wyniku jako bezpośredniego benchmarku modelu.
FAQ
Czy istnieje oficjalne API Gemma 4 26B?
Tak. Google udostępnia Gemma 4 26B przez Gemini API z identyfikatorem modelu gemma-4-26b-a4b-it. Obsługuje generowanie tekstu, wejście obrazów, instrukcje systemowe, konfigurowalne rozumowanie, wywoływanie funkcji i konwersacje wieloturowe.
Czy API Gemma 4 26B jest darmowe?
Google obecnie wymienia wejście, wyjście i buforowanie kontekstu dla Gemma 4 jako darmowe w darmowym poziomie Gemini API. Płatny tier Gemma 4 nie jest obecnie wymieniony. Treści z darmowego poziomu mogą być używane do ulepszania produktów Google, więc przeanalizuj odpowiednie warunki przed wysłaniem wrażliwych informacji.
Czy Gemma 4 26B naprawdę działa w 2 GB RAM?
TurboFieldfare zgłasza około 2 GB dla wag i pamięci KV 4K. Cała konfiguracja nadal wymaga Maca Apple Silicon z 8 GB pamięci, około 14,3 GB przestrzeni i strumieniowania ekspertów z SSD.
Czy konfiguracja 2 GB obsługuje kontekst 256K?
Model obsługuje do 256K tokenów, ale opublikowany lokalny wynik 2 GB używa pamięci KV 4K. Dłuższe lokalne konteksty wymagają dodatkowej pamięci i testów wydajności.
Czy lokalna Gemma 4 jest tańsza niż hostowane API?
Może być dla długotrwałych zadań tekstowych na sprzęcie, który już posiadasz, ale wynik zależy od przepustowości, wykorzystania, energii, utrzymania, ponowień i jakości wyjścia. Ponieważ oficjalne API jest obecnie darmowe w limitach darmowego poziomu, lokalne wdrożenie nie jest automatycznie najtańszą opcją.
Końcowa rekomendacja
Konfiguracja około 2 GB w TurboFieldfare to wyspecjalizowana technika wdrożenia na Apple Silicon, a nie uniwersalne wymaganie pamięciowe Gemma 4 26B. Działa dzięki ograniczeniu pamięci KV i strumieniowaniu trasowanych ekspertów z SSD zamiast utrzymywania pełnego skwantyzowanego modelu rezydentnie w pamięci.
Dla większości użytkowników praktyczne wybory pozostają następujące:
- Użyj API dla wygody i szybkości, jeśli pozwalają na to koszty i prywatność.
- Uruchom standardowe lokalne skwantyzowane wersje, jeśli masz 24 GB+ pamięci.
- Użyj TurboFieldfare (lub przyszłych podobnych silników), jeśli szczególnie chcesz jakości 26B MoE na ograniczonym sprzęcie Apple Silicon.
Dla obciążeń produkcyjnych porównuj obie trasy używając tych samych promptów, długości kontekstu, limitów wyjścia i kryteriów akceptacji. Ostateczna decyzja powinna opierać się na jakości, latencji, osiągalnej przepustowości i całkowitym koszcie na zaakceptowane zadanie — a nie wyłącznie na nagłówku „2 GB”.
