Specyfikacja techniczna — Gemini 3.1 Pro
| Element | gemini-3-pro (publiczne podsumowanie) |
|---|---|
| Dostawca | |
| Kanoniczny identyfikator modelu | gemini-3-pro (publiczna wersja zapoznawcza) |
| Typy wejścia | Tekst, Obraz, Wideo, Audio, PDF |
| Typy wyjścia | Tekst (język naturalny, wyniki strukturalne, ładunki wywołań funkcji) |
| Limit tokenów wejściowych (kontekst) | 1,048,576 tokenów |
| Limit tokenów wyjściowych | 65,536 tokenów |
| Wywoływanie funkcji / użycie narzędzi | Obsługiwane (wywoływanie funkcji, wyniki strukturalne, integracje z narzędziami) |
| Multimodalność | Pełne wsparcie multimodalne (obrazy, wideo, audio, dokumenty) |
| Wykonywanie kodu i przepływy agentowe | Obsługiwane (tryb agenta, asysta kodu, orkiestracja narzędzi) |
| Data odcięcia wiedzy | styczeń 2025 |
Czym jest Gemini 3.1 Pro?
Gemini 3.1 Pro to publiczna flagowa wersja Google w rodzinie Gemini 3, pozycjonowana jako najnowocześniejszy multimodalny model rozumowania z zaawansowanymi narzędziami agentskimi i dla deweloperów. Model kładzie nacisk na obsługę kontekstu o bardzo dużej pojemności (ponad 1M tokenów na wejściu), szerokie wsparcie mediów (obrazy, wideo, audio, PDF) oraz głębokie integracje dla użycia narzędzi, wywoływania funkcji i przepływów skoncentrowanych na kodzie (np. Gemini Code Assist i tryby agenta).
Gemini 3 Pro jest przedstawiany przez Google jako zoptymalizowany zarówno pod kątem interaktywnych doświadczeń deweloperskich (niskie opóźnienia w kodowaniu i przepływach agenta), jak i wysokiej wierności zrozumienia multimodalnego (interpretowanie i rozumowanie na bazie mieszanych wejść medialnych).
Główne funkcje Gemini 3.1 Pro
Gemini-3.1 Pro (w wersji Preview) wprowadza następujące funkcje:
Integracja multimodalna
Przetwarza dane wejściowe z:
- Języka naturalnego
- Obrazów
- Mowy/audio
- Wideo
z ujednoliconą reprezentacją tokenów dla rozumowania międzymodalnego.
Rozszerzone okno kontekstu
Wyjątkowo duża pojemność kontekstu do ~1 miliona tokenów umożliwia obsługę:
- Długich dokumentów
- Syntezy wielodokumentowej
- Baz kodu i transkrypcji.
To przewyższa wiele konkurencyjnych modeli, które zazwyczaj obsługują ~32 K–262 K tokenów.
Rzadkie Mixture-of-Experts (MoE) — skalowanie
Routowanie Sparse MoE pozwala na skalowanie wewnętrznej pojemności modelu bez proporcjonalnych kosztów obliczeniowych, poprawiając rozumowanie w skali.
Zaawansowane rozumowanie / planowanie
Innowacje takie jak trening chain-of-thought, uczenie ze wzmocnieniem z informacją zwrotną od ludzi oraz wyspecjalizowane benchmarki sprawiają, że model jest mocny w zadaniach logicznych i matematycznych.
Domniemane benchmarki:
AIME 2025: 100% (z wykonywaniem kodu)
SWE-Bench Verified: 83,9%
ARC-AGI-2: 71,8%
LiveCodeBench Pro: 2844 Elo
Terminal-Bench 2.0: 63,5%
MMMLU: 93,6%
Reprezentatywne przypadki użycia w przedsiębiorstwach
- End-to-end potoki medialne: Pobieranie wideo, transkryptów i obrazów w celu generowania zsynchronizowanych podsumowań, metadanych i ustrukturyzowanych spostrzeżeń na dużą skalę.
- Generowanie i przegląd kodu na dużą skalę: Użycie w IDE i potokach CI do automatycznego generowania kodu, refaktoryzacji projektów wieloplikowych oraz proponowania testów w dużych bazach kodu.
- Automatyzacja agentowa: Koordynowanie agentów wielonarzędziowych, którzy wchodzą w interakcje z usługami chmurowymi, systemami orkiestracji i wewnętrznymi interfejsami API, wykorzystując ustrukturyzowane wywołania funkcji.
- Badania i produkcja treści: Tworzenie długich materiałów (raporty, książki), które łączą tekst i osadzone multimedia z zachowaniem wewnętrznych odwołań krzyżowych.
Jak uzyskać dostęp do Gemini 3.1 Pro API
Krok 1: Zarejestruj klucz API
Zaloguj się do cometapi.com. Jeśli nie jesteś jeszcze naszym użytkownikiem, najpierw się zarejestruj. Zaloguj się do konsoli CometAPI. Uzyskaj klucz API (poświadczenie dostępu) do interfejsu. Kliknij “Add Token” przy tokenie API w centrum osobistym, pobierz klucz tokenu: sk-xxxxx i zatwierdź.
Krok 2: Wysyłanie żądań do Gemini 3.1 Pro API
Wybierz endpoint “gemini-3.1-pro”, aby wysłać żądanie do API i ustaw treść żądania. Metodę żądania i treść żądania znajdziesz w dokumentacji API na naszej stronie. Na naszej stronie dostępny jest także test w Apifox dla Twojej wygody. Zastąp <YOUR_API_KEY> rzeczywistym kluczem CometAPI ze swojego konta. bazowy URL to Generowanie treści Gemini oraz Czat.
Wstaw swoje pytanie lub prośbę do pola content — na to model odpowie. Przetwórz odpowiedź API, aby uzyskać wygenerowaną odpowiedź.
Krok 3: Pobieranie i weryfikacja wyników
Przetwórz odpowiedź API, aby uzyskać wygenerowaną odpowiedź. Po przetworzeniu API zwróci status zadania i dane wyjściowe.
Zobacz także Gemini 3 Pro API