Specyfikacja techniczna mj-turbo-pic-reader
| Atrybut | Szczegóły |
|---|---|
| Identyfikator modelu | mj-turbo-pic-reader |
| Dostawca / rodzina modeli | Przepływ pracy do odczytu promptów obrazkowych oparty na Midjourney, udostępniony w CometAPI pod identyfikatorem mj-turbo-pic-reader. |
| Główna funkcja | Odczytuje i interpretuje prompty obrazkowe, aby mogły posłużyć do ukierunkowania generowania obrazów w Midjourney. |
| Typ wejścia | Wejście w postaci promptu obrazkowego, zazwyczaj łączone z opcjonalnymi instrukcjami tekstowymi dla silniejszej kontroli nad kompozycją i treścią. |
| Typ wyjścia | Zrozumienie promptu / kontekst generowania kierowanego obrazem, wykorzystywany do dalszego tworzenia obrazów w stylu Midjourney. |
| Kontekst trybu generowania | Powiązany z przepływami Midjourney Turbo, gdzie Tryb Turbo został zaprojektowany do generowania obrazów nawet czterokrotnie szybciej niż Tryb Fast, przy jednoczesnym zużyciu podwójnego czasu Fast. |
| Kompatybilny kontekst Midjourney | Tryb Turbo jest dostępny dla Midjourney w wersji 5 i nowszych; nowsze wersje Midjourney poprawiają precyzję dla promptów tekstowych i obrazkowych. |
| Typowe przypadki użycia | Analiza obrazu referencyjnego, promptowanie warunkowane obrazem, sterowanie stylem, wskazówki dotyczące kompozycji oraz szybkie iteracje kreatywne. |
| Sposób dostępu | Przez ujednolicone API CometAPI z użyciem identyfikatora modelu mj-turbo-pic-reader. |
Czym jest mj-turbo-pic-reader?
mj-turbo-pic-reader to identyfikator platformy CometAPI dla ukierunkowanego na Midjourney przepływu pracy odczytującego prompty obrazkowe. Bazując na zachowaniu promptów obrazkowych w Midjourney, model najlepiej rozumieć jako narzędzie do analizy dostarczonego obrazu i wykorzystania jego kluczowych elementów wizualnych jako wskazówek przy nowych generacjach, zwłaszcza w połączeniu z promptem tekstowym. Midjourney opisuje prompty obrazkowe jako sposób prowadzenia treści, kompozycji i kolorystyki poprzez analizę rdzeniowych elementów obrazu i użycie ich jako inspiracji dla nowego wyniku.
Część identyfikatora „turbo” silnie sugeruje zgodność z przepływami Midjourney Turbo, a nie oddzielną publiczną nazwę modelu bazowego Midjourney. Oficjalna dokumentacja Midjourney wyjaśnia, że Tryb Turbo to szybki tryb GPU, który potrafi generować obrazy do czterech razy szybciej niż Tryb Fast, choć wykorzystuje więcej rozliczanego czasu GPU. Czyni to mj-turbo-pic-reader praktycznym wyborem dla kreatywnych pipeline’ów zorientowanych na obraz, gdzie liczy się szybszy czas realizacji.
W praktyce ten identyfikator modelu jest najwłaściwszy, gdy chcesz przesłać obraz jako referencję wizualną, wyodrębnić lub wykorzystać jego sygnały stylistyczne i kompozycyjne oraz poprowadzić przepływ generowania w stylu Midjourney przez CometAPI, bez bezpośredniego mierzenia się z różnicami integracyjnymi specyficznymi dla dostawców. Ten opis to wniosek wyprowadzony z oficjalnej dokumentacji Midjourney dotyczącej promptów obrazkowych i Trybu Turbo, połączony z identyfikatorem modelu w CometAPI.
Główne funkcje mj-turbo-pic-reader
- Interpretacja promptu obrazkowego: akceptuje obraz jako wejście prowadzące, aby przepływ generowania mógł wykorzystać wskazówki wizualne, takie jak kompozycja, temat i kierunek kolorystyczny.
- Promptowanie tekst plus obraz: najlepiej sprawdza się w przepływach, w których obraz referencyjny łączy się z opisowym tekstem, dając bardziej jednoznaczną kontrolę nad wynikiem.
- Profil szybkości zgodny z Trybem Turbo: dopasowany do szybszych iteracji kreatywnych, ponieważ Tryb Turbo w Midjourney zaprojektowano do znacznie szybszego generowania niż standardowy Tryb Fast.
- Szybkie eksperymentowanie: pomocny dla zespołów szybko testujących wiele kierunków wizualnych, szczególnie w konceptowaniu, moodboardingu i eksploracji stylu. To praktyczny wniosek wynikający z Trybu Turbo oraz mechaniki promptów obrazkowych w Midjourney.
- Większa wierność promptów w nowszych generacjach Midjourney: dokumentacja Midjourney wskazuje, że nowsze wersje lepiej obsługują prompty tekstowe i obrazkowe, co sprzyja przepływom typu image-reader.
- Kreatywne ukierunkowanie zamiast dokładnej ekstrakcji: prompty obrazkowe Midjourney służą jako inspiracja oparta na elementach rdzeniowych, dlatego przepływ najlepiej sprawdza się do prowadzonego generowania, a nie deterministycznego parsowania obrazu czy odczytu OCR.
Jak uzyskać dostęp i zintegrować mj-turbo-pic-reader
Krok 1: Zarejestruj się, aby uzyskać klucz API
Zarejestruj się w CometAPI i utwórz klucz API w swoim panelu. CometAPI zapewnia ujednoliconą warstwę API, więc możesz uzyskać dostęp do mj-turbo-pic-reader przy użyciu tego samego schematu uwierzytelniania, którego używasz dla innych obsługiwanych modeli.
Krok 2: Wysyłaj żądania do API mj-turbo-pic-reader
Użyj zgodnego z Midjourney endpointu CometAPI pod adresem POST /mj/submit/describe.
curl https://api.cometapi.com/mj/submit/describe \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_API_KEY" \
-d '{
"prompt": "a futuristic cityscape at sunset --v 6.1",
"botType": "MID_JOURNEY",
"accountFilter": {
"modes": ["TURBO"]
}
}'
Krok 3: Pobierz i zweryfikuj wyniki
API zwraca obiekt zadania z identyfikatorem zadania. Odpytuj GET /mj/task/{task_id}/fetch, aby sprawdzić status generowania i pobrać adres URL obrazu wyjściowego, gdy zadanie osiągnie stan końcowy.