Specyfikacja techniczna mj-turbo-describe
| Specyfikacja | Szczegóły |
|---|---|
| ID modelu | mj-turbo-describe |
| Dostawca / rodzina | Możliwość Describe Midjourney, udostępniona przez CometAPI z wykorzystaniem platformowego identyfikatora modelu mj-turbo-describe |
| Modalność | Generowanie promptów typu image-to-text |
| Główna funkcja | Analizuje przesłany obraz i zwraca opisowe propozycje promptów, które można ponownie wykorzystać do generowania obrazów |
| Typ wejścia | Przesłanie obrazu lub URL obrazu, w zależności od implementacji klienta |
| Typ wyjścia | Wiele tekstowych propozycji promptów pochodzących z obrazu wejściowego |
| Typowa liczba wyników | Przepływ Describe w Midjourney zwraca cztery propozycje promptów na obraz |
| Wzorzec interakcji | Asynchroniczne, kreatywne generowanie promptów na podstawie wejścia wizualnego |
| Najlepiej do | Odwrócone promptowanie, tworzenie pomysłów na prompty, odkrywanie stylu, przepływy pracy remix oraz konwersja materiałów referencyjnych na prompty tekstowe do wielokrotnego użytku |
| Dostęp do platformy | Dostępny poprzez CometAPI pod kodem modelu mj-turbo-describe |
| Uwagi dotyczące zachowania upstream | Według Midjourney, Describe to narzędzie image-to-text, którego celem jest inspirowanie promptów, a nie dokładne odtworzenie obrazu źródłowego; wielokrotne uruchomienia na tym samym obrazie mogą dawać różne propozycje. |
Czym jest mj-turbo-describe?
mj-turbo-describe to identyfikator platformy CometAPI dla możliwości image-to-text w stylu Describe od Midjourney. Zamiast generować obraz z promptu tekstowego, ten model działa w odwrotnym kierunku: analizuje przesłany obraz i proponuje język promptu, który oddaje elementy wizualne, wskazówki stylistyczne i kreatywną ramę. Midjourney oficjalnie opisuje Describe jako narzędzie, które analizuje obraz i oferuje słowa oraz frazy do inspiracji promptami.
W praktyce czyni to mj-turbo-describe użytecznym dla osób, które chcą zamienić istniejące materiały wizualne w nadający się do ponownego wykorzystania język promptów. Może pomóc wydobyć słownictwo stylistyczne, zidentyfikować wzorce kompozycyjne i przyspieszyć eksperymenty przy budowaniu promptów do dalszego generowania obrazów. Midjourney zaznacza również, że propozycje mają charakter inspiracyjny, a nie wierne odtwarzanie obrazu źródłowego, dlatego model najlepiej rozumieć jako kreator promptów, a nie ścisły system podpisów czy analizy forensycznej.
Ponieważ powtarzane uruchomienia Describe mogą generować różne zestawy promptów dla tego samego obrazu, mj-turbo-describe dobrze sprawdza się w iteracyjnych przepływach pracy, gdzie zmienność jest cenna.
Główne funkcje mj-turbo-describe
- Konwersja obrazu na prompt: Konwertuje obraz źródłowy na propozycje promptów tekstowych, ułatwiając przejście od inspiracji wizualnej do gotowego promptu.
- Wiele kandydatów na prompt: Zwraca cztery propozycje promptów na obraz, oferując kilka kreatywnych kierunków zamiast jednej sztywnej opisu.
- Wsparcie ideacji promptów: Pomaga odkrywać słowa i frazy dotyczące stylu, nastroju, kompozycji i tematu, których użytkownik mógłby sam nie zapisać.
- Niedeterministyczna kreatywna zmienność: Ponowne uruchomienie Describe na tym samym obrazie może przynieść inny zestaw propozycji, co sprzyja burzy mózgów i eksploracji.
- Przepływ oparty na referencjach: Wspiera przepływy pracy oparte na przesyłanych obrazach lub linkach do obrazów, dobrze dopasowane do twórców zaczynających od szkiców, zdjęć, moodboardów lub wcześniejszych generacji.
- Szybkie ponowne użycie w potokach generowania: Wyniki Describe z Midjourney są zaprojektowane do natychmiastowego ponownego użycia jako prompty, co łatwo mapuje się na automatyzację kreatywną przez API.
- Odkrywanie stylu: Szczególnie przydatne do identyfikowania języka wizualnego osadzonego w obrazie referencyjnym, w tym wskazówek estetycznych mogących zasilać przyszłe generacje.
Jak uzyskać dostęp i zintegrować mj-turbo-describe
Krok 1: Zarejestruj się po klucz API
Aby rozpocząć, zarejestruj się w CometAPI i wygeneruj swój klucz API w pulpicie. Następnie bezpiecznie przechowuj klucz jako zmienną środowiskową, na przykład COMETAPI_API_KEY. Ten klucz będzie używany do uwierzytelniania każdego żądania wysyłanego do interfejsu API mj-turbo-describe.
Krok 2: Wysyłanie żądań do interfejsu API mj-turbo-describe
Użyj punktu końcowego CometAPI zgodnego z Midjourney pod adresem POST /mj/submit/describe.
curl https://api.cometapi.com/mj/submit/describe \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_API_KEY" \
-d '{
"prompt": "a futuristic cityscape at sunset --v 6.1",
"botType": "MID_JOURNEY",
"accountFilter": {
"modes": ["TURBO"]
}
}'
Krok 3: Pobierz i zweryfikuj wyniki
API zwraca obiekt zadania z identyfikatorem zadania. Odpytuj GET /mj/task/{task_id}/fetch, aby sprawdzić status generowania i pobrać wyjściowy URL obrazu, gdy zadanie osiągnie stan końcowy.