Tekniske specifikationer for Hy-Image 3.5 Preview
| Element | Hy-Image 3.5 Preview |
|---|---|
| Model-id | hy-image-v3.5-preview |
| Udbyder | Tencent Hunyuan |
| Modeltype | Professionel model til billedgenerering og -redigering |
| Input | Tekst + referencebilleder |
| Output | Billeder |
| Inputgrænse | Op til 100K tokens |
| Genereringstilstande | Tekst-til-billede, billede-til-billede, fleromgangsredigering |
| Billedreferencer | Op til 20 billeder pr. anmodning |
| Referencebilledstørrelse | Op til 20MB pr. billede |
| Outputopløsning | Op til 4096 × 4096 (4K) |
| Protokol | Chat / Messages |
| Generering | Synkron |
| Ekstern søgning | Understøttet |
| Seed | Understøttet |
| Brugertilpasset størrelse | Understøttet |
Hvad er Hy-Image 3.5 Preview?
Hy-Image 3.5 Preview er Tencent Hunyuans professionelle billedgenereringsmodel designet til tekst-til-billede-generering, billede-til-billede-generering og fleromgangs billedredigering.
I modsætning til en konventionel billedgenererings-API med én prompt bruger Hy-Image 3.5 Preview en Chat/Messages-stil-protokol, som gør det muligt at kombinere tekstprompter, referencebilleder og tidligere billedgenereringskontekst i en samtalebaseret arbejdsgang. Modellen kan derfor ikke kun bruges til at skabe et billede fra bunden, men også til iterativt at ændre et eksisterende resultat over flere runder.
Hovedfunktioner i Hy-Image 3.5 Preview
- Tekst-til-billede-generering: Generer billeder ud fra naturlige sprogprompter, og lad modellen fortolke den ønskede komposition, stil, motiv og visuelle detaljer.
- Billede-til-billede-generering: Kombinér tekstinstruktioner med referencebilleder for at styre det genererede resultat.
- Fleromgangsredigering: Bevar tidligere samtale- og billedkontekst, så brugere gradvist kan forfine et billede i stedet for at starte forfra.
- Multimodalt input: En anmodning kan kombinere tekstlige instruktioner med referencebilleder, hvilket gør den egnet til stiloverførsel, produktbilledredigering, karakterjusteringer og visuel iteration.
- 4K-output: Den officielle API-dokumentation understøtter output op til 4096 × 4096 pixels, med forbehold for de dokumenterede begrænsninger for billedareal.
- Forbedring via ekstern søgning: API-dokumentationen angiver forbedring via ekstern søgning som en understøttet funktion, hvilket gør det muligt for billedgenereringsarbejdsgange at inddrage yderligere information efter behov.
- Fleksibel billedstørrelse: Udviklere kan angive en præcis
sizeeller lade modellen bestemme en passende outputstørrelse baseret på prompten og det konfigurerede pixelbudget. - Seed-kontrol: Et seed kan angives, når reproducerbar generering er påkrævet.
Funktioner til billedgenerering og -redigering
Tekst-til-billede
Hy-Image 3.5 Preview kan generere billeder direkte ud fra tekstinstruktioner. Modellen accepterer en forespørgsel i Messages-stil, hvor brugerens tekst fungerer som billedgenereringsinstruktion.
Dette gør den velegnet til kreative opgaver som illustrationer, concept art, reklamebilleder, præsentationsgrafik, produktbilleder og andre arbejdsgange for visuelt indhold.
Billede-til-billede
Modellen kan kombinere tekstinstruktioner med referencebilleder. Referencebilleder kan leveres via offentlige billed-URL'er eller Base64-kodede billeddata.
Den officielle API-dokumentation tillader op til 20 referencebilleder, med en maksimal størrelse på 20MB pr. billede.
Fleromgangsredigering af billeder
En af Hy-Image 3.5 Previews særprægede funktioner er fleromgangsredigering. I stedet for at generere hver revision som en uafhængig anmodning kan udviklere bevare den tidligere samtale- og billedkontekst for genererede billeder og derefter indsende en ny redigeringsinstruktion.
Dette muliggør arbejdsgange som:
- Generér et første billede.
- Bed modellen om at ændre et bestemt element.
- Bevar resten af kompositionen.
- Fortsæt med at forfine billedet over flere runder.
API'et returnerer en assembled_history-struktur, der kan genbruges som kontekst i efterfølgende redigeringsrunder.
Opløsning og billedstørrelse
Hy-Image 3.5 Preview understøtter fleksible outputdimensioner.
Når size angives eksplicit, kan de ønskede dimensioner styres direkte, og den officielle API dokumenterer dimensioner fra 256 til 8192 pixels pr. side og et maksimalt billedareal på 16,777,216 pixels, svarende til et 4K-klasses 4096 × 4096-output.
For 4K-generering anbefaler API-dokumentationen eksplicit at angive den ønskede size. Hvis der ikke angives en nøjagtig størrelse, kan modellen bestemme outputdimensionerne baseret på prompten og det konfigurerede pixelbudget.
Benchmark-ydeevne for Hy-Image 3.5 Preview
Tencents offentlige lanceringsmateriale beskriver Hy-Image 3.5 Preview som en professionel billedgenereringsmodel. Tencent rapporterede også en intern blind evaluering med hundreder af professionelle designere, som hævder en 30% forbedring i forhold til Hy-Image 3.0 og resultater, der kan sammenlignes med Seedream 5.0 Pro. Disse er leverandørrapporterede interne evalueringsresultater, snarere end en uafhængigt reproduceret offentlig benchmark.
Da den officielle API-dokumentation ikke giver en standardiseret offentlig benchmarktabel, bør disse rapporterede resultater ikke præsenteres som direkte sammenlignelige ranglistescore.
Hy-Image 3.5 Preview vs. Hy-Image 3.0
| Funktion | Hy-Image 3.5 Preview | Hy-Image 3.0 |
|---|---|---|
| Tekst-til-billede | Ja | Ja |
| Generering med referencebilleder | Ja | Ja |
| Fleromgangsredigering | Ja | Nej |
| Chat / Messages-protokol | Ja | Nej |
| Multimodalt input | Ja | Ja |
| Maksimalt dokumenteret output | Op til 4K | Op til 2048 × 2048 |
| Inputgrænse | 100K tokens | 8192 tegn |
| Billedreferencer | Op til 20 | 0–3 |
| Forbedring via ekstern søgning | Ja | — |
| Seed | Ja | Ja |
Hy-Image 3.5 Preview er derfor positioneret som et mere samtalebaseret og redigeringsorienteret genereringssystem, mens Hy-Image 3.0 bruger en enklere genereringsgrænseflade centreret omkring en prompt og valgfrie referencebilleder.
Hy-Image 3.5 Preview vs. andre billedmodeller
Hy-Image 3.5 Preview adskiller sig primært gennem kombinationen af billedgenerering, multimodalt referenceinput, samtalebaseret redigering og arbejdsgange for billeder med stor kontekst.
For applikationer med fokus på iterativ visuel skabelse kan Chat/Messages-arkitekturen være særlig nyttig, fordi modellen kan bevare konteksten fra tidligere redigeringsrunder i stedet for at betragte hver generering som en isoleret anmodning.
Sammenlignet med modeller, der primært udstiller en enkelt billedgenereringsprompt, leverer Hy-Image 3.5 Preview en arbejdsgang, der ligger tættere på et samtalebaseret billedredigeringsværktøj.
Repræsentative brugsscenarier
1. Kommerciel annoncering
Generér kampagnebilleder, promoveringsillustrationer, marketinggrafik og reklamekoncepter ud fra detaljerede beskrivelser i naturligt sprog.
2. Oprettelse af produktbilleder
Brug referencebilleder og tekstinstruktioner til at oprette eller ændre produktbilleder, samtidig med at vigtige visuelle karakteristika bevares.
3. UI- og produktdesign
Generér interfacekoncepter, visuelle mockups, designundersøgelser og præsentationsklare visuelle ressourcer.
4. Redigering af karakterer og portrætter
Brug referencebilleder og iterative instruktioner til at forfine karakterer, portrætter, styling, påklædning, baggrunde og andre visuelle elementer.
5. Kreativ illustration
Skab illustrationer, concept art, visuelle elementer til fortællinger og andre kreative ressourcer ud fra detaljerede prompter.
6. Fleromgangs visuel produktion
Brug den samtalebaserede redigeringsfunktion til gradvist at forfine et billede på tværs af flere instruktioner, hvilket gør modellen velegnet til arbejdsgange, hvor det endelige visuelle udvikles gennem flere iterationer.
Begrænsninger og overvejelser
Hy-Image 3.5 Preview er i øjeblikket en Preview-model, så API-adfærd og underliggende modelversioner kan ændre sig, efterhånden som Tencent fortsætter med at opdatere tjenesten.
Genererede billed-URL'er, der returneres af API'et, er midlertidige. Den officielle dokumentation angiver, at genererede billed-URL'er er gyldige i 12 timer, så applikationer, der har brug for vedvarende ressourcer, bør downloade og gemme de genererede billeder i stedet for at stole på den returnerede URL på ubestemt tid.
Udviklere, der bruger fleromgangsredigering, bør også bevare den returnerede assembled_history, når en redigeringssession fortsættes, da denne struktur indeholder den kontekst, der kræves til efterfølgende runder.
Sådan får du adgang til Hy-Image 3.5 Preview API via CometAPI
CometAPI kan levere et samlet integrationslag for applikationer, der vil få adgang til understøttede AI-modeller via en ensartet API-arbejdsgang.
Trin 1: Tilmeld dig eller log ind på CometAPI
Opret en CometAPI-konto, eller log ind på en eksisterende konto. Når du er i CometAPI-konsollen, får du adgang til området for API-nøgleadministration.
Trin 2: Opret en CometAPI API-nøgle
Generér en API-nøgle fra CometAPI-konsollen. Opbevar nøglen sikkert, da den bruges til at godkende API-forespørgsler.
Trin 3: Find Hy-Image 3.5 Preview
Åbn CometAPI's modelkatalog, og søg efter Hy-Image 3.5 Preview. Bekræft, at modellen i øjeblikket er tilgængelig via din CometAPI-konto, før du integrerer den i en produktionsapplikation.
Brug modelidentifikatoren:
hy-image-v3.5-preview
Trin 4: Konfigurer din applikation
Konfigurer din applikation til at bruge CometAPI's ensartede API-grænseflade, og godkend forespørgsler med din CometAPI API-nøgle.
For en billedgenereringsarbejdsgang skal du videregive den relevante tekstprompt, referencebilledinformation og de genereringsparametre, som modellen understøtter.
Trin 5: Send din anmodning om billedgenerering
Send anmodningen via CometAPI med hy-image-v3.5-preview som den valgte model.
Afhængigt af din applikation kan du bruge modellen til tekst-til-billede-generering, referencebilledgenerering eller fleromgangsredigering.
Trin 6: Behandl og gem det genererede billede
Hent det genererede billede fra API-svaret, og gem det i applikationens lager, hvis billedet skal være tilgængeligt ud over den midlertidige URL's levetid.