Tekniske spesifikasjoner for Hy-Image 3.5 Preview
| Element | Hy-Image 3.5 Preview |
|---|---|
| Modell-ID | hy-image-v3.5-preview |
| Leverandør | Tencent Hunyuan |
| Modelltype | Profesjonell modell for bildegenerering og -redigering |
| Inndata | Tekst + referansebilder |
| Utdata | Bilder |
| Inndatagrense | Opptil 100K tokens |
| Generasjonsmoduser | Tekst-til-bilde, bilde-til-bilde, redigering over flere runder |
| Referansebilder | Opptil 20 bilder per forespørsel |
| Størrelse på referansebilde | Opptil 20MB per bilde |
| Utdataoppløsning | Opptil 4096 × 4096 (4K) |
| Protokoll | Chat / Meldinger |
| Generering | Synkron |
| Eksternt søk | Støttet |
| Seed | Støttet |
| Egendefinert størrelse | Støttet |
Hva er Hy-Image 3.5 Preview?
Hy-Image 3.5 Preview er den profesjonelle bildegenereringsmodellen fra Tencent Hunyuan, laget for tekst-til-bilde-generering, bilde-til-bilde-generering og redigering over flere runder.
I motsetning til et konvensjonelt bildegenererings-API med én enkelt prompt bruker Hy-Image 3.5 Preview en protokoll i Chat/Meldinger-stil, som gjør det mulig å kombinere tekstprompter, referansebilder og tidligere bildegenereringskontekst i en samtalebasert arbeidsflyt. Modellen kan derfor ikke bare brukes til å lage et bilde fra bunnen av, men også til å endre et eksisterende resultat iterativt over flere runder.
Hovedfunksjoner for Hy-Image 3.5 Preview
- Generering fra tekst til bilde: Generer bilder fra naturlige språkprompter, og la modellen tolke ønsket komposisjon, stil, motiv og visuelle detaljer.
- Generering fra bilde til bilde: Kombiner tekstinstruksjoner med referansebilder for å styre det genererte resultatet.
- Redigering over flere runder: Bevar tidligere samtale- og bildekontekst slik at brukere kan forbedre et bilde gradvis i stedet for å starte på nytt.
- Multimodal inndata: En forespørsel kan kombinere tekstlige instruksjoner med referansebilder, noe som gjør den egnet for stiloverføring, redigering av produktbilder, figurjusteringer og visuell iterasjon.
- 4K-utdata: Den offisielle API-dokumentasjonen støtter utdata opp til 4096 × 4096 piksler, med forbehold om de dokumenterte begrensningene for bildeareal.
- Forbedring via eksternt søk: API-dokumentasjonen lister ekstern-søk-forbedring som en støttet funksjon, slik at bildegenereringsarbeidsflyter kan innhente tilleggsinformasjon ved behov.
- Fleksibel bildestørrelse: Utviklere kan angi en nøyaktig
size, eller la modellen bestemme en passende utgangsstørrelse basert på prompten og konfigurert pikselbudsjett. - Seed-kontroll: En seed kan oppgis når reproduserbar generering er nødvendig.
Muligheter for bildegenerering og -redigering
Tekst til bilde
Hy-Image 3.5 Preview kan generere bilder direkte fra tekstinstruksjoner. Modellen aksepterer en forespørsel i Messages-stil, der brukerens tekst fungerer som bildegenereringsinstruksjon.
Dette gjør den egnet for kreative oppgaver som illustrasjoner, konseptkunst, reklamevisuelle, presentasjonsgrafikk, produktbilder og andre arbeidsflyter for visuelt innhold.
Bilde til bilde
Modellen kan kombinere tekstinstruksjoner med referansebilder. Referansebilder kan leveres via offentlige bilde-URL-er eller Base64-kodede bildedata.
Den offisielle API-dokumentasjonen tillater opptil 20 referansebilder, med en maksimal størrelse på 20MB per bilde.
Redigering over flere runder
En av de særegne egenskapene til Hy-Image 3.5 Preview er redigering over flere runder. I stedet for å generere hver revisjon som en uavhengig forespørsel, kan utviklere bevare den forrige samtalen og konteksten til det genererte bildet, og deretter sende inn en ny redigeringsinstruksjon.
Dette muliggjør arbeidsflyter som:
- Generer et første bilde.
- Be modellen endre et spesifikt element.
- Bevar resten av komposisjonen.
- Fortsett å finjustere bildet over flere runder.
API-et returnerer en assembled_history-struktur som kan gjenbrukes som kontekst for påfølgende redigeringsrunder.
Oppløsning og bildestørrelse
Hy-Image 3.5 Preview støtter fleksible utdata-dimensjoner.
Når size angis eksplisitt, kan de ønskede dimensjonene kontrolleres direkte, og den offisielle API-dokumentasjonen beskriver dimensjoner fra 256 til 8192 piksler per side og et maksimalt bildeareal på 16,777,216 piksler, som tilsvarer 4K-klassen 4096 × 4096.
For 4K-generering anbefaler API-dokumentasjonen å angi ønsket size eksplisitt. Hvis ingen eksakt størrelse oppgis, kan modellen bestemme utgangsdimensjonene basert på prompten og konfigurert pikselbudsjett.
Benchmark-ytelse for Hy-Image 3.5 Preview
Tencents offentlige lanseringsmateriale beskriver Hy-Image 3.5 Preview som en profesjonell bildegenereringsmodell. Tencent rapporterte også en intern blind evaluering med hundrevis av profesjonelle designere, og hevder 30% forbedring over Hy-Image 3.0 og resultater på nivå med Seedream 5.0 Pro. Dette er leverandørrapporterte interne evalueringsresultater, ikke en uavhengig reprodusert offentlig benchmark.
Siden den offisielle API-dokumentasjonen ikke tilbyr en standardisert offentlig benchmark-tabell, bør disse rapporterte resultatene ikke presenteres som direkte sammenlignbare resultatlister.
Hy-Image 3.5 Preview vs. Hy-Image 3.0
| Funksjon | Hy-Image 3.5 Preview | Hy-Image 3.0 |
|---|---|---|
| Tekst til bilde | Ja | Ja |
| Generering med referansebilder | Ja | Ja |
| Redigering over flere runder | Ja | Nei |
| Chat / Meldinger-protokoll | Ja | Nei |
| Multimodal inndata | Ja | Ja |
| Maksimum dokumentert utdata | Opptil 4K | Opptil 2048 × 2048 |
| Inndatagrense | 100K tokens | 8192 tegn |
| Referansebilder | Opptil 20 | 0–3 |
| Ekstern søkeforbedring | Ja | — |
| Seed | Ja | Ja |
Hy-Image 3.5 Preview er derfor posisjonert som et mer samtalebasert og redigeringsorientert genereringssystem, mens Hy-Image 3.0 bruker et enklere genereringsgrensesnitt sentrert rundt en prompt og valgfrie referansebilder.
Hy-Image 3.5 Preview vs. andre bildemodeller
Hy-Image 3.5 Preview er primært differensiert av kombinasjonen av bildegenerering, multimodale referanseinndata, samtalebasert redigering og bildearbeidsflyter med stor kontekst.
For applikasjoner som fokuserer på iterativ visuell skapelse, kan Chat/Meldinger-arkitekturen være spesielt nyttig fordi modellen kan beholde konteksten fra tidligere redigeringsrunder i stedet for å behandle hver generering som en isolert forespørsel.
Sammenlignet med modeller som primært eksponerer en enkelt bildegenereringsprompt, tilbyr Hy-Image 3.5 Preview en arbeidsflyt som ligner mer på en samtalebasert bilderedigerer.
Representative bruksområder
1. Kommersiell reklame
Generer kampanjevisuelle, promomateriell, markedsføringsgrafikk og reklamekonsepter fra detaljerte naturlig-språkbeskrivelser.
2. Opprettelse av produktbilder
Bruk referansebilder og tekstinstruksjoner til å opprette eller endre produktvisualer samtidig som viktige visuelle kjennetegn bevares.
3. UI- og produktdesign
Generer grensesnittkonsepter, visuelle mockups, designutforskninger og presentasjonsklare visuelle ressurser.
4. Karakter- og portrettredigering
Bruk referansebilder og iterative instruksjoner for å finjustere karakterer, portretter, styling, klær, bakgrunner og andre visuelle elementer.
5. Kreativ illustrasjon
Lag illustrasjoner, konseptkunst, historievisuelle og andre kreative ressurser fra detaljerte prompter.
6. Visuell produksjon over flere runder
Bruk den samtalebaserte redigeringsmuligheten til gradvis å finjustere et bilde over flere instruksjoner, noe som gjør modellen egnet for arbeidsflyter der det endelige visuelle utvikles gjennom flere iterasjoner.
Begrensninger og hensyn
Hy-Image 3.5 Preview er for øyeblikket en Preview-modell, så API-oppførsel og underliggende modellversjoner kan endres etter hvert som Tencent oppdaterer tjenesten.
Genererte bilde-URL-er som returneres av API-et er midlertidige. Den offisielle dokumentasjonen oppgir at genererte bilde-URL-er er gyldige i 12 timer, så applikasjoner som trenger varige ressurser bør laste ned og lagre de genererte bildene i stedet for å basere seg på den returnerte URL-en på ubestemt tid.
Utviklere som bruker redigering over flere runder bør også bevare returnert assembled_history når en redigeringsøkt fortsetter, fordi denne strukturen inneholder konteksten som kreves for påfølgende runder.
Slik får du tilgang til Hy-Image 3.5 Preview API via CometAPI
CometAPI kan tilby et enhetlig integrasjonslag for applikasjoner som ønsker å få tilgang til støttede AI-modeller gjennom en konsistent API-arbeidsflyt.
Trinn 1: Registrer deg eller logg inn på CometAPI
Opprett en CometAPI-konto eller logg inn på en eksisterende konto. Etter å ha gått inn i CometAPI-konsollen, gå til området for administrasjon av API-nøkler.
Trinn 2: Opprett en CometAPI API-nøkkel
Generer en API-nøkkel fra CometAPI-konsollen. Hold nøkkelen sikker, siden den brukes til å autentisere API-forespørsler.
Trinn 3: Finn Hy-Image 3.5 Preview
Åpne CometAPI-modellkatalogen og søk etter Hy-Image 3.5 Preview. Bekreft at modellen for øyeblikket er tilgjengelig via din CometAPI-konto før du integrerer den i en produksjonsapplikasjon.
Bruk modellidentifikatoren:
hy-image-v3.5-preview
Trinn 4: Konfigurer applikasjonen din
Konfigurer applikasjonen din til å bruke CometAPIs enhetlige API-grensesnitt og autentiser forespørsler med din CometAPI API-nøkkel.
For en bildegenereringsarbeidsflyt, send med passende tekstprompt, referansebildeinformasjon og genereringsparametere som støttes av modellen.
Trinn 5: Send bildegenereringsforespørselen
Send forespørselen via CometAPI med hy-image-v3.5-preview som valgt modell.
Avhengig av applikasjonen din kan du bruke modellen til tekst-til-bilde-generering, generering med referansebilder eller redigering over flere runder.
Trinn 6: Behandle og lagre det genererte bildet
Hent det genererte bildet fra API-responsen og lagre det i applikasjonens egen lagring dersom bildet må være tilgjengelig utover den midlertidige URL-levetiden.