Hy-Image 3.5 Preview의 기술 사양
| 항목 | Hy-Image 3.5 Preview |
|---|---|
| 모델 ID | hy-image-v3.5-preview |
| 제공사 | Tencent Hunyuan |
| 모델 유형 | 전문급 이미지 생성 및 편집 모델 |
| 입력 | 텍스트 + 참조 이미지 |
| 출력 | 이미지 |
| 입력 한도 | 최대 100K 토큰 |
| 생성 모드 | 텍스트-투-이미지, 이미지-투-이미지, 멀티턴 편집 |
| 이미지 참조 | 요청당 이미지 최대 20장 |
| 참조 이미지 크기 | 이미지당 최대 20MB |
| 출력 해상도 | 최대 4096 × 4096 (4K) |
| 프로토콜 | 채팅/메시지 |
| 생성 | 동기식 |
| 외부 검색 | 지원됨 |
| 시드 | 지원됨 |
| 사용자 지정 크기 | 지원됨 |
Hy-Image 3.5 Preview란 무엇인가?
Hy-Image 3.5 Preview는 텍스트-투-이미지 생성, 이미지-투-이미지 생성, 멀티턴 이미지 편집을 위해 설계된 Tencent Hunyuan의 전문 이미지 생성 모델입니다.
일반적인 단일 프롬프트 기반 이미지 생성 API와 달리, Hy-Image 3.5 Preview는 채팅/메시지 스타일 프로토콜을 사용하여 텍스트 프롬프트, 참조 이미지, 이전 이미지 생성 컨텍스트를 대화형 워크플로에 결합할 수 있습니다. 따라서 처음부터 이미지를 생성할 뿐만 아니라 기존 결과를 여러 차례에 걸쳐 반복적으로 수정하는 데도 사용할 수 있습니다.
Hy-Image 3.5 Preview의 주요 기능
- 텍스트-투-이미지 생성: 자연어 프롬프트로부터 이미지를 생성하고, 요청된 구성, 스타일, 피사체, 시각적 디테일을 모델이 해석하도록 합니다.
- 이미지-투-이미지 생성: 텍스트 지시와 참조 이미지를 결합하여 생성 결과를 유도합니다.
- 멀티턴 편집: 이전 대화와 이미지 컨텍스트를 보존하여 처음부터 다시 시작하지 않고 이미지를 점진적으로 다듬을 수 있습니다.
- 멀티모달 입력: 한 번의 요청에 텍스트 지시와 참조 이미지를 함께 제공할 수 있어 스타일 전환, 제품 이미지 편집, 캐릭터 조정, 시각적 반복에 적합합니다.
- 4K 출력: 공식 API 문서에 따르면 문서화된 이미지 면적 제한을 준수하는 전제하에 최대 4096 × 4096 픽셀 출력을 지원합니다.
- 외부 검색 강화: 필요 시 이미지 생성 워크플로에 추가 정보를 통합할 수 있도록 외부 검색 강화 기능 지원이 문서화되어 있습니다.
- 유연한 이미지 크기 지정: 개발자는 정확한
size를 지정하거나, 프롬프트와 설정된 픽셀 예산에 따라 모델이 적절한 출력 크기를 결정하도록 할 수 있습니다. - 시드 제어: 재현 가능한 생성을 위해 시드를 제공할 수 있습니다.
이미지 생성 및 편집 기능
텍스트-투-이미지
Hy-Image 3.5 Preview는 텍스트 지시만으로 이미지를 직접 생성할 수 있습니다. 사용자 텍스트가 이미지 생성 지시로 사용되는 메시지 스타일 요청을 수용합니다.
이는 일러스트레이션, 컨셉 아트, 광고 비주얼, 프레젠테이션 그래픽, 제품 이미지 및 기타 시각 콘텐츠 워크플로 등 창의적 작업에 적합합니다.
이미지-투-이미지
이 모델은 텍스트 지시를 참조 이미지와 결합할 수 있습니다. 참조 이미지는 공개 이미지 URL 또는 Base64로 인코딩된 이미지 데이터로 제공할 수 있습니다.
공식 API 문서에 따르면 최대 20개의 참조 이미지를 지원하며, 이미지당 최대 20MB를 허용합니다.
멀티턴 이미지 편집
Hy-Image 3.5 Preview의 두드러진 기능 중 하나는 멀티턴 편집입니다. 각 수정본을 독립 요청으로 생성하는 대신, 이전 대화와 생성된 이미지 컨텍스트를 보존한 뒤 새로운 편집 지시를 제출할 수 있습니다.
이를 통해 다음과 같은 워크플로가 가능합니다:
- 초기 이미지를 생성합니다.
- 특정 요소의 변경을 모델에 요청합니다.
- 나머지 구도는 유지합니다.
- 여러 차례에 걸쳐 이미지를 계속 다듬습니다.
API는 후속 편집 라운드의 컨텍스트로 재사용할 수 있는 assembled_history 구조를 반환합니다.
해상도와 이미지 크기
Hy-Image 3.5 Preview는 유연한 출력 크기를 지원합니다.
size를 명시적으로 제공하면 요청한 치수를 직접 제어할 수 있으며, 공식 API 문서에는 한 변 기준 256에서 8192 픽셀까지, 최대 이미지 면적 16,777,216 픽셀(4K급 4096 × 4096 출력에 해당)이 문서화되어 있습니다.
4K 생성의 경우, API 문서는 원하는 size를 명시적으로 지정할 것을 권장합니다. 정확한 크기를 제공하지 않으면, 모델은 프롬프트와 설정된 픽셀 예산에 따라 출력 치수를 결정할 수 있습니다.
Hy-Image 3.5 Preview의 벤치마크 성능
Tencent의 공개 출시 자료는 Hy-Image 3.5 Preview를 전문급 이미지 생성 모델로 설명합니다. 또한 수백 명의 전문 디자이너가 참여한 내부 블라인드 평가에서 Hy-Image 3.0 대비 30% 개선, Seedream 5.0 Pro에 필적하는 결과를 보고했습니다. 이는 독립적으로 재현된 공개 벤치마크가 아닌, 벤더가 보고한 내부 평가 결과입니다.
공식 API 문서에 표준화된 공개 벤치마크 표가 제공되지 않으므로, 이러한 보고 결과를 리더보드 점수처럼 직접 비교 가능한 수치로 제시해서는 안 됩니다.
Hy-Image 3.5 Preview vs. Hy-Image 3.0
| 기능 | Hy-Image 3.5 Preview | Hy-Image 3.0 |
|---|---|---|
| 텍스트-투-이미지 | 예 | 예 |
| 참조 이미지 생성 | 예 | 예 |
| 멀티턴 편집 | 예 | 아니오 |
| 채팅/메시지 프로토콜 | 예 | 아니오 |
| 멀티모달 입력 | 예 | 예 |
| 문서화된 최대 출력 | 최대 4K | 최대 2048 × 2048 |
| 입력 한도 | 100K 토큰 | 8192자 |
| 이미지 참조 | 최대 20 | 0–3 |
| 외부 검색 강화 | 예 | — |
| 시드 | 예 | 예 |
따라서 Hy-Image 3.5 Preview는 보다 대화형이며 편집 중심의 생성 시스템으로 포지셔닝되고, Hy-Image 3.0은 프롬프트와 선택적 참조 이미지에 초점을 둔 더 단순한 생성 인터페이스를 사용합니다.
Hy-Image 3.5 Preview와 기타 이미지 모델 비교
Hy-Image 3.5 Preview는 이미지 생성, 멀티모달 참조 입력, 대화형 편집, 대용량 컨텍스트 이미지 워크플로의 결합으로 주로 차별화됩니다.
반복적인 시각 창작에 초점을 둔 애플리케이션의 경우, 채팅/메시지 아키텍처는 각 생성을 독립적인 요청으로 처리하기보다 이전 편집 라운드의 컨텍스트를 유지할 수 있어 특히 유용합니다.
주로 단일 이미지 생성 프롬프트만 제공하는 모델과 비교하면, Hy-Image 3.5 Preview는 대화형 이미지 편집기에 더 가까운 워크플로를 제공합니다.
대표적 활용 사례
1. 상업 광고
자연어 설명을 바탕으로 캠페인 비주얼, 프로모션 아트워크, 마케팅 그래픽, 광고 콘셉트를 생성합니다.
2. 제품 이미지 제작
참조 이미지와 텍스트 지시를 사용하여 중요한 시각적 특성을 유지하면서 제품 비주얼을 생성하거나 수정합니다.
3. UI 및 제품 디자인
인터페이스 콘셉트, 비주얼 목업, 디자인 탐색, 프레젠테이션용 시각 에셋을 생성합니다.
4. 캐릭터 및 인물 편집
참조 이미지와 반복 지시를 사용해 캐릭터, 인물, 스타일링, 의상, 배경 및 기타 시각 요소를 다듬습니다.
5. 크리에이티브 일러스트레이션
자세한 프롬프트로 일러스트, 컨셉 아트, 스토리 비주얼 및 기타 크리에이티브 에셋을 생성합니다.
6. 다회차 시각 제작
대화형 편집 기능을 사용해 여러 번의 지시를 통해 이미지를 점진적으로 정제하여, 최종 비주얼을 여러 단계에 걸쳐 개발하는 워크플로에 적합합니다.
제한 사항 및 고려사항
Hy-Image 3.5 Preview는 현재 프리뷰 모델이므로, Tencent가 서비스를 업데이트함에 따라 API 동작과 기반 모델 버전이 변경될 수 있습니다.
API가 반환하는 생성 이미지 URL은 임시입니다. 공식 문서에 따르면 생성 이미지 URL의 유효 기간은 12시간이므로, 지속적인 에셋이 필요한 애플리케이션은 반환된 URL에 계속 의존하지 말고 이미지를 다운로드하여 저장해야 합니다.
멀티턴 편집을 사용하는 개발자는 편집 세션을 이어갈 때 반환된 assembled_history를 반드시 보존해야 합니다. 이 구조에는 후속 라운드에 필요한 컨텍스트가 포함되어 있습니다.
CometAPI를 통해 Hy-Image 3.5 Preview API에 액세스하는 방법
CometAPI는 지원되는 AI 모델에 대해 일관된 API 워크플로로 액세스하고자 하는 애플리케이션을 위한 통합 통합 계층을 제공할 수 있습니다.
1단계: CometAPI 가입 또는 로그인
CometAPI 계정을 생성하거나 기존 계정에 로그인합니다. CometAPI 콘솔에 들어간 후 API 키 관리 영역에 접근합니다.
2단계: CometAPI API 키 생성
CometAPI 콘솔에서 API 키를 생성합니다. 이 키는 API 요청 인증에 사용되므로 안전하게 보관하세요.
3단계: Hy-Image 3.5 Preview 찾기
CometAPI 모델 카탈로그를 열고 Hy-Image 3.5 Preview를 검색합니다. 프로덕션 애플리케이션에 통합하기 전에, 해당 모델이 현재 CometAPI 계정에서 사용 가능한지 확인하세요.
모델 식별자:
hy-image-v3.5-preview
4단계: 애플리케이션 구성
CometAPI의 통합 API 인터페이스를 사용하도록 애플리케이션을 구성하고, CometAPI API 키로 요청을 인증합니다.
이미지 생성 워크플로의 경우, 모델이 지원하는 적절한 텍스트 프롬프트, 참조 이미지 정보, 생성 파라미터를 전달하세요.
5단계: 이미지 생성 요청 보내기
선택한 모델로 hy-image-v3.5-preview를 사용하여 CometAPI를 통해 요청을 제출합니다.
애플리케이션에 따라 텍스트-투-이미지 생성, 참조 이미지 생성, 멀티턴 편집에 모델을 사용할 수 있습니다.
6단계: 생성된 이미지 처리 및 저장
API 응답에서 생성된 이미지를 가져오고, 이미지가 임시 URL 유효 기간 이후에도 필요하다면 자체 애플리케이션 스토리지에 저장하세요.