Seed 1.8 API의 기술 사양
| 항목 | 사양/비고 |
|---|---|
| 모델 이름/패밀리 | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| 지원 모달리티 | 텍스트, 이미지, 비디오(멀티모달 VLM 기능), 생태계 내 오디오 도구(오디오/비디오 생성은 별도 모델). |
| 컨텍스트 윈도우(텍스트) | 256K 토큰 |
| 비디오/시각 처리 능력 | 장시간 비디오 추론에 최적화되어 있으며, 효율적인 시각 인코딩과 큰 비디오 토큰 예산을 지원합니다(모델 카드에 비디오 토큰 실험과 장시간 비디오 벤치마크가 보고됨). |
| 입력 형식 | 자유 텍스트 프롬프트; 이미지 업로드(스크린샷, 차트, 사진); 토큰화된 프레임 형태의 비디오/세그먼트 점검용 비디오 도구; 파일 업로드(문서). |
| 출력 형식 | 자연어 텍스트, 구조화된 출력(structured-output 베타), 함수 호출/도구 호출, 코드, 오케스트레이션을 통한 멀티모달 출력. |
| 사고/추론 모드 | no_think, think-low, think-medium, think-high — 정확도와 지연/비용 간 트레이드오프. |
Doubao Seed 1.8이란?
Doubao Seed 1.8은 Seed 팀의 1.8 릴리스로, 단일 모델 안에서 지각(이미지/비디오), 추론, 도구 오케스트레이션(검색, 함수 호출, 코드 실행, GUI 그라운딩) 및 다단계 의사결정을 아우르는 통합 LLM+VLM이며, 이는 곧 일반화된 실제 세계 에이전시를 명시적으로 지향합니다. 설계는 구성 가능한 “사고 모드”(지연 시간과 깊이의 절충), 효율적인 시각 인코딩, 장문 컨텍스트와 멀티모달 입력에 대한 네이티브 지원을 강조하여, 모델이 프로덕션 워크플로에서 자율형 어시스턴트/에이전트로 동작할 수 있도록 합니다.
Seed 1.8 API의 주요 기능
- 통합 멀티모달 에이전트형 모델. 지각(이미지/비디오), 추론(LLM), 실행(도구/GUI 호출, 코드 실행)을 단일 모델에 통합하여 분리된 파이프라인 대신 제공합니다. 이를 통해 에이전트 워크플로를 간결하게 하고 오케스트레이션 복잡도를 낮춥니다.
- 초장문 컨텍스트 및 장시간 비디오 처리. 긴 컨텍스트(제품 지원 최대 256k 토큰)와 특정 장시간 비디오 벤치마크에서의 성능(Seed1.8은 장시간 비디오 토큰 효율이 우수함). 모델은 선택적 비디오 도구(VideoCut)를 지원하여 특정 타임스탬프에 초점을 맞춘 추론을 수행합니다.
- 에이전트형 GUI 자동화 및 도구 사용. 벤치마크와 내부 테스트(OSWorld, AndroidWorld, LiveCodeBench, GUI 그라운딩 벤치마크)에서 GUI 에이전트 작업과 다단계 자동화 성능이 개선되었습니다. 모델은 GUI 그라운딩 명령을 출력하고 시뮬레이션된 OS/웹/모바일 컨텍스트에서 동작할 수 있습니다.
- 지연/비용 제어를 위한 구성 가능한 사고 모드. 네 가지 추론 모드는 인터랙티브 작업과 고품질 배치 작업 간 요구에 맞춰 테스트 시점의 연산량을 조정할 수 있게 해줍니다. 이는 엄격한 지연 시간 예산을 가진 프로덕션 시스템에 유용합니다.
- 향상된 토큰 효율(멀티모달). Seed 1.8은 전작(Seed-1.5/1.6 시리즈) 대비 멀티모달 벤치마크에서 더 높은 토큰 효율을 보이며, 여러 장시간 비디오 과제에서 더 적은 토큰 예산으로도 높은 정확도를 달성합니다.
- 구성 가능한 사고 모드: 구분된 모드(
no_think→think-high)로 추론 깊이와 지연/비용 간 절충을 제공하여 인터랙티브한 프로덕션 사용에 맞게 튜닝할 수 있습니다. - 기술적 역량
- 토큰 효율: Seed1.8은 전작(Seed-1.5/1.6) 대비 뚜렷한 토큰 효율 향상을 보이며, 장시간 비디오 과제에서 더 낮은 토큰 예산으로 더 높은 정확도를 제공합니다(예: 비디오 토큰 32K에서도 경쟁력 있는 정확도 달성). 이는 장문 입력의 추론 비용을 낮춥니다.
- 멀티모달 추론 및 지각: 다중 이미지 VQA와 모션/지각 과제의 여러 항목에서 SOTA를 달성하며, 다수의 멀티모달 추론 벤치마크에서 2위 또는 SOTA에 근접한 성능을 보입니다. 특히 시각/비디오 전 영역에서 전작 대비 우수한 성능을 확인했습니다.
- 에이전트형 도구 사용 및 GUI 그라운딩: 스크린 기반 동작 벤치마크(ScreenSpot-Pro, GUI agenting)에서 문서화된 GUI 그라운딩 지원과 강한 그라운딩 점수를 보이며(예: ScreenSpot-Pro에서 Seed-1.5-VL 대비 개선), 화면 기반 작업 수행 능력을 입증했습니다.
- 병렬/단계적 추론: 테스트 시점 연산을 늘리면(병렬 사고) 수학, 코딩, 멀티모달 추론 벤치마크에서 측정 가능한 성능 향상이 나타납니다.
Seed1.8의 주요 공개 벤치마크 하이라이트
- VCRBench(시각적 상식 추론): Seed1.8은 모델 카드 표에 보고된 Pass@1 기준으로 59.8점을 기록하여 Seed-1.5-VL 대비 개선되었고 상위 모델들과 경쟁합니다.
- VideoHolmes(비디오 추론): Seed1.8 65.5로 Seed-1.5-VL을 능가하며 프로급 경쟁 모델에 근접합니다.
- MMLB-NIAH(멀티모달 장문 컨텍스트, 128k): Seed1.8은 128k 컨텍스트에서 72.2 Pass@1을 달성하여 일부 동시대 프로 모델을 상회했습니다.
- 모션 & 지각 스위트: 평가된 6개 과제 중 5개에서 SOTA를 달성; TVBench, TempCompass, TOMATO 등에서 시간적 지각의 뚜렷한 향상을 보입니다.
- 에이전트형 워크플로: BrowseComp 및 기타 에이전트형 검색/코드 벤치마크에서 종종 경쟁 프로 모델과 동급이거나 상회합니다.
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: 멀티모달 지각, 장시간 비디오 토큰 효율, 에이전트 실행에서 명확한 개선.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: 다수의 멀티모달 벤치마크에서 Seed1.8이 Gemini 3 Pro와 대등하거나 능가합니다(여러 VQA/모션 과제에서 SOTA; MMLB-NIAH 128k 런에서 더 나은 성능). 다만 일부 전문 분야 지식 과제에서는 Gemini 계열이 여전히 강점을 보이는 영역도 있어, 상대적 순위는 벤치마크에 따라 달라집니다.
- Seed-Code 변형(Doubao-Seed-Code): 프로그래밍/에이전트형 코드 작업에 특화(대규모 코드베이스 컨텍스트; 특화 SWE 벤치마크). Seed1.8은 범용 에이전트형 멀티모달 모델이며, Seed-Code는 프로그래밍 중심 변형입니다.
CometAPI의 Seedream 4.5 API로 구현하는 실사용 사례
- 멀티모달 리서치 어시스턴트 & 문서 분석: 장문 문서, 슬라이드, 다페이지 리포트를 추출/요약/종합 추론.
- 장시간 비디오 이해 & 모니터링: 보안/스포츠 방송 분석, 장시간 회의 요약, 스트리밍 분석 등에서 장시간 비디오 토큰 효율이 중요한 시나리오.
- 에이전트형 워크플로/자동화: 다단계 웹 검색 + 코드 실행 + 데이터 추출 시나리오(내부 벤치마크에서 입증된 자동 경쟁 분석, 여행 계획, 리서치 파이프라인 등).
- 개발자 도구(Seed-Code 사용 시): 대규모 코드베이스 분석, IDE 어시스턴트, 테스트/수정을 위한 에이전트형 코드 실행(프로그래밍 특화 변형으로 Seed-Code 권장).
- GUI 자동화 & RPA: 스크린 그라운딩과 GUI 에이전트 벤치마크에서 전작 대비 더 구조화된 GUI 작업 수행 능력.
CometAPI를 통해 doubao Seed 1.8 API를 사용하는 방법
Doubao seed1.8은 현재 CometAPI를 통해 호스티드 추론 API로 상용 제공됩니다. 이 API는 멀티모달 페이로드(텍스트 + 이미지 + 비디오 조각/타임스탬프)를 지원하며, 응답 품질 대비 지연/연산 비용을 절충할 수 있는 구성 가능한 추론 모드를 제공합니다.
호출 패턴: 표준 채팅/완성형 요청, 스트리밍 응답, 그리고 모델이 도구 호출(검색, 코드 실행, GUI 동작)을 발행하고 도구 출력을 후속 컨텍스트로 수용하는 에이전트형 플로우를 지원합니다.
스트리밍 & 장문 컨텍스트 처리: 스트리밍을 지원하며, 장시간 세션을 위한 내장 컨텍스트 관리 프리미티브를 제공하여 100K+ 컨텍스트/다단계 에이전트 트레이스를 가능하게 합니다.
1단계: API 키 발급
cometapi.com에 로그인하세요. 아직 사용자 아니라면 먼저 등록하세요. CometAPI 콘솔에 로그인합니다. 인터페이스 접근 자격인 API 키를 발급받습니다. 개인 센터의 API 토큰에서 “Add Token”을 클릭하여 토큰 키: sk-xxxxx를 발급받아 제출하세요.
2단계: doubao Seed 1.8 API로 요청 보내기
“doubao-seed-1-8-251228” 엔드포인트를 선택해 API 요청을 전송하고 요청 본문을 설정하세요. 요청 메서드와 요청 본문은 당사 웹사이트 API 문서에서 확인할 수 있습니다. 또한 편의를 위해 Apifox 테스트를 제공합니다. <YOUR_API_KEY>를 계정의 실제 CometAPI 키로 교체하세요. Chat API와의 호환성을 제공합니다.
content 필드에 질문 또는 요청을 입력하세요 — 모델은 해당 내용에 응답합니다. API 응답을 처리하여 생성된 답변을 얻습니다.
3단계: 결과 조회 및 검증
API 응답을 처리하여 생성된 답변을 얻습니다. 처리 후, API는 작업 상태와 출력 데이터를 함께 응답합니다.