Especificações técnicas da API Seed 1.8
| Item | Especificação / observação |
|---|---|
| Model name / family | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalities supported | Texto, imagens, vídeo (capacidades VLM multimodais), ferramentas de áudio no ecossistema (modelos separados para geração de áudio/vídeo). |
| Context window (text) | 256K tokens |
| Video / visual capacity | Projetado para raciocínio com vídeos longos, oferece codificação visual eficiente e orçamentos grandes de tokens de vídeo (o cartão do modelo relata experimentos com tokens de vídeo e benchmarks de vídeos longs). |
| Input formats | Prompts de texto livre; envio de imagens (capturas de tela, gráficos, fotos); vídeo como quadros tokenizados / ferramentas de vídeo para inspeção de segmentos; envio de arquivos (documentos). |
| Output formats | Texto em linguagem natural, saídas estruturadas (structured-output beta), chamadas de função / de ferramenta, código e saídas multimodais via orquestração. |
| Thinking / inference modes | no_think, think-low, think-medium, think-high — equilibram precisão vs. latência/custo. |
O que é Doubao Seed 1.8?
Doubao Seed 1.8 é a versão 1.8 da equipe Seed: um LLM+VLM unificado que visa explicitamente a agência generalizada no mundo real — isto é, percepção (imagens/vídeo), raciocínio, orquestração de ferramentas (busca, chamadas de função, execução de código, grounding de GUI) e tomada de decisão em múltiplas etapas em um único modelo. O design enfatiza “modos de pensamento” configuráveis (equilíbrios entre latência e profundidade), codificação visual eficiente e suporte nativo a contexto longo e entradas multimodais para que o modelo possa operar como um assistente/agente autônomo em fluxos de trabalho de produção.
Principais recursos da API Seed 1.8
- Modelo multimodal agente unificado. Integra percepção (imagem/vídeo), raciocínio (LLM) e ação (chamadas de ferramenta/G U I, execução de código) em um único modelo em vez de um pipeline dividido. Isso permite fluxos de trabalho de agente mais compactos e menor complexidade de orquestração.
- Contexto ultralongo e tratamento de vídeos longos. Contexto extenso (suporte do produto até 256k tokens) e benchmarks específicos de vídeos longs (Seed1.8 apresenta forte eficiência de tokens para vídeos longs). O modelo suporta ferramentas de vídeo seletivas (VideoCut) para focar o raciocínio em timestamps.
- Automação de GUI orientada a agente e uso de ferramentas. Benchmarks e testes internos (OSWorld, AndroidWorld, LiveCodeBench, benchmarks de grounding de GUI) indicam melhorias em tarefas de agente de GUI e automação em múltiplas etapas. O modelo pode emitir comandos de grounding de GUI e operar em contextos simulados de SO/web/móvel.
- Modos de pensamento configuráveis para controle de latência/custo. Quatro modos de inferência permitem que desenvolvedores ajustem o nível de computação em tempo de teste para tarefas interativas vs. lotes de alta qualidade. Isso é útil para sistemas de produção com orçamentos de latência rígidos.
- Eficiência de tokens aprimorada (multimodal). Seed 1.8 demonstra maior eficiência de tokens em benchmarks multimodais em relação aos seus predecessores (séries Seed-1.5/1.6), alcançando alta precisão com orçamentos menores de tokens em várias tarefas de vídeos longs.
- Modos de pensamento configuráveis: troque profundidade de inferência vs. latência/custo com modos distintos (
no_think→think-high) para ajustar ao uso de produção interativo. - Capacidades técnicas
- Eficiência de tokens: Seed1.8 apresenta eficiência de tokens notável vs. predecessores (Seed-1.5/1.6), entregando maior precisão com orçamentos menores de tokens em tarefas de vídeos longs (por exemplo, alcançando precisão competitiva mesmo com 32K tokens de vídeo). Isso possibilita menor custo de inferência para entradas longs.
- Raciocínio e percepção multimodais: O modelo atinge SOTA em várias tarefas de VQA multi-imagem e de movimento/percepção e obtém segundo lugar ou próximo de SOTA em muitos benchmarks de raciocínio multimodal; especificamente, supera seu predecessor em quase todas as dimensões visuais/de vídeo medidas.
- Uso de ferramentas orientado a agente e grounding de GUI: Suporte documentado para grounding de GUI e benchmarks de operação baseados em tela (ScreenSpot-Pro, agenting de GUI) com fortes pontuações de grounding (por exemplo, melhorias em relação ao Seed-1.5-VL no ScreenSpot-Pro).
- Raciocínio paralelo/em etapas: Aumentar a computação em tempo de teste (pensamento paralelo) gera ganhos mensuráveis em benchmarks de matemática, codificação e raciocínio multimodal
Destaques selecionados de benchmarks públicos do Seed1.8
- VCRBench (raciocínio de senso comum visual): Seed1.8 obteve 59.8 (Pass@1 relatado na tabela do cartão do modelo), uma melhoria em relação ao Seed-1.5-VL e competitivo com os principais modelos
- VideoHolmes (raciocínio em vídeo): Seed1.8 65.5, superando o Seed-1.5-VL e aproximando-se de modelos concorrentes de nível profissional.
- MMLB-NIAH (multimodal, contexto longo, 128k): Seed1.8 atingiu 72.2 Pass@1 com contexto de 128k no MMLB-NIAH, superando alguns modelos profissionais contemporâneos.
- Conjunto de Motion & Perception: SOTA em 5 das 6 tarefas avaliadas; exemplos incluem TVBench, TempCompass e TOMATO, onde o Seed1.8 apresenta ganhos substanciais em percepção temporal.
- Fluxos de trabalho orientados a agente: No BrowseComp e em outros benchmarks de busca/código orientados a agente, o Seed1.8 frequentemente fica próximo ou acima de modelos profissionais concorrentes
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Melhorias claras em percepção multimodal, eficiência de tokens para vídeos longs e execução orientada a agente.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: Em muitos benchmarks multimodais, o Seed1.8 iguala ou supera o Gemini 3 Pro (SOTA em várias tarefas de VQA/movimento; melhor no MMLB-NIAH com 128k). No entanto, o cartão também mostra áreas em que os modelos da família Gemini mantêm vantagens em certas tarefas de conhecimento disciplinar — portanto, a ordenação relativa depende do benchmark.
- Variante Seed-Code (Doubao-Seed-Code): especializada em tarefas de programação/código orientado a agente (contexto amplo para bases de código; benchmarks SWE especializados). Seed1.8 é o modelo multimodal orientado a agente generalista, enquanto o Seed-Code é a variante focada em programação.
Casos de uso práticos com a API Seedream 4.5 na CometAPI
- Assistentes de pesquisa multimodal e análise de documentos: extrair, resumir e raciocinar em documentos longs, apresentações e relatórios de múltiplas páginas.
- Compreensão e monitoramento de vídeos longs: análises de segurança/transmissões esportivas, sumarização de reuniões longs e análises de streaming em que a eficiência de tokens para vídeos longs do modelo é importante.
- Fluxos de trabalho/automação orientados a agente: cenários de busca na web em múltiplas etapas + execução de código + extração de dados (por exemplo, análise competitiva automatizada, planejamento de viagens, pipelines de pesquisa demonstrados em benchmarks internos).
- Ferramentas para desenvolvedores (se usar Seed-Code): análise de grandes bases de código, assistentes de IDE e execução de código orientada a agente para testes e correções (Seed-Code é a variante especializada recomendada).
- Automação de GUI e RPA: benchmarks de grounding de tela e de agente de GUI indicam que o modelo pode executar tarefas de GUI estruturadas melhor do que versões anteriores do Seed.
Como usar a API doubao Seed 1.8 via CometAPI
Doubao seed1.8 está disponível comercialmente por meio da CometAPI como uma API de inferência hospedada. A API suporta payloads multimodais (texto + imagens + fragmentos de vídeo/marcas de tempo) e modos de inferência configuráveis para equilibrar latência e computação com a qualidade das respostas.
Padrões de chamada: a API suporta solicitações no estilo chat/completion padrão, respostas em streaming e fluxos orientados a agente em que o modelo emite chamadas de ferramentas (busca, execução de código, ações de GUI) e incorpora as saídas das ferramentas como contexto subsequente.
Transmissão e tratamento de contexto longo: a API suporta streaming e possui primitivas de gerenciamento de contexto integradas para sessões longas (para permitir contextos de 100K+ / rastros de agente em múltiplas etapas).
Etapa 1: Cadastre-se para obter a chave de API
Faça login em cometapi.com. Se você ainda não é nosso usuário, registre-se primeiro. Acesse seu console CometAPI. Obtenha a chave de API de credencial de acesso da interface. Clique em “Add Token” no token de API no centro pessoal, obtenha a chave do token: sk-xxxxx e envie.
Etapa 2: Envie solicitações para a API doubao Seed 1.8
Selecione o endpoint “doubao-seed-1-8-251228” para enviar a solicitação à API e defina o corpo da solicitação. O método e o corpo da solicitação são obtidos na documentação de API do nosso site. Nosso site também fornece teste no Apifox para sua conveniência. Substitua <YOUR_API_KEY> pela sua chave CometAPI real da sua conta. Compatibilidade com as APIs Chat.
Insira sua pergunta ou solicitação no campo de conteúdo — é isso que o modelo responderá. Processe a resposta da API para obter a resposta gerada.
Etapa 3: Recupere e verifique os resultados
Processe a resposta da API para obter a resposta gerada. Após o processamento, a API responde com o status da tarefa e os dados de saída.