Especificaciones técnicas de la API Seed 1.8
| Elemento | Especificación / nota |
|---|---|
| Nombre del modelo / familia | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalidades admitidas | Texto, imágenes, video (capacidades VLM multimodales), herramientas de audio en el ecosistema (modelos separados para generación de audio/video). |
| Ventana de contexto (texto) | 256K tokens |
| Capacidad de video / visual | Diseñado para razonamiento sobre videos largos, admite codificación visual eficiente y grandes presupuestos de tokens de video (la ficha del modelo informa experimentos de tokens de video y pruebas de referencia de videos largos). |
| Formatos de entrada | Prompts en texto libre; cargas de imágenes (capturas de pantalla, gráficos, fotos); video como fotogramas tokenizados / herramientas de video para inspección de segmentos; cargas de archivos (documentos). |
| Formatos de salida | Texto en lenguaje natural, salidas estructuradas (structured-output beta), llamadas a funciones / llamadas a herramientas, código y salidas multimodales mediante orquestación. |
| Modos de pensamiento / inferencia | no_think, think-low, think-medium, think-high — compensan precisión frente a latencia/costo. |
¿Qué es Doubao Seed 1.8?
Doubao Seed 1.8 es la versión 1.8 del equipo Seed: un LLM+VLM unificado que apunta explícitamente a la agencia generalizada en el mundo real — es decir, percepción (imágenes/video), razonamiento, orquestación de herramientas (búsqueda, llamadas a funciones, ejecución de código, grounding de GUI) y toma de decisiones en múltiples pasos dentro de un único modelo. El diseño enfatiza “modos de pensamiento” configurables (compensaciones entre latencia y profundidad), codificación visual eficiente y soporte nativo para contexto largo e entradas multimodales, de modo que el modelo pueda operar como asistente/agente autónomo en flujos de trabajo de producción.
Características principales de la API Seed 1.8
- Modelo multimodal unificado con capacidad de agencia. Integra percepción (imagen/video), razonamiento (LLM) y acción (llamadas a herramientas/G U I, ejecución de código) en un único modelo en lugar de una canalización dividida. Esto habilita flujos de trabajo de agente compactos y menor complejidad de orquestación.
- Contexto ultralargo y manejo de videos largos. Contexto largo (soporte del producto hasta 256k tokens) y pruebas de referencia específicas para videos largos (Seed1.8 muestra una fuerte eficiencia de tokens en videos largos). El modelo admite herramientas de video selectivas (VideoCut) para enfocar el razonamiento en marcas de tiempo.
- Automatización de GUI con agencia y uso de herramientas. Los benchmarks y pruebas internas (OSWorld, AndroidWorld, LiveCodeBench, benchmarks de grounding de GUI) muestran mejoras en tareas de agente de GUI y automatización en múltiples pasos. El modelo puede emitir comandos de grounding de GUI y operar en contextos simulados de sistemas operativos/web/móvil.
- Modos de pensamiento configurables para controlar latencia/costo. Cuatro modos de inferencia permiten a los desarrolladores ajustar el cómputo en tiempo de prueba para tareas interactivas vs. lotes de alta calidad. Esto es útil para sistemas de producción con presupuestos estrictos de latencia.
- Eficiencia de tokens mejorada (multimodal). Seed 1.8 demuestra mayor eficiencia de tokens en benchmarks multimodales frente a sus predecesores (series Seed-1.5/1.6), logrando alta precisión con presupuestos de tokens más pequeños en varias tareas de video largo.
- Modos de pensamiento configurables: compensan profundidad de inferencia frente a latencia/costo con modos distintos (
no_think→think-high) para ajustar su uso en producción interactiva. - Capacidades técnicas
- Eficiencia de tokens: Seed1.8 muestra una marcada eficiencia de tokens frente a sus predecesores (Seed-1.5/1.6), ofreciendo mayor precisión con presupuestos de tokens más bajos en tareas de video largo (p. ej., logrando precisión competitiva incluso con 32K tokens de video). Esto permite menor costo de inferencia para entradas largas.
- Razonamiento y percepción multimodal: El modelo alcanza SOTA en varias tareas VQA de múltiples imágenes y de movimiento/percepción y obtiene segundo lugar o cerca de SOTA en muchos benchmarks de razonamiento multimodal; específicamente supera a su predecesor en casi todas las dimensiones visuales/de video medidas.
- Uso de herramientas con agencia y grounding de GUI: Soporte documentado para grounding de GUI y benchmarks de operación basada en pantalla (ScreenSpot-Pro, agente de GUI) con puntajes de grounding sólidos (p. ej., mejoras sobre Seed-1.5-VL en ScreenSpot-Pro).
- Razonamiento paralelo / por etapas: Aumentar el cómputo en tiempo de prueba (pensamiento paralelo) produce ganancias medibles en benchmarks de matemáticas, programación y razonamiento multimodal
Aspectos destacados seleccionados de benchmarks públicos de Seed1.8
- VCRBench (razonamiento de sentido común visual): Seed1.8 obtuvo 59.8 (Pass@1 informado en la tabla de la ficha del modelo), una mejora sobre Seed-1.5-VL y competitivo con modelos de primer nivel
- VideoHolmes (razonamiento en video): Seed1.8 65.5, superando a Seed-1.5-VL y acercándose a modelos competidores de nivel profesional.
- MMLB-NIAH (multimodal de contexto largo, 128k): Seed1.8 alcanzó 72.2 Pass@1 con contexto de 128k en MMLB-NIAH, superando a algunos modelos profesionales contemporáneos.
- Suite de Movimiento y Percepción: SOTA en 5 de 6 tareas evaluadas; ejemplos incluyen TVBench, TempCompass y TOMATO donde Seed1.8 muestra ganancias sustanciales en percepción temporal.
- Flujos de trabajo con agencia: En BrowseComp y otros benchmarks de búsqueda/código con agencia, Seed1.8 a menudo se sitúa cerca o por encima de modelos profesionales competidores
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Mejoras claras en percepción multimodal, eficiencia de tokens para videos largos y ejecución con agencia.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: En muchos benchmarks multimodales Seed1.8 igualaría o superaría a Gemini 3 Pro (SOTA en varias tareas de VQA / movimiento; mejor en la ejecución 128k de MMLB-NIAH). Sin embargo, la ficha también muestra áreas donde los modelos de la familia Gemini mantienen ventajas en ciertas tareas de conocimiento disciplinario — por lo que el orden relativo depende del benchmark.
- Variante Seed-Code (Doubao-Seed-Code): especializada para tareas de programación/código con agencia (contexto grande para bases de código; benchmarks SWE especializados). Seed1.8 es el modelo multimodal generalista con agencia, mientras que Seed-Code es la variante enfocada en programación.
Casos de uso prácticos con la API Seedream 4.5 en CometAPI
- Asistentes de investigación multimodal y análisis de documentos: extraer, resumir y razonar a través de documentos largos, presentaciones y reportes multipágina.
- Comprensión y monitoreo de videos largos: analítica de seguridad/deportes, resumen de reuniones largas y análisis en streaming donde la eficiencia de tokens de video largo del modelo es importante.
- Flujos de trabajo con agencia / automatización: escenarios de búsqueda web en múltiples pasos + ejecución de código + extracción de datos (p. ej., análisis competitivo automatizado, planificación de viajes, canalizaciones de investigación demostradas en benchmarks internos).
- Herramientas para desarrolladores (si usa Seed-Code): análisis de bases de código grandes, asistentes para IDE, y ejecución de código con agencia para pruebas y reparación (Seed-Code es la variante especializada recomendada).
- Automatización de GUI y RPA: los benchmarks de grounding de pantalla y de agente de GUI indican que el modelo puede realizar tareas estructuradas de GUI mejor que las versiones Seed anteriores.
Cómo usar la API doubao Seed 1.8 a través de CometAPI
Doubao seed1.8 está disponible comercialmente a través de CometAPI como una API de inferencia alojada. La API admite cargas multimodales (texto + imágenes + fragmentos de video / marcas de tiempo) y modos de inferencia configurables para compensar latencia y cómputo frente a la calidad de la respuesta.
Patrones de llamada: La API admite solicitudes estilo chat/completion estándar, respuestas en streaming y flujos con agencia donde el modelo emite llamadas a herramientas (búsqueda, ejecución de código, acciones de GUI) e ingiere salidas de herramientas como contexto posterior.
Streaming y manejo de contexto largo: La API admite streaming y cuenta con primitivas integradas de gestión de contexto para sesiones largas (para habilitar contextos de 100K+ / trazas de agente en múltiples pasos).
Paso 1: Regístrese para obtener la clave de API
Inicie sesión en cometapi.com. Si aún no es nuestro usuario, regístrese primero. Inicie sesión en su Consola de CometAPI. Obtenga la clave de credencial de acceso de la API. Haga clic en “Add Token” en el token de API en el centro personal, obtenga la clave de token: sk-xxxxx y envíela.
Paso 2: Envíe solicitudes a la API doubao Seed 1.8
Seleccione el endpoint “doubao-seed-1-8-251228 ” para enviar la solicitud de API y establezca el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de la API en nuestro sitio web. Nuestro sitio web también proporciona prueba en Apifox para su conveniencia. Reemplace <YOUR_API_KEY> con su clave real de CometAPI de su cuenta. Compatibilidad con las Chat APIs.
Inserte su pregunta o solicitud en el campo de contenido — esto es a lo que el modelo responderá. Procese la respuesta de la API para obtener la respuesta generada.
Paso 3: Recupere y verifique los resultados
Procese la respuesta de la API para obtener la respuesta generada. Después del procesamiento, la API responde con el estado de la tarea y los datos de salida.