Especificaciones técnicas de la API de Seed 1.8
| Elemento | Especificación / nota |
|---|---|
| Nombre del modelo / familia | Doubao-Seed-1.8 (Seed1.8) — ByteDance Seed / Volcano Engine |
| Modalidades admitidas | Texto, imágenes, video (capacidades VLM multimodales), herramientas de audio en el ecosistema (modelos separados para la generación de audio/video). |
| Ventana de contexto (texto) | 256K tokens |
| Capacidad de video/visual | Diseñado para razonamiento en videos largos, admite codificación visual eficiente y grandes presupuestos de tokens de video (la ficha del modelo reporta experimentos de tokens de video y benchmarks de videos largos). |
| Formatos de entrada | Prompts de texto libre; cargas de imágenes (capturas de pantalla, gráficos, fotos); video como fotogramas tokenizados / herramientas de video para inspección por segmentos; cargas de archivos (documentos). |
| Formatos de salida | Texto en lenguaje natural, salidas estructuradas (structured-output beta), llamadas a funciones / llamadas a herramientas, código y salidas multimodales mediante orquestación. |
| Modos de pensamiento/inferencia | no_think, think-low, think-medium, think-high — equilibrio entre precisión y latencia/costo. |
¿Qué es Doubao Seed 1.8?
Doubao Seed 1.8 es la versión 1.8 del equipo Seed: un LLM+VLM unificado que apunta explícitamente a la agencia generalizada en el mundo real, es decir, percepción (imágenes/video), razonamiento, orquestación de herramientas (búsqueda, llamadas a funciones, ejecución de código, GUI grounding) y toma de decisiones en múltiples pasos dentro de un solo modelo. El diseño enfatiza “modos de pensamiento” configurables (compromisos entre latencia y profundidad), codificación visual eficiente y compatibilidad nativa con contexto largo y entradas multimodales para que el modelo pueda operar como asistente/agente autónomo en flujos de trabajo de producción.
Características principales de la API de Seed 1.8
- Modelo multimodal de agencia unificado. Integra percepción (imagen/video), razonamiento (LLM) y acción (llamadas a herramientas/G U I, ejecución de código) en un solo modelo en lugar de una canalización dividida. Esto permite flujos de trabajo de agentes más compactos y menor complejidad de orquestación.
- Contexto ultralargo y manejo de videos largos. Contexto largo (compatibilidad del producto hasta 256K tokens) y benchmarks específicos de videos largos (Seed1.8 muestra una fuerte eficiencia de tokens en video largo). El modelo admite herramientas de video selectivas (VideoCut) para enfocar el razonamiento en marcas de tiempo.
- Automatización de GUI con agencia y uso de herramientas. Los benchmarks y pruebas internas (OSWorld, AndroidWorld, LiveCodeBench, benchmarks de GUI grounding) muestran mejoras en tareas de agentes de GUI y automatización de múltiples pasos. El modelo puede generar comandos de GUI grounding y operar en contextos simulados de OS/web/móvil.
- Modos de pensamiento configurables para controlar latencia/costo. Cuatro modos de inferencia permiten a los desarrolladores ajustar el cómputo en tiempo de prueba para tareas interactivas frente a tareas por lotes de alta calidad. Esto es útil para sistemas de producción con presupuestos de latencia estrictos.
- Eficiencia de tokens mejorada (multimodal). Seed 1.8 demuestra una mayor eficiencia de tokens en benchmarks multimodales frente a sus predecesores (serie Seed-1.5/1.6), logrando alta precisión con presupuestos de tokens menores en varias tareas de videos largos.
- Modos de pensamiento configurables: equilibrar profundidad de inferencia frente a latencia/costo con modos distintos (
no_think→think-high) para ajustar el uso en producción interactiva. - Capacidades técnicas
- Eficiencia de tokens: Seed1.8 muestra una marcada eficiencia de tokens frente a los predecesores (Seed-1.5/1.6), ofreciendo mayor precisión con presupuestos de tokens más bajos en tareas de video largo (p. ej., logrando precisión competitiva incluso con 32K tokens de video). Esto permite reducir el costo de inferencia para entradas largas.
- Razonamiento y percepción multimodal: El modelo alcanza SOTA en varios VQA multimagen y tareas de movimiento/percepción, y obtiene el segundo lugar o cerca de SOTA en muchos benchmarks de razonamiento multimodal; específicamente supera a su predecesor en casi todas las dimensiones visuales/de video medidas.
- Uso de herramientas con agencia y GUI grounding: Soporte documentado para grounding en pantalla y benchmarks de operación basada en pantalla (ScreenSpot-Pro, GUI agenting) con puntajes de grounding sólidos (p. ej., mejoras sobre Seed-1.5-VL en ScreenSpot-Pro).
- Razonamiento paralelo/escalonado: Incrementar el cómputo en tiempo de prueba (pensamiento paralelo) produce mejoras medibles en benchmarks de matemáticas, programación y razonamiento multimodal
Aspectos destacados de benchmarks públicos seleccionados de Seed1.8
- VCRBench (razonamiento visual de sentido común): Seed1.8 obtuvo 59.8 (Pass@1 reportado en la tabla de la ficha del modelo), una mejora sobre Seed-1.5-VL y competitiva con los modelos líderes.
- VideoHolmes (razonamiento de video): Seed1.8 65.5, superando a Seed-1.5-VL y acercándose a modelos competidores de nivel profesional.
- MMLB-NIAH (multimodal de contexto largo, 128k): Seed1.8 alcanzó 72.2 Pass@1 con contexto 128k en MMLB-NIAH, superando a algunos modelos profesionales contemporáneos.
- Suite de Movimiento y Percepción: SOTA en 5 de 6 tareas evaluadas; ejemplos incluyen TVBench, TempCompass y TOMATO, donde Seed1.8 muestra ganancias sustanciales en percepción temporal.
- Flujos de trabajo con agencia: En BrowseComp y otros benchmarks de búsqueda/código con agencia, Seed1.8 a menudo se ubica cerca o por encima de modelos profesionales competidores.
Seed 1.8 vs Gemini 3 Pro / GPT-5.x
- Seed1.8 vs Seed-1.5-VL / Seed-1.6: Mejoras claras en percepción multimodal, eficiencia de tokens para videos largos y ejecución con agencia.
- Seed1.8 vs Gemini 3 Pro / GPT-5.x: En muchos benchmarks multimodales Seed1.8 iguala o supera a Gemini 3 Pro (SOTA en varias tareas de VQA/movimiento; mejor en la ejecución de MMLB-NIAH 128k). Sin embargo, la ficha también muestra áreas donde los modelos de la familia Gemini mantienen ventajas en ciertas tareas de conocimiento disciplinar, por lo que el orden relativo depende del benchmark.
- Variante Seed-Code (Doubao-Seed-Code): especializada en tareas de programación/código con agencia (contexto amplio para bases de código; benchmarks SWE especializados). Seed1.8 es el modelo multimodal generalista con agencia, mientras que Seed-Code es la variante enfocada en programación.
Casos de uso prácticos de la API Seedream 4.5 en CometAPI
- Asistentes de investigación multimodal y análisis de documentos: extraer, resumir y razonar sobre documentos largos, presentaciones y reportes de múltiples páginas.
- Comprensión y monitorización de videos largos: analítica de seguridad/transmisiones deportivas, resumen de reuniones largas y análisis de streaming donde importa la eficiencia de tokens en videos largos del modelo.
- Flujos de trabajo con agencia / automatización: escenarios de múltiples pasos con búsqueda web + ejecución de código + extracción de datos (p. ej., análisis competitivo automatizado, planificación de viajes, canalizaciones de investigación demostradas en benchmarks internos).
- Herramientas para desarrolladores (si usa Seed-Code): análisis de bases de código grandes, asistentes en IDE y ejecución de código con agencia para pruebas y reparación (Seed-Code es la variante especializada recomendada).
- Automatización de GUI y RPA: el grounding en pantalla y los benchmarks de agentes de GUI indican que el modelo puede ejecutar tareas de GUI estructuradas mejor que versiones anteriores de Seed.
Cómo usar la API de doubao Seed 1.8 a través de CometAPI
Doubao seed1.8 se ofrece comercialmente a través de CometAPI como una API de inferencia alojada. La API admite cargas multimodales (texto + imágenes + fragmentos de video / marcas de tiempo) y modos de inferencia configurables para equilibrar latencia y cómputo frente a la calidad de la respuesta.
Patrones de llamada: La API admite solicitudes estándar de tipo chat/completion, respuestas en streaming y flujos con agencia donde el modelo emite llamadas a herramientas (búsqueda, ejecución de código, acciones de GUI) e ingiere las salidas de las herramientas como contexto subsiguiente.
Streaming y manejo de contexto largo: La API admite streaming y cuenta con primitivas de gestión de contexto integradas para sesiones largas (para habilitar contextos de 100K+ / trazas de agentes de múltiples pasos).
Paso 1: Regístrese para obtener la clave de API
Inicie sesión en cometapi.com. Si aún no es usuario, regístrese primero. Inicie sesión en su Consola de CometAPI. Obtenga la clave de API de credenciales de acceso de la interfaz. Haga clic en “Add Token” en el token de la API en el centro personal, obtenga la clave de token: sk-xxxxx y envíe.
Paso 2: Envíe solicitudes a la API de doubao Seed 1.8
Seleccione el endpoint “doubao-seed-1-8-251228” para enviar la solicitud a la API y configure el cuerpo de la solicitud. El método y el cuerpo de la solicitud se obtienen de la documentación de la API en nuestro sitio web. Nuestro sitio web también proporciona pruebas en Apifox para su conveniencia. Reemplace <YOUR_API_KEY> por su clave real de CometAPI de su cuenta. Compatible con las APIs de Chat.
Inserte su pregunta o solicitud en el campo content —esto es a lo que el modelo responderá—. Procese la respuesta de la API para obtener la respuesta generada.
Paso 3: Recupere y verifique los resultados
Procese la respuesta de la API para obtener la respuesta generada. Tras el procesamiento, la API responde con el estado de la tarea y los datos de salida.