Seedance 2.0
- Referencias multimodales, edición y clips de 15 segundos
Seedance 2.0 de ByteDance (febrero 2026). Generación de vídeo multimodal nativo: texto + imagen + audio + vídeo como input, hasta 15 segundos con audio sync y multi-shot. Acceso principal: Jimeng AI (即梦).
Métricas comparables, agrupadas por capacidad para que se vea qué mide cada prueba.
Modelo cerrado: disponible mediante web o API, sin ejecución local publicada.
Resumen práctico de las formas razonables de usar este modelo.
Lo usas desde una web, app o API. No instalas el modelo en tu equipo.
Para correrlo completo necesitas GPU profesional o una máquina grande.
Puede funcionar en una buena gráfica con cuantización, normalmente sacrificando algo de calidad.
Uso en un portátil normal o con GPU modesta. Idealmente sin montar un servidor dedicado.
Uso realista en teléfono o tablet, con modelos muy pequeños u optimizados.
Dónde puedes usarlo sin entrar en detalles de hardware.
Diffusion
Unified multimodal audio-video joint generation architecture. Acepta hasta 9 imágenes + 3 vídeos + 3 audios + texto simultáneamente.
La arquitectura da pistas sobre contexto, coste, velocidad y facilidad para ejecutarlo. No es una nota de calidad por sí sola.
Proprietary
Notas
Acceso consumer vía Jimeng AI (gratis con límites). Acceso enterprise vía Volcano Engine API. No weights disponibles.
La versión actual y el linaje que explica de dónde viene y qué cambió por el camino.
Pendiente de medir
Por ahora esta nota se asigna a mano en la edición de Raziel. Más adelante la votará la comunidad.
Si Seedance 2.0 te encaja, ponlo frente a otro modelo o mira qué alternativas hay antes de cerrar la decisión.
Encuentra opciones mejores si priorizas precio, local o creatividad.
Déjalo marcado para volver cuando tengas claro el caso de uso.