PublicidadPublicidadPublicidadPublicidad
IA

Alibaba presentó el modelo multimodal Qwen3.8-Omni-Flash

22/9/2026, 08:14 • Eugenia Sliv

(edited: 22/09/2026)

Alibaba presentó el modelo multimodal Qwen3.8-Omni-Flash

Alibaba Cloud presentó Qwen3.8-Omni-Flash, un modelo de IA multimodal que trabaja simultáneamente con texto, imágenes, grabaciones de audio y video. La ventana de contexto del sistema alcanza 1 millón de tokens, lo que permite procesar grandes volúmenes de información en una sola solicitud. La versión principal genera respuestas textuales y el propio modelo admite la llamada a funciones externas, búsqueda web y un modo de razonamiento con profundidad ajustable. Los desarrolladores posicionan a Qwen3.8-Omni-Flash no solo como una herramienta para el reconocimiento y análisis de datos multimedia, sino también como una base para realizar tareas secuenciales complejas utilizando agentes de IA. Por separado, Alibaba Cloud presentó la variante Qwen3.8-Omni-Flash-Realtime, diseñada para trabajar con audio y video en tiempo real.

Uno de los principales usos que Alibaba menciona para el modelo es el procesamiento de grabaciones de audio y video prolongadas. Qwen3.8-Omni-Flash es capaz de analizar materiales de varias horas, encontrar los episodios necesarios y generar resultados estructurados. Al trabajar con grabaciones de reuniones, el sistema puede crear transcripciones, distinguir a los participantes de la conversación, resaltar las tareas planteadas y preparar resúmenes finales. Para video, el usuario puede predefinir un intervalo de tiempo, el objeto de búsqueda, el grado de detalle necesario y el formato de la respuesta final. Este enfoque permite utilizar un solo modelo para diferentes tipos de contenido multimedia sin la necesidad de convertir los datos originales a texto por separado. Herramientas adicionales amplían las capacidades del sistema en escenarios relacionados con la traducción, edición de video, creación de comentarios y otro procesamiento de materiales multimedia.

Según Alibaba Cloud, Qwen3.8-Omni-Flash mostró un resultado promedio más del 25% superior en comparación con Qwen3.5-Omni-Plus en 29 pruebas internas e industriales. La compañía también afirma una reducción en el costo de procesamiento de contenido de audio y audiovisual a través de API en relación con el modelo anterior. Qwen3.8-Omni-Flash ya está disponible a través de Alibaba Cloud Model Studio y admite interfaces de Chat Completions y Responses, compatibles con la API de OpenAI. De esta manera, los desarrolladores pueden conectar el modelo a aplicaciones existentes y usarlo no solo para solicitudes individuales, sino también como parte de procesos automatizados. Una versión en tiempo real separada amplía este enfoque a escenarios donde el análisis de audio y video debe ocurrir directamente durante la interacción.

Popular news