РекламаРекламаРекламаРеклама
ИИ

Alibaba представила мультимодальную модель Qwen3.8-Omni-Flash

21.09.2026, 16:43 • Евгения Слив

(обновлено: 21.09.2026)

Alibaba представила мультимодальную модель Qwen3.8-Omni-Flash

Alibaba Cloud представила Qwen3.8-Omni-Flash – мультимодальную ИИ-модель, которая работает сразу с текстом, изображениями, аудиозаписями и видео. Контекстное окно системы достигает 1 млн токенов, что позволяет обрабатывать большие объемы информации в рамках одного запроса. Основная версия формирует текстовый ответ, а сама модель поддерживает вызов внешних функций, веб-поиск и режим рассуждений с регулируемой глубиной. Разработчики позиционируют Qwen3.8-Omni-Flash не только как инструмент для распознавания и анализа мультимедийных данных, но и как основу для выполнения сложных последовательных задач с использованием ИИ-агентов. Отдельно Alibaba Cloud представила вариант Qwen3.8-Omni-Flash-Realtime, предназначенный для работы с аудио и видео в режиме реального времени.

Одним из основных направлений применения модели Alibaba называет обработку продолжительных аудио- и видеозаписей. Qwen3.8-Omni-Flash способна анализировать многочасовые материалы, находить в них нужные эпизоды и формировать структурированные результаты. При работе с записями встреч система может создавать стенограммы, различать участников разговора, выделять поставленные задачи и готовить итоговые резюме. Для видео пользователь может заранее задать временной интервал, объект поиска, необходимую степень детализации и формат итогового ответа. Такой подход позволяет использовать одну модель для разных типов мультимедийного контента без необходимости отдельно преобразовывать исходные данные в текст. Дополнительные инструменты расширяют возможности системы в сценариях, связанных с переводом, видеомонтажом, созданием комментариев и другой обработкой медиаматериалов.

По данным Alibaba Cloud, Qwen3.8-Omni-Flash показала в среднем более чем на 25% более высокий результат по сравнению с Qwen3.5-Omni-Plus в 29 внутренних и отраслевых тестах. Компания также заявляет о снижении стоимости обработки аудио и аудиовизуального контента через API относительно предыдущей модели. Qwen3.8-Omni-Flash уже доступна через Alibaba Cloud Model Studio и поддерживает интерфейсы Chat Completions и Responses, совместимые с API OpenAI. Таким образом, разработчики могут подключать модель к существующим приложениям и использовать ее не только для отдельных запросов, но и в составе автоматизированных процессов. Отдельная realtime-версия расширяет этот подход на сценарии, где анализ аудио и видео должен происходить непосредственно во время взаимодействия.

Популярные статьи