
قدمت Alibaba Cloud نموذج Qwen3.8-Omni-Flash – وهو نموذج ذكاء اصطناعي متعدد الوسائط يعمل مع النصوص والصور والتسجيلات الصوتية والفيديو في وقت واحد. يصل حجم نافذة السياق للنظام إلى مليون رمز، مما يسمح بمعالجة كميات كبيرة من المعلومات في إطار طلب واحد. النسخة الأساسية تشكل استجابة نصية، ويدعم النموذج نفسه استدعاء الوظائف الخارجية، والبحث على الويب، ووضع التفكير بعمق قابل للتنظيم. يضع المطورون Qwen3.8-Omni-Flash ليس فقط كأداة للتعرف على البيانات المتعددة الوسائط وتحليلها، ولكن أيضًا كأساس لتنفيذ المهام المتسلسلة المعقدة باستخدام وكلاء الذكاء الاصطناعي. قدمت Alibaba Cloud بشكل منفصل نسخة Qwen3.8-Omni-Flash-Realtime، المصممة للعمل مع الصوت والفيديو في الوقت الفعلي.
تعتبر معالجة التسجيلات الصوتية والفيديو الطويلة واحدة من الاتجاهات الرئيسية لتطبيق النموذج الذي تسميه Alibaba. يمكن لـ Qwen3.8-Omni-Flash تحليل المواد الطويلة لساعات، والعثور على الحلقات المطلوبة فيها وتشكيل نتائج منظمة. عند العمل مع تسجيلات الاجتماعات، يمكن للنظام إنشاء نصوص، وتمييز المشاركين في المحادثة، وتحديد المهام المطروحة وإعداد ملخصات نهائية. بالنسبة للفيديو، يمكن للمستخدم تحديد الفاصل الزمني مسبقًا، وموضوع البحث، ودرجة التفاصيل المطلوبة، وصيغة الاستجابة النهائية. يتيح هذا النهج استخدام نموذج واحد لأنواع مختلفة من المحتوى المتعدد الوسائط دون الحاجة إلى تحويل البيانات الأصلية إلى نص بشكل منفصل. الأدوات الإضافية توسع من إمكانيات النظام في السيناريوهات المتعلقة بالترجمة، وتحرير الفيديو، وإنشاء التعليقات، ومعالجة المواد الإعلامية الأخرى.
وفقًا لبيانات Alibaba Cloud، أظهر Qwen3.8-Omni-Flash نتائج أعلى بنسبة تزيد عن 25% مقارنة بـ Qwen3.5-Omni-Plus في 29 اختبارًا داخليًا وصناعيًا. كما تدعي الشركة تخفيض تكلفة معالجة المحتوى الصوتي والسمعي البصري عبر API مقارنة بالنموذج السابق. يتوفر Qwen3.8-Omni-Flash بالفعل عبر Alibaba Cloud Model Studio ويدعم واجهات Chat Completions وResponses المتوافقة مع API OpenAI. وبالتالي، يمكن للمطورين توصيل النموذج بالتطبيقات الحالية واستخدامه ليس فقط للطلبات الفردية، ولكن أيضًا كجزء من العمليات الآلية. النسخة الخاصة بالوقت الفعلي توسع هذا النهج إلى السيناريوهات التي يجب أن يحدث فيها تحليل الصوت والفيديو مباشرة أثناء التفاعل.





