النموذج الأحدث يدعم المدخلات المرجعية متعددة الوسائط، ما يتيح تحويل البيانات الثابتة وكثيفة النصوص إلى
محتوى فيديو ديناميكي تصل مدته إلى 30 ثانية
أطلقت “علي بابا” النسخة التجريبية من Wan3.0، نموذج توليد الفيديو المتقدّم الذي يدعم توليد مقاطع بمدة 30 ثانية والمدخلات المرجعية متعددة الوسائط. وتمثل تلك الأداة المبتكرة تطوراً نوعياً ضمن مجال الذكاء الاصطناعي التوليدي، إذ تدمج إنتاج الفيديو عالي الدقة، والاتساق البصري المحكم، والمدخلات الشاملة متعددة الوسائط ضمن نموذج واحد مصمم لتبسيط مسارات العمل الاحترافي. ومع بدء الاختبار التجريبي العام لـ Wan3.0، يمكن للمستخدمين التقدم بطلب لاختبار النموذج عبر منصة تطوير الذكاء الاصطناعي من علي بابا كلاود “موديل استوديو”، والمنصة السحابية القائمة على الذكاء الاصطناعي Qwen Cloud.
وتنتج مولّدات الفيديو السائدة المدعومة بالذكاء الاصطناعي مقاطع لا تتجاوز مدتها بضع ثوانٍ إلى 15 ثانية، وهي المدة القصوى للمقطع الواحد في Wan2.7-Video، النموذج السابق لتوليد الفيديو ضمن سلسلة Wan. ويتيح دعم Wan3.0 الأصيل للتسلسلات الأطول مدةً، والتي تصل إلى 30 ثانية للمقطع الواحد، لصانعي المحتوى تنفيذ حركات كاميرا معقدة ولقطات متواصلة دون انقطاع. كما يقدم النموذج خاصية المدة الذكية التي توصي بمدة مثلى للفيديو بناءً على أوامر المستخدم النصية، إلى جانب خصائص تمديد الفيديو للمساعدة على توسيع نطاق الجداول الزمنية للسردية.
ويشكّل اتساع القدرة على استيعاب المدخلات متعددة الوسائط عاملاً رئيسياً يميّز Wan3.0، إذ يمكن للنموذج معالجة المدخلات النصية والصورية والمرئية والصوتية في آنٍ واحد، مع دعم صفحات الويب والمستندات مثل ملفات “بي دي إف” وعروض “باوربوينت”. وتتيح تلك الخاصية للمستخدمين تحويل البيانات الثابتة وكثيفة النصوص مباشرة إلى محتوى فيديو ديناميكي.
ولمعالجة الانحرافات والتشوهات البصرية الشائعة في المحتوى المولّد بالذكاء الاصطناعي، يتميز Wan3.0 باستمرارية بصرية عالية الدقة. ويرسم النموذج وجوهاً بشرية شديدة الواقعية مع تعبيرات دقيقة متزامنة، وينتج مخرجات صوتية طبيعية بلغات متعددة، ويعرض بدقة واجهات المستخدم البرمجية المستقرة والرسوم المتحركة.
وإلى جانب الاستقرار البصري، تم تصميم Wan3.0 لاستنساخ التفاصيل الدقيقة من المدخلات المرجعية، مع تحكم صارم بتفاصيل الشخصيات والمنتجات، والعلاقات المكانية، واتساق الصوت. وبدلاً من توليد أوجه تشابه تقريبية، يستنسخ النموذج بدقة الشخصيات والإكسسوارات والمقاطع الصوتية والتخطيطات المكانية والأنماط من المدخلات المرجعية، مع الحفاظ على استقرار التخطيطات والصوت. وتقترن تلك الدقة بحركة طبيعية وتعبيرات عاطفية لتحويل مقاطع الذكاء الاصطناعي الاعتيادية إلى قصص درامية غامرة.
كما تم تصميم النموذج لدعم مجموعة واسعة من القطاعات، بدءاً من تبسيط الإنتاج لصانعي الأفلام، وإنتاج الأعمال الدرامية القصيرة ومحتوى وسائل التواصل الاجتماعي، ووصولاً إلى مساعدة الشركات على تحويل النصوص والصور بسهولة إلى مقاطع فيديو تسويقية وتعليمية. ويمكن أن يشكّل Wan3.0 أداة قوية لمطوري التكنولوجيا عبر توليد مقاطع محاكاة واقعية لتدريب المركبات ذاتية القيادة وأنظمة الروبوتات.
ومنذ إطلاقها في يوليو من عام 2023، خضعت سلسلة Wan من نماذج التوليد البصري التابعة لعلي بابا لتحديثات متواصلة تجعل توليد الصور ومقاطع الفيديو أكثر واقعية وسهولة في التحكم وملاءمة لصانعي المحتوى.

