أبرز النقاط
Wan 2.1:
البنية: يستخدم محول انتشار و Wan-VAE جديد لتشفير الفيديو المكاني-الزماني بدقة 1080P.
الإمكانيات: متعدد الوسائط (نص/صورة إلى فيديو، تحرير، فيديو إلى صوت)، توليد نصوص ثنائي اللغة.
الكفاءة: يعمل على 8.19 جيجابايت من VRAM، مما يجعله متاحًا لوحدات معالجة الرسوميات المتوسطة.
السرعة: يُنتج فيديو مدته 5 ثوانٍ بدقة 480P في حوالي 4 دقائق (RTX 4090).
HunyuanVideo:
البنية: يستفيد من VAE ثلاثي الأبعاد سببي و محول ثنائي التدفق لتوليف الصور/الفيديو الموحد.
الإمكانيات: محاذاة نص-فيديو فائقة، تنوع حركي، واستقرار؛ يتضمن نموذج إعادة كتابة المطالبات.
الأجهزة: يتطلب 60–80 جيجابايت من ذاكرة GPU (720p)، موجه للاستوديوهات عالية المستوى.
السرعة: مُحسَّن عبر الاستدلال المتوازي xDiT لتوليد أسرع، 2-3 دقائق لكل مقطع بأقصى جودة.
تطورت نماذج توليد الفيديو بشكل كبير، حيث تدفع المشاريع مفتوحة المصدر مثل HunyuanVideo و Wan2.1 حدود الابتكار. يبرز HunyuanVideo كنموذج أساسي للفيديو مفتوح المصدر رائد، ينافس البدائل المغلقة من الدرجة الأولى. في الوقت نفسه، يوفر Wan2.1 مجموعة شاملة وقوية من نماذج الفيديو الأساسية مفتوحة المصدر. يستفيد كلاهما من أحدث التقنيات لإنتاج فيديوهات عالية الجودة، مما يتيح تخصيصًا وتحسينًا واسع النطاق.
ابدأ تجربة مجانية على Novita AI اليوم. لدمج Wan 2.1 و Hunyuan Video API، تفضل بزيارة وثائق المطور لمزيد من التفاصيل.
تقدم Novita أسعارًا تنافسية للغاية في السوق.
على سبيل المثال، فيديو من Wan 2.1 بدقة 720P لمدة 5 ثوانٍ يكلف فقط 0.4 دولار لكل فيديو
إذا كنت ترغب في تقييم مجموعة Tencent دون توفير 60-80 جيجابايت من VRAM لـ HunyuanVideo الكامل، ابدأ بـ البدء السريع لـ Hunyuan Video Fast API. يغطي نقطة نهاية Novita منخفضة زمن الوصول، وتدفق الاستقصاء غير المتزامن، والمقايضة العملية بين التكرار الأسرع وأقصى دقة حركية.
بينما فيديو مماثل على Replicate يكلف 2.39 دولار لكل فيديو
Wan2.1
- مفتوح المصدر: نعم
- الإمكانيات:
- يوفر إمكانيات توليد متعددة الوسائط، بما في ذلك:
- نص إلى فيديو
- صورة إلى فيديو
- تحرير الفيديو
- نص إلى صورة
- فيديو إلى صوت
- يدعم توليد نصوص ثنائية اللغة باللغتين الصينية والإنجليزية.
- مدعوم بـ Wan-VAE، يمكنه تشفير وفك تشفير فيديوهات 1080P بأي طول مع الحفاظ على الاتساق الزمني.
- يوفر إمكانيات توليد متعددة الوسائط، بما في ذلك:
HunyuanVideo
- مفتوح المصدر: نعم
- الإمكانيات:
- يدعم توليد نص إلى فيديو.
- يتضمن نموذج إعادة كتابة المطالبات لتحسين وتكييف مطالبات المستخدم.
البنية
| الميزة | Wan2.1 | HunyuanVideo |
|---|---|---|
| البنية | نموذج محول الانتشار | VAE ثلاثي الأبعاد سببي لمساحة كامنة مضغوطة مكانيًا-زمانيًا |
| المساحة الكامنة | مشفر تلقائي متغير مكاني-زماني (VAE) يسمى Wan-VAE | يضغط بيانات الفيديو والصورة في مساحة كامنة مدمجة باستخدام VAE ثلاثي الأبعاد مع CausalConv3D |
| تشفير النص | مشفر T5 لإدخال نص متعدد اللغات | نموذج لغة كبير متعدد الوسائط (MLLM) |
| تصميم المحول | الانتباه المتبادل في كل كتلة محول يدمج النص في بنية النموذج | محول “ثنائي التدفق إلى أحادي التدفق” لتوليد الصور والفيديو الموحد |
- Wan 2.1، من ناحية أخرى، يعزز توليد الترجمة باستخدام مشفر T5 و آلية الانتباه المتبادل، مع دعم توليد فيديو طويل قوي باستخدام Wan-VAE و نموذج محول الانتشار.
- HunyuanVideo يحسن بشكل كبير دقة النص إلى فيديو واستقرار التوليد من خلال VAE ثلاثي الأبعاد السببي، و نموذج إعادة كتابة المطالبات، و ضغط المساحة الكامنة.
متطلبات الأجهزة
Wan2.1
Wan2.1 أكثر كفاءة من حيث الأجهزة بشكل ملحوظ، خاصة للمهام ذات الدقة المنخفضة. إنه مصمم ليكون متاحًا للمستخدمين ذوي موارد الأجهزة المحدودة مع دعم توليد الفيديو عالي الجودة. النقاط الرئيسية:
- متطلبات GPU:
- يتطلب نموذج T2V-1.3B (نص إلى فيديو) فقط 8.19 جيجابايت من VRAM، مما يجعله متاحًا لوحدات معالجة الرسوميات مثل RTX 3060 أو RTX 4060.
- تتطلب نماذج الدقة الأعلى (مثل نماذج 14B) وحدات معالجة رسوميات أكثر قوة، مثل RTX 3090 أو RTX 4090 أو A100، لكن هذه المتطلبات لا تزال أقل مقارنة بـ HunyuanVideo.
| اسم النموذج | الوظيفة | دعم الدقة | حجم النموذج | الطلب على الأجهزة | GPU الموصى به |
|---|---|---|---|---|---|
| T2V-14B | نص إلى فيديو (T2V) | 480P / 720P | 14B | ⭐⭐⭐⭐ | A100 / RTX 3090 / RTX 4090 |
| I2V-14B-720P | صورة إلى فيديو (I2V) | 720P | 14B | ⭐⭐⭐⭐ | A100 / RTX 3090 / RTX 4090 |
| I2V-14B-480P | صورة إلى فيديو (I2V) | 480P | 14B | ⭐⭐⭐ | RTX 3090 / RTX 4070 Ti |
| T2V-1.3B | نص إلى فيديو (T2V) | دقة منخفضة | 1.3B | ⭐⭐ | RTX 3060 / RTX 4060 أو أعلى |
HunyuanVideo
لدى HunyuanVideo متطلبات أجهزة أعلى، حيث أنه مصمم للتعامل مع مهام توليد الفيديو عالية الدقة والمعقدة. فيما يلي النقاط الرئيسية المتعلقة بمتطلبات أجهزته:
- متطلبات GPU:
- يتطلب GPU من NVIDIA مع دعم CUDA.
- لدقة 720×1280 عند 129 إطارًا، يلزم 60 جيجابايت على الأقل من ذاكرة GPU.
- لدقة 544×960، يلزم 45 جيجابايت على الأقل من ذاكرة GPU.
- يُوصى باستخدام GPU بسعة 80 جيجابايت (مثل NVIDIA A100) للحصول على الأداء الأمثل.
HunyuanVideo مصمم لـ الأجهزة عالية المستوى، ويتطلب ذاكرة VRAM كبيرة (45 جيجابايت–80 جيجابايت)، مما يجعله مناسبًا للمستخدمين الذين لديهم إمكانية الوصول إلى وحدات معالجة رسوميات عالية الأداء (مثل NVIDIA A100 أو ما يشابهها). إنه أكثر ملاءمة للمهام التي تتطلب توليد فيديو عالي الدقة و تسلسلات أطول.
Wan2.1 أكثر سهولة في الوصول للمستخدمين الذين لديهم وحدات معالجة رسوميات قياسية، خاصة للمهام مثل توليد النص إلى فيديو منخفض الدقة. يحتاج نموذج T2V-1.3B فقط إلى 8.19 جيجابايت VRAM، مما يجعله مثاليًا للمستخدمين الذين لديهم وحدات معالجة رسوميات متوسطة مثل RTX 3060 أو RTX 4060. ومع ذلك، للدقة الأعلى (720P أو أكبر)، يُوصى باستخدام وحدات معالجة رسوميات أكثر قوة.
تقييم المخرجات
1. جودة الفيديو - الدقة
- Wan2.1:
- يدعم توليد الفيديو بدقة 480P و 720P.
- HunyuanVideo:
- تم تقييمه بناءً على محاذاة النص، جودة الحركة، و الجودة البصرية.
- يدعم دقة تصل إلى 720P.
2. الإبداع
- Wan2.1:
- يوسع المطالبات لتشمل تفاصيل أكثر ثراءً في الفيديوهات المُنشأة.
- يركز على تحسين المخرجات الإبداعية من خلال إثراء عملية توليد الفيديو.
- HunyuanVideo:
- يتميز بـ أوضاع إعادة كتابة المطالبات لفهم نية المستخدم بشكل أفضل.
- يعزز الجودة البصرية من خلال تحسين فهم المطالبات.
3. السرعة
- Wan2.1:
- يُنشئ فيديو مدته 5 ثوانٍ بدقة 480P على RTX 4090 في حوالي 4 دقائق (بدون تقنيات تحسين).
- HunyuanVideo:
- يستخدم كود استدلال متوازي مدعوم بـ xDiT، مما يتيح توليد فيديو أسرع.
- متوسط سرعة التوليد: 2-3 دقائق لكل مقطع بأقصى جودة.
- Wan2.1: يتفوق في المخرجات الإبداعية و تنوع المطالبات، مما يجعله مثاليًا للمستخدمين الذين يبحثون عن توليد فيديو غني ومفصل، على الرغم من أنه أبطأ قليلاً.
- HunyuanVideo: مناسب للمستخدمين الذين يعطون الأولوية لـ جودة الفيديو، سرعات التوليد الأسرع، و المرونة في تخصيص الفيديو.
التطبيق
Wan2.1
إنشاء فيديو متعدد الوسائط
- التطبيق: مثالي لإنشاء فيديوهات تجمع بين وسائط متعددة، مثل دمج النصوص والصور والعناصر البصرية الأخرى في مخرجات متماسكة.
- السبب: يتفوق Wan 2.1 في التوليد متعدد الوسائط، مما يجعله مناسبًا لمحتوى الفيديو الإبداعي والديناميكي حيث تكون المدخلات المتنوعة مطلوبة.
فيديوهات مع توليد ترجمة تلقائية
- التطبيق: مثالي لإنتاج فيديوهات مع ترجمات مُنشأة تلقائيًا، مثل البرامج التعليمية أو فيديوهات الشرح أو محتوى وسائل التواصل الاجتماعي.
- السبب: قدرة Wan 2.1 على توليد الترجمات مباشرة تحسن إمكانية الوصول وتوفر الوقت في مرحلة ما بعد الإنتاج.
محتوى وسائل التواصل الاجتماعي مع ديناميكيات بصرية محسّنة
- التطبيق: مناسب لإنشاء فيديوهات جذابة لوسائل التواصل الاجتماعي حيث تكون العناصر متعددة الوسائط مثل تراكبات النص ورسوم الترجمات المتحركة ضرورية (مثل TikTok، Instagram).
- السبب: تركيزه على دمج المدخلات متعددة الوسائط يسمح بفيديوهات قصيرة ديناميكية بصريًا وجاذبة للانتباه.
HunyuanVideo
توليد فيديو يركز على النص
- التطبيق: مثالي للفيديوهات حيث يكون التركيز الأساسي على التفسير الدقيق والتمثيل البصري للمحتوى النصي، مثل العروض التقديمية للشركات أو فيديوهات تعليمية.
- السبب: فهم Hunyuan الفائق للنص يضمن محاذاة دقيقة بين مطالبات الإدخال ومخرجات الفيديو النهائية.
فيديوهات شرح أو تعليمية احترافية
- التطبيق: الأفضل لإنشاء فيديوهات شرح أو أدلة إرشادية واضحة وموجزة واحترافية.
- السبب: قوة Hunyuan في فهم النص تضمن ترجمة الأفكار والتعليمات المعقدة بشكل فعال إلى تنسيق فيديو.
فيديوهات علامة تجارية أو تسويقية عالية الجودة
- التطبيق: مناسب لصياغة محتوى تسويقي احترافي عالي الدقة حيث توجه المطالبات النصية عناصر السرد القصصي أو العلامة التجارية.
- السبب: قدرة Hunyuan على الفهم العميق للنص تمكن من إنشاء فيديوهات تتوافق بشكل وثيق مع رسائل العلامة التجارية أو الحملات التسويقية.
نسخة مبسطة
نقوم الآن باختبار النموذجين عن طريق إدخال نفس المطالبات النصية لتقييم فهمهم للنص والمخرجات النهائية للفيديوهات.
المطالبة: تصوير سريالي حيوي، قضاعة نشيطة تقفز في بحيرة صافية فجأة، مما يثير على الفور طبقات من التموجات. تخرج رأسها ببراعة من الماء، فرائها المبلل يلتصق بجسدها، وقطرات ماء بلورية تتدحرج على خديها المستديرين. القضاعة تحدق إلى الأمام بفضول، زوايا فمها مرتفعة قليلاً، كما لو كانت تشارك سعادتها مع المشاهد. عدسة عين السمكة تلتقط هذا المنظور الفريد، الضوء الطبيعي يسقط بلطف، وبريق دقيق على سطح الماء. الصورة العامة تقدم ألوانًا ناعمة، تؤكد على الجمال الطبيعي للقضاعة وتعبيرها الحيوي. نسيج عالي الدقة وتكوين في المنتصف يخلقان جوًا غامرًا.
wan 2.1
Hunyuan
المطالبة: تصوير فني بإضاءة خلفية، العارضة تقف في وهج الغروب الذهبي، مع خطوط واضحة، مثل صورة ظلية. الحرير الخفيف والشفاف يلف العارضة، يرفرف بلطف في النسيم، متشابكًا مع الضوء الذهبي، مما يخلق تأثير هالة حالمة. تعبير العارضة هادئ ووضعيتها أنيقة، كما لو كانت غارقة في عالمها الخاص. الخلفية هي أفق ضبابي، وشمس الغروب تغطي الأرض. التباين العالي ومعالجة الضوء والظل الدقيقة تظهر مهارات المصور الفائقة. منتصف اللقطة، تم التصوير من الجانب عكس الضوء، مع التأكيد على الخطوط والجو
Wan 2.1
Hunyuan
استكشف Wan 2.1 و Hunyuan Video Demo الآن
يمثل HunyuanVideo و Wan2.1 تقدمًا كبيرًا في توليد الفيديو، حيث يعرضان بنى مبتكرة وإمكانيات قوية ومخرجات عالية الجودة. من خلال الاستفادة من تقنيات مثل 3D VAEs، و محولات الانتشار، والتدريب على البيانات واسعة النطاق، تدفع هذه النماذج حدود إنشاء المحتوى البصري. مرونتها في التخصيص والتحسين تجعلها أدوات قيمة لدفع الابتكار عبر صناعات مثل الإعلام والتعليم والإعلان.
Novita AI هي المنصة السحابية الشاملة التي تعزز طموحاتك في الذكاء الاصطناعي. واجهات برمجة تطبيقات متكاملة، بدون خادم، مثيل GPU — الأدوات الفعالة من حيث التكلفة التي تحتاجها. تخلص من البنية التحتية، ابدأ مجانًا، واجعل رؤيتك للذكاء الاصطناعي حقيقة واقعة.

