"خبر" رونمایی علی‌بابا از مدل هوش مصنوعی ویدیوساز Wan 3.0؛ رقیب Veo از راه رسید - آموزش گرافیک

“خبر” رونمایی علی‌بابا از مدل هوش مصنوعی ویدیوساز Wan 3.0؛ رقیب Veo از راه رسید

رونمایی علی‌بابا از مدل هوش مصنوعی ویدیوساز Wan 3.0

فکر می‌کردی جنگ ویدیوسازهای هوش مصنوعی فقط بین Google، OpenAI و چند استارتاپ معروفه؟ علی‌بابا با Wan 3.0 برگشته و این‌بار یه آپدیت معمولی هم نیاورده.

نسل تازه Wan می‌تونه در یک مرحله تا ۳۰ ثانیه ویدیوی پیوسته تولید کنه، خروجی 1080p بده، صدا و تصویر رو با هم بسازه و حتی برای ساخت ویدیو فقط به متن و عکس محدود نیست؛ فایل PDF، پاورپوینت، اکسل، ویدیو، صدا و حتی صفحه وب هم می‌تونن به‌عنوان مرجع وارد پروژه بشن.

یعنی اگر قبلاً برای ساخت یه ویدیوی تبلیغاتی باید از چند ابزار مختلف استفاده می‌کردی، علی‌بابا حالا می‌خواد بخش بزرگی از این مسیر رو داخل یک مدل جمع کنه.

و دقیقاً به همین خاطره که اسم Google Veo خیلی زود کنار Wan 3.0 قرار گرفته.

اما آیا واقعاً با قاتل Veo طرفیم؟ بیایید ببینیم این مدل جدید چه چیزی برای طراح‌ها و تولیدکننده‌های محتوا آورده.

Wan 3.0 دقیقاً چیه؟

Wan خانواده مدل‌های تولید تصویر و ویدیوی علی‌باباست که طی نسخه‌های قبلی حسابی بین کاربران AI شناخته شد. حالا Alibaba Cloud نسخه جدید این خانواده رو با نام Wan 3.0 وارد مرحله عمومی آزمایشی کرده.

بزرگ‌ترین تغییرش رو می‌شه توی یه جمله خلاصه کرد:

Wan دیگه نمی‌خواد فقط یه کلیپ بسازه؛ می‌خواد یه صحنه کامل رو کارگردانی کنه.

مدل جدید می‌تونه شخصیت، محیط، حرکت دوربین، دیالوگ و صدا رو در یک روند واحد مدیریت کنه. یعنی به‌جای اینکه چند کلیپ کوتاه جدا بسازی و بعد توی Premiere یا After Effects به هم بچسبونی، امکان ساخت یک توالی طولانی‌تر و منسجم‌تر وجود داره.

برای کسی که ریلز، تبلیغات، تیزر محصول یا محتوای شبکه اجتماعی می‌سازه، همین موضوع به‌تنهایی می‌تونه زمان زیادی ذخیره کنه.

Wan 3.0 دقیقاً چیه؟

مهم‌ترین ویژگی Wan 3.0؛ ویدیوی ۳۰ ثانیه‌ای در یک مرحله

یکی از جذاب‌ترین ویژگی‌های رسمی Wan 3.0، تولید ویدیوی تا ۳۰ ثانیه در یک خروجیه.

شاید ۳۰ ثانیه در نگاه اول زیاد به نظر نرسه، ولی توی دنیای AI Video عدد مهمیه.

بخش بزرگی از مدل‌های ویدیوساز هنوز روی کلیپ‌های کوتاه چندثانیه‌ای تمرکز دارن. وقتی زمان کلیپ بیشتر می‌شه، حفظ چهره، لباس، محیط، اشیا و حرکت شخصیت خیلی سخت‌تر می‌شه.

Wan 3.0 تلاش می‌کنه همین مشکل رو حل کنه.

مثلاً می‌تونی یک سناریو داشته باشی که:

شخصیت وارد اتاق می‌شه، با یه نفر صحبت می‌کنه، دوربین حرکت می‌کنه، اتفاقی داخل صحنه می‌افته و در پایان قاب کاملاً متفاوتی داریم.

همه این اتفاق‌ها می‌تونن داخل همون ویدیوی واحد شکل بگیرن.

برای ساخت تیزرهای کوتاه تبلیغاتی، ویدیوهای محصول و حتی داستان‌های کوتاه این قابلیت حسابی جذابه.

مهم‌ترین ویژگی Wan 3.0؛ ویدیوی ۳۰ ثانیه‌ای در یک مرحله

فقط متن و عکس نیست؛ PDF بده و ویدیو تحویل بگیر!

اینجا Wan 3.0 واقعاً جالب می‌شه.

مدل فقط Text-to-Video یا Image-to-Video نیست.

علی‌بابا سیستم جدیدش رو به‌عنوان یه مدل Omni Reference معرفی کرده؛ یعنی منابع مختلف رو می‌تونه با هم بفهمه و ازشون برای ساخت ویدیو استفاده کنه.

مثلاً می‌تونی:

PDF بدی،

پاورپوینت بدی،

فایل Excel بدی،

عکس مرجع بدی،

ویدیوی قبلی بدی،

فایل صوتی وارد کنی،

یا حتی یه صفحه وب رو به‌عنوان منبع معرفی کنی.

بعد از مدل بخوای بر اساس همه این اطلاعات یه ویدیو بسازه.

تصور کن یه برند کاتالوگ محصولاتش رو به‌صورت PDF داره. به‌جای اینکه طراح از صفر تمام اطلاعات، تصاویر و ویژگی‌های محصول رو استخراج کنه، مدل می‌تونه از همون فایل به‌عنوان منبع استفاده کنه و یه خروجی ویدیویی اولیه بسازه.

اینجاست که AI کم‌کم از یه مولد ویدیو تبدیل می‌شه به ابزار تولید محتوا.

فقط متن و عکس نیست؛ PDF بده و ویدیو تحویل بگیر!

صدا هم همراه ویدیو ساخته می‌شه

یکی از چیزهایی که مدل‌های جدید ویدیوساز رو جذاب‌تر کرده، ترکیب تصویر و صداست.

Wan 3.0 هم Native Audio-Visual Generation داره.

یعنی می‌تونه صدا رو در همون فرآیند تولید ویدیو بسازه؛ از دیالوگ گرفته تا صدای محیط و افکت‌های صوتی.

علی‌بابا در نمونه‌های خودش حتی صحنه‌هایی با دیالوگ چندزبانه و Lip Sync نمایش داده.

این خیلی مهمه، چون توی نسل‌های قبلی معمولاً مسیر کار این شکلی بود:

اول ویدیو تولید کن.

بعد صدا بساز.

بعد Lip Sync انجام بده.

بعد افکت صوتی اضافه کن.

بعد همه‌چیز رو توی نرم‌افزار تدوین با هم هماهنگ کن.

حالا بخش بیشتری از این روند می‌تونه داخل خود مدل اتفاق بیفته.

صدا هم همراه ویدیو ساخته می‌شه

مشکل همیشگی AI Video؛ شخصیت چرا وسط فیلم عوض می‌شود؟

احتمالاً اگه با مدل‌های ویدیوساز کار کرده باشی، این صحنه رو دیدی:

ثانیه اول شخصیت عالیه.

ثانیه پنجم صورتش یه کم فرق می‌کنه.

ثانیه هشتم لباس تغییر می‌کنه.

و چند ثانیه بعد انگار یه آدم دیگه وارد فیلم شده!

این مشکل به Consistency مربوط می‌شه و یکی از دردسرهای اصلی تولید ویدیوی AIه.

علی‌بابا می‌گه Wan 3.0 روی حفظ جزئیات شخصیت، اشیا، محیط و فضا تمرکز زیادی داشته. حتی می‌تونی چند تصویر مرجع به مدل بدی تا ظاهر شخصیت یا محصول رو بهتر حفظ کنه.

این قابلیت برای تبلیغات خیلی مهمه.

چون اگر داری ویدیو یه محصول واقعی رو می‌سازی، نمی‌تونی اجازه بدی مدل وسط ویدیو شکل بسته‌بندی، لوگو یا حتی رنگ محصول رو عوض کنه.

همین مسئله رو توی مدل‌های تصویری هم داریم. مثلاً در مطلب نسل تازه Grok Imagine و جدی‌تر شدن ابزارهای طراحی با AI دیدیم که مدل‌های جدید فقط روی کیفیت خروجی رقابت نمی‌کنن؛ کنترل و ثبات خروجی داره به اندازه کیفیت مهم می‌شه.

مشکل همیشگی AI Video؛ شخصیت چرا وسط فیلم عوض می‌شود؟

خروجی 1080p؛ یعنی Wan فقط برای تست نیست

Wan 3.0 از چند سطح کیفیت پشتیبانی می‌کنه:

480p برای تست سریع،

720p برای تعادل بین کیفیت و هزینه،

و 1080p برای خروجی با کیفیت بالاتر.

این یعنی مدل فقط برای ساخت یه کلیپ بامزه جهت اشتراک‌گذاری توی شبکه اجتماعی طراحی نشده و Alibaba مشخصاً کاربردهای تجاری مثل تبلیغات، فیلم‌سازی و محتوای برند رو هم هدف گرفته.

البته هنوز نباید انتظار داشته باشیم خروجی AI مستقیماً بدون هیچ اصلاحی جای یه پروژه حرفه‌ای فیلم‌سازی رو بگیره.

نور، تدوین، رنگ، تایپوگرافی، لوگو و جزئیات برند معمولاً هنوز نیاز به اصلاح دارن.

ولی چیزی که قبلاً شاید ساعت‌ها برای ساخت نسخه اولیه زمان می‌برد، حالا می‌تونه خیلی سریع‌تر آماده بشه.

خروجی 1080p؛ یعنی Wan فقط برای تست نیست

قیمت ساخت ویدیو با Wan 3.0 چقدره؟

علی‌بابا قیمت‌گذاری رو بر اساس مدت ویدیو انجام می‌ده.

در زمان انتشار فعلی، قیمت اعلام‌شده برای هر ثانیه تقریباً این شکلیه:

480p: حدود ۰.۰۵ دلار در ثانیه

720p: حدود ۰.۱۰ دلار در ثانیه

1080p: حدود ۰.۲۰ دلار در ثانیه

یعنی یه ویدیوی کامل ۳۰ ثانیه‌ای با کیفیت 1080p حدود ۶ دلار هزینه تولید داره.

برای نسخه 720p همین ویدیو حدود ۳ دلار می‌شه و اگر فقط برای تست و ایده‌پردازی خروجی 480p بگیری، حدود ۱.۵ دلار هزینه خواهد داشت.

برای پروژه‌های تجاری، این قیمت می‌تونه خیلی جذاب باشه؛ مخصوصاً اگر AI بتونه چند ساعت از مرحله کانسپت، تصویربرداری آزمایشی یا ساخت پیش‌نمایش کم کنه.

قیمت ساخت ویدیو با Wan 3.0 چقدره؟

Wan 3.0 واقعاً رقیب Google Veo شده؟

اینجا باید کمی دقیق‌تر حرف بزنیم.

بله؛ از نظر حوزه کاری، Wan 3.0 مستقیم وارد زمینی شده که Google Veo هم یکی از مهم‌ترین بازیگرهای اونه.

هر دو روی ساخت ویدیوی واقع‌گرایانه، کنترل شخصیت، صدا و کاربردهای حرفه‌ای تمرکز دارن.

اما اینکه الان بگیم Wan 3.0 «بهتر از Veo» شده، هنوز زوده.

فعلاً بنچمارک مستقل و معتبر کافی برای یه مقایسه قطعی Head-to-Head منتشر نشده.

Google هم Veo رو متوقف نکرده. Veo 3.1 همچنان مدل اصلی ویدیوساز DeepMind محسوب می‌شه و روی کنترل، ثبات شخصیت، تولید صدا و ابزار Flow تمرکز داره.

پس بهتره Wan 3.0 رو نه «قاتل Veo»، بلکه یه رقیب جدی تازه بدونیم.

رقیبی که یه برگ برنده جالب داره:

ورودی‌های خیلی متنوع و امکان استفاده مستقیم از اسناد و صفحات وب.

Wan 3.0 واقعاً رقیب Google Veo شده؟

این خبر برای طراح‌های گرافیک چرا مهمه؟

شاید بگی:

«من تدوینگر نیستم؛ Wan 3.0 چه ربطی به طراحی گرافیک داره؟»

اتفاقاً ربطش خیلی زیاده.

مرز بین Graphic Designer، Motion Designer و Content Creator روزبه‌روز محوتر می‌شه.

یه مشتری ممکنه امروز ازت کاور اینستاگرام بخواد و فردا بگه:

«یه نسخه متحرک همین طرح هم برای ریلز می‌خوام.»

اگر ابزارهایی مثل Wan بتونن تصویر ثابت رو به یه ویدیوی کنترل‌شده تبدیل کنن، طراح می‌تونه بدون اینکه از صفر وارد تولید سه‌بعدی یا فیلم‌برداری بشه، نسخه متحرک ایده خودش رو هم بسازه.

مثلاً:

پوستر رو طراحی می‌کنی.

کاراکتر و فضای اصلی رو به Wan می‌دی.

حرکت دوربین رو توضیح می‌دی.

مدل ویدیو می‌سازه.

بعد توی After Effects یا Premiere تایپوگرافی و جزئیات نهایی رو اضافه می‌کنی.

این مدل استفاده، خیلی منطقی‌تر از اینه که انتظار داشته باشیم AI کل پروژه رو بدون دخالت طراح تحویل بده.

%D8%A7%DB%8C%D9%86 %D8%AE%D8%A8%D8%B1 %D8%A8%D8%B1%D8%A7%DB%8C %D8%B7%D8%B1%D8%A7%D8%AD%E2%80%8C%D9%87%D8%A7%DB%8C %DA%AF%D8%B1%D8%A7%D9%81%DB%8C%DA%A9 %DA%86%D8%B1%D8%A7 %D9%85%D9%87%D9%85%D9%87%D8%9F 1

هوش مصنوعی توی ساخت تصویر و ویدیو پیشرفت عجیبی کرده، اما وقتی پای تایپوگرافی فارسی وسط میاد، هنوز بهتره کنترل نهایی دست طراح باشه.

فرض کن Wan یه ویدیوی تبلیغاتی خیلی خوب برات ساخته.

اگه تیتر اصلی با فونت بد، فاصله‌بندی ضعیف و انیمیشن نامناسب روی تصویر بیاد، کل حس حرفه‌ای ویدیو از بین می‌ره.

برای پروژه‌هایی که نیاز داری سریع به چند سبک فارسی قابل استفاده دسترسی داشته باشی، یه مجموعه جمع‌وجور از فونت‌های کاربردی برای طراحی‌های روزمره می‌تونه کنار ابزارهای AI خیلی کاربردی باشه.

اگر هم پروژه‌هات سبک‌های مختلف دارن و از تبلیغات گرفته تا کاور، لوگوتایپ و محتوای شبکه اجتماعی کار می‌کنی، می‌تونی از بین مجموعه‌های مختلف فونت فارسی بر اساس سبک طراحی انتخاب دقیق‌تری داشته باشی.

چون AI شاید تصویر رو بسازه، ولی هویت بصری هنوز از انتخاب‌های طراح میاد.

از Grok Imagine تا Wan 3.0؛ AI دارد کل مسیر طراحی را می‌بلعد؟

چند ماه پیش جنگ اصلی روی تولید عکس بود.

الان تقریباً همه شرکت‌های بزرگ دارن یه قدم جلوتر می‌رن.

Grok Imagine روی تولید و اصلاح تصویر کار می‌کنه، Adobe هوش مصنوعی رو وارد خود محیط طراحی کرده و حالا Wan 3.0 می‌تونه مجموعه‌ای از تصویر، صدا، سند و متن رو بگیره و به ویدیو تبدیل کنه.

در مطلب ورود Grok Imagine به رقابت جدی ابزارهای طراحی هم دقیقاً همین تغییر رو دیدیم؛ AI دیگه یه ابزار تک‌کاره نیست.

حتی مدل‌های متنی هم دارن تخصصی‌تر می‌شن. در مطلب نسل تازه مدل‌های ChatGPT و تغییر مسیر OpenAI دیدیم که شرکت‌ها سعی می‌کنن برای هر نوع کار، مدل یا تجربه متفاوتی بسازن.

نتیجه؟

ابزارهای طراحی، متن، تصویر و ویدیو کم‌کم دارن به هم وصل می‌شن.

می‌شه با Wan 3.0 از یه عکس محصول، تبلیغ ساخت؟

یکی از کاربردهای جذابش دقیقاً همینه.

فرض کن عکس محصول داری.

چند عکس از محیط برند هم داری.

لوکیشن مورد نظر رو مشخص می‌کنی و برای مدل توضیح می‌دی که دوربین چطور حرکت کنه، محصول کجا قرار بگیره و چه اتفاقی توی صحنه بیفته.

Wan می‌تونه بر اساس این منابع یه نسخه ویدیویی ایجاد کنه.

برای ساخت محتوای UGC هم Alibaba نمونه‌هایی نمایش داده که محصول و شخصیت در طول کلیپ ثبات خودشون رو حفظ می‌کنن.

برای یه برند کوچک، این یعنی می‌شه قبل از هزینه‌کردن برای یه کمپین واقعی، چند کانسپت ویدیویی ساخت و تست کرد.

حتی اگه خروجی AI نسخه نهایی نباشه، برای Previsualization خیلی ارزشمنده.

آیا فیلم‌بردار و موشن‌دیزاینر باید نگران باشن؟

احتمالاً جواب همون چیزیه که درباره طراح گرافیک می‌گیم.

AI بعضی کارها رو می‌گیره، ولی همه کار رو نه.

ساخت یه کلیپ تبلیغاتی فقط تولید تصویر نیست.

باید بدونی:

ریتم داستان چیه،

مخاطب کیه،

کادر چطور بسته بشه،

چه چیزی باید دیده بشه،

چه زمانی باید Cut بزنی،

صدا چطور وارد بشه،

و پیام برند کجا منتقل بشه.

مدل می‌تونه اجرا رو خیلی سریع‌تر کنه، ولی تصمیم‌های خوب هنوز نیاز به نگاه خلاق دارن.

برای همین، به‌جای اینکه بپرسیم «Wan جای تدوینگر رو می‌گیره؟»، سؤال کاربردی‌تر اینه:

تدوینگر یا طراح چطور می‌تونه از Wan استفاده کنه تا سریع‌تر و خلاق‌تر کار کنه؟

دسترسی به Wan 3.0 چطوره؟

Wan 3.0 فعلاً در مرحله Preview قرار داره.

Alibaba Cloud امکان تجربه مدل رو از طریق Model Studio فراهم کرده و برای دسترسی به API هم باید درخواست بدی.

یعنی API هنوز در مرحله عرضه محدود و آزمایشی قرار داره و دسترسی عمومی کامل در ادامه عرضه می‌شه.

این نکته مهمه چون ممکنه توی شبکه‌های اجتماعی ببینی که گفته شده «Wan 3.0 برای همه منتشر شد»، اما وضعیت دقیق فعلی بیشتر شبیه Public Preview / Betaـه تا عرضه نهایی کامل.

یه نکته مهم؛ هر چیزی که درباره Wan 3.0 می‌بینیم رسمی نیست

قبل از معرفی رسمی Wan 3.0 کلی مشخصات عجیب توی اینترنت پخش شده بود.

از مدل‌های چندده میلیارد پارامتری گرفته تا ادعای 4K Native و نسخه کاملاً Open Source.

اما مشخصاتی که الان می‌شه با اطمینان بهشون استناد کرد، همون چیزهاییه که Alibaba Cloud رسماً اعلام کرده:

تا ۳۰ ثانیه تولید ویدیو،

خروجی تا 1080p،

ورودی چندرسانه‌ای،

صدای Native،

استفاده از اسناد و صفحات وب،

و قابلیت Reference-based Generation.

پس اگه جایی مشخصات خیلی عجیب‌تر دیدی، بهتره قبل از انتشار بررسی کنی که واقعاً از کانال رسمی علی‌بابا اومده یا نه.

جمع‌بندی؛ جنگ ویدیوسازهای AI تازه داره جذاب می‌شه

Wan 3.0 نشون می‌ده Alibaba قصد نداره توی رقابت هوش مصنوعی فقط تماشاچی باشه.

ساخت ویدیوی ۳۰ ثانیه‌ای در یک مرحله، خروجی 1080p، تولید هم‌زمان صدا، حفظ بهتر شخصیت‌ها و مهم‌تر از همه امکان استفاده از عکس، ویدیو، صدا، PDF، پاورپوینت و صفحه وب به‌عنوان منبع، Wan رو به یه ابزار خیلی جدی‌تر از یه Video Generator معمولی تبدیل کرده.

به این آموزش چه امتیازی میدی؟

میانگین امتیازات / 5. تعداد رای ها

تو اولین نفری باش که بهمون امتیاز میدی !

پست های مرتبط

مطالعه این پست ها رو از دست ندین!
فتوشاپ وارد عصر Agent شد

“خبر” فتوشاپ وارد عصر Agent شد؛ Adobe دستیار هوش مصنوعی طراح‌ها را معرفی کرد!

آنچه در این پست میخوانید AI Agent در فتوشاپ دقیقاً یعنی چه؟Adobe می‌خواهد فتوشاپ را از یک ابزار به یک…

بیشتر بخوانید
OpenAI حالت Ultrafast را معرفی کرد

“خبر” OpenAI حالت Ultrafast را معرفی کرد؛ مدل هوش مصنوعی GPT تا 14 برابر سریع‌تر می‌شود!

آنچه در این پست میخوانید Ultrafast دقیقاً چیه و چرا این‌قدر سر و صدا کرده؟۷۵۰ توکن در ثانیه یعنی دقیقاً…

بیشتر بخوانید
Grok Imagine Image 2.0

“خبر” زلزله جدید در طراحی با AI؛ Grok Imagine Image 2.0 فتوشاپ را نشانه گرفت!

آنچه در این پست میخوانید Grok Imagine Image 2.0 دقیقاً چیه؟کیفیت تصویر؛ Grok می‌خواد خروجی AI کمتر شبیه AI باشهبالاخره…

بیشتر بخوانید

نظرات

سوالات و نظراتتون رو با ما به اشتراک بذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *