“خبر” رونمایی علیبابا از مدل هوش مصنوعی ویدیوساز Wan 3.0؛ رقیب Veo از راه رسید
- Wan 3.0 دقیقاً چیه؟
- مهمترین ویژگی Wan 3.0؛ ویدیوی ۳۰ ثانیهای در یک مرحله
- فقط متن و عکس نیست؛ PDF بده و ویدیو تحویل بگیر!
- صدا هم همراه ویدیو ساخته میشه
- مشکل همیشگی AI Video؛ شخصیت چرا وسط فیلم عوض میشود؟
- خروجی 1080p؛ یعنی Wan فقط برای تست نیست
- قیمت ساخت ویدیو با Wan 3.0 چقدره؟
- Wan 3.0 واقعاً رقیب Google Veo شده؟
- این خبر برای طراحهای گرافیک چرا مهمه؟
- از Grok Imagine تا Wan 3.0؛ AI دارد کل مسیر طراحی را میبلعد؟
- میشه با Wan 3.0 از یه عکس محصول، تبلیغ ساخت؟
- آیا فیلمبردار و موشندیزاینر باید نگران باشن؟
- دسترسی به Wan 3.0 چطوره؟
- یه نکته مهم؛ هر چیزی که درباره Wan 3.0 میبینیم رسمی نیست
- جمعبندی؛ جنگ ویدیوسازهای AI تازه داره جذاب میشه
فکر میکردی جنگ ویدیوسازهای هوش مصنوعی فقط بین Google، OpenAI و چند استارتاپ معروفه؟ علیبابا با Wan 3.0 برگشته و اینبار یه آپدیت معمولی هم نیاورده.
نسل تازه Wan میتونه در یک مرحله تا ۳۰ ثانیه ویدیوی پیوسته تولید کنه، خروجی 1080p بده، صدا و تصویر رو با هم بسازه و حتی برای ساخت ویدیو فقط به متن و عکس محدود نیست؛ فایل PDF، پاورپوینت، اکسل، ویدیو، صدا و حتی صفحه وب هم میتونن بهعنوان مرجع وارد پروژه بشن.
یعنی اگر قبلاً برای ساخت یه ویدیوی تبلیغاتی باید از چند ابزار مختلف استفاده میکردی، علیبابا حالا میخواد بخش بزرگی از این مسیر رو داخل یک مدل جمع کنه.
و دقیقاً به همین خاطره که اسم Google Veo خیلی زود کنار Wan 3.0 قرار گرفته.
اما آیا واقعاً با قاتل Veo طرفیم؟ بیایید ببینیم این مدل جدید چه چیزی برای طراحها و تولیدکنندههای محتوا آورده.
Wan 3.0 دقیقاً چیه؟
Wan خانواده مدلهای تولید تصویر و ویدیوی علیباباست که طی نسخههای قبلی حسابی بین کاربران AI شناخته شد. حالا Alibaba Cloud نسخه جدید این خانواده رو با نام Wan 3.0 وارد مرحله عمومی آزمایشی کرده.
بزرگترین تغییرش رو میشه توی یه جمله خلاصه کرد:
Wan دیگه نمیخواد فقط یه کلیپ بسازه؛ میخواد یه صحنه کامل رو کارگردانی کنه.
مدل جدید میتونه شخصیت، محیط، حرکت دوربین، دیالوگ و صدا رو در یک روند واحد مدیریت کنه. یعنی بهجای اینکه چند کلیپ کوتاه جدا بسازی و بعد توی Premiere یا After Effects به هم بچسبونی، امکان ساخت یک توالی طولانیتر و منسجمتر وجود داره.
برای کسی که ریلز، تبلیغات، تیزر محصول یا محتوای شبکه اجتماعی میسازه، همین موضوع بهتنهایی میتونه زمان زیادی ذخیره کنه.

مهمترین ویژگی Wan 3.0؛ ویدیوی ۳۰ ثانیهای در یک مرحله
یکی از جذابترین ویژگیهای رسمی Wan 3.0، تولید ویدیوی تا ۳۰ ثانیه در یک خروجیه.
شاید ۳۰ ثانیه در نگاه اول زیاد به نظر نرسه، ولی توی دنیای AI Video عدد مهمیه.
بخش بزرگی از مدلهای ویدیوساز هنوز روی کلیپهای کوتاه چندثانیهای تمرکز دارن. وقتی زمان کلیپ بیشتر میشه، حفظ چهره، لباس، محیط، اشیا و حرکت شخصیت خیلی سختتر میشه.
Wan 3.0 تلاش میکنه همین مشکل رو حل کنه.
مثلاً میتونی یک سناریو داشته باشی که:
شخصیت وارد اتاق میشه، با یه نفر صحبت میکنه، دوربین حرکت میکنه، اتفاقی داخل صحنه میافته و در پایان قاب کاملاً متفاوتی داریم.
همه این اتفاقها میتونن داخل همون ویدیوی واحد شکل بگیرن.
برای ساخت تیزرهای کوتاه تبلیغاتی، ویدیوهای محصول و حتی داستانهای کوتاه این قابلیت حسابی جذابه.

فقط متن و عکس نیست؛ PDF بده و ویدیو تحویل بگیر!
اینجا Wan 3.0 واقعاً جالب میشه.
مدل فقط Text-to-Video یا Image-to-Video نیست.
علیبابا سیستم جدیدش رو بهعنوان یه مدل Omni Reference معرفی کرده؛ یعنی منابع مختلف رو میتونه با هم بفهمه و ازشون برای ساخت ویدیو استفاده کنه.
مثلاً میتونی:
PDF بدی،
پاورپوینت بدی،
فایل Excel بدی،
عکس مرجع بدی،
ویدیوی قبلی بدی،
فایل صوتی وارد کنی،
یا حتی یه صفحه وب رو بهعنوان منبع معرفی کنی.
بعد از مدل بخوای بر اساس همه این اطلاعات یه ویدیو بسازه.
تصور کن یه برند کاتالوگ محصولاتش رو بهصورت PDF داره. بهجای اینکه طراح از صفر تمام اطلاعات، تصاویر و ویژگیهای محصول رو استخراج کنه، مدل میتونه از همون فایل بهعنوان منبع استفاده کنه و یه خروجی ویدیویی اولیه بسازه.
اینجاست که AI کمکم از یه مولد ویدیو تبدیل میشه به ابزار تولید محتوا.

صدا هم همراه ویدیو ساخته میشه
یکی از چیزهایی که مدلهای جدید ویدیوساز رو جذابتر کرده، ترکیب تصویر و صداست.
Wan 3.0 هم Native Audio-Visual Generation داره.
یعنی میتونه صدا رو در همون فرآیند تولید ویدیو بسازه؛ از دیالوگ گرفته تا صدای محیط و افکتهای صوتی.
علیبابا در نمونههای خودش حتی صحنههایی با دیالوگ چندزبانه و Lip Sync نمایش داده.
این خیلی مهمه، چون توی نسلهای قبلی معمولاً مسیر کار این شکلی بود:
اول ویدیو تولید کن.
بعد صدا بساز.
بعد Lip Sync انجام بده.
بعد افکت صوتی اضافه کن.
بعد همهچیز رو توی نرمافزار تدوین با هم هماهنگ کن.
حالا بخش بیشتری از این روند میتونه داخل خود مدل اتفاق بیفته.

مشکل همیشگی AI Video؛ شخصیت چرا وسط فیلم عوض میشود؟
احتمالاً اگه با مدلهای ویدیوساز کار کرده باشی، این صحنه رو دیدی:
ثانیه اول شخصیت عالیه.
ثانیه پنجم صورتش یه کم فرق میکنه.
ثانیه هشتم لباس تغییر میکنه.
و چند ثانیه بعد انگار یه آدم دیگه وارد فیلم شده!
این مشکل به Consistency مربوط میشه و یکی از دردسرهای اصلی تولید ویدیوی AIه.
علیبابا میگه Wan 3.0 روی حفظ جزئیات شخصیت، اشیا، محیط و فضا تمرکز زیادی داشته. حتی میتونی چند تصویر مرجع به مدل بدی تا ظاهر شخصیت یا محصول رو بهتر حفظ کنه.
این قابلیت برای تبلیغات خیلی مهمه.
چون اگر داری ویدیو یه محصول واقعی رو میسازی، نمیتونی اجازه بدی مدل وسط ویدیو شکل بستهبندی، لوگو یا حتی رنگ محصول رو عوض کنه.
همین مسئله رو توی مدلهای تصویری هم داریم. مثلاً در مطلب نسل تازه Grok Imagine و جدیتر شدن ابزارهای طراحی با AI دیدیم که مدلهای جدید فقط روی کیفیت خروجی رقابت نمیکنن؛ کنترل و ثبات خروجی داره به اندازه کیفیت مهم میشه.

خروجی 1080p؛ یعنی Wan فقط برای تست نیست
Wan 3.0 از چند سطح کیفیت پشتیبانی میکنه:
480p برای تست سریع،
720p برای تعادل بین کیفیت و هزینه،
و 1080p برای خروجی با کیفیت بالاتر.
این یعنی مدل فقط برای ساخت یه کلیپ بامزه جهت اشتراکگذاری توی شبکه اجتماعی طراحی نشده و Alibaba مشخصاً کاربردهای تجاری مثل تبلیغات، فیلمسازی و محتوای برند رو هم هدف گرفته.
البته هنوز نباید انتظار داشته باشیم خروجی AI مستقیماً بدون هیچ اصلاحی جای یه پروژه حرفهای فیلمسازی رو بگیره.
نور، تدوین، رنگ، تایپوگرافی، لوگو و جزئیات برند معمولاً هنوز نیاز به اصلاح دارن.
ولی چیزی که قبلاً شاید ساعتها برای ساخت نسخه اولیه زمان میبرد، حالا میتونه خیلی سریعتر آماده بشه.

قیمت ساخت ویدیو با Wan 3.0 چقدره؟
علیبابا قیمتگذاری رو بر اساس مدت ویدیو انجام میده.
در زمان انتشار فعلی، قیمت اعلامشده برای هر ثانیه تقریباً این شکلیه:
480p: حدود ۰.۰۵ دلار در ثانیه
720p: حدود ۰.۱۰ دلار در ثانیه
1080p: حدود ۰.۲۰ دلار در ثانیه
یعنی یه ویدیوی کامل ۳۰ ثانیهای با کیفیت 1080p حدود ۶ دلار هزینه تولید داره.
برای نسخه 720p همین ویدیو حدود ۳ دلار میشه و اگر فقط برای تست و ایدهپردازی خروجی 480p بگیری، حدود ۱.۵ دلار هزینه خواهد داشت.
برای پروژههای تجاری، این قیمت میتونه خیلی جذاب باشه؛ مخصوصاً اگر AI بتونه چند ساعت از مرحله کانسپت، تصویربرداری آزمایشی یا ساخت پیشنمایش کم کنه.

Wan 3.0 واقعاً رقیب Google Veo شده؟
اینجا باید کمی دقیقتر حرف بزنیم.
بله؛ از نظر حوزه کاری، Wan 3.0 مستقیم وارد زمینی شده که Google Veo هم یکی از مهمترین بازیگرهای اونه.
هر دو روی ساخت ویدیوی واقعگرایانه، کنترل شخصیت، صدا و کاربردهای حرفهای تمرکز دارن.
اما اینکه الان بگیم Wan 3.0 «بهتر از Veo» شده، هنوز زوده.
فعلاً بنچمارک مستقل و معتبر کافی برای یه مقایسه قطعی Head-to-Head منتشر نشده.
Google هم Veo رو متوقف نکرده. Veo 3.1 همچنان مدل اصلی ویدیوساز DeepMind محسوب میشه و روی کنترل، ثبات شخصیت، تولید صدا و ابزار Flow تمرکز داره.
پس بهتره Wan 3.0 رو نه «قاتل Veo»، بلکه یه رقیب جدی تازه بدونیم.
رقیبی که یه برگ برنده جالب داره:
ورودیهای خیلی متنوع و امکان استفاده مستقیم از اسناد و صفحات وب.

این خبر برای طراحهای گرافیک چرا مهمه؟
شاید بگی:
«من تدوینگر نیستم؛ Wan 3.0 چه ربطی به طراحی گرافیک داره؟»
اتفاقاً ربطش خیلی زیاده.
مرز بین Graphic Designer، Motion Designer و Content Creator روزبهروز محوتر میشه.
یه مشتری ممکنه امروز ازت کاور اینستاگرام بخواد و فردا بگه:
«یه نسخه متحرک همین طرح هم برای ریلز میخوام.»
اگر ابزارهایی مثل Wan بتونن تصویر ثابت رو به یه ویدیوی کنترلشده تبدیل کنن، طراح میتونه بدون اینکه از صفر وارد تولید سهبعدی یا فیلمبرداری بشه، نسخه متحرک ایده خودش رو هم بسازه.
مثلاً:
پوستر رو طراحی میکنی.
کاراکتر و فضای اصلی رو به Wan میدی.
حرکت دوربین رو توضیح میدی.
مدل ویدیو میسازه.
بعد توی After Effects یا Premiere تایپوگرافی و جزئیات نهایی رو اضافه میکنی.
این مدل استفاده، خیلی منطقیتر از اینه که انتظار داشته باشیم AI کل پروژه رو بدون دخالت طراح تحویل بده.
هوش مصنوعی توی ساخت تصویر و ویدیو پیشرفت عجیبی کرده، اما وقتی پای تایپوگرافی فارسی وسط میاد، هنوز بهتره کنترل نهایی دست طراح باشه.
فرض کن Wan یه ویدیوی تبلیغاتی خیلی خوب برات ساخته.
اگه تیتر اصلی با فونت بد، فاصلهبندی ضعیف و انیمیشن نامناسب روی تصویر بیاد، کل حس حرفهای ویدیو از بین میره.
برای پروژههایی که نیاز داری سریع به چند سبک فارسی قابل استفاده دسترسی داشته باشی، یه مجموعه جمعوجور از فونتهای کاربردی برای طراحیهای روزمره میتونه کنار ابزارهای AI خیلی کاربردی باشه.
اگر هم پروژههات سبکهای مختلف دارن و از تبلیغات گرفته تا کاور، لوگوتایپ و محتوای شبکه اجتماعی کار میکنی، میتونی از بین مجموعههای مختلف فونت فارسی بر اساس سبک طراحی انتخاب دقیقتری داشته باشی.
چون AI شاید تصویر رو بسازه، ولی هویت بصری هنوز از انتخابهای طراح میاد.
از Grok Imagine تا Wan 3.0؛ AI دارد کل مسیر طراحی را میبلعد؟
چند ماه پیش جنگ اصلی روی تولید عکس بود.
الان تقریباً همه شرکتهای بزرگ دارن یه قدم جلوتر میرن.
Grok Imagine روی تولید و اصلاح تصویر کار میکنه، Adobe هوش مصنوعی رو وارد خود محیط طراحی کرده و حالا Wan 3.0 میتونه مجموعهای از تصویر، صدا، سند و متن رو بگیره و به ویدیو تبدیل کنه.
در مطلب ورود Grok Imagine به رقابت جدی ابزارهای طراحی هم دقیقاً همین تغییر رو دیدیم؛ AI دیگه یه ابزار تککاره نیست.
حتی مدلهای متنی هم دارن تخصصیتر میشن. در مطلب نسل تازه مدلهای ChatGPT و تغییر مسیر OpenAI دیدیم که شرکتها سعی میکنن برای هر نوع کار، مدل یا تجربه متفاوتی بسازن.
نتیجه؟
ابزارهای طراحی، متن، تصویر و ویدیو کمکم دارن به هم وصل میشن.
میشه با Wan 3.0 از یه عکس محصول، تبلیغ ساخت؟
یکی از کاربردهای جذابش دقیقاً همینه.
فرض کن عکس محصول داری.
چند عکس از محیط برند هم داری.
لوکیشن مورد نظر رو مشخص میکنی و برای مدل توضیح میدی که دوربین چطور حرکت کنه، محصول کجا قرار بگیره و چه اتفاقی توی صحنه بیفته.
Wan میتونه بر اساس این منابع یه نسخه ویدیویی ایجاد کنه.
برای ساخت محتوای UGC هم Alibaba نمونههایی نمایش داده که محصول و شخصیت در طول کلیپ ثبات خودشون رو حفظ میکنن.
برای یه برند کوچک، این یعنی میشه قبل از هزینهکردن برای یه کمپین واقعی، چند کانسپت ویدیویی ساخت و تست کرد.
حتی اگه خروجی AI نسخه نهایی نباشه، برای Previsualization خیلی ارزشمنده.
آیا فیلمبردار و موشندیزاینر باید نگران باشن؟
احتمالاً جواب همون چیزیه که درباره طراح گرافیک میگیم.
AI بعضی کارها رو میگیره، ولی همه کار رو نه.
ساخت یه کلیپ تبلیغاتی فقط تولید تصویر نیست.
باید بدونی:
ریتم داستان چیه،
مخاطب کیه،
کادر چطور بسته بشه،
چه چیزی باید دیده بشه،
چه زمانی باید Cut بزنی،
صدا چطور وارد بشه،
و پیام برند کجا منتقل بشه.
مدل میتونه اجرا رو خیلی سریعتر کنه، ولی تصمیمهای خوب هنوز نیاز به نگاه خلاق دارن.
برای همین، بهجای اینکه بپرسیم «Wan جای تدوینگر رو میگیره؟»، سؤال کاربردیتر اینه:
تدوینگر یا طراح چطور میتونه از Wan استفاده کنه تا سریعتر و خلاقتر کار کنه؟
دسترسی به Wan 3.0 چطوره؟
Wan 3.0 فعلاً در مرحله Preview قرار داره.
Alibaba Cloud امکان تجربه مدل رو از طریق Model Studio فراهم کرده و برای دسترسی به API هم باید درخواست بدی.
یعنی API هنوز در مرحله عرضه محدود و آزمایشی قرار داره و دسترسی عمومی کامل در ادامه عرضه میشه.
این نکته مهمه چون ممکنه توی شبکههای اجتماعی ببینی که گفته شده «Wan 3.0 برای همه منتشر شد»، اما وضعیت دقیق فعلی بیشتر شبیه Public Preview / Betaـه تا عرضه نهایی کامل.
یه نکته مهم؛ هر چیزی که درباره Wan 3.0 میبینیم رسمی نیست
قبل از معرفی رسمی Wan 3.0 کلی مشخصات عجیب توی اینترنت پخش شده بود.
از مدلهای چندده میلیارد پارامتری گرفته تا ادعای 4K Native و نسخه کاملاً Open Source.
اما مشخصاتی که الان میشه با اطمینان بهشون استناد کرد، همون چیزهاییه که Alibaba Cloud رسماً اعلام کرده:
تا ۳۰ ثانیه تولید ویدیو،
خروجی تا 1080p،
ورودی چندرسانهای،
صدای Native،
استفاده از اسناد و صفحات وب،
و قابلیت Reference-based Generation.
پس اگه جایی مشخصات خیلی عجیبتر دیدی، بهتره قبل از انتشار بررسی کنی که واقعاً از کانال رسمی علیبابا اومده یا نه.
جمعبندی؛ جنگ ویدیوسازهای AI تازه داره جذاب میشه
Wan 3.0 نشون میده Alibaba قصد نداره توی رقابت هوش مصنوعی فقط تماشاچی باشه.
ساخت ویدیوی ۳۰ ثانیهای در یک مرحله، خروجی 1080p، تولید همزمان صدا، حفظ بهتر شخصیتها و مهمتر از همه امکان استفاده از عکس، ویدیو، صدا، PDF، پاورپوینت و صفحه وب بهعنوان منبع، Wan رو به یه ابزار خیلی جدیتر از یه Video Generator معمولی تبدیل کرده.

