یوتیوب در سالهای اخیر سرمایهگذاری بزرگی روی بخش Shorts کرده است؛ بخشی که شباهت زیادی به تیکتاک و ریلز اینستاگرام دارد و بهعنوان بستری برای انتشار ویدیوهای کوتاه و خلاقانه مورد توجه میلیونها کاربر در سراسر جهان قرار گرفته است. حالا یوتیوب با بهرهگیری از هوش مصنوعی مولد (Generative AI) قصد دارد تجربهای تازه برای کاربران و تولیدکنندگان محتوا رقم بزند. از ابزارهای ساده برای تبدیل عکس به ویدیو گرفته تا افکتهای پیچیدهای که روی گوشیهای هوشمند اجرا میشوند، همگی نشان میدهند که یوتیوب آینده تولید ویدیوهای کوتاه را با سرعتی چشمگیر تغییر میدهد.
در ادامه این مقاله از مجله اینترنتی اسید هولیک، نگاهی جامع به ابزارهای جدید یوتیوب، فناوریهای پشتصحنه و تأثیر آنها بر تولیدکنندگان محتوا خواهیم داشت.
ابزارهای تازه یوتیوب شورتس با کمک هوش مصنوعی
۱. تبدیل عکس به ویدیو
یکی از جذابترین قابلیتهایی که یوتیوب معرفی کرده، ابزار Photo to Video است. این ابزار به کاربران امکان میدهد تنها با یک عکس ساده از گالری گوشی، ویدیویی پویا و متحرک بسازند. بهعنوان مثال:
- میتوان به یک منظره ثابت حرکت داد.
- تصاویر گروهی را زنده کرد.
- یا حتی عکسهای معمولی را به کلیپهای خلاقانه تبدیل نمود.
این قابلیت فعلاً در آمریکا، کانادا، استرالیا و نیوزیلند فعال شده و قرار است تا پایان سال ۲۰۲۵ به سایر کشورها نیز برسد.
۲. افکتهای مولد برای شورتس
افکتهای هوش مصنوعی مولد (Generative Effects) به کاربران اجازه میدهند ویدیوهای خود را به شکلی متفاوت و خلاقانه بازآفرینی کنند. برای مثال:
- یک نقاشی ساده به تصویر واقعی تبدیل میشود.
- سلفیهای عادی به ویدیوهای سرگرمکننده تغییر شکل میدهند.
- حتی میتوان افکتهایی مانند حضور در دنیای زیر آب یا داشتن یک همزاد را امتحان کرد.
این قابلیتها با مدل Veo 2 پشتیبانی میشوند و قرار است نسخه پیشرفتهتر یعنی Veo 3 نیز تا پایان تابستان ۲۰۲۵ عرضه شود.
۳. فضای تعاملی «زمین بازی هوش مصنوعی»
یوتیوب همچنین بخشی به نام AI Playground معرفی کرده است؛ محیطی که در آن کاربران میتوانند با دستورهای آماده، نمونهها و ابزارهای مختلف، محتواهای متنی، تصویری و موسیقایی بسازند. همه محتوای تولیدشده با این ابزارها دارای واترمارک SynthID هستند تا شفافیت و اصالت حفظ شود.
چالش اجرای افکتهای هوش مصنوعی روی گوشیها
چرا اجرای افکتها دشوار است؟
مدلهای بزرگ هوش مصنوعی مانند StyleGAN2 یا Imagen از دیپمایند توانایی بالایی در تولید تصاویر و ویدیوهای باکیفیت دارند، اما بسیار سنگین هستند و اجرای آنها روی گوشیهای هوشمند تقریبا غیرممکن است.
راهکار: دانش انتقالی (Knowledge Distillation)
برای حل این مشکل، مهندسان یوتیوب از روش دانش انتقالی استفاده کردهاند. در این روش:
- یک مدل بزرگ بهعنوان «معلم» روی میلیونها تصویر آموزش میبیند.
- سپس دانش خود را به یک مدل کوچکتر یا همان «دانشآموز» منتقل میکند.
- مدل کوچکتر به اندازه کافی سبک است که روی گوشی اجرا شود، اما همچنان توانایی تولید افکتهای دقیق را دارد.
استفاده از دادههای متنوع
در فرایند آموزش، دادههایی متنوع شامل سنین، جنسیتها و رنگهای پوست مختلف بر اساس مقیاس Monk Skin Tone استفاده شد. همچنین شرایط چالشبرانگیز مانند نور متفاوت، عینک یا دستهایی که صورت را میپوشانند نیز در دادهها لحاظ شدند تا مدل در شرایط واقعی عملکرد بهتری داشته باشد.
دقت در بازآفرینی چهرهها
یکی از بزرگترین چالشها در ویرایش ویدیویی با هوش مصنوعی، حفظ هویت چهره افراد است. مشکلی که با عنوان Inversion Problem شناخته میشود. اگر مدل بهدرستی عمل نکند، ممکن است رنگ پوست تغییر کند، عینکها مخدوش شوند یا حتی لباسها تغییر یابند.
راهکار: Pivotal Tuning Inversion
یوتیوب از روشی به نام Pivotal Tuning Inversion استفاده کرده است که به مدل کمک میکند جزئیات دقیق چهره فرد را بیاموزد. به این ترتیب، افکتهایی مثل آرایش، استایل کارتونی یا ماسک روی صورت اعمال میشوند، اما چهره همچنان طبیعی و واقعی باقی میماند.
استفاده از MediaPipe
مدل نهایی بههمراه چارچوب MediaPipe اجرا میشود؛ سیستمی متنباز که وظیفه دارد:
- تشخیص و همترازی چهرهها
- اجرای افکتها
- و بازترکیب تصویر نهایی در ویدیو
این فرایند تنها در ۳۳ میلیثانیه برای هر فریم انجام میشود و باعث میشود ویدیو با کیفیت بالای ۳۰ فریم بر ثانیه کاملاً روان اجرا شود.
تأثیر این فناوری بر تولیدکنندگان محتوا
سرعت و تنوع
این فناوریها تاکنون بیش از ۲۰ افکت زنده روی شورتس فعال کردهاند؛ از ماسکهای موضوعی مثل «زامبی برخاسته» گرفته تا ابزارهایی مانند «هرگز پلک نزن» یا «همیشه لبخند بزن».
بهینهسازی برای گوشیهای مختلف
زمان تأخیر اجرای افکتها اکنون به حدود ۶ میلیثانیه در Pixel 8 Pro و ۱۰.۶ میلیثانیه در iPhone 13 رسیده است. این یعنی کاربران با گوشیهای پرچمدار و میانرده میتوانند بدون مشکل از افکتهای هوش مصنوعی استفاده کنند.
حمایت از خلاقیت فردی
سارا علی، معاون مدیر محصول یوتیوب شورتس، تأکید کرده است که این ابزارها جایگزین خلاقیت فردی نیستند، بلکه نقش پشتیبان و تقویتکننده ایدههای شخصی را دارند. به بیان دیگر، یوتیوب میخواهد سازندگان محتوا سریعتر و راحتتر ایدههای خود را عملی کنند.
آینده و چالشها
شفافیت و اصالت محتوا
یوتیوب با افزودن واترمارک SynthID تلاش کرده مرز میان محتوای ساختهشده توسط هوش مصنوعی و آثار انسانی را شفاف کند. با این حال، همچنان چالشهایی در زمینه تشخیص محتواهای جعلی یا سوءاستفادههای احتمالی وجود دارد.
رقابت با پلتفرمهای دیگر
با توجه به اینکه تیکتاک و اینستاگرام نیز روی ابزارهای هوش مصنوعی سرمایهگذاری میکنند، یوتیوب باید سرعت نوآوری خود را حفظ کند تا از رقبا عقب نماند.
فشار بر زیرساختها
اجرای مدلهای سنگین روی میلیاردها گوشی در سراسر جهان میتواند فشار زیادی بر سرورهای گوگل و یوتیوب وارد کند. بنابراین بهینهسازی و کاهش مصرف منابع همچنان یکی از چالشهای اصلی خواهد بود.
جمعبندی
یوتیوب با ورود جدی به عرصه هوش مصنوعی مولد در بخش شورتس، تجربه کاربران و سازندگان محتوا را وارد مرحلهای تازه کرده است. ابزارهایی مانند تبدیل عکس به ویدیو، افکتهای مولد خلاقانه و زمین بازی هوش مصنوعی نه تنها تولید محتوا را سادهتر میکنند، بلکه به سازندگان فرصت میدهند آثار خود را در سطحی حرفهایتر و جذابتر ارائه دهند.
با این حال، آینده این فناوری وابسته به مدیریت چالشهایی مانند شفافیت، اصالت محتوا و رقابت بازار است. اگر یوتیوب بتواند این موانع را پشت سر بگذارد، بدون شک شورتس به یکی از قدرتمندترین پلتفرمهای ویدیویی کوتاه تبدیل خواهد شد و هوش مصنوعی، نقشی کلیدی در این مسیر ایفا میکند.


