یوتیوب در سال‌های اخیر سرمایه‌گذاری بزرگی روی بخش Shorts کرده است؛ بخشی که شباهت زیادی به تیک‌تاک و ریلز اینستاگرام دارد و به‌عنوان بستری برای انتشار ویدیوهای کوتاه و خلاقانه مورد توجه میلیون‌ها کاربر در سراسر جهان قرار گرفته است. حالا یوتیوب با بهره‌گیری از هوش مصنوعی مولد (Generative AI) قصد دارد تجربه‌ای تازه برای کاربران و تولیدکنندگان محتوا رقم بزند. از ابزارهای ساده برای تبدیل عکس به ویدیو گرفته تا افکت‌های پیچیده‌ای که روی گوشی‌های هوشمند اجرا می‌شوند، همگی نشان می‌دهند که یوتیوب آینده تولید ویدیوهای کوتاه را با سرعتی چشمگیر تغییر می‌دهد.

در ادامه این مقاله از مجله اینترنتی اسید هولیک، نگاهی جامع به ابزارهای جدید یوتیوب، فناوری‌های پشت‌صحنه و تأثیر آن‌ها بر تولیدکنندگان محتوا خواهیم داشت.

ابزارهای تازه یوتیوب شورتس با کمک هوش مصنوعی

۱. تبدیل عکس به ویدیو

یکی از جذاب‌ترین قابلیت‌هایی که یوتیوب معرفی کرده، ابزار Photo to Video است. این ابزار به کاربران امکان می‌دهد تنها با یک عکس ساده از گالری گوشی، ویدیویی پویا و متحرک بسازند. به‌عنوان مثال:

  • می‌توان به یک منظره ثابت حرکت داد.
  • تصاویر گروهی را زنده کرد.
  • یا حتی عکس‌های معمولی را به کلیپ‌های خلاقانه تبدیل نمود.

این قابلیت فعلاً در آمریکا، کانادا، استرالیا و نیوزیلند فعال شده و قرار است تا پایان سال ۲۰۲۵ به سایر کشورها نیز برسد.

۲. افکت‌های مولد برای شورتس

افکت‌های هوش مصنوعی مولد (Generative Effects) به کاربران اجازه می‌دهند ویدیوهای خود را به شکلی متفاوت و خلاقانه بازآفرینی کنند. برای مثال:

  • یک نقاشی ساده به تصویر واقعی تبدیل می‌شود.
  • سلفی‌های عادی به ویدیوهای سرگرم‌کننده تغییر شکل می‌دهند.
  • حتی می‌توان افکت‌هایی مانند حضور در دنیای زیر آب یا داشتن یک همزاد را امتحان کرد.

این قابلیت‌ها با مدل Veo 2 پشتیبانی می‌شوند و قرار است نسخه پیشرفته‌تر یعنی Veo 3 نیز تا پایان تابستان ۲۰۲۵ عرضه شود.

۳. فضای تعاملی «زمین بازی هوش مصنوعی»

یوتیوب همچنین بخشی به نام AI Playground معرفی کرده است؛ محیطی که در آن کاربران می‌توانند با دستورهای آماده، نمونه‌ها و ابزارهای مختلف، محتواهای متنی، تصویری و موسیقایی بسازند. همه محتوای تولیدشده با این ابزارها دارای واترمارک SynthID هستند تا شفافیت و اصالت حفظ شود.

چالش اجرای افکت‌های هوش مصنوعی روی گوشی‌ها

چرا اجرای افکت‌ها دشوار است؟

مدل‌های بزرگ هوش مصنوعی مانند StyleGAN2 یا Imagen از دیپ‌مایند توانایی بالایی در تولید تصاویر و ویدیوهای باکیفیت دارند، اما بسیار سنگین هستند و اجرای آن‌ها روی گوشی‌های هوشمند تقریبا غیرممکن است.

راهکار: دانش انتقالی (Knowledge Distillation)

برای حل این مشکل، مهندسان یوتیوب از روش دانش انتقالی استفاده کرده‌اند. در این روش:

  • یک مدل بزرگ به‌عنوان «معلم» روی میلیون‌ها تصویر آموزش می‌بیند.
  • سپس دانش خود را به یک مدل کوچک‌تر یا همان «دانش‌آموز» منتقل می‌کند.
  • مدل کوچک‌تر به اندازه کافی سبک است که روی گوشی اجرا شود، اما همچنان توانایی تولید افکت‌های دقیق را دارد.

استفاده از داده‌های متنوع

در فرایند آموزش، داده‌هایی متنوع شامل سنین، جنسیت‌ها و رنگ‌های پوست مختلف بر اساس مقیاس Monk Skin Tone استفاده شد. همچنین شرایط چالش‌برانگیز مانند نور متفاوت، عینک یا دست‌هایی که صورت را می‌پوشانند نیز در داده‌ها لحاظ شدند تا مدل در شرایط واقعی عملکرد بهتری داشته باشد.

دقت در بازآفرینی چهره‌ها

یکی از بزرگ‌ترین چالش‌ها در ویرایش ویدیویی با هوش مصنوعی، حفظ هویت چهره افراد است. مشکلی که با عنوان Inversion Problem شناخته می‌شود. اگر مدل به‌درستی عمل نکند، ممکن است رنگ پوست تغییر کند، عینک‌ها مخدوش شوند یا حتی لباس‌ها تغییر یابند.

راهکار: Pivotal Tuning Inversion

یوتیوب از روشی به نام Pivotal Tuning Inversion استفاده کرده است که به مدل کمک می‌کند جزئیات دقیق چهره فرد را بیاموزد. به این ترتیب، افکت‌هایی مثل آرایش، استایل کارتونی یا ماسک روی صورت اعمال می‌شوند، اما چهره همچنان طبیعی و واقعی باقی می‌ماند.

استفاده از MediaPipe

مدل نهایی به‌همراه چارچوب MediaPipe اجرا می‌شود؛ سیستمی متن‌باز که وظیفه دارد:

  • تشخیص و هم‌ترازی چهره‌ها
  • اجرای افکت‌ها
  • و بازترکیب تصویر نهایی در ویدیو

این فرایند تنها در ۳۳ میلی‌ثانیه برای هر فریم انجام می‌شود و باعث می‌شود ویدیو با کیفیت بالای ۳۰ فریم بر ثانیه کاملاً روان اجرا شود.

تأثیر این فناوری بر تولیدکنندگان محتوا

سرعت و تنوع

این فناوری‌ها تاکنون بیش از ۲۰ افکت زنده روی شورتس فعال کرده‌اند؛ از ماسک‌های موضوعی مثل «زامبی برخاسته» گرفته تا ابزارهایی مانند «هرگز پلک نزن» یا «همیشه لبخند بزن».

بهینه‌سازی برای گوشی‌های مختلف

زمان تأخیر اجرای افکت‌ها اکنون به حدود ۶ میلی‌ثانیه در Pixel 8 Pro و ۱۰.۶ میلی‌ثانیه در iPhone 13 رسیده است. این یعنی کاربران با گوشی‌های پرچم‌دار و میان‌رده می‌توانند بدون مشکل از افکت‌های هوش مصنوعی استفاده کنند.

حمایت از خلاقیت فردی

سارا علی، معاون مدیر محصول یوتیوب شورتس، تأکید کرده است که این ابزارها جایگزین خلاقیت فردی نیستند، بلکه نقش پشتیبان و تقویت‌کننده ایده‌های شخصی را دارند. به بیان دیگر، یوتیوب می‌خواهد سازندگان محتوا سریع‌تر و راحت‌تر ایده‌های خود را عملی کنند.

آینده و چالش‌ها

شفافیت و اصالت محتوا

یوتیوب با افزودن واترمارک SynthID تلاش کرده مرز میان محتوای ساخته‌شده توسط هوش مصنوعی و آثار انسانی را شفاف کند. با این حال، همچنان چالش‌هایی در زمینه تشخیص محتواهای جعلی یا سوءاستفاده‌های احتمالی وجود دارد.

رقابت با پلتفرم‌های دیگر

با توجه به اینکه تیک‌تاک و اینستاگرام نیز روی ابزارهای هوش مصنوعی سرمایه‌گذاری می‌کنند، یوتیوب باید سرعت نوآوری خود را حفظ کند تا از رقبا عقب نماند.

فشار بر زیرساخت‌ها

اجرای مدل‌های سنگین روی میلیاردها گوشی در سراسر جهان می‌تواند فشار زیادی بر سرورهای گوگل و یوتیوب وارد کند. بنابراین بهینه‌سازی و کاهش مصرف منابع همچنان یکی از چالش‌های اصلی خواهد بود.

جمع‌بندی

یوتیوب با ورود جدی به عرصه هوش مصنوعی مولد در بخش شورتس، تجربه کاربران و سازندگان محتوا را وارد مرحله‌ای تازه کرده است. ابزارهایی مانند تبدیل عکس به ویدیو، افکت‌های مولد خلاقانه و زمین بازی هوش مصنوعی نه تنها تولید محتوا را ساده‌تر می‌کنند، بلکه به سازندگان فرصت می‌دهند آثار خود را در سطحی حرفه‌ای‌تر و جذاب‌تر ارائه دهند.

با این حال، آینده این فناوری وابسته به مدیریت چالش‌هایی مانند شفافیت، اصالت محتوا و رقابت بازار است. اگر یوتیوب بتواند این موانع را پشت سر بگذارد، بدون شک شورتس به یکی از قدرتمندترین پلتفرم‌های ویدیویی کوتاه تبدیل خواهد شد و هوش مصنوعی، نقشی کلیدی در این مسیر ایفا می‌کند.