اگر تا به حال با تولید ویدیو با هوش مصنوعی کار کرده باشید، حتماً با این مشکل آشنا هستید: شخصیتی که در صحنه اول فوقالعاده به نظر میرسد، در صحنه بعدی چهرهای کاملاً متفاوت پیدا میکند. این همان چالش «ثبات بصری» است؛ مشکلی که سالها گریبانگیر تولیدکنندگان محتوا بوده و باعث میشود مخاطب، ویدیو را غیرحرفهای و بیاعتبار ببیند.
راهحل این مشکل، قابلیتی به نام چندتصویری یا Multi-image Fusion است. به جای اینکه فقط با متن، شخصیت را توصیف کنید، چند تصویر مرجع به سیستم میدهید تا هویت بصری یک شخصیت را یک بار قفل کند و در تمام صحنهها از آن استفاده کند. در این راهنما، قدم به قدم یاد میگیرید که چطور از این قابلیت برای تولید ویدیوهای یکدست و سینمایی استفاده کنید.
چرا شخصیتها در ویدیوهای هوش مصنوعی تغییر میکنند؟
مدلهای تولید ویدیو بر اساس متن، هر بار یک «نسخه جدید» از شخصیت میسازند. وقتی مینویسید «یک زن با کت قرمز وارد کافه میشود»، مدل یک چهره قابل قبول میسازد. صحنه بعدی که مینویسید «روی صندلی مینشیند»، مدل دوباره از صفر شروع میکند و چهره دیگری میسازد. هیچچیز در متن نمیتواند جزئیات دقیق چهره، فرم بدن و لباس را به مدل منتقل کند.
در تولید محتوای سریالی، تبلیغات برند و هر پروژهای که یک شخصیت در چند صحنه ظاهر میشود، این ناپایداری داستان را میشکند. مخاطب ممکن است دقیقاً نفهمد مشکل چیست، اما حس میکند چیزی درست نیست و ویدیو را کنار میگذارد.
قابلیت چندتصویری دقیقاً چه کاری انجام میدهد؟
روش کار ساده است: به جای تکیه فقط روی متن، چند تصویر مرجع از شخصیت خود آماده کنید. یک تصویر روبهرو، یک تصویر نیمرخ، یک تصویر تمامقد و در صورت لزوم، نمای نزدیک از یک جزئیات خاص مثل خالکوبی یا گردنبند.
سیستم این تصاویر را تحلیل میکند و ویژگیهایی را که هویت شخصیت را میسازند، از نورپردازی، پسزمینه و عناصر موقت جدا میکند. این ویژگیها در یک «اثر انگشت بصری» فشرده میشوند که مثل یک دانه ثابت عمل میکند. از این به بعد، هر صحنهای که تولید کنید، همان اثر انگشت را میخواند و چهره، تناسب اندام و جزئیات امضادار شخصیت ثابت میماند.
این روش خیلی قویتر از ارسال یک تصویر مرجع است. یک تصویر واحد ممکن است تحت تأثیر حالت چهره، ژست یا پسزمینه شلوغ قرار بگیرد، اما مجموعهای از چند تصویر به مدل کمک میکند ویژگیهای پایدار را از عناصر اتفاقی تشخیص دهد.
کاربرد در تغییر استایل
آزمون واقعی ثبات، تغییر استایل است. ممکن است بخواهید ویدیو با ظاهری واقعگرایانه شروع شود، وسط کار به یک سکانس انیمهای برود و در پایان یک قاب تبلیغاتی خاص داشته باشد. چندتصویری این کار را با جدا نگه داشتن لایه هویت از لایه استایل انجام میدهد.
در این روش، هویت شخصیت ابتدا روی یک ساختار خنثی و بدون استایل نگاشت میشود. این ساختار، هندسه و تناسبی را حمل میکند که شخصیت را قابل شناسایی میکند. بعد، مدل مقصد استایل خودش را روی این ساختار اعمال میکند. نتیجه، یک نسخه انیمهای از همان شخصیت است، نه یک آدم جدید که اتفاقاً انیمهای کشیده شده است.
اگر استایل هدف خیلی خاص است، تصاویر مرجعی اضافه کنید که همان استایل را دارند. این کار بردار استایل را تقویت میکند و در عین حال هویت اصلی حفظ میشود. تفاوت بین «به سبک فلان» و «خودِ این شخص، اما با یک سبک جدید» همین است.
قدمهای عملی برای شروع
اول: یک پک مرجع بسازید. چند پرتره با نورپردازی مشابه، چند تصویر تمامقد و یکی دو تصویر از اشیای ثابت مثل کیف یا اکسسوری که شخصیت همیشه با خود دارد. هرچه ورودی تمیزتر باشد، اثر انگشت بصری دقیقتر است.
دوم: پرامپت را روی صحنه متمرکز کنید، نه روی شخصیت. بعد از اینکه هویت قفل شد، فقط اتفاقاتی را توصیف کنید که در صحنه میافتد. تکرار توضیحات ظاهری طولانی در هر پرامپت، در واقع آنکر هویت را ضعیف میکند.
سوم: قبل از مقیاسسازی، تست کنید. یک صحنه تولید کنید، بعد صحنه دوم با مکان و نور متفاوت، و چهرهها را کنار هم ببینید. اگر جایی تغییر کرده، قبل از ادامه، مراجع را اصلاح کنید.
چهارم: از انتقال استایل عمدی استفاده کنید. تغییر استایل میتواند یک ضرب داستانی باشد، فقط به شرطی که شخصیت در آن سالم بماند. قبل از قفل کردن سکانس، مطمئن شوید که شخصیت در هر دو استایل همان آدم است.
یکدستی اشیا و محیط
ثبات فقط به چهره محدود نمیشود. اگر شخصیت همیشه یک کیف خاص حمل میکند، یا یک لیوان قهوه در سه صحنه ظاهر میشود، این اشیا هم باید ثابت بمانند. چندتصویری از قفل کردن اشیای ثابت هم پشتیبانی میکند: شیء را یک بار تعریف کنید و در همه نماها به آن ارجاع دهید تا دیگر بین نماها تغییر شکل ندهد.
برای سکانسهای طولانی، فریم شروع و پایان کلیپ را هم قفل کنید. بعضی مدلها اجازه میدهند هم فریم اول و هم فریم آخر را مشخص کنید. ترکیب این قابلیت با اثر انگشت هویت، دو نقطه ثابت به مدل میدهد و کیفیت حرکت را در صحنههای اکشن، پنهای طولانی و نماهایی که شخصیت از کادر خارج و دوباره وارد میشود، به شدت بهبود میدهد.
نکتههایی برای حرفهایتر شدن
اگر تازه شروع کردهاید، با یک آزمایش ساده شروع کنید: یک شخصیت را قفل کنید، سه صحنه در محیطهای مختلف بسازید و ببینید چطور هویت در همه آنها حفظ میشود. همین تمرین کوچک، طرز فکر شما را درباره تولید ویدیو تغییر میدهد.
برای آمادهسازی تصاویر مرجع با کیفیت، میتوانید از یک تولیدکننده تصویر هوش مصنوعی استفاده کنید تا پرترههای یکدست و تمیز بسازید. وقتی نوبت به ساخت ویدیو میرسد، یک ابزار ویدیوی هوش مصنوعی که از ورودی تصویری پشتیبانی میکند، اجازه میدهد همان تصاویر مرجع را وارد کنید و سکانسهای یکدست بگیرید. اگر پروژه شما با متن شروع میشود، مسیر متن به ویدیو را انتخاب کنید و بعد هویت شخصیت را با تصاویر مرجع قفل کنید.
جمعبندی
تغییر شکل شخصیت بین نماها دیگر بهای اجتنابناپذیر ویدیوی هوش مصنوعی نیست. با قابلیت چندتصویری، شخصیت خود را یک بار تعریف میکنید و تمام صحنهها همان چهره، همان تناسب و همان جزئیات را به ارث میبرند. این تفاوت بین مجموعهای از کلیپهای چشمگیر و یک داستان واقعی است.
چه روی یک کمپین برند کار کنید، چه فیلم کوتاه، چه سریال برای شبکههای اجتماعی، یکدستی شخصیت همان چیزی است که خروجی آماتور را از چیزی که واقعاً منتشر میکنید جدا میکند. همین امروز یک پک مرجع بسازید، اولین تست را انجام دهید و تفاوت را با چشم خود ببینید.


