ویدیوی هوش مصنوعی امروز: از کلیپ آزمایشی تا کار حرفه‌ای

دو سال پیش خروجی چهار ثانیه بود و می‌لرزید. حالا پلان ده‌ثانیه‌ای با حرکت دوربین و صدا می‌گیریم. اینجا می‌بینیم کدام کار تحویل‌دادنی است و کدام هنوز نه.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
چند قاب پیاپی از یک کلیپ روی خط زمانی تدوین، کنار پلان‌های فیلم‌برداری واقعی

یک کلیپ ده‌ثانیه‌ای می‌سازید و خروجی حیرت‌آور است. کلیپ دوم را می‌سازید تا ادامه‌ی همان صحنه باشد و صورت شخصیت عوض شده و نور از سمت دیگری می‌تابد. این تجربه‌ی مشترک هر کسی است که چند ساعت جدی با ویدیوی هوش مصنوعی کار کرده: تک‌پلان درخشان، پیوستگی افتضاح.

پس بدون هیجان‌زدگی و بدون بدبینی نگاه کنیم. چند چیز در دو سال گذشته واقعاً جابه‌جا شده و چند چیز سر جایش مانده. مهم این است که بدانید امروز کدام کار را می‌شود تحویل داد و سر کدام یکی نباید قول بدهید.

چه چیزی واقعاً بهتر شده

اول طول کلیپ. نسل قبل معمولاً سه چهار ثانیه می‌داد که فقط به درد یک نمای گذرا می‌خورد. حالا ده ثانیه و گاهی بیشتر عادی است: یک پلان کامل با شروع و پایان، نه یک تکه‌ی معلق.

دوم، ثبات بین فریم‌ها. آن حالت «ذوب شدن» که جسم وسط کلیپ شکل عوض می‌کرد کم شده؛ یک فنجان تا آخر پلان فنجان می‌ماند. سوم، حرکت دوربین: اگر بنویسید دوربین آرام به جلو می‌رود یا دور سوژه می‌چرخد، اغلب همان را می‌گیرید — که قبلاً شانسی بود.

چهارم صداست. بعضی مدل‌ها صدای محیط هماهنگ با تصویر می‌سازند و گفتار را با حرکت لب تطبیق می‌دهند؛ برای انگلیسی گاهی قابل استفاده، برای فارسی هنوز نه. تفاوت خانواده‌های مدل را در مقایسه ابزارهای ساخت ویدیو باز کرده‌ام.

چه چیزی هنوز مسئله است

ثبات شخصیت در چند صحنه، بزرگ‌ترین مشکل باقی‌مانده است. مدل بین دو درخواست حافظه ندارد و چهره را هر بار از نو می‌سازد؛ عکس مرجع فاصله را کم می‌کند، ولی از بین نمی‌برد.

دست و انگشت در حرکت سریع هنوز خراب می‌شود، مخصوصاً وقت برداشتن و چرخاندن اشیا. متن فارسی داخل قاب عملاً غیرممکن است. و فیزیک برخورد — ریختن چای در استکان، افتادن جعبه، تماس دو جسم — اغلب اشتباه درمی‌آید: مایع از جایی می‌آید که نباید، یا جسم انگار وزن ندارد.

⚠️ نوشته و لوگو را از مدل نخواهید

حروف متصل فارسی در فریم‌های پیاپی به هم می‌ریزند و خروجی لرزان و ناخوانا می‌شود. لوگوی برند هم هر فریم کمی فرق می‌کند: شبیه لوگوی شما هست ولی خودش نیست. اینجا ابزار جواب نمی‌دهد و اصرار فقط بودجه می‌سوزاند — پلان را خالی بگیرید و نوشته را در تدوین اضافه کنید.

کار و وضعیت امروز

خلاصه‌ی تجربه‌ی عملی:

کاروضعیت امروزراه عملی
تیزر ۱۰ تا ۳۰ ثانیه‌ایتحویل‌دادنیچند پلان کوتاه، محصول واقعی در نمای بسته
پلان پرکننده و بی‌راههتحویل‌دادنیجایگزین فوتیج استوک
انیمیشن توضیحی و موشن سادهتحویل‌دادنیصدا و زیرنویس جدا
شخصیت ثابت در چند صحنهناپایدارعکس مرجع، یا نشان ندادن چهره
گفت‌وگوی دونفره‌ی فارسیضعیففیلم‌برداری واقعی
متن فارسی داخل قابجواب نمی‌دهددر مرحله‌ی تدوین
فیلم بلند داستانینهفعلاً کنار بگذارید

سه کاری که امروز واقعاً پول درمی‌آورد

تیزر کوتاه. یک فروشنده‌ی زعفران در مشهد که برای شب یلدا ویدیوی پانزده‌ثانیه‌ای اینستاگرام می‌خواهد، امروز نتیجه‌ی خوبی می‌گیرد: نمای بسته از پرهای زعفران، بخار چای، دستی که بسته را باز می‌کند. سه پلان چهارثانیه‌ای، چسبانده در تدوین. پرامپت پایه در ساخت ویدیو با هوش مصنوعی آمده و برای قالب عمودی ویدیوی کوتاه برای ریلز و شورتس نکته‌های جداگانه دارد.

بی‌راهه و پلان پرکننده. بی‌سروصداترین کاربرد و بیشترین صرفه. مصاحبه‌ای گرفته‌اید و وسطش نمای شهر یا دفتر خالی لازم دارید. تا دیروز فوتیج استوک می‌خریدید؛ حالا در چند دقیقه می‌سازید.

انیمیشن توضیحی. برای معرفی یک سرویس یا توضیح یک فرایند اداری، صحنه‌های ساده و نمادین کافی است و ضعف‌های مدل — چهره و دست — کمتر دیده می‌شود. متن را اول بنویسید؛ روشش در نوشتن سناریو و متن ویدیو است.

چرا ویدیوی بلند داستانی هنوز نه

سه دلیل، و هیچ‌کدام با پرامپت بهتر حل نمی‌شود. تداوم: شخصیت باید در دقیقه‌ی دوازدهم همان باشد که در دقیقه‌ی دوم بود. بازیگری: خشم و تردید و مکث را مدل قابل کارگردانی تحویل نمی‌دهد. و کنترل: وقتی کارگردان می‌گوید «نگاهش کمی دیرتر برگردد»، ابزار امروز جوابی ندارد؛ فقط می‌توانید دوباره قرعه بیندازید.

هزینه و زمان رندر

قیمت‌گذاری معمولاً بر حسب ثانیه‌ی خروجی است، پس تیزر کوتاه قابل کنترل می‌ماند. هزینه‌ی پنهانش پلان‌های دورریز است: اغلب باید چند نسخه بگیرید تا یکی قابل استفاده باشد، پس بودجه را چند برابر ببندید. رندر هم آنی نیست و معمولاً چند ده ثانیه تا چند دقیقه طول می‌کشد. عددهای مقایسه‌ای در هزینه‌ی واقعی کار با هوش مصنوعی جمع شده است.

گردش کار حرفه‌ای یعنی ترکیب

کسی که با این ابزار پول درمی‌آورد، همه‌ی ویدیو را نمی‌سازد. هر جا چهره یا محصول واقعی دیده می‌شود با دوربین گرفته می‌شود — حتی با موبایل — و ساخته‌ی مدل نقش پرکننده را بازی می‌کند. بعد در تدوین رنگ هر دو را یکی می‌کنند تا چشم جای وصله را نبیند؛ همان منطق قدیمی کروماکی. اینکه کجای تدوین وقت برمی‌گردد، در تدوین ویدیو با کمک هوش مصنوعی آمده.

این ساختار را برای یک پلان امتحان کنید. پرامپت شلوغ، نتیجه‌ی شلوغ می‌دهد:

پلان: نمای بسته از یک استکان چای روی میز چوبی کنار پنجره
حرکت دوربین: آرام و کوتاه به جلو، حدود ده سانتی‌متر
نور: نور طبیعی صبح از پنجره، سایه‌ی نرم
جزئیات: بخار ملایم بالای استکان، بدون دست و بدون آدم
سبک: فیلم‌برداری واقعی، بدون افکت و بدون کند شدن
مدت: ۵ ثانیه — نسبت: عمودی ۹:۱۶

برای امتحان چند مدل زیر یک حساب، در نارنگی کنار هم هستند. مبنای فنی این خانواده از مدل‌ها هم در مدخل مدل متن‌به‌ویدیو توضیح داده شده.

جمع‌بندی

ویدیوی هوش مصنوعی از مرحله‌ی اسباب‌بازی رد شده ولی به «دوربین را کنار بگذار» نرسیده. تیزر کوتاه، پلان پرکننده و انیمیشن توضیحی قابل تحویل‌اند. صحنه‌ی داستانی با شخصیت ثابت، گفت‌وگوی فارسی و متن داخل قاب هنوز نه.

عملی‌ترین توصیه: پروژه را طوری طراحی کنید که ضعف‌های مدل داخل قاب نیفتد. نمای بسته به‌جای نمای کامل، دست و شیء به‌جای چهره، پلان کوتاه به‌جای طولانی. همین سه انتخاب فاصله‌ی خروجی شما را با کار حرفه‌ای محسوس کم می‌کند.

برای ادامه:

پرسش‌های پرتکرار

با هوش مصنوعی می‌شود یک ویدیوی چند دقیقه‌ای یکپارچه ساخت؟ +
به‌شکل مستقیم نه؛ خروجی هر بار یک پلان کوتاه است و ویدیوی بلند از کنار هم چیدن ده‌ها پلان در نرم‌افزار تدوین ساخته می‌شود. برای کلیپ‌های آموزشی و تبلیغاتی که ذاتاً پلان‌پلان هستند این روش جواب می‌دهد. برای صحنه‌ی داستانی پیوسته با شخصیت ثابت، نتیجه معمولاً ناپیوسته درمی‌آید.
چرا شخصیت من در کلیپ دوم فرق می‌کند؟ +
چون مدل بین دو درخواست حافظه‌ی تصویری ندارد و هر بار چهره را از نو می‌سازد. دادن یک عکس مرجع ثابت و توصیف دقیق لباس و رنگ مو فاصله را کم می‌کند، ولی از بین نمی‌برد. راه امن‌تر این است که چهره را نبینیم: پلان از پشت سر، دست، سایه، یا نمای بسته روی کار.
می‌شود متن یا لوگوی فارسی را داخل ویدیو گذاشت؟ +
از خود مدل نخواهید؛ حروف متصل فارسی در فریم‌های متوالی به هم می‌ریزند و خروجی لرزان و ناخواناست. نوشته و لوگو را در مرحله‌ی تدوین روی کلیپ بگذارید تا هم درست دربیاید و هم بعداً قابل ویرایش باشد. همین کار چند دقیقه وقت می‌برد و کیفیت را از آماتور به حرفه‌ای می‌برد.
ساخت یک تیزر کوتاه چقدر خرج و وقت می‌برد؟ +
هزینه معمولاً بر حسب ثانیه‌ی خروجی حساب می‌شود، پس تیزر پانزده‌ثانیه‌ای از چند پلان کوتاه ساخته می‌شود و بودجه‌اش قابل کنترل است. نکته‌ی پنهان، پلان‌های دورریز است: اغلب باید چند نسخه بگیرید تا یکی قابل استفاده باشد. برای برآورد واقع‌بینانه، خرج را دو تا سه برابر پلان‌های نهایی در نظر بگیرید.
خروجی این ابزارها را می‌شود تبلیغاتی استفاده کرد؟ +
اغلب سرویس‌ها در پلن پولی اجازه‌ی استفاده‌ی تجاری می‌دهند، ولی شرط‌ها بین سرویس‌ها فرق دارد و باید قوانین همان سرویس را بخوانید. جدا از آن، ساختن چهره‌ی افراد واقعی یا شبیه‌سازی برند دیگران دردسر حقوقی دارد. برای محصول خودتان و صحنه‌های عمومی معمولاً مسئله‌ای پیش نمی‌آید.
#ساخت ویدیو با هوش مصنوعی #تیزر تبلیغاتی #متن به ویدیو #پلان پرکننده #کیفیت ویدیوی هوش مصنوعی
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است