ساخت مستقیم ویدیو اگر سناریوی کوتاه و مرجعهای آماده دارید، با تنظیم پیشنهادی این راهنما وارد استودیوی ویدیو نقطه شوید.
ساخت ویدیو با هوش مصنوعی فقط نوشتن یک جمله و زدن دکمه «ساخت» نیست. مدل ویدیویی باید از روی چند ورودی محدود، ظاهر شخصیت، حرکت بدن، محیط، دوربین، نور، زمانبندی و گاهی صدا را همزمان حدس بزند. اگر سناریو شلوغ باشد، مرجعها نقش مشخصی نداشته باشند یا از مدل انتظار داشته باشیم چیزی را از اینترنت پیدا کند، احتمال رد شدن درخواست یا ساخت خروجی ضعیف بالا میرود.
این راهنما از یک الگوی واقعی در پشتیبانی نقطه شکل گرفته است: کاربری میخواست در یک کلیپ کوتاه، چند شخصیت حرف بزنند، یک نفر از خودرو پیاده شود، چهره و صدای یک بازیگر مشهور بازسازی شود و مدل هم تصاویر لازم را از اینترنت پیدا کند. درخواست چند بار روی مدلهای مختلف تکرار شد؛ بخشی از تلاشها به محدودیت فنی مرجعها خورد و بخشی دیگر به دلیل تقلید چهره و صدای یک فرد مشهور توسط فیلتر ایمنی مدل رد شد. مسئله اصلی خراب بودن حساب نبود؛ انتظار نادرست از شیوه کار مدل ویدیویی بود.
در ادامه، همین تجربه را به یک فرایند درست و قابل تکرار تبدیل میکنیم؛ فرایندی که برای ریلز، ویدیوی محصول، کلیپ داستانی، معرفی خدمات و تبدیل عکس به ویدیو کاربرد دارد.
مدل ویدیوساز موتور جستوجو نیست
وقتی نام یک بازیگر، محصول یا مکان را در پرامپت مینویسید، مدل ویدیوساز لزوماً وارد اینترنت نمیشود تا عکس، فیلم یا صدای درست را پیدا کند. مدل فقط پرامپت، فایلهای مرجع بارگذاریشده و دانشی را که هنگام آموزش آموخته است میبیند. حتی اگر یک چهره در اینترنت بسیار شناختهشده باشد، نوشتن نام او جای مرجع تصویری را نمیگیرد.
برای شخصیت داستانی باید ظاهر او را خودتان تعریف کنید یا تصویر مرجع مجاز بدهید. برای حرکت خاص، ویدیوی حرکت مفید است. برای دیالوگ دقیق، فایل صوتی مجاز یا مرحله جداگانه Lip Sync نتیجه قابلکنترلتری میدهد. هر ورودی باید یک وظیفه روشن داشته باشد؛ انباشتن تعداد زیادی عکس و ویدیو بدون توضیح نقش آنها معمولاً مدل را گیج میکند.
روال درست ساخت ویدیو با هوش مصنوعی چیست؟
یک گردشکار مطمئن پنج بخش دارد: سناریو، مرجع، پرامپت، ساخت و بازبینی. اگر خروجی اول مناسب نبود، بهجای تکرار بدون تغییر همان درخواست، باید مشخص کنید مشکل در کدام بخش است و فقط همان متغیر را اصلاح کنید.
۱. نتیجه نهایی را پیش از پرامپت تعریف کنید
قبل از انتخاب مدل، پاسخ این سؤالها را بنویسید: ویدیو برای کجا منتشر میشود؟ چند ثانیه است؟ افقی یا عمودی است؟ آیا صدا لازم دارد؟ بیننده باید در پایان چه چیزی را ببیند یا بفهمد؟ برای نمونه، «ریلز عمودی ۸ ثانیهای از معرفی یک تعمیرگاه» از «یک ویدیوی جذاب بساز» هدف بسیار روشنتری است.
- ریلز و استوری: معمولاً نسبت 9:16 و قاب نزدیکتر
- ویدیوی سایت و یوتیوب: معمولاً 16:9 و فضای بیشتر برای محیط
- تبلیغ محصول: تمرکز روی یک محصول و یک حرکت دوربین
- کلیپ داستانی: چند شات کوتاه که بعداً تدوین میشوند
۲. سناریوی بلند را به شاتهای کوتاه تقسیم کنید
مدل ویدیویی در یک خروجی کوتاه، ظرفیت محدودی برای حفظ شخصیت و اجرای چند رویداد دارد. اگر در ۸ ثانیه از شخصیت بخواهید از خودرو پیاده شود، راه برود، با نفر دوم حرف بزند، کاپوت را باز کند و دوربین هم زاویه عوض کند، مدل باید چند مسئله سخت را همزمان حل کند.
راه بهتر این است که داستان را به شات تبدیل کنید:
- شات اول، ۵ تا ۸ ثانیه: شخصیت از خودرو پیاده میشود و رو به تعمیرکار میایستد.
- شات دوم، ۵ تا ۸ ثانیه: نمای دونفره و گفتوگوی کوتاه.
- شات سوم، ۵ تا ۸ ثانیه: تعمیرکار کاپوت را باز میکند و دوربین حرکت را دنبال میکند.
این تقسیمبندی هم کیفیت هر خروجی را بیشتر میکند و هم اگر یک شات خراب شد، لازم نیست کل ویدیو را دوباره بسازید.
۳. شخصیت را قبل از ویدیو تثبیت کنید
اگر ثبات چهره و لباس مهم است، ابتدا یک شناسنامه تصویری برای شخصیت بسازید. دو تا چهار تصویر هماهنگ معمولاً از ده عکس نامرتبط مفیدتر است: نمای روبهرو، سهرخ، نیمتنه و تمامقد. نور، لباس، سن تقریبی، مدل مو و رنگها در همه تصاویر یکسان باشند.
برای شخصیتهای داستانی میتوانید ابتدا در بخش ساخت عکس نقطه، تصویر مرجع را بسازید و پس از تأیید ظاهر، همان تصاویر را وارد مدل ویدیو کنید. اگر از عکس واقعی استفاده میکنید، تصویر باید واضح، دارای نور مناسب و با اجازه صاحب تصویر باشد.
۴. برای هر مرجع یک نقش مشخص بنویسید
مدل باید بداند هر فایل چرا وارد شده است. نقش مرجعها را در ابتدای پرامپت مشخص کنید:
- تصویر ۱ و ۲: ظاهر و لباس شخصیت اول
- تصویر ۳: ظاهر شخصیت دوم
- ویدیوی ۱: فقط مرجع حرکت پیاده شدن
- صدای ۱: دیالوگ و زمانبندی حرکت لب
محدودیت تعداد، حجم و مدت مرجع در مدلها یکسان نیست. برای مثال، در تنظیمات فعلی وان ۳ ویدیو پرایم، مجموع مدت ویدیوهای مرجع باید حداکثر ۱۵ ثانیه باشد. اگر دو کلیپ ۱۰ ثانیهای وارد کنید، درخواست پیش از شروع ساخت رد میشود. همیشه محدودیت نمایشدادهشده کنار ورودیهای همان مدل را معیار قرار دهید.
۵. صدا و Lip Sync را جداگانه جدی بگیرید
نوشتن متن دیالوگ تضمین نمیکند مدل دقیقاً همان جمله را با تلفظ و زمانبندی مطلوب اجرا کند. اگر دیالوگ برای پروژه مهم است، صدا را با گوینده خودتان یا یک صدای مجاز آماده کنید. سپس فایل صوتی را به مدل سازگار بدهید و صریحاً بخواهید حرکت لبها با همان فایل هماهنگ شود.
اگر مدل انتخابی ورودی صوتی یا قابلیت هماهنگسازی لب ندارد، مسیر دو مرحلهای بهتر است: ابتدا ویدیوی بیصدا را بسازید، بعد در ابزار Lip Sync صدا را روی خروجی قرار دهید. تقلید صدای افراد واقعی بدون رضایت، بهویژه افراد مشهور، ممکن است توسط ارائهدهنده رد شود و برای انتشار نیز مسئولیت حقوقی ایجاد کند.
ساختار یک پرامپت خوب برای ویدیو
پرامپت ویدیویی خوب باید یک صحنه را روشن کند، نه اینکه کل فیلمنامه را در یک پاراگراف فشرده کند. ترتیب زیر معمولاً خواناتر و قابلکنترلتر است:
- نقشه مرجعها: هر تصویر، ویدیو و صدا چه نقشی دارد؟
- نوع خروجی: مدت، نسبت تصویر، کیفیت و وجود صدا
- سوژه: چه کسی یا چه چیزی در صحنه است؟
- حرکت اصلی: دقیقاً یک کنش اصلی چیست؟
- دوربین: اندازه نما، زاویه و حرکت دوربین
- نور و فضا: زمان روز، رنگ، حس و محیط
- دیالوگ یا صدا: متن کوتاه و مرجع صوتی
- محدودیتها: چه چیزهایی نباید تغییر کنند؟
قالب آماده پرامپت ویدیویی
نقشه مرجعها:
تصویر ۱ و ۲ = ظاهر شخصیت اصلی
ویدیوی ۱ = فقط مرجع حرکت
صدای ۱ = دیالوگ مجاز و زمانبندی لبها
خروجی:
ویدیوی عمودی 9:16، مدت ۸ ثانیه، یک شات پیوسته
صحنه:
[شخصیت] در [محیط] قرار دارد و فقط [یک حرکت اصلی] را انجام میدهد.
دوربین:
[اندازه نما] با [حرکت آرام یا دوربین ثابت]، بدون کات ناگهانی
نور و حس:
[زمان روز]، [نوع نور]، [حس صحنه]
صدا:
حرکت لبها و زمانبندی گفتوگو با صدای ۱ هماهنگ باشد.
ثبات:
چهره، لباس و رنگها مطابق تصاویر مرجع ثابت بمانند؛
دستها و پاها طبیعی باشند؛ نوشته و لوگوی ناخواسته ایجاد نشود.
نمونه پرامپت کامل برای صحنه خودرو و تعمیرکار
نقشه مرجعها: تصویر ۱ و ۲ ظاهر شخصیت اصلی داستانی را مشخص میکنند؛
تصویر ۳ ظاهر تعمیرکار است؛ ویدیوی ۱ فقط مرجع حرکت طبیعی پیاده شدن است؛
صدای ۱ شامل دیالوگ مجاز صحنه است.
یک ویدیوی عمودی 9:16 و ۸ ثانیهای بساز. شخصیت اصلی با ظاهر دقیقاً
مطابق تصاویر ۱ و ۲، بهآرامی از یک خودروی مشکی پیاده شود و رو به
تعمیرکار بایستد. حرکت بدن پیوسته و طبیعی باشد؛ دستها، پاها، چهره و
لباس در طول شات تغییر نکنند. دوربین در نمای متوسط و همسطح چشم، با
حرکت بسیار نرم شخصیت را دنبال کند. نور عصر طبیعی، سایهها نرم و فضای
خیابان واقعی باشد.
شخصیت اصلی بگوید: «سلام داداش، بیزحمت به این ماشین یه نگاه بنداز.»
تعمیرکار پاسخ دهد: «چشم داداش.» حرکت لبها و زمانبندی گفتوگو با
صدای ۱ هماهنگ باشد. هیچ شباهت یا تقلیدی از فرد مشهور ایجاد نشود.
بدون کات ناگهانی، نوشته، لوگوی اضافی یا تغییر ناگهانی پسزمینه.
در اولین تست، فقط یک خروجی بسازید. تولید همزمان دو یا چهار خروجی هزینه آزمون را زیاد میکند و تشخیص علت مشکل را سختتر میکند. وقتی پرامپت و مرجعها تأیید شدند، میتوانید نسخههای بیشتری بگیرید.
کدام مدل ویدیو را انتخاب کنیم؟
مدل بهتر همیشه گرانترین مدل نیست؛ مدل مناسب مدلی است که ورودی مورد نیاز پروژه را پشتیبانی کند. پیش از ساخت، کارت مدل و ورودیهای فعال آن را بررسی کنید.
| نیاز پروژه | قابلیت مهم مدل | نکته عملی |
|---|---|---|
| حرکت دادن یک عکس | Image to Video یا فریم شروع | یک عکس واضح با فضای کافی اطراف سوژه بدهید. |
| ویرایش کلیپ موجود | Video to Video | مدت و فرمت ویدیوی مبدأ باید با محدودیت مدل سازگار باشد. |
| ثبات چند شخصیت | چند تصویر مرجع و پشتیبانی از Character Reference | برای هر شخصیت عکسهای هماهنگ و نقش مشخص تعریف کنید. |
| دیالوگ دقیق | صدای بومی، Audio Reference یا Lip Sync | صدا را جداگانه و با اجازه صاحب صدا آماده کنید. |
| ویدیوی چندصحنهای | مدل مناسب هر شات + تدوین | بهجای یک خروجی بلند، چند شات کوتاه بسازید. |
ممکن است یک مدل در حرکت دوربین عالی باشد اما در گفتوگوی فارسی یا حفظ دو شخصیت ضعیفتر عمل کند. مدلها را با یک تست کوچک و قابلاندازهگیری مقایسه کنید؛ نه با چند پرامپت متفاوت و مرجعهای متفاوت.
چطور خروجی را حرفهای بازبینی کنیم؟
پس از ساخت، فقط به «قشنگ بودن» ویدیو نگاه نکنید. خروجی را با چکلیست بررسی کنید و زمان دقیق ایراد را یادداشت کنید:
- ثبات شخصیت: چهره، مو و لباس از ابتدا تا انتها ثابتاند؟
- آناتومی: دست، پا، انگشتها و تماس با اشیا طبیعی است؟
- حرکت: شتاب ناگهانی، پرش یا تغییر غیرمنطقی وجود ندارد؟
- دوربین: کادر سوژه را گم نمیکند و بیدلیل نمیچرخد؟
- پیوستگی محیط: خودرو، خیابان و اشیای پسزمینه ناگهان عوض نمیشوند؟
- صدا: جمله کامل است و لبها با صدا هماهنگاند؟
- ایمنی انتشار: چهره، صدا، لوگو، موسیقی و تصاویر مجوز استفاده دارند؟
در اصلاح بعدی فقط یک یا دو ایراد را هدف بگیرید. مثلاً «حرکت پیاده شدن آهستهتر و پیوستهتر شود؛ دوربین و ظاهر شخصیت بدون تغییر بماند.» بازنویسی کامل پرامپت میتواند بخشهای سالم خروجی را هم تغییر دهد.
خطاهای رایج ساخت ویدیو و راهحل آنها
| نشانه خطا | علت محتمل | راهحل |
|---|---|---|
| درخواست توسط سیستم ایمنی رد شد | چهره عمومی، تقلید صدا، محتوای حساس یا مرجع مسئلهدار | شخصیت داستانی و مرجع مجاز استفاده کنید؛ هدف پروژه را شفاف بنویسید. |
| مدل مرجع را نمیپذیرد | مدت، حجم، فرمت یا تعداد مرجع از سقف مدل بیشتر است | مرجعها را کوتاه و کم کنید و محدودیت همان مدل را بخوانید. |
| چهره مدام تغییر میکند | مرجعهای ناسازگار یا سناریوی بیش از حد شلوغ | شناسنامه تصویری هماهنگ بسازید و هر خروجی را به یک شات محدود کنید. |
| حرکت مصنوعی یا ناگهانی است | حرکت اصلی دقیق تعریف نشده یا چند حرکت همزمان خواسته شده | سرعت، مسیر و پایان حرکت را بنویسید و از ویدیوی حرکت کوتاه استفاده کنید. |
| دیالوگ ناقص یا نامفهوم است | متن طولانی یا مدل فاقد کنترل صوتی کافی | جمله را کوتاه کنید یا ویدیو و Lip Sync را در دو مرحله بسازید. |
| خطای فنی ارائهدهنده دیده میشود | پارامتر ناسازگار، اختلال موقت یا خطای اتصال مدل | همان پیام خطا را نگه دارید، وضعیت بازگشت کردیت را بررسی و به پشتیبانی گزارش کنید. |
کردیت و مسئولیت خروجی چگونه محاسبه میشود؟
هزینه هر اجرا پیش از ساخت و بر اساس مدل، مدت، کیفیت، تعداد خروجی و تعداد مرجعها نمایش داده میشود. در نقطه، اگر اجرای ارائهدهنده با وضعیت ناموفق ثبت شود، کردیت همان اجرای ناموفق طبق سازوکار سیستم بازمیگردد. اما اگر مدل خروجی کامل تحویل دهد و نتیجه از نظر سلیقهای یا هنری دقیقاً مطابق انتظار نباشد، آن اجرا انجامشده محسوب میشود.
نقطه ابزار دسترسی به مدلهای هوش مصنوعی خارجی است و نتیجه هر ساخت به مدل، پرامپت، مرجع و تنظیمات انتخابی بستگی دارد. پیش از استفاده تجاری، خروجی را از نظر حقوق تصویر و صدا، علائم تجاری، موسیقی، اطلاعات غلط و تناسب با محل انتشار بررسی کنید. جزئیات بیشتر در قوانین و شرایط استفاده نقطه آمده است.
اجرای اولین شات ابتدا یک شخصیت داستانی، یک حرکت اصلی و یک خروجی ۸ ثانیهای بسازید. بعد از بازبینی، شات دوم را جداگانه تولید کنید.
جمعبندی
برای ساخت ویدیو با هوش مصنوعی، از مدل انتظار کارگردانی، جستوجوی اینترنتی و تدوین کامل در یک درخواست نداشته باشید. ابتدا هدف و نسبت تصویر را مشخص کنید، سناریو را به شاتهای کوتاه تقسیم کنید، شخصیت و صدای مجاز بسازید، به هر مرجع یک نقش بدهید و پرامپت را روی یک حرکت اصلی متمرکز کنید. خروجی اول را آزمایش بدانید، با چکلیست بازبینی کنید و در هر تکرار فقط ایراد مشخصی را اصلاح کنید. این روش هم هزینه آزمون را کنترل میکند و هم احتمال رسیدن به ویدیوی قابلاستفاده را بالا میبرد.



