هوش مصنوعی مولد چیست و از متن تا ویدیو چه میسازد
بعضی سامانهها فقط تشخیص میدهند، بعضی میسازند. اینجا میبینیم ابزارهای مولد چطور متن و عکس و ویدیو و صدا تولید میکنند، چرا گاهی از خودشان چیزی درمیآورند و خروجی مالِ کیست.
یک عکاسیِ کوچک در اصفهان تا پارسال برای پسزمینهی عکسِ محصول، چند ساعت در استودیو وقت میگذاشت. حالا عکسِ خام را با موبایل میگیرد و یک ابزار پسزمینهی کاشیکاریِ مسجدِ شیخ لطفالله را پشتش میسازد. همین مثال جوابِ کوتاهِ این سؤال است که هوش مصنوعی مولد چیست: سامانهای که بهجای فقط تشخیص دادن، چیزِ تازه میسازد.
متن، عکس، ویدیو، صدا و کد، همه در این خانوادهاند. و همه یک ضعفِ مشترک دارند که کمتر کسی دربارهاش حرف میزند: گاهی چیزی میسازند که وجود ندارد. این مقاله هر دو طرف را میگوید.
اگر هنوز با مفاهیمِ پایه آشنا نیستی، اول هوش مصنوعی چیست را بخوان. اینجا فرض بر این است که میدانی ماشین از داده یاد میگیرد.
مولد در برابرِ تحلیلی: دو کارِ متفاوت
بیشترِ هوش مصنوعیای که تا چند سال پیش دور و برمان بود، تحلیلی بود. فیلترِ هرزنامهی ایمیل تشخیص میدهد پیام تبلیغ است یا نه. سامانهی تشخیصِ پلاک، پلاکِ ماشین را میخواند. بانک تراکنشِ مشکوک را علامت میزند. اینها همه چیزی را برچسب میزنند یا پیشبینی میکنند.
هوش مصنوعیِ مولد کارِ دیگری میکند. نمیپرسد «این عکسِ گربه است یا نه»؛ میپرسد «یک گربهی ایرانیِ خوابیده روی قالیِ کاشان چه شکلی میشود» و آن را میکشد. هر دو از داده یاد گرفتهاند، ولی خروجیِ یکی یک برچسب است و خروجیِ دیگری یک اثر.
این تفاوت فقط اسمی نیست. خطای یک سامانهی تحلیلی معمولاً معلوم است: برچسبِ اشتباه. خطای یک سامانهی مولد پنهان است، چون خروجی روان و قانعکننده است حتی وقتی غلط است. مدخلِ هوش مصنوعیِ مولد در ویکیپدیا تاریخچه و نمونههای بیشتری دارد.
هوش مصنوعی مولد چه چیزهایی میسازد
پنج نوعِ اصلیِ خروجی داریم. سطحِ پختگیِ همه یکی نیست و این جدول سعی کرده صادق باشد:
| خروجی | مثالِ روزمره | کجا خوب است | کجا لنگ میزند |
|---|---|---|---|
| متن | نوشتنِ آگهیِ دیوار برای فروشِ یخچال | پیشنویس، خلاصه، بازنویسی | عدد، منبع، اطلاعاتِ تازه |
| عکس | پوسترِ جشنِ یلدای یک کافه | ایده، پسزمینه، تصویرسازی | نوشتنِ متنِ فارسی روی تصویر |
| ویدیو | استوریِ چندثانیهای برای معرفیِ محصول | تیزرِ کوتاه، متحرک کردنِ عکس | فیلمِ بلند، ثباتِ چهره در چند صحنه |
| صدا | خواندنِ متنِ یک پادکستِ آموزشی | گویندگیِ ساده | لحنِ طبیعیِ فارسی، احساس |
| کد | یک اسکریپتِ کوچک برای مرتب کردنِ فایلهای اکسل | کدِ کوتاه و رایج | پروژهی بزرگ و منطقِ پیچیده |
برای عکس، روشِ کامل در راهنمای ساخت عکس با هوش مصنوعی آمده. ویدیو هنوز جوانترین شاخه است و محدودیتهایش را در ساخت ویدیو با هوش مصنوعی صریح نوشتهایم: برای چند ثانیه عالی، برای فیلمِ بلند نه.
چطور میسازد، بدونِ ریاضی
تصور کن کسی هزاران غزلِ حافظ و سعدی را آنقدر خوانده که حسِ این را دارد که بعد از «ای» معمولاً چه میآید و قافیهی «یار» چه کلمههایی است. هیچ غزلی را حفظ نیست، ولی میتواند غزلی بسازد که شبیهِ آنها باشد. مدلهای مولد همینطورند: الگو را یاد گرفتهاند، نه متن را.
مدلِ متنی کلمهی بعدی را حدس میزند، بعد کلمهی بعدی را، تا جمله کامل شود. مدلِ تصویری از یک صفحهی پر از نویز شروع میکند و قدم به قدم آن را تمیز میکند تا به تصویری برسد که با توصیفِ تو جور باشد. جزئیاتِ بیشترِ سمتِ متنی را در مدل زبانی بزرگ چیست گفتهایم.
یک نتیجهی مهم از همین سازوکار: اگر یک درخواست را دو بار بدهی، دو خروجیِ متفاوت میگیری. این عیب نیست، ویژگی است. برای ایدهپردازی عالی است، چون هر بار گزینهی تازهای میبینی. ولی اگر دنبالِ جوابِ ثابت و تکرارپذیری، مثلاً برای متنِ قرارداد، باید قالب و جزئیات را دقیقتر بنویسی تا جا برای حدس کم بماند. دلیلِ فنیاش در چرا هر بار جواب متفاوتی میگیرم آمده.
نکتهی دیگر اینکه مدلِ مولد فقط تا جایی میداند که دادهی آموزشیاش پیش رفته. قیمتِ امروزِ سکه یا نتیجهی بازیِ دیشبِ پرسپولیس را از خودش نمیداند، مگر اینکه به جستوجوی وب وصل باشد. اگر نباشد، باز هم ممکن است جوابی بدهد، و این همان جایی است که مشکلِ بعدی شروع میشود.
چرا گاهی از خودش میسازد
این مهمترین بخشِ این مقاله است. مدلِ مولد برای محتمل بودن ساخته شده، نه برای درست بودن. بیشترِ وقتها این دو یکیاند. ولی وقتی نیستند، مدل محتمل را انتخاب میکند.
بپرس «شمارهی بخشنامهی مالیاتیِ فلان سال دربارهی معافیتِ اجاره چیست» و احتمالاً شمارهای دقیق و قانعکننده میگیری که ممکن است اصلاً وجود نداشته باشد. به این توهم میگویند. در عکس هم هست: دستِ ششانگشتی یا تابلوی مغازهای با حروفی که شبیهِ فارسیاند ولی خوانده نمیشوند.
هر جا خروجی شامل عدد، تاریخ، نامِ قانون، نقلقول یا منبع است، آن را فرض کن پیشنویس است تا وقتی خودت چک کنی. در حوزهی پزشکی، حقوقی و مالی این قاعده سختگیرانهتر است: ابزار پیشنویس میدهد، تصمیم و مسئولیت با متخصص است. راههای کم کردنِ این خطا را در توهم هوش مصنوعی چیست بخوان.
خروجی مالِ کیست
سؤالی که هر طراح و کسبوکاری زود یا دیر میپرسد. جوابِ صادقانه: هنوز یکدست نیست. قانونگذارها در کشورهای مختلف راههای متفاوتی رفتهاند و بعضیشان اثرِ صرفاً ماشینی را قابلِ ثبت نمیدانند، مگر سهمِ خلاقانهی انسان در آن روشن باشد.
برای کارِ روزمره، سه قاعده معمولاً کافی است: شرایطِ استفادهی سرویسی که با آن کار میکنی را بخوان؛ از اسم و چهرهی آدمِ واقعی یا لوگوی برندِ دیگر نساز؛ و روی کارِ نهایی دست ببر تا سهمِ خودت روشن باشد. جزئیاتِ حقوقی را در حق نشر محتوای تولیدشده با هوش مصنوعی باز کردهایم.
یک نکتهی اخلاقی هم هست که از قانون جلوتر است. ساختنِ ویدیو یا صدای ساختگی از یک آدمِ واقعی، حتی به شوخی، میتواند آسیبِ جدی بزند. دیپفیک دقیقاً همین سوءاستفاده از ابزارِ مولد است.
کاربردِ روزمره، با یک پرامپتِ آماده
بهترین جا برای شروع، کارهایی است که پیشنویسِ اول وقتگیرترین بخشش است: متنِ آگهی، کپشنِ اینستاگرام، نامهی اداری، ایدهی پوستر. نمونهی زیر برای یک فروشگاهِ زعفران نوشته شده ولی قالبش برای هر کسبوکاری کار میکند:
من یک فروشگاهِ آنلاینِ کوچکِ زعفران در مشهد دارم.
برای معرفیِ بستهی یک مثقالیِ جدیدمان اینها را بساز:
۱. کپشنِ اینستاگرام، حداکثر ۶۰ کلمه، لحنِ گرم و صمیمی
۲. توضیحِ یک پوسترِ عمودی برای استوری، بدونِ هیچ متنی روی تصویر
۳. سه عنوانِ کوتاه برای آگهی
ادعای پزشکی یا عددی که از من نگرفتهای ننویس.
خطِ آخر عمداً آنجاست: جلوی توهم را همان اول میگیرد. این پرامپت را میتوانی در چتِ نارنگی امتحان کنی؛ همانجا توضیحِ پوستر را هم میشود به عکس تبدیل کرد.
جمعبندی
هوش مصنوعیِ مولد بهجای برچسب زدن، محتوا میسازد: متن، عکس، ویدیو، صدا و کد. در پیشنویسِ اول، ایدهپردازی و کارهای تکراری واقعاً وقت آزاد میکند. ولی چون برای روان بودن ساخته شده نه درست بودن، هر جا عدد و منبع در کار است باید خودت چک کنی. مالکیتِ خروجی هنوز قطعی نیست؛ سهمِ خودت را در کارِ نهایی پررنگ کن و از آدم و برندِ واقعی چیزی نساز.
مطالب مرتبط: