ساخت عکس با هوش مصنوعی: راهنمای کامل از صفر تا تصویر حرفهای
چرا تصویرهایی که میسازید شبیه چیزی که در ذهن داشتید نیست؟ این راهنما ساختار پرامپت تصویری، انتخاب سبک، نسبت تصویر و رفع خطاهای رایج را با دهها مثال فارسی توضیح میدهد.
بیشتر کسانی که برای اولین بار سراغ تصویرساز هوش مصنوعی میروند، یک تجربهی مشترک دارند: مینویسند «یک عکس زیبا از یک دختر در پارک»، و چیزی میگیرند که فنی درست است ولی هیچ شباهتی به تصویر ذهنیشان ندارد. بعد چند بار دیگر امتحان میکنند، نتیجه بهتر نمیشود، و نتیجه میگیرند «این ابزارها هنوز خوب نیستند».
ابزارها مشکلی ندارند. مسئله این است که تصویرساز، برخلاف چت، دستور نمیگیرد — توصیف میگیرد. شما دارید به کسی که چشمهایش بسته است میگویید چه ببیند. هرچه توصیفتان دقیقتر باشد، تصویر نزدیکتر میشود.
این راهنما همان چیزی است که کاش کسی روز اول به ما گفته بود: ساختار توصیف، واژههایی که واقعاً کار میکنند، و مشکلاتی که همه به آنها میخورند.
تصویرساز واقعاً چه کار میکند
لازم نیست ریاضیاتش را بدانید، ولی یک تصویر ذهنی درست از فرآیند، بیشتر پرامپتنویسیتان را اصلاح میکند.
مدل از یک تصویر کاملاً نویزی — مثل برفک تلویزیون قدیمی — شروع میکند و مرحلهبهمرحله نویز را کم میکند تا چیزی بسازد که با توصیف شما همخوان باشد. به این فرآیند «انتشار» یا diffusion میگویند.
سه نتیجهی عملی از این ماجرا:
- هر اجرا متفاوت است. چون نقطهی شروع، نویز تصادفی است. همان پرامپت، ده تصویر متفاوت میدهد.
- مدل مفاهیم را از تصویرهای برچسبخورده یاد گرفته. پس کلماتی که در توصیف عکسهای واقعی به کار میروند — «نور طلایی»، «عمق میدان کم»، «لنز ۸۵ میلیمتری» — قویتر عمل میکنند تا کلمات انتزاعی مثل «زیبا» یا «باکیفیت».
- چیزی که کم دیده، بد میسازد. دست، دندان، متن، و اشیای بسیار خاص در این دستهاند.
بهجای «چه میخواهم؟» بپرسید «اگر این تصویر جلوی من بود، چطور توصیفش میکردم؟» — همان جمله، پرامپت شماست.
ساختار یک پرامپت تصویری
یک توصیف کامل معمولاً شش لایه دارد. لازم نیست همیشه هر ششتا را بنویسید، ولی ترتیبشان مهم است: مدل به کلمات ابتدای پرامپت وزن بیشتری میدهد.
۱. سوژه — چه چیزی در تصویر است
مشخص و ملموس. «یک زن» ضعیف است؛ «زنی میانسال با روسری آبی» تصویر میسازد.
❌ یک آدم
✅ مرد جوان با ریش کوتاه و کاپشن چرم قهوهای
۲. کنش و حالت — دارد چه میکند
ایستاده؟ نشسته؟ به کجا نگاه میکند؟ این لایه بیشترین تأثیر را روی «زنده بودن» تصویر دارد.
❌ مرد جوان با کاپشن چرم
✅ مرد جوان با کاپشن چرم، به پنجره تکیه داده و
به بیرون نگاه میکند، نیمرخ
۳. صحنه و محیط — کجاست
مکان، زمان، آبوهوا، جزئیات پسزمینه. هرچه محیط مشخصتر باشد، تصویر کمتر شناور و بیجا بهنظر میرسد.
... داخل یک کافهی قدیمی با میزهای چوبی،
بیرون پنجره باران میبارد، اواخر پاییز
۴. نور — تعیینکنندهترین لایه
اگر فقط یک لایه را بتوانید اضافه کنید، این را اضافه کنید. نور بیشتر از هر چیز دیگری حس تصویر را میسازد.
| عبارت | چه حسی میسازد | مناسب برای |
|---|---|---|
| نور طلایی ساعت غروب | گرم، نوستالژیک، آرام | پرتره، منظره، برندینگ گرم |
| نور نرم پراکنده روز ابری | خنثی، تمیز، بدون سایهی تند | عکس محصول، پرترهی رسمی |
| نور کناری شدید با سایهی عمیق | دراماتیک، جدی | پرترهی هنری، پوستر |
| نور پشت سوژه (کنترنور) | هالهدار، رؤیایی | عکس احساسی، تبلیغ |
| نئون آبی و صورتی در شب | مدرن، شهری، پرانرژی | سایبرپانک، موسیقی، جوانپسند |
| نور شمع / چراغ گرم کمنور | صمیمی، خصوصی | غذا، فضای داخلی، رستوران |
۵. سبک — با چه زبان بصری
اینجا تعیین میکنید خروجی عکس باشد یا نقاشی یا تصویرسازی. مبهمترین بخش برای تازهکارهاست، پس چند گزینهی امتحانشده:
- عکاسی واقعگرایانه: «عکاسی حرفهای، واقعگرایانه، جزئیات بالا»
- عکس فیلم آنالوگ: «حس فیلم ۳۵ میلیمتری، دانهدانه، رنگهای ملایم»
- تصویرسازی تخت: «تصویرسازی مسطح، رنگهای محدود، بدون سایهی پیچیده»
- آبرنگ: «نقاشی آبرنگ، لبههای نرم، کاغذ بافتدار»
- سهبعدی: «رندر سهبعدی، متریال براق، نورپردازی استودیویی»
- مینیاتور ایرانی: «سبک مینیاتور ایرانی، جزئیات تزئینی، رنگهای لاجوردی و طلایی»
۶. جزئیات فنی — قاب و لنز
اینها به مدل میگویند دوربین کجا ایستاده:
- اندازهی قاب: کلوزآپ / نمای نیمتنه / نمای کامل / نمای باز
- زاویه: همسطح چشم / از پایین / از بالا / زاویهی پرنده
- عمق میدان: «عمق میدان کم، پسزمینهی محو» برای جدا کردن سوژه
- لنز: «۸۵ میلیمتری» برای پرتره، «۲۴ میلیمتری» برای فضای باز
از توصیف ساده تا پرامپت کامل
ببینیم لایهها روی هم چطور جواب میدهند. هدف: تصویری برای صفحهی یک کافه.
نسخه ۱ (خام)
یک عکس از کافه
نسخه ۲ (+ سوژه و صحنه)
داخل یک کافهی کوچک با میزهای چوبی و صندلیهای فلزی
نسخه ۳ (+ نور)
داخل یک کافهی کوچک با میزهای چوبی و صندلیهای فلزی،
نور طلایی عصر از پنجرهی بزرگ میتابد
نسخه ۴ (+ جزئیات حسی)
داخل یک کافهی کوچک با میزهای چوبی و صندلیهای فلزی،
نور طلایی عصر از پنجرهی بزرگ، یک فنجان قهوه با بخار
روی میز جلو، چند گیاه سبز روی طاقچه
نسخه ۵ (+ سبک و فن)
داخل یک کافهی کوچک با میزهای چوبی و صندلیهای فلزی،
نور طلایی عصر از پنجرهی بزرگ، یک فنجان قهوه با بخار
روی میز جلو، چند گیاه سبز روی طاقچه،
عکاسی واقعگرایانه، عمق میدان کم، لنز ۳۵ میلیمتری،
رنگهای گرم، حس آرام و دنج
نسخهی پنجم تقریباً همیشه قابل استفاده است. نسخهی اول تقریباً هیچوقت.
نسبت تصویر را درست انتخاب کنید
این را خیلیها جا میاندازند و بعد مجبور میشوند تصویر را برش بزنند — که یعنی بخشی از ترکیببندی را دور میریزند.
| نسبت | کجا استفاده میشود |
|---|---|
| ۱:۱ (مربع) | پست اینستاگرام، آواتار، آیکون |
| ۴:۵ (عمودی) | پست اینستاگرام با بیشترین فضای اشغالی |
| ۹:۱۶ (کشیدهی عمودی) | استوری، ریلز، شورتس، والپیپر گوشی |
| ۱۶:۹ (افقی) | کاور مقاله، تصویر شاخص سایت، اسلاید |
| ۳:۲ | حس عکاسی کلاسیک، چاپ |
و یک نکتهی مهم: نسبت تصویر روی ترکیببندی اثر میگذارد نه فقط برش. اگر ۹:۱۶ بخواهید، مدل ترکیبی عمودی میسازد — نه اینکه تصویر افقی را ببرد.
هفت مشکل رایج و راهحلشان
۱. دستها و انگشتها خراباند
شایعترین شکایت. دست در دادههای آموزشی معمولاً کوچک، در حرکت، یا نیمهپنهان است، پس مدل ساختار دقیقش را خوب یاد نگرفته.
چه کنیم:
- دست را از کادر بیرون بگذارید: «نمای نیمتنه از شانه به بالا»
- حالت را دقیق بگویید: «دستها در جیب»، «دستها روی فنجان»، «دستها پشت سر گرهخورده»
- چیزی در دستش بگذارید — گرفتن یک شیء، ساختار دست را تثبیت میکند
- چند بار تولید کنید و بهترین را بردارید؛ این کار در عمل سریعتر از تلاش برای پرامپت بینقص است
۲. متن داخل تصویر ناخواناست
برای فارسی، این محدودیت جدی است. حروف فارسی به هم میچسبند و شکلشان بسته به جایگاه عوض میشود؛ مدلهای تصویری این را یاد نگرفتهاند. نتیجه معمولاً چیزی است که شبیه فارسی است ولی خواندنی نیست.
راه درست: تصویر را بدون متن بسازید و نوشته را بعداً اضافه کنید. اگر تابلوی مغازه یا جلد کتاب میخواهید، بنویسید «تابلوی خالی» یا «جلد ساده بدون نوشته».
۳. صورتها عجیب یا تکراریاند
مدلها به سمت «صورت میانگین» میروند. برای شکستن این الگو، مشخصات غیرمعمول اضافه کنید: سن دقیق، ویژگی چهره، حالت.
❌ یک زن ایرانی
✅ زنی حدود ۵۵ ساله، موهای جوگندمی جمعشده،
چینهای خنده کنار چشم، لبخند محو، نگاه به دوربین
۴. تصویر شلوغ و بیتمرکز است
وقتی چیزهای زیادی میخواهید، مدل همه را میچپاند. یک سوژهی اصلی انتخاب کنید و بقیه را به پسزمینه بفرستید: «تمرکز روی [X]، بقیهی صحنه محو».
۵. سبک ثابت نمیماند
اگر چند تصویر برای یک مجموعه میسازید، بخش سبک و نور را عیناً در همهی پرامپتها تکرار کنید و فقط سوژه را عوض کنید. کوچکترین تغییر در توصیف سبک، نتیجه را جابهجا میکند.
[قالب ثابت]
... ، تصویرسازی مسطح، پالت نارنجی و آبی نفتی،
خطوط ساده، بدون بافت، پسزمینهی کرم یکدست
[فقط این بخش عوض میشود]
یک فنجان قهوه ← یک کتاب باز ← یک گلدان کوچک
۶. اندامها غیرطبیعیاند
معمولاً وقتی پیش میآید که حرکت پیچیده یا زاویهی نامتعارف خواسته باشید. حالتهای سادهتر (ایستاده، نشسته، نیمرخ) بسیار پایدارترند از حالتهای پویا (در حال پرش، چرخش).
۷. تصویر «ایرانی» بهنظر نمیرسد
مدلها بیشتر با دادههای غربی آموزش دیدهاند. اگر فضای ایرانی میخواهید، جزئیات فرهنگی مشخص بدهید:
بهجای «یک خانه»:
حیاط خانهی سنتی ایرانی، حوض آبیکاشی وسط،
درخت انار، پنجرههای ارسی رنگی، آجرکاری
بهجای «یک بازار»:
راستهی بازار سنتی با سقف طاقی آجری،
نور از روزنههای سقف، بساط ادویه و خشکبار
ده پرامپت آماده برای کارهای پرتکرار
۱) عکس محصول
[محصول] روی سطح سنگی روشن، پسزمینهی خنثی،
نور نرم استودیویی از دو طرف، سایهی ملایم،
عکاسی تجاری، جزئیات بالا، نسبت ۱:۱
۲) پرترهی حرفهای لینکدین
پرترهی نیمتنه، پسزمینهی خاکستری محو،
نور نرم از جلو، لبخند طبیعی، لباس رسمی ساده،
عکاسی حرفهای، عمق میدان کم، نسبت ۴:۵
۳) کاور مقاله
تصویرسازی مفهومی از [موضوع]، سبک مسطح مدرن،
پالت دو رنگ، فضای خالی در سمت راست برای متن،
بدون نوشته، نسبت ۱۶:۹
۴) عکس غذا
[غذا] در ظرف سفالی، نمای از بالا ۴۵ درجه،
نور طبیعی کناری، بخار ملایم، چند مادهی اولیه
پراکنده دور ظرف، رنگهای گرم، نسبت ۴:۵
۵) پسزمینهی انتزاعی
گرادیان نرم [رنگ] تا [رنگ]، اشکال ارگانیک محو،
بدون سوژهی مشخص، مناسب پسزمینهی متن، نسبت ۱۶:۹
۶) شخصیت تصویرسازیشده
شخصیت [توصیف] با سبک تصویرسازی کتاب کودک،
خطوط گرد و نرم، رنگهای شاد، پسزمینهی ساده
۷) منظره
[مکان] در [فصل]، نور [زمان روز]، آسمان [حالت]،
عمق میدان زیاد، جزئیات بالا، نسبت ۱۶:۹
۸) استوری اینستاگرام
[سوژه] در مرکز پایین کادر، دوسوم بالای تصویر
فضای خالی برای متن، نور روشن، نسبت ۹:۱۶
۹) آیکون / نماد
نماد سادهی [مفهوم]، سبک خطی، ضخامت یکنواخت،
تکرنگ، پسزمینهی شفاف، مینیمال
۱۰) فضای داخلی
اتاق [نوع] با سبک [سبک]، نور طبیعی از پنجرهی چپ،
مبلمان [توصیف]، حس [احساس]، نمای وسیع، نسبت ۳:۲
ویرایش تصویر: کاری که کمتر شناخته شده
خیلیها فقط از تولید استفاده میکنند و نمیدانند میشود تصویر موجود را هم به هوش مصنوعی داد و تغییرش داد. این معمولاً سریعتر به نتیجه میرسد تا ساختن از صفر.
کارهایی که خوب جواب میدهند:
- حذف شیء: «سیم برق را از آسمان حذف کن»
- تعویض پسزمینه: «پسزمینه را به دیوار آجری تغییر بده، سوژه دستنخورده بماند»
- تغییر نور: «نور را به غروب گرم تبدیل کن»
- گسترش کادر: وقتی تصویر برای نسبت مورد نیازتان کوتاه است
- تغییر رنگ یک جزء: «رنگ کاپشن را از قرمز به سبز زیتونی عوض کن»
ویرایش چهرهی افراد واقعی — مخصوصاً برای ساختن صحنهای که اتفاق نیفتاده — هم از نظر اخلاقی و هم حقوقی مسئلهساز است. اگر عکس شخص دیگری است، رضایتش را داشته باشید.
حق نشر، اخلاق و مرزها
این بخش خشک است ولی خواندنش بهتر از دردسر بعدی است.
مالکیت تصویر
قوانین کشورها متفاوت است و هنوز در حال شکلگرفتن. در آمریکا دفتر حق نشر گفته اثری که کاملاً ماشین ساخته، قابل ثبت نیست. در ایران چارچوب مشخصی هنوز تدوین نشده. عملاً برای بیشتر استفادههای تجاری کوچک مشکلی پیش نمیآید، ولی روی آن بهعنوان دارایی انحصاری حساب نکنید.
سه چیزی که بهتر است نسازید
- چهرهی افراد واقعی در موقعیتهای ساختگی — مخصوصاً چهرههای شناختهشده. این جدیترین ریسک است.
- لوگو و شخصیتهای برندها. «کاراکتر فلان انیمیشن» یعنی استفاده از دارایی ثبتشدهی یک شرکت.
- تقلید مستقیم سبک هنرمند زنده. «به سبک [نام هنرمند معاصر]» هم اخلاقاً و هم حقوقاً محل بحث است. بهجایش سبک را توصیف کنید نه نام ببرید.
شفافیت
اگر تصویر را جایی منتشر میکنید که مخاطب ممکن است فکر کند عکس واقعی است — خبر، گزارش، شهادت مشتری — بگویید ساختهی هوش مصنوعی است. این هم درستتر است و هم اعتماد را حفظ میکند.
ساخت عکس در نارنگی
اگر با نارنگی کار میکنید:
- فارسی بنویسید. ترجمهی بهینهشده پشت صحنه انجام میشود و لازم نیست انگلیسی بلد باشید.
- در حالت هوشمند، لازم نیست بگویید «عکس بساز» — از متن درخواستتان تشخیص داده میشود.
- برای ویرایش، تصویر را بفرستید و بگویید چه تغییری میخواهید.
- هزینه بر اساس نوع مدل متفاوت است؛ پیش از ساخت، مقدارش نمایش داده میشود.
- تصویرهای ساختهشده در گالری میمانند و میتوانید دوباره دانلودشان کنید.
تمرین: یک ساعت که سطحتان را عوض میکند
بهجای خواندن بیشتر، این را انجام دهید:
- یک سوژه انتخاب کنید — مثلاً «یک فنجان چای».
- پنج نسخه بسازید که فقط نور در آنها فرق کند (طلایی غروب، ابری، نئون شب، شمع، نور سخت ظهر).
- پنج نسخه بسازید که فقط سبک فرق کند (عکاسی، آبرنگ، سهبعدی، تصویرسازی مسطح، مینیاتور).
- پنج نسخه بسازید که فقط قاب فرق کند (کلوزآپ تا نمای باز).
بعد از این پانزده تصویر، بدون اینکه چیزی حفظ کرده باشید، میدانید کدام کلمه چه کاری میکند. این از هر مقالهای — از جمله همین یکی — بیشتر یاد میدهد.
جمعبندی
ساخت عکس با هوش مصنوعی مهارت نوشتن است، نه مهارت طراحی. کسی که میتواند یک صحنه را دقیق توصیف کند، تصویر بهتری میگیرد از کسی که فتوشاپ بلد است ولی مبهم مینویسد.
و مثل هر مهارتی، اولین ده تصویرتان بد خواهد بود. این طبیعی است — نه نشانهی ضعف ابزار.
برای ادامه:
- پرامپتنویسی فارسی: از جوابهای بیربط تا خروجی دقیق
- طراحی لوگو با هوش مصنوعی
- ساخت ویدیو با هوش مصنوعی
برای مطالعهی بیشتر دربارهی نحوهی کار مدلهای انتشاری، توضیح تصویری Diffusion Explainer منبع خوبی است.