مدل چندوجهی چیست؟ وقتی هوش مصنوعی عکس را می‌فهمد

عکس قبض برق را می‌فرستید و می‌پرسید چرا این‌قدر شده. اینکه ماشین هم‌زمان تصویر و سؤال شما را بفهمد، تفاوت اصلی نسل تازه‌ی مدل‌هاست.

🍊 تیم نارنگی ⏱ 4 دقیقه مطالعه
گوشی که عکس یک قبض را نشان می‌دهد و پاسخ تحلیلی کنارش

قبض برق دو برابر شده. عکسش را می‌گیرید، می‌فرستید، و می‌پرسید «چرا این‌قدر شده و کدام بخشش قابل کم‌کردن است؟» جوابی که می‌گیرید هم اعداد قبض را خوانده، هم فهمیده کدام ردیف پلکان مصرف است، و هم سؤال شما را در نظر گرفته.

چند سال پیش این کار سه ابزار جدا می‌خواست: یکی برای خواندن متن از تصویر، یکی برای فهمیدن ساختار قبض، یکی برای جواب دادن. حالا یک مدل هر سه را می‌کند. اسم این توانایی، مدل چندوجهی است.

چندوجهی یعنی چه

هر نوع ورودی — متن، تصویر، صدا، ویدیو — یک «وجه» یا مُد است. مدل تک‌وجهی فقط متن می‌گیرد و متن می‌دهد. مدل چندوجهی چند نوع ورودی را هم‌زمان و در یک فضای مشترک پردازش می‌کند.

نکته‌ی مهم همان «هم‌زمان» است. مدل تصویر را به متن ترجمه نمی‌کند تا بعد بخواندش؛ تصویر و متن هر دو به شکل واحدی از عدد تبدیل می‌شوند و کنار هم می‌نشینند. برای همین می‌توانید بگویید «در این عکس، چیزی که گوشه‌ی چپ است با آنچه در متن سؤالم گفتم جور درمی‌آید؟» — سؤالی که با ابزارهای جدا اصلاً قابل پرسیدن نبود. مبانی این تبدیل را در مقاله‌ی نحوه‌ی کار مدل‌ها باز کرده‌ایم.

تفاوت با OCR

این دو را زیاد اشتباه می‌گیرند. تفاوتشان در هدف است:

معیارOCR اختصاصیمدل چندوجهی
کارش چیستبیرون‌کشیدن حروففهمیدن کل تصویر
خروجیمتن خامجواب، خلاصه، تحلیل
دقت روی متن انبوهبالاترپایین‌تر
درک چیدمان و بافتمحدودخوب
هزینه برای ۵۰۰ صفحهکمتربیشتر
پاسخ به سؤال درباره‌ی تصویرندارددارد

پس اگر می‌خواهید یک کتاب اسکن‌شده را به متن تبدیل کنید، سراغ روش‌های تبدیل عکس به متن فارسی بروید. اگر می‌خواهید از یک صفحه سؤال بپرسید، مدل چندوجهی درست‌تر است.

کجا واقعاً به‌درد می‌خورد

کاربردهایی که در عمل بیشترین ارزش را دارند، همان‌هایی هستند که «توضیح‌دادن با کلمه» سخت است:

  • خطای روی صفحه — عکس ارور را بفرستید به‌جای تایپ‌کردنش. کل بافت پنجره هم منتقل می‌شود.
  • عکس یک دستگاه یا قطعه — وقتی نمی‌دانید اسمش چیست، توصیفش هم ممکن نیست.
  • نمودار و اسکرین‌شات داشبورد — برای فهمیدن روند کلی، نه خواندن عدد دقیق.
  • عکس یک صفحه از کتاب — سؤال‌پرسیدن درباره‌ی همان پاراگراف بدون تایپ‌کردنش.
  • عکس محصول — نوشتن توضیح فروشگاهی از روی خود تصویر.
💡 پرامپت تصویری خوب

فقط عکس نفرستید. بگویید عکس چیست، از کجا آمده، و دقیقاً چه می‌خواهید. «این اسکرین‌شات پنل فروشگاه من است؛ فقط بگو کدام سه محصول بیشترین برگشتی را دارند» خیلی بهتر از «این را بررسی کن» جواب می‌دهد.

جایی که اشتباه می‌کند

سه ضعف مشخص و تکرارشونده دارد و بهتر است از قبل بدانید:

عدد دقیق. خواندن رقم از جدول فشرده یا نمودار میله‌ای، بیشترین خطا را دارد. مدل روند را می‌فهمد ولی گاهی عدد را حدس می‌زند و با همان اطمینان همیشگی می‌گوید.

شمارش. «چند نفر در این عکس هستند» یا «چند قلم در فاکتور آمده» را روی تصاویر شلوغ اشتباه جواب می‌دهد.

جزئیات ریز و متن کوچک. اگر عکس کم‌کیفیت یا کج باشد، حروف نزدیک به هم فارسی راحت جابه‌جا خوانده می‌شوند. عکس را صاف، نزدیک و در نور خوب بگیرید.

صدا و ویدیو

وجه صوتی هم به همین منطق اضافه شده: می‌شود فایل صدا داد و خلاصه یا نکته‌های اصلی گرفت. برای فارسی، کیفیت به وضوح ضبط و لهجه حساس است. جزئیات این بخش را در مقاله‌ی گفتار و متن نوشته‌ایم.

ویدیو معمولاً با نمونه‌برداری از فریم‌ها پردازش می‌شود. یعنی موضوع کلی را می‌گیرد ولی اتفاق کوتاهی که بین دو فریم نمونه‌برداری‌شده افتاده را نمی‌بیند.

کدام مدل‌ها این توانایی را دارند

نسخه‌های امروزی سه خانواده‌ی اصلی — GPT، Gemini و Claude — همه ورودی تصویری دارند، با تفاوت‌هایی در دقت و محدودیت اندازه‌ی فایل. مقایسه‌ی کاربردی‌شان در مقایسه‌ی چت‌جی‌پی‌تی، جمینای و کلاد آمده است. برای مرور مفاهیم پایه، چت‌جی‌پی‌تی چیست نقطه‌ی شروع مناسبی است.

مستندات فنی بینایی در Gemini و راهنمای تصویر OpenAI محدودیت‌های دقیق هر کدام را فهرست کرده‌اند.

یک آزمایش پنج‌دقیقه‌ای

از یک صفحه‌ی کاغذی که جلوی دستتان است عکس بگیرید — قبض، فاکتور، فرم — و سه سؤال بپرسید: یکی درباره‌ی محتوا، یکی درباره‌ی یک عدد مشخص، یکی درباره‌ی چیزی که در تصویر نیست. جواب سوم به شما نشان می‌دهد این مدل کجا کم می‌آورد. در نارنگی می‌توانید همین حالا امتحان کنید.

جمع‌بندی

چندوجهی‌بودن یک قابلیت تزئینی نیست؛ ورودی‌ای را ممکن کرده که قبلاً وجود نداشت. خیلی وقت‌ها توصیف چیزی که می‌بینید از خودِ نشان‌دادنش سخت‌تر است، و همین یک قدم، کار را از تایپ‌کردن نجات می‌دهد.

ولی یک عادت را نگه دارید: هر عددی که از تصویر بیرون می‌آید مشکوک است تا وقتی خودتان ببینید. برای فهمیدن، اعتماد کنید؛ برای عدد، بررسی کنید.

مطالب مرتبط:

پرسش‌های پرتکرار

مدل چندوجهی با OCR چه فرقی دارد؟ +
OCR فقط حروف را از تصویر بیرون می‌کشد و کاری به معنایشان ندارد. مدل چندوجهی هم متن را می‌خواند و هم می‌فهمد در چه بافتی نشسته — که این عدد قیمت است یا شماره‌ی فاکتور، و اینکه چیدمان صفحه چه می‌گوید. برای استخراج انبوه متن، OCR اختصاصی هنوز دقیق‌تر و ارزان‌تر است.
می‌توانم عکس دست‌خط فارسی بدهم و بخواهم بخواند؟ +
برای دست‌خط خوانا و مرتب معمولاً جواب می‌دهد، برای دست‌خط شکسته و تندنویسی نه. فارسی به‌دلیل چسبیدن حروف و نقطه‌های نزدیک، از انگلیسی سخت‌تر است. هر خروجی را قبل از استفاده بخوانید؛ خطاها معمولاً در عدد و اسم خاص رخ می‌دهند.
آیا اعداد داخل جدول و نمودار را درست می‌خواند؟ +
این ضعیف‌ترین بخش کار است. مدل معمولاً روند کلی نمودار را درست توصیف می‌کند ولی وقتی می‌خواهد عدد دقیق یک ستون را بگوید، گاهی رقم می‌سازد. اگر عدد مهم است، حتماً با فایل اصلی مقایسه کنید یا داده را متنی بدهید.
فرستادن عکس مدارک و اسناد شخصی امن است؟ +
همان قاعده‌ی متن اینجا هم برقرار است: چیزی را که نمی‌خواهید جای دیگری ذخیره شود نفرستید. کارت ملی، شناسنامه، فیش حقوقی و مدارک بانکی را ارسال نکنید. اگر ناچارید بخشی از یک سند را بپرسید، قسمت‌های شناسایی‌کننده را بپوشانید.
برای ویدیو هم کار می‌کند؟ +
بعضی مدل‌ها بله، ولی معمولاً با نمونه‌برداری از فریم‌ها و نه دیدن پیوسته. یعنی برای فهمیدن موضوع کلی یک ویدیو خوب است و برای پیداکردن لحظه‌ی دقیق یک اتفاق کوتاه قابل اعتماد نیست.
#مدل چندوجهی #مالتی مودال #درک تصویر #بینایی ماشین #هوش مصنوعی تصویری
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است