تبدیل عکس به متن فارسی (OCR): از عکس کتاب تا متن قابل ویرایش
تشخیص متن فارسی از عکس، سختتر از انگلیسی است و کیفیت عکس بیشتر از انتخاب ابزار اهمیت دارد. این راهنما نشان میدهد چطور عکس بگیرید و چطور خروجی را تصحیح کنید.
میخواهید یک صفحه از کتاب را تایپ کنید، یا فاکتوری را وارد اکسل کنید، یا از یک جزوهی اسکنشده متن دربیاورید. کاری که دستی نیم ساعت طول میکشد، در چند ثانیه انجام میشود.
البته اگر عکس درست باشد. و این «اگر» بزرگتر از چیزی است که فکر میکنید — کیفیت عکس معمولاً بیشتر از انتخاب ابزار روی نتیجه اثر میگذارد.
چرا فارسی سختتر است
سه دلیل ساختاری:
- حروف به هم میچسبند و شکلشان بسته به جایگاه در کلمه عوض میشود. «ه» در ابتدا، وسط و آخر سه شکل متفاوت دارد.
- نقطهها تعیینکنندهاند. ب، پ، ت، ث فقط در نقطه فرق دارند. یک لکه یا سایه، حرف را عوض میکند.
- دادهی آموزشی کمتر است — بهخصوص برای فونتهای قدیمی و کتابهای چاپ سربی.
عکس خوب: پنج قاعده
این بخش بیشترین تأثیر را روی نتیجه دارد. اگر فقط یک بخش را اجرا کنید، این را انتخاب کنید.
- نور یکنواخت. کنار پنجره در روز، بدون آفتاب مستقیم. سایهی دست یا گوشی روی صفحه، شایعترین خرابکار است.
- موازی و صاف. دوربین دقیقاً روبهروی صفحه، نه با زاویه. اگر کاغذ خمیده است، صافش کنید.
- پر کردن کادر. فقط متن در کادر باشد، نه میز و دست و اطراف.
- فوکوس دقیق. روی متن ضربه بزنید تا فوکوس کند. تاری جزئی، نقطهها را از بین میبرد.
- بخشبخش برای متن ریز. یک عکس از کل صفحهی ریزنویس، بدتر از سه عکس از سه بخش است.
عکس را روی گوشی بزرگ کنید. اگر خودتان نقطههای حروف را بهسختی تشخیص میدهید، ماشین هم نمیتواند. دوباره بگیرید.
پرامپتهای استخراج
۱) استخراج ساده
متن این تصویر را دقیقاً استخراج کن.
- چیزی اضافه یا تفسیر نکن
- ساختار پاراگرافها را حفظ کن
- اگر جایی ناخوانا بود، بهجای حدسزدن
بنویس [ناخوانا]
۲) استخراج جدول
جدول این تصویر را استخراج کن و بهصورت
جدول با همان ستونها بده.
اگر سلولی خالی است، خالی بگذار — پر نکن.
۳) فاکتور و رسید
از این تصویر استخراج کن:
تاریخ، شماره، اقلام (نام، تعداد، قیمت واحد، جمع)،
جمع کل.
خروجی: جدول.
اگر عددی مبهم بود علامت بزن، حدس نزن.
۴) استخراج + تصحیح
متن این تصویر را استخراج کن.
بعد جداگانه فهرست کن کجاها احتمال خطای
تشخیص هست (کلمات عجیب، اعداد مشکوک)
تا خودم بررسی کنم.
۵) متن + ترجمه
متن این تصویر را استخراج کن و
بعد ترجمهاش را بده. اول متن اصلی،
بعد ترجمه — جدا از هم.
شمارهی چهارم را جدی بگیرید: مدل معمولاً خودش میداند کجا مطمئن نبوده، ولی اگر نپرسید نمیگوید.
خطاهای رایج فارسی
| خطا | مثال | چه کنیم |
|---|---|---|
| جابهجایی حروف نقطهدار | بیمار ← نیمار | عکس واضحتر؛ بازخوانی متن |
| قاطیشدن ارقام فارسی و لاتین | ۵ ← 0 | همهی اعداد را دستی بررسی کنید |
| چسبیدن یا جداشدن کلمات | میروم ← میروم | بخواهید نیمفاصله را اصلاح کند |
| حذف اعراب و تشدید | مُعلّم ← معلم | معمولاً مشکلی نیست مگر متن دینی/شعر |
| بههمریختن ترتیب در متن دوستونه | سطرها قاطی میشوند | هر ستون را جدا عکس بگیرید |
| خواندن شمارهی صفحه و سرصفحه | وسط متن ظاهر میشود | بگویید سرصفحه و پاورقی را نیاورد |
PDF اسکنشده
اول تشخیص دهید با چه چیزی طرفید: PDF را باز کنید و سعی کنید متنی را انتخاب کنید.
- متن انتخاب میشود → PDF متنی است، OCR لازم ندارید. مستقیم به هوش مصنوعی بدهید.
- انتخاب نمیشود → مجموعهای از عکس است. باید صفحهبهصفحه استخراج شود.
برای اسناد چندصفحهای، صفحهبهصفحه پیش بروید. فرستادن بیست صفحه یکجا، کیفیت را پایین میآورد و خطاها را پنهان میکند.
تصحیح خروجی
این متن از روی عکس استخراج شده و ممکن است
خطای تشخیص داشته باشد.
- کلماتی که در فارسی معنا ندارند را اصلاح کن
- نیمفاصلهها را درست کن
- اعداد را دست نزن — فقط علامت بزن کدام مشکوک است
- ساختار متن را عوض نکن، فقط خطاها را بگیر
- در پایان فهرست کن چه چیزهایی را تغییر دادی
---
[متن استخراجشده]
آن مورد سوم مهم است: مدل نباید عدد را «تصحیح» کند، چون هیچ راهی برای دانستن عدد درست ندارد و ممکن است عددی منطقیتر ولی اشتباه بگذارد.
برای قرارداد، سند مالی و مدرک رسمی، خروجی OCR را بدون بازخوانی کامل استفاده نکنید. یک رقم اشتباه در مبلغ، مشکل بزرگی است.
در نارنگی
در نارنگی کافی است عکس را بفرستید و بگویید چه میخواهید — متن کامل، فقط جدول، یا استخراج و خلاصه. برای PDF هم میتوانید فایل را مستقیم پیوست کنید.
جمعبندی
دو چیز بیشترین تأثیر را دارند: کیفیت عکس، و بازبینی اعداد. اگر این دو را رعایت کنید، بقیهاش تقریباً همیشه درست درمیآید.
مطالب مرتبط: