تبدیل PDF و تصویر به اکسل با کمک هوش مصنوعی

صورتحساب، گزارش بانکی و لیست قیمتی که فقط به‌صورت PDF دارید را می‌شود به جدول قابل ویرایش تبدیل کرد. روش، ابزار، و جاهایی که خروجی را نباید باور کنید.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
تبدیل جدول یک فایل PDF به صفحه‌گسترده‌ی قابل ویرایش

یک حسابدار، صورت‌حساب بانکی سه‌ماهه را به‌صورت PDF می‌گیرد. چهارصد سطر تراکنش که باید در اکسل دسته‌بندی شود. کپی‌کردن جواب نمی‌دهد — ستون‌ها به هم می‌ریزند، تاریخ‌ها می‌چسبند، و بعد از بیست دقیقه هنوز سطر شصتم است.

این مسئله راه‌حل دارد و راه‌حلش هم پیچیده نیست. ولی یک تله دارد که اگر به آن برخورد نکنید، بعداً گران تمام می‌شود: خروجی گاهی مرتب و اشتباه است. جدول تمیزی می‌گیرید که سه سطرش جا افتاده و شما متوجه نمی‌شوید.

اول بفهمید با کدام نوع PDF طرفید

یک آزمون دو ثانیه‌ای: فایل را باز کنید و سعی کنید متنی از آن را با موس انتخاب کنید.

اگر انتخاب می‌شود، فایل PDF متنی است. داده واقعاً در فایل هست و استخراجش تقریباً بدون خطا انجام می‌شود. صورت‌حساب بانکی، فاکتور رسمی و گزارش‌های سامانه‌ای معمولاً از این نوع‌اند.

اگر انتخاب نمی‌شود، آنچه می‌بینید عکس است. اینجا اول باید متن از تصویر خوانده شود، و همان‌جاست که خطا وارد می‌شود — به‌خصوص در فارسی. جزئیات این مرحله را در تبدیل عکس به متن فارسی نوشته‌ایم.

روشی که در عمل جواب می‌دهد

فایل را پیوست کنید و به‌جای «این را به اکسل تبدیل کن»، دقیق بگویید چه می‌خواهید:

از فایل پیوست، جدول تراکنش‌ها را استخراج کن.

خروجی: CSV با جداکننده‌ی کاما، ستون‌ها دقیقاً به این ترتیب:
تاریخ | شرح | بدهکار | بستانکار | مانده

قواعد:
— همه‌ی ارقام فارسی و عربی را به لاتین تبدیل کن
— جداکننده‌ی هزارگان (کاما یا نقطه) را از اعداد حذف کن
— تاریخ‌ها را به شکل YYYY/MM/DD بنویس، شمسی بمانند
— سلول خالی را خالی بگذار، صفر نگذار
— هیچ سطری را خلاصه یا ادغام نکن
— در آخر تعداد سطرها و جمع ستون بدهکار را بنویس

فقط CSV و آن دو عدد را بده، بدون توضیح.

خط آخر — گزارش تعداد سطر و جمع ستون — همان چیزی است که این روش را از حدس‌زدن جدا می‌کند.

⚠️ همیشه جمع بزنید

قبل از استفاده از خروجی، جمع یک ستون عددی را در اکسل حساب کنید و با جمع همان ستون در فایل اصلی مقایسه کنید. اگر فایل اصلی جمع ندارد، ماشین‌حساب بردارید. این کار دو دقیقه وقت می‌برد و تنها راه کشف سطرِ جا‌افتاده است. خروجیِ مرتب لزوماً خروجیِ کامل نیست.

مشکل مخصوص فارسی: عدد، تاریخ، جهت

سه چیز است که در فایل‌های فارسی مدام دردسر می‌سازد:

  • ارقام فارسی. «۱۲۳» و «123» از نظر رایانه یکی نیستند. اکسل اولی را متن می‌بیند و جمع نمی‌زند. تبدیل به لاتین را صریح بخواهید.
  • تاریخ شمسی. اکسل تاریخ شمسی را نمی‌شناسد. اگر می‌خواهید مرتب‌سازی کار کند، قالب YYYY/MM/DD را نگه دارید تا مرتب‌سازی متنی هم درست از آب دربیاید.
  • جهت متن. وقتی متن راست‌به‌چپ با عدد چپ‌به‌راست مخلوط می‌شود، ترتیب نمایش گاهی با ترتیب واقعی کاراکترها فرق می‌کند. اگر عددی عجیب به‌نظر رسید، در نوار فرمول اکسل نگاهش کنید نه در سلول.

کدام روش برای کدام فایل

نوع فایلبهترین روشخطای محتمل
PDF متنی، جدول سادهپیوست فایل + پرامپت بالاکم
PDF متنی، جدول چندصفحه‌ایصفحه‌به‌صفحه، ده‌تا ده‌تاجا‌افتادن سطر در مرز صفحه
عکس گرفته‌شده با موبایلاول صاف و روشن کردن، بعد استخراجاشتباه در ارقام مشابه
اسکن قدیمی و کم‌کیفیتابزار OCR اختصاصی، بعد بازبینی دستیزیاد — بازبینی کامل لازم است
PDF با سلول‌های ادغام‌شدهدستی، یا بازطراحی جدولساختار به‌هم می‌ریزد
داده‌ی حساس مالیابزار محلی روی رایانه‌ی خودتانریسک محرمانگی

برای فایل‌های متنی و ساختاریافته، ابزار رایگان Tabula روی رایانه‌ی خودتان اجرا می‌شود و هیچ داده‌ای جایی نمی‌فرستد. برای فایل‌های به‌هم‌ریخته و اسکن‌شده، مدل‌های زبانی معمولاً بهتر عمل می‌کنند چون ساختار را حدس می‌زنند.

کجا شکست می‌خورد

سه موقعیت هست که هنوز به‌سختی جواب می‌دهد و بهتر است انتظار معجزه نداشته باشید:

سلول‌های ادغام‌شده و سرستون‌های دوطبقه. جدولی که سرستونش دو ردیف است و بعضی سلول‌هایش روی چند ستون کشیده شده، هیچ نگاشت یکتایی به CSV ندارد. اینجا مدل مجبور است تصمیم بگیرد و تصمیمش معمولاً با تصمیم شما یکی نیست.

جدول‌های بدون خط. وقتی جدول فقط با فاصله ساخته شده، تشخیص مرز ستون‌ها حدسی است. اگر یک سلول خالی باشد، ستون‌ها یکی به چپ می‌لغزند.

دست‌خط. فرم‌های دست‌نویس فارسی هنوز نتیجه‌ی قابل اتکایی نمی‌دهند. مخصوصاً اعداد.

بعد از اینکه داده در اکسل نشست

استخراج نصف کار است. اگر می‌خواهید از داده چیزی بفهمید، نه فقط ذخیره‌اش کنید، روش‌های تحلیل داده با هوش مصنوعی ادامه‌ی طبیعی این مسیر است. برای کارهای دوره‌ای حسابداری هم راهنمای هوش مصنوعی برای حسابداران سناریوهای مشخص‌تری دارد. و اگر داده‌ی موردنظرتان اصلاً در فایل نیست بلکه در یک صفحه‌ی وب است، استخراج داده از سایت مسیر دیگری است.

جمع‌بندی

تبدیل PDF به اکسل از آن کارهایی است که هوش مصنوعی واقعاً وقت‌گیری‌اش را حذف می‌کند — نه صد درصد، ولی به‌اندازه‌ای که ارزشش را داشته باشد. شرطش یک عادت است: هر بار جمع ستون‌ها را چک کنید.

اگر این کار را ماهی چند بار انجام می‌دهید، پرامپت بالا را یک‌جا ذخیره کنید و هر بار همان را با فایل جدید در نارنگی استفاده کنید. خروجیِ یکدست، بررسی را هم ساده‌تر می‌کند.

مطالب مرتبط:

پرسش‌های پرتکرار

فرق PDF متنی و PDF اسکن‌شده چیست و چرا مهم است؟ +
اگر بتوانید در فایل متن را با موس انتخاب کنید، PDF متنی است و داده‌اش دقیق استخراج می‌شود. اگر انتخاب نمی‌شود، فایل در واقع یک تصویر است و باید اول OCR شود — و آنجاست که خطای خواندن اعداد شروع می‌شود.
خروجی هوش مصنوعی برای جدول‌های مالی قابل اعتماد است؟ +
به‌عنوان پیش‌نویس بله، به‌عنوان سند نهایی نه. همیشه جمع ستون‌های عددی خروجی را با جمع همان ستون در فایل اصلی مقایسه کنید. اگر برابر نبود، یک سطر جا افتاده یا یک عدد اشتباه خوانده شده است.
چرا اعداد فارسی گاهی به‌هم می‌ریزند؟ +
چون ارقام فارسی (۱۲۳) با ارقام لاتین (123) کاراکترهای متفاوتی هستند و اکسل ارقام فارسی را متن می‌بیند نه عدد. در پرامپت صریح بخواهید همه‌ی ارقام به لاتین تبدیل و جداکننده‌ی هزارگان حذف شود.
برای فایل‌های خیلی بزرگ چه کنم؟ +
صفحه‌به‌صفحه جلو بروید. وقتی یک فایل صدصفحه‌ای را یک‌جا می‌دهید، احتمال جا‌افتادن سطر بالا می‌رود و متوجهش هم نمی‌شوید. ده صفحه در هر مرحله، با بررسی جمع ستون‌ها بعد از هر مرحله، مطمئن‌تر است.
آیا فرستادن صورتحساب شرکت به هوش مصنوعی مشکل دارد؟ +
بستگی به محتوای آن دارد. اگر نام مشتری، شماره حساب یا اطلاعات قرارداد در فایل هست، آن ستون‌ها را قبل از ارسال حذف کنید. برای داده‌ی حساس، بهترین کار استفاده از ابزار محلی روی رایانه‌ی خودتان است.
#تبدیل PDF به اکسل #استخراج جدول از PDF #تبدیل عکس به اکسل #صورتحساب به اکسل #استخراج داده
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است