محدودیتهای فارسی در هوش مصنوعی و راه دور زدنشان
هشت جایی که فارسی هنوز شهروند درجهی دو است — از هزینهی توکن و نیمفاصله تا تاریخ شمسی و لهجه در صوت — و برای هرکدام یک راه عملی که همین امروز جواب میدهد.
یک قرارداد فارسی و ترجمهی انگلیسیاش را به یک مدل بدهید و صورتحساب را ببینید. نسخهی فارسی گرانتر تمام شده؛ همان معنا، همان مدل، هزینهی بیشتر. این تنها جایی نیست که فارسی عقب میماند، فقط قابلاندازهگیریترینش است.
بقیه آرامترند: اصطلاحی که غلط برگردانده میشود، تاریخی که یک روز جابهجا میافتد، اسمی که وسط جمله میشکند. خطای فاحش نیستند و دقیقاً برای همین از زیر چشم رد میشوند.
هشتتا هستند. هرکدام یک دور زدن مشخص دارد که همین امروز میشود اجرا کرد.
۱. هزینهی توکن
مدل متن را کلمهبهکلمه نمیبیند؛ به قطعههایی بهنام توکن میشکندش و فهرست این قطعهها عمدتاً روی انگلیسی ساخته شده. یک واژهی انگلیسی اغلب یک توکن است و یک واژهی فارسی چند تا. نتیجه: پنجرهی زمینه زودتر پر میشود، جواب بریده میشود و صورتحساب API بالا میرود. جزئیاتش در توکن چیست و چرا فارسی گرانتر تمام میشود باز شده و پایهی فنیاش الگوریتم BPE است.
چارهاش ساده است: دستور سیستمی و قالبهای ثابت را انگلیسی بنویسید و فقط محتوا را فارسی بدهید. سند بلند را تکه کنید و خروجی را فهرستوار بخواهید.
۲. دادهی آموزشی کم و اصطلاح تخصصی
سهم فارسی از دادهی آموزشی این مدلها کوچک است. فارسی عمومی را خوب میفهمند، اما در واژگان تخصصی لغزش شروع میشود: «ودیعه» را رهن مینویسد، «سند حسابداری» را با سند ملکی اشتباه میگیرد، و معادل انگلیسی را تحتاللفظی برمیگرداند.
کاری که جواب میدهد واژهنامه است: ده تا پانزده اصطلاح کلیدی با معادل دقیق در ابتدای پرامپت، با قید اینکه ثابتاند. همین یک بند بیشتر از عوض کردن مدل اثر دارد؛ منطقش در ترجمه با هوش مصنوعی باز شده.
۳. نیمفاصله و «ي» و «ك» عربی
متنی که از ورد یا یک سایت قدیمی کپی میشود آلوده است: «ي» و «ك» عربی، نیمفاصلهی جاافتاده در «می شود»، و اعداد در سه شکل مختلف.
معنا معمولاً از دست نمیرود؛ مدل «می شود» را هم میفهمد. خرابی یک لایه پایینتر است. این دو رشتهی یکسانی نیستند، پس جستوجوی دقیق نتیجه نمیدهد، تطبیق با پایگاه داده ردیفی پیدا نمیکند و خروجی خود مدل بین دو شکل نوسان میکند. این نویسهی نامرئی در مدخل نیمفاصله توضیح داده شده.
راه دور زدن: پیش از ارسال یکدستسازی کنید — ي به ی، ك به ک، اعداد به یک شکل. اگر برنامهنویس نیستید، همین را اولین بند پرامپت بگذارید.
۴. تاریخ شمسی و تبدیل نادرست
اینجا ابزار با اطمینان اشتباه میکند و همین خطرناکش میکند. «۱۴ مرداد ۱۴۰۵» را به میلادی برمیگرداند و گاهی یک روز جلو یا عقب میافتد. بدتر، «چهارشنبهی هفتهی بعد» را نسبت به تاریخی حساب میکند که خودش تصور میکند امروز است.
در هر پرامپتی که تاریخ نقش دارد — قرارداد، فاکتور، سررسید پرداخت — تاریخ امروز را صریح و به هر دو تقویم بنویسید و خروجی را هم دوتایی بخواهید. برای سند رسمی عدد نهایی را خودتان بازبینی کنید؛ ابزار پیشنویس میدهد و مسئولیت با شماست.
۵ و ۶. اسم خاص ایرانی و فارسی محاورهای
«دیوار» را گاهی ترجمه میکند، «گیشا» را به گیشه تبدیل میکند، و اسم کمبسامدی مثل «مهدیقلی» را وسط جمله میشکند. در فهرست مشتری و آدرس، همین چند مورد کل خروجی را بیاعتبار میکند.
محاوره طرف دیگر ماجراست. «میخوام» و «نمیدونم» را میفهمد ولی رسمی جواب میدهد؛ و در پیادهسازی یک مکالمهی تلفنیِ طولانی، مرز جملهها را اشتباه میگیرد.
اسمها را در گیومه بگذارید و بنویسید نه ترجمه شوند نه اصلاح. برای لحن به تقلید امید نبندید؛ دو سه جمله نمونه بالای پرامپت بگذارید. الگوهایش در پرامپتنویسی فارسی آمده است.
۷ و ۸. متن روی تصویر و لهجه در صوت
مدلهای تصویری فارسی را روی تصویر درست نمینویسند: حروف متصل از هم میافتند و جهت راستبهچپ به هم میریزد. راهحل تغییر پرامپت نیست؛ تصویر را بدون نوشته بسازید و متن را بعداً رویش بگذارید.
خواندن متن از عکس بهتر شده اما دستنویس فارسی هنوز ضعیف است؛ نکتههایش در تبدیل عکس به متن فارسی هست. در صوت هم فارسی معیار قابل قبول است، ولی لهجهی غلیظ، همزمانی دو گوینده و اسم خاص خطا را بالا میبرند؛ راهش در تبدیل گفتار به متن باز شده.
جدول کوتاه و یک پرامپت آماده
هر هشت مورد، فشرده در یک جدول:
| محدودیت | اثر عملی | راه دور زدن |
|---|---|---|
| توکن بیشتر | هزینهی بالاتر، جواب بریده | دستور ثابت انگلیسی |
| دادهی آموزشی کم | اصطلاح تخصصی غلط | واژهنامه در ابتدای پرامپت |
| ي و ك عربی، نیمفاصله | تطبیق و جستوجوی خراب | یکدستسازی پیش از ارسال |
| تاریخ شمسی | یک روز خطا، سررسید غلط | نوشتن صریح هر دو تقویم |
| اسم خاص ایرانی | شکستن یا ترجمهی نام | گیومه و قید «ترجمه نکن» |
| محاوره و شکستهنویسی | لحن رسمی، مرز جملهی اشتباه | نمونهی لحن |
| متن روی تصویر | حروف ناخوانا | افزودن متن پس از ساخت |
| لهجه در صوت | رونویسی پرخطا | فایل تکگوینده، فهرست نامها |
این قالب بیشتر موارد بالا را یکجا میبندد؛ در نارنگی ذخیرهاش کنید و هر بار واژهنامه و تاریخ را عوض کنید.
نقش: دستیار متن فارسی، دقیق و کمحرف.
اول متن ورودی را یکدست کن:
- «ي» و «ك» عربی را به «ی» و «ک» فارسی تبدیل کن
- نیمفاصلهها را درست بگذار، شکل اعداد را یکدست کن
واژهنامه (عوض نکن):
deposit = ودیعه | invoice = صورتحساب
اسم خاص را نه ترجمه کن نه اصلاح:
«دیوار»، «گیشا»، «مهدیقلی»
تاریخ: امروز ۱۴ مرداد ۱۴۰۵ برابر ۵ اوت ۲۰۲۶.
هر تاریخ را به هر دو تقویم بنویس.
خروجی: فقط JSON با کلیدهای
title، body، date_jalali، date_gregorian
متن ورودی:
---
[متن خود را اینجا بگذارید]
جمعبندی
هیچکدام از این هشت مورد با «مدل بهتر» حل نمیشود. سهتایشان — نویسه، تاریخ و اسم خاص — کاملاً در دست شماست و با چند خط دستور بسته میشوند. سهتای بعدی — توکن، اصطلاح تخصصی و محاوره — کم میشوند نه صفر.
دو مورد آخر هنوز حل نشدهاند: متن فارسی روی تصویر، و رونویسی لهجهی غلیظ. برای این دو بهجای اصرار روی پرامپت، مسیر را عوض کنید.
برای ادامه: