محدودیت‌های فارسی در هوش مصنوعی و راه دور زدنشان

هشت جایی که فارسی هنوز شهروند درجه‌ی دو است — از هزینه‌ی توکن و نیم‌فاصله تا تاریخ شمسی و لهجه در صوت — و برای هرکدام یک راه عملی که همین امروز جواب می‌دهد.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
خطی از متن فارسی که وسط آن حروف و نیم‌فاصله‌ها از هم پاشیده‌اند

یک قرارداد فارسی و ترجمه‌ی انگلیسی‌اش را به یک مدل بدهید و صورت‌حساب را ببینید. نسخه‌ی فارسی گران‌تر تمام شده؛ همان معنا، همان مدل، هزینه‌ی بیشتر. این تنها جایی نیست که فارسی عقب می‌ماند، فقط قابل‌اندازه‌گیری‌ترینش است.

بقیه آرام‌ترند: اصطلاحی که غلط برگردانده می‌شود، تاریخی که یک روز جابه‌جا می‌افتد، اسمی که وسط جمله می‌شکند. خطای فاحش نیستند و دقیقاً برای همین از زیر چشم رد می‌شوند.

هشت‌تا هستند. هرکدام یک دور زدن مشخص دارد که همین امروز می‌شود اجرا کرد.

۱. هزینه‌ی توکن

مدل متن را کلمه‌به‌کلمه نمی‌بیند؛ به قطعه‌هایی به‌نام توکن می‌شکندش و فهرست این قطعه‌ها عمدتاً روی انگلیسی ساخته شده. یک واژه‌ی انگلیسی اغلب یک توکن است و یک واژه‌ی فارسی چند تا. نتیجه: پنجره‌ی زمینه زودتر پر می‌شود، جواب بریده می‌شود و صورت‌حساب API بالا می‌رود. جزئیاتش در توکن چیست و چرا فارسی گران‌تر تمام می‌شود باز شده و پایه‌ی فنی‌اش الگوریتم BPE است.

چاره‌اش ساده است: دستور سیستمی و قالب‌های ثابت را انگلیسی بنویسید و فقط محتوا را فارسی بدهید. سند بلند را تکه کنید و خروجی را فهرست‌وار بخواهید.

۲. داده‌ی آموزشی کم و اصطلاح تخصصی

سهم فارسی از داده‌ی آموزشی این مدل‌ها کوچک است. فارسی عمومی را خوب می‌فهمند، اما در واژگان تخصصی لغزش شروع می‌شود: «ودیعه» را رهن می‌نویسد، «سند حسابداری» را با سند ملکی اشتباه می‌گیرد، و معادل انگلیسی را تحت‌اللفظی برمی‌گرداند.

کاری که جواب می‌دهد واژه‌نامه است: ده تا پانزده اصطلاح کلیدی با معادل دقیق در ابتدای پرامپت، با قید اینکه ثابت‌اند. همین یک بند بیشتر از عوض کردن مدل اثر دارد؛ منطقش در ترجمه با هوش مصنوعی باز شده.

۳. نیم‌فاصله و «ي» و «ك» عربی

متنی که از ورد یا یک سایت قدیمی کپی می‌شود آلوده است: «ي» و «ك» عربی، نیم‌فاصله‌ی جاافتاده در «می شود»، و اعداد در سه شکل مختلف.

معنا معمولاً از دست نمی‌رود؛ مدل «می شود» را هم می‌فهمد. خرابی یک لایه پایین‌تر است. این دو رشته‌ی یکسانی نیستند، پس جست‌وجوی دقیق نتیجه نمی‌دهد، تطبیق با پایگاه داده ردیفی پیدا نمی‌کند و خروجی خود مدل بین دو شکل نوسان می‌کند. این نویسه‌ی نامرئی در مدخل نیم‌فاصله توضیح داده شده.

راه دور زدن: پیش از ارسال یکدست‌سازی کنید — ي به ی، ك به ک، اعداد به یک شکل. اگر برنامه‌نویس نیستید، همین را اولین بند پرامپت بگذارید.

۴. تاریخ شمسی و تبدیل نادرست

اینجا ابزار با اطمینان اشتباه می‌کند و همین خطرناکش می‌کند. «۱۴ مرداد ۱۴۰۵» را به میلادی برمی‌گرداند و گاهی یک روز جلو یا عقب می‌افتد. بدتر، «چهارشنبه‌ی هفته‌ی بعد» را نسبت به تاریخی حساب می‌کند که خودش تصور می‌کند امروز است.

⚠️ تاریخ را به حدس مدل نسپارید

در هر پرامپتی که تاریخ نقش دارد — قرارداد، فاکتور، سررسید پرداخت — تاریخ امروز را صریح و به هر دو تقویم بنویسید و خروجی را هم دوتایی بخواهید. برای سند رسمی عدد نهایی را خودتان بازبینی کنید؛ ابزار پیش‌نویس می‌دهد و مسئولیت با شماست.

۵ و ۶. اسم خاص ایرانی و فارسی محاوره‌ای

«دیوار» را گاهی ترجمه می‌کند، «گیشا» را به گیشه تبدیل می‌کند، و اسم کم‌بسامدی مثل «مهدی‌قلی» را وسط جمله می‌شکند. در فهرست مشتری و آدرس، همین چند مورد کل خروجی را بی‌اعتبار می‌کند.

محاوره طرف دیگر ماجراست. «میخوام» و «نمیدونم» را می‌فهمد ولی رسمی جواب می‌دهد؛ و در پیاده‌سازی یک مکالمه‌ی تلفنیِ طولانی، مرز جمله‌ها را اشتباه می‌گیرد.

اسم‌ها را در گیومه بگذارید و بنویسید نه ترجمه شوند نه اصلاح. برای لحن به تقلید امید نبندید؛ دو سه جمله نمونه بالای پرامپت بگذارید. الگوهایش در پرامپت‌نویسی فارسی آمده است.

۷ و ۸. متن روی تصویر و لهجه در صوت

مدل‌های تصویری فارسی را روی تصویر درست نمی‌نویسند: حروف متصل از هم می‌افتند و جهت راست‌به‌چپ به هم می‌ریزد. راه‌حل تغییر پرامپت نیست؛ تصویر را بدون نوشته بسازید و متن را بعداً رویش بگذارید.

خواندن متن از عکس بهتر شده اما دست‌نویس فارسی هنوز ضعیف است؛ نکته‌هایش در تبدیل عکس به متن فارسی هست. در صوت هم فارسی معیار قابل قبول است، ولی لهجه‌ی غلیظ، هم‌زمانی دو گوینده و اسم خاص خطا را بالا می‌برند؛ راهش در تبدیل گفتار به متن باز شده.

جدول کوتاه و یک پرامپت آماده

هر هشت مورد، فشرده در یک جدول:

محدودیتاثر عملیراه دور زدن
توکن بیشترهزینه‌ی بالاتر، جواب بریدهدستور ثابت انگلیسی
داده‌ی آموزشی کماصطلاح تخصصی غلطواژه‌نامه در ابتدای پرامپت
ي و ك عربی، نیم‌فاصلهتطبیق و جست‌وجوی خرابیکدست‌سازی پیش از ارسال
تاریخ شمسییک روز خطا، سررسید غلطنوشتن صریح هر دو تقویم
اسم خاص ایرانیشکستن یا ترجمه‌ی نامگیومه و قید «ترجمه نکن»
محاوره و شکسته‌نویسیلحن رسمی، مرز جمله‌ی اشتباهنمونه‌ی لحن
متن روی تصویرحروف ناخواناافزودن متن پس از ساخت
لهجه در صوترونویسی پرخطافایل تک‌گوینده، فهرست نام‌ها

این قالب بیشتر موارد بالا را یک‌جا می‌بندد؛ در نارنگی ذخیره‌اش کنید و هر بار واژه‌نامه و تاریخ را عوض کنید.

نقش: دستیار متن فارسی، دقیق و کم‌حرف.

اول متن ورودی را یکدست کن:
- «ي» و «ك» عربی را به «ی» و «ک» فارسی تبدیل کن
- نیم‌فاصله‌ها را درست بگذار، شکل اعداد را یکدست کن

واژه‌نامه (عوض نکن):
deposit = ودیعه | invoice = صورت‌حساب

اسم خاص را نه ترجمه کن نه اصلاح:
«دیوار»، «گیشا»، «مهدی‌قلی»

تاریخ: امروز ۱۴ مرداد ۱۴۰۵ برابر ۵ اوت ۲۰۲۶.
هر تاریخ را به هر دو تقویم بنویس.

خروجی: فقط JSON با کلیدهای
title، body، date_jalali، date_gregorian

متن ورودی:
---
[متن خود را اینجا بگذارید]

جمع‌بندی

هیچ‌کدام از این هشت مورد با «مدل بهتر» حل نمی‌شود. سه‌تایشان — نویسه، تاریخ و اسم خاص — کاملاً در دست شماست و با چند خط دستور بسته می‌شوند. سه‌تای بعدی — توکن، اصطلاح تخصصی و محاوره — کم می‌شوند نه صفر.

دو مورد آخر هنوز حل نشده‌اند: متن فارسی روی تصویر، و رونویسی لهجه‌ی غلیظ. برای این دو به‌جای اصرار روی پرامپت، مسیر را عوض کنید.

برای ادامه:

پرسش‌های پرتکرار

چرا متن فارسی در هوش مصنوعی گران‌تر تمام می‌شود؟ +
چون واژگان توکن این مدل‌ها عمدتاً روی متن انگلیسی ساخته شده و یک واژه‌ی فارسی معمولاً به چند توکن خرد می‌شود. همین باعث می‌شود پنجره‌ی زمینه زودتر پر شود و صورت‌حساب API بالاتر بیاید. راه کم کردنش این است که دستورهای ثابت و قالب‌ها را انگلیسی بنویسید و فقط محتوای اصلی را فارسی بدهید.
آیا لازم است متن را قبل از فرستادن یکدست کنم؟ +
اگر متن را از ورد، پی‌دی‌اف یا سایت‌های قدیمی کپی کرده‌اید بله، چون معمولاً «ي» و «ك» عربی و نیم‌فاصله‌ی جاافتاده دارد. مدل معنا را می‌گیرد، ولی «می‌شود» و «می شود» برای هر جست‌وجو و تطبیق دقیقی دو رشته‌ی متفاوت‌اند و همین اختلاف نامرئی نتیجه را خالی برمی‌گرداند. اگر برنامه‌نویس نیستید، یکدست‌سازی را به‌عنوان اولین دستور در خود پرامپت بخواهید.
چرا مدل تاریخ شمسی را اشتباه تبدیل می‌کند؟ +
تبدیل تقویم برای مدل یک بازیابی حفظی است نه یک محاسبه‌ی دقیق، و در سال‌های کبیسه و مرز ماه‌ها یک روز جابه‌جا می‌شود. بدتر آنکه مدل تصور خودش از «امروز» را دارد و تاریخ‌های نسبی مثل «هفته‌ی بعد» را نسبت به همان حساب می‌کند. تاریخ امروز را صریح و به هر دو تقویم در پرامپت بنویسید و خروجی را هم دوتایی بخواهید.
می‌شود کاری کرد که متن فارسی روی تصویر درست نوشته شود؟ +
با پرامپت‌نویسی نه. مدل‌های تصویری حروف متصل فارسی و جهت راست‌به‌چپ را نمی‌سازند و خروجی فقط شبیه فارسی است. تصویر را بدون نوشته بسازید و متن را در یک ویرایشگر ساده اضافه کنید؛ این تنها راهی است که نتیجه‌ی قابل انتشار می‌دهد.
واژه‌نامه دادن به مدل واقعاً فرق می‌کند؟ +
در متن تخصصی بیشترین اثر را همین یک کار دارد. ده تا پانزده اصطلاح کلیدی حوزه‌تان را با معادل ثابت در ابتدای پرامپت بگذارید و بنویسید که این معادل‌ها نباید عوض شوند. نتیجه معمولاً از عوض کردن مدل بهتر است و هزینه‌ای هم ندارد.
#فارسی در هوش مصنوعی #نیم‌فاصله #توکن فارسی #تاریخ شمسی هوش مصنوعی #پرامپت فارسی
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است