توکن چیست و چرا فارسی گران‌تر تمام می‌شود

هوش مصنوعی متن را کلمه‌به‌کلمه نمی‌بیند، توکن‌به‌توکن می‌بیند. فهمیدن این یک مفهوم توضیح می‌دهد چرا مکالمه‌ی طولانی کند می‌شود و چرا متن فارسی بیشتر خرج برمی‌دارد.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
نمایش تقسیم یک جمله‌ی فارسی به قطعه‌های کوچک‌تر یا توکن

دو کاربر یک سؤال تقریباً مشابه می‌پرسند. یکی خیلی کمتر از دیگری خرج برمی‌دارد. مکالمه‌ای که ده پیام جلو رفته، ناگهان کندتر می‌شود. و مدلی که ادعا می‌کند «یک کتاب کامل را می‌خواند»، وسط یک گفت‌وگوی طولانی چیزی را که پنج پیام قبل گفته‌اید فراموش می‌کند.

پشت هر سه‌ی این‌ها یک مفهوم است: توکن. این تنها مفهوم فنی هوش مصنوعی است که فهمیدنش برای کاربر عادی هم به‌درد می‌خورد، چون مستقیم روی هزینه و کیفیت اثر می‌گذارد.

توکن یعنی چه

مدل زبانی متن شما را به قطعه‌های کوچک می‌شکند. این قطعه‌ها نه دقیقاً کلمه‌اند و نه دقیقاً حرف. کلمه‌های پرتکرار معمولاً یک قطعه‌اند و کلمه‌های نادر به چند قطعه شکسته می‌شوند.

مثال: در انگلیسی «the» یک توکن است. «tokenization» ممکن است به سه قطعه بشکند. در فارسی «کتاب» احتمالاً یک یا دو قطعه است و «کتاب‌فروشی» چند قطعه.

مدل هرگز کلمه نمی‌بیند. همین است که توضیح می‌دهد چرا در شمردن حروف یک کلمه گاهی اشتباه می‌کند — چیزی که در نحوه‌ی کار مدل‌های هوش مصنوعی مفصل‌تر توضیح داده‌ایم.

چرا فارسی گران‌تر تمام می‌شود

واژگان توکن‌سازِ مدل‌های اصلی عمدتاً از متن انگلیسیِ اینترنت ساخته شده. یعنی الگوهای پرتکرار انگلیسی جای خودشان را در این واژگان گرفته‌اند و الگوهای فارسی کمتر.

نتیجه‌ی عملی: یک پاراگراف فارسی و ترجمه‌ی انگلیسی‌اش که معنای یکسانی دارند، تعداد توکن یکسانی ندارند. متن فارسی معمولاً چند برابر بیشتر توکن می‌گیرد — چقدر بیشتر، به متن و به مدل بستگی دارد.

💡 خودتان اندازه بگیرید

به‌جای اعتماد به عدد کلی، یک پاراگراف از متن‌های واقعی خودتان را بردارید و در توکن‌شمار OpenAI بگذارید. بعد ترجمه‌ی انگلیسی همان را امتحان کنید. تفاوت را که ببینید، حس واقعی‌تری از هزینه‌ی کارتان پیدا می‌کنید.

خبر خوب این است که این وضعیت در حال بهتر شدن است. نسل‌های تازه‌تر توکن‌ساز، زبان‌های غیرلاتین را کارآمدتر می‌شکنند. خبر بد این است که فاصله هنوز هست و به این زودی صفر نمی‌شود.

پنجره‌ی زمینه: سقفی که همه‌چیز در آن جا می‌شود

هر مدل یک سقف دارد: حداکثر تعداد توکنی که می‌تواند یک‌جا ببیند. این سقف شامل همه‌چیز است — پیام فعلی شما، همه‌ی پیام‌های قبلی مکالمه، فایل‌های پیوست، و جوابی که دارد می‌سازد.

سه پیامد دارد:

  • مکالمه‌ی طولانی گران‌تر است. در هر پیام جدید، کل تاریخچه دوباره پردازش می‌شود. پیام بیستم بسیار سنگین‌تر از پیام اول است، حتی اگر خودش کوتاه باشد.
  • فراموشی واقعی است. وقتی مکالمه از سقف رد شود، قدیمی‌ترین بخش‌ها حذف می‌شوند. مدل تظاهر به فراموشی نمی‌کند؛ واقعاً دیگر آن‌ها را نمی‌بیند.
  • پنجره‌ی بزرگ‌تر همیشه بهتر نیست. مدلی که یک میلیون توکن می‌گیرد، لزوماً همه‌ی آن را به یک اندازه خوب استفاده نمی‌کند. دقت روی متن‌های خیلی بلند معمولاً افت می‌کند.

توکن ورودی و توکن خروجی یکی نیستند

در بیشتر سرویس‌ها، توکنی که مدل تولید می‌کند گران‌تر از توکنی است که می‌خواند. دلیلش هم روشن است: خواندن یک‌باره انجام می‌شود ولی تولید، قطعه‌به‌قطعه.

این نکته یک نتیجه‌ی عملی دارد: خواستنِ جواب بلند وقتی جواب کوتاه کافی است، بیشتر از چسباندن یک متن بلند خرج برمی‌دارد. جمله‌ی «حداکثر ۱۵۰ کلمه» در پرامپت، هم کیفیت را بالا می‌برد هم هزینه را پایین.

کاری که می‌کنیداثرش روی مصرفجایگزین بهتر
ادامه‌دادن یک مکالمه‌ی خیلی طولانیزیاد، و رو به افزایشگفت‌وگوی تازه با خلاصه‌ی وضعیت
پیوست‌کردن کل یک سند برای یک سؤالزیادفقط بخش مرتبط را بچسبانید
نگفتن سقف طول جوابمتوسط تا زیاد«حداکثر [عدد] کلمه»
پرسیدن چند سؤال بی‌ربط در یک نخزیادهر موضوع، یک گفت‌وگو
خواستن بازنویسی کامل به‌جای اصلاح جزئیزیاد«فقط بند دوم را عوض کن»
کوتاه‌کردن بیش از حد پرامپتکم — ولی کیفیت افت می‌کندزمینه را نگه دارید، تکرار را حذف کنید

صرفه‌جویی هوشمندانه، نه صرفه‌جویی کور

وسوسه‌ی طبیعی بعد از خواندن این مطالب، کوتاه‌نویسی افراطی است. این معمولاً نتیجه‌ی معکوس می‌دهد: پرامپت ناقص، جواب بی‌ربط، و سه بار تکرار. سه بار تکرارِ یک سؤالِ کوتاه از یک بارِ سؤال کاملْ گران‌تر است.

جای درست صرفه‌جویی این‌هاست: نچسباندن فایل‌هایی که لازم نیستند، شروع گفت‌وگوی تازه وقتی موضوع عوض می‌شود، و خواستن اصلاح جزئی به‌جای بازتولید کامل. اگر با متن‌های بلند سروکار دارید، روش‌های خلاصه‌کردن متن با هوش مصنوعی دقیقاً برای همین وضعیت است. و پرامپتی که دقیق نوشته شده باشد — طبق راهنمای پرامپت‌نویسی — هم توکن کمتری می‌گیرد هم دفعات تکرار را کم می‌کند.

در نارنگی چطور حساب می‌شود

در نارنگی شما مستقیم با توکن سروکار ندارید؛ هزینه بر حسب واحد نارنگی حساب می‌شود. ولی پشت صحنه همین توکن‌هاست که مبنای محاسبه است — یعنی همه‌ی نکات بالا اینجا هم اثر دارند. مدل‌های مختلف نرخ‌های متفاوتی دارند و همین است که انتخاب مدل را مهم می‌کند؛ مقایسه‌ی مدل‌های اصلی در این انتخاب کمک می‌کند.

جمع‌بندی

توکن مفهوم پیچیده‌ای نیست، ولی نفهمیدنش باعث دو رفتار اشتباه می‌شود: نگه‌داشتن یک مکالمه‌ی بی‌پایان که هم گران است هم بی‌حافظه، و کوتاه‌نویسی‌ای که کیفیت را قربانی می‌کند.

قاعده‌ی عملی ساده است: زمینه‌ی لازم را کامل بدهید، هر چیز غیرلازم را حذف کنید، سقف طول جواب را مشخص کنید، و وقتی موضوع عوض شد گفت‌وگوی تازه باز کنید.

مطالب مرتبط:

پرسش‌های پرتکرار

توکن دقیقاً چیست؟ +
توکن یک قطعه از متن است — گاهی یک کلمه‌ی کامل، گاهی بخشی از یک کلمه، گاهی فقط یک علامت. مدل‌های زبانی متن را به این قطعه‌ها می‌شکنند و روی همین‌ها کار می‌کنند، نه روی کلمه‌ها به معنای دستوری.
چرا متن فارسی توکن بیشتری مصرف می‌کند؟ +
چون واژگان توکن‌سازِ این مدل‌ها بیشتر روی متن انگلیسی ساخته شده است. کلمه‌های پرتکرار انگلیسی معمولاً یک توکن‌اند، ولی کلمه‌ی فارسی اغلب به چند قطعه شکسته می‌شود. نتیجه: همان معنا با تعداد توکن بیشتری منتقل می‌شود.
پنجره‌ی زمینه با توکن چه فرقی دارد؟ +
پنجره‌ی زمینه سقف تعداد توکنی است که مدل می‌تواند یک‌جا ببیند — شامل کل مکالمه، فایل‌های پیوست و جوابی که تولید می‌کند. وقتی مکالمه بلند می‌شود، بخش‌های قدیمی از این پنجره بیرون می‌افتند و مدل واقعاً فراموششان می‌کند.
چطور بفهمم یک متن چند توکن است؟ +
ساده‌ترین راه استفاده از ابزارهای آنلاین توکن‌شمار است؛ متن را می‌چسبانید و تعداد را می‌بینید. اگر می‌خواهید حس دقیقی پیدا کنید، یک پاراگراف فارسی و ترجمه‌ی انگلیسی‌اش را پشت سر هم امتحان کنید.
کوتاه‌نویسی واقعاً هزینه را کم می‌کند؟ +
بله، ولی نه به هر قیمتی. حذف زمینه‌ی لازم باعث می‌شود جواب بی‌ربط شود و مجبور شوید دوباره بپرسید — که در مجموع گران‌تر تمام می‌شود. صرفه‌جویی واقعی از حذف تکرار و پیوست‌های بی‌ربط می‌آید، نه از حذف اطلاعات مفید.
#توکن در هوش مصنوعی #توکن چیست #پنجره زمینه #مصرف توکن فارسی #هزینه هوش مصنوعی
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است