پنجره‌ی یک میلیون توکنی یعنی چه و کجا به کار می‌آید

عدد بزرگ روی برگه‌ی معرفی مدل‌ها را به کار واقعی ترجمه می‌کنیم: چقدر متن فارسی جا می‌شود، چرا دقت در میانه افت می‌کند و کِی بازیابی از سند بهتر جواب می‌دهد.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
انبوهی از برگه‌های سند که فقط بخشی از آن‌ها زیر نور یک قاب روشن قرار گرفته‌اند

روی برگه‌ی معرفی مدل نوشته‌اند «پنجره‌ی زمینه: یک میلیون توکن». پرسش واقعی اما این است: من که یک پوشه‌ی پر از قرارداد پیمانکاری و صورت‌جلسه‌ی هیئت‌مدیره دارم، این عدد چه کاری برایم می‌کند؟

یک نمونه‌ی آشنا: قرارداد چهل‌صفحه‌ای را پیوست می‌کنید و می‌پرسید بند فسخ چه می‌گوید. جواب می‌آید — روان، مرتب، مطمئن. بعد سند را باز می‌کنید و می‌بینید بند فسخ آن نبوده. ظرفیت کم نیامده؛ آن عدد وعده‌ی جا دادن است، نه وعده‌ی دقت.

پنجره‌ی زمینه یعنی چه و چرا حافظه نیست

پنجره‌ی زمینه سقف چیزی است که مدل در یک نوبت جلوی چشمش دارد: دستور سیستمی، تاریخچه‌ی گفتگو، فایل‌های پیوست، پرسش تازه و جوابی که می‌نویسد. اگر مجموع از سقف بگذرد، اپ‌های چت معمولاً قدیمی‌ترین بخش‌ها را بی‌صدا کنار می‌گذارند، بی‌آنکه خبردار شوید.

بزرگ‌ترین سوءتفاهم همین‌جاست: پنجره حافظه نیست. حافظه چیزی است که بعد از بستن گفتگو می‌ماند و دفعه‌ی بعد خودش برمی‌گردد؛ پنجره فقط میز کار موقت است. در هر پیام، تمام آن متن دوباره از اول خوانده می‌شود. اینکه چه چیزی ارزش جا گرفتن روی این میز را دارد، بحث مهندسی زمینه است.

یک میلیون توکن در فارسی چقدر متن است

توکن واحد شمارش مدل است، نه کلمه. در انگلیسی هر کلمه معمولاً کمی بیشتر از یک توکن می‌گیرد؛ در فارسی همان کلمه اغلب به دو تا سه تکه می‌شکند. چرایی‌اش در توکن چیست و چرا فارسی گران‌تر تمام می‌شود آمده.

با همین نسبت و صفحه‌ای حدود ۲۵۰ تا ۳۰۰ کلمه، یک میلیون توکن تقریباً هزار تا دو هزار صفحه‌ی فارسی درمی‌آید — نه ده‌ها هزار صفحه‌ای که عدد القا می‌کند. یعنی یک کتاب قطور، چند ده قرارداد، یا صورت‌جلسه‌های یک سال یک شرکت کوچک. حساب PDF اسکن‌شده جداست و ظرفیت را زودتر پر می‌کند.

گم شدن در وسط: خطایی که بی‌صدا رد می‌شود

جا شدن یک چیز است، خوانده شدن چیزی دیگر. پژوهش‌ها نشان داده‌اند مدل‌ها به ابتدا و انتهای متن بیشتر تکیه می‌کنند و روی چیزی که وسط یک متن بلند نشسته دقتشان افت می‌کند؛ نامش را گم شدن در وسط گذاشته‌اند.

اثرش خطرناک است: مدل ممکن است بند چهاردهم یک قرارداد چهل‌بندی را نبیند و با اطمینان بنویسد چنین بندی وجود ندارد. یک کار هم هست که اصلاً جواب نمی‌دهد: «همه‌ی موارد را فهرست کن» روی سند بلند. فهرست ناقص درمی‌آید و ناقص بودنش از روی خروجی پیدا نیست؛ برای استخراج کامل، جست‌وجوی متنی ساده مطمئن‌تر از مدل است.

⚠️ جواب بدون نقل‌قول را نپذیرید

برای هر ادعا شماره‌ی صفحه یا بند و یک نقل‌قول مستقیم بخواهید. نقل‌قول را در خود سند جست‌وجو کنید؛ اگر پیدا نشد، آن نکته ساختگی است و همان‌جا لو می‌رود. سازوکارش در توهم هوش مصنوعی آمده.

هزینه‌ای که با طول ورودی بالا می‌رود

هزینه عمدتاً با تعداد توکن حساب می‌شود، نه با سختی سؤال. تله‌ی پنهان جای دیگری است: چون در هر نوبت کل گفتگو دوباره فرستاده می‌شود، سند سیصدصفحه‌ای که یک بار پیوست کرده‌اید در پیام دهم هم دارد پول می‌گیرد. ذخیره‌ی موقت زمینه در بعضی سرویس‌ها این را کم می‌کند، نه حذف. راهکار ساده است: سؤال‌ها را یک‌جا بپرسید و با عوض شدن موضوع، گفتگوی تازه باز کنید. عددها در هزینه‌ی واقعی کار با هوش مصنوعی آمده.

کِی کل متن، کِی بازیابی از سند

روش رقیب بازیابی است: به‌جای فرستادن همه‌ی متن، سند یک‌بار نمایه می‌شود و در هر پرسش فقط تکه‌های مرتبط ارسال می‌شوند؛ منطقش در RAG چیست باز شده. انتخاب به اندازه‌ی آرشیو برمی‌گردد، نه به سلیقه.

وضعیتانتخاب بهترچرا
یک سند صدصفحه‌ای، پرسش‌های متنوعکل متنارتباط بخش‌های دور دیده می‌شود
مقایسه‌ی سه قرارداد بند به بندکل متنتفاوت فقط با کنار هم بودن پیداست
یافتن یک بند مشخص در آرشیو بزرگبازیابیافت میانه دور زده می‌شود
مستندات پشتیبانیِ پرتغییربازیابیتغییر یک سند بقیه را درگیر نمی‌کند

کارهایی که پنجره‌ی بزرگ ممکن کرده

سه کار هست که تفاوتش محسوس است. اول، خواندن یکپارچه‌ی یک پایان‌نامه: می‌شود پرسید نویسنده در فصل هفتم حرف فصل دوم را نقض کرده یا نه — چیزی که از خلاصه‌های تکه‌تکه درنمی‌آید. دوم، سه پیشنهاد پیمانکاری کنار هم و یک جدول از تفاوت تعهدها و مهلت‌ها. سوم، بازخوانی یک پروژه‌ی کد، وقتی چند فایل با هم داخل پنجره‌اند.

مرز را روشن نگه دارید: خروجی این کارها پیش‌نویسِ بررسی است. تصمیم حقوقی، مالی یا پزشکی با کارشناس شماست.

پرامپت آماده برای سند بلند

دو نکته‌ی این قالب مهم است: پرسش اصلی در انتها می‌آید تا از افت میانه دور بماند، و هر ادعا باید نقل‌قول داشته باشد. در نارنگی فایل را پیوست کنید و همین متن را بفرستید:

نقش تو: تحلیلگر سند.
سند پیوست: [نام سند]
هدف: [یافتن تعهدهای مالی و مهلت‌ها]

قواعد:
۱. فقط از خود سند استفاده کن، نه از دانش عمومی.
۲. برای هر نکته شماره‌ی صفحه یا بند را بنویس.
۳. زیرش یک نقل‌قول مستقیم و کوتاه بیاور، داخل گیومه.
۴. اگر چیزی نبود بنویس «در سند یافت نشد» و حدس نزن.
۵. تناقض دو بخش را با شماره‌ی صفحه نشان بده.

پرسش اصلی من: [اینجا بنویس]

بعد یک آزمون بگیرید: نکته‌ای را که می‌دانید کجای سند است بپرسید و ببینید درست ارجاع می‌دهد. اگر غلط بود، سند را بشکنید.

جمع‌بندی

پنجره‌ی متن یک میلیون توکنی یعنی می‌شود متن خیلی بلند را یک‌جا جلوی مدل گذاشت؛ یعنی این نیست که همه‌اش را با دقت یکسان می‌خواند، یا به خاطر می‌سپارد، یا ارزان تمام می‌شود.

قاعده‌ای که در عمل جواب می‌دهد: تا وقتی اسناد به هم مربوط‌اند و تعدادشان محدود است، کل متن را بدهید و نقل‌قول بخواهید. وقتی آرشیو بزرگ شد، سراغ بازیابی بروید. و در هر دو حالت، جوابی که ارجاع ندارد را جواب حساب نکنید.

برای ادامه:

پرسش‌های پرتکرار

پنجره‌ی زمینه با حافظه‌ی مدل چه فرقی دارد؟ +
پنجره‌ی زمینه ظرفیت یک نوبت است: هر چه در همان درخواست جلوی مدل گذاشته می‌شود و با تمام شدن جواب هم تمام می‌شود. حافظه قابلیتی جداست که چند نکته را برای دفعه‌های بعد نگه می‌دارد و به بزرگی پنجره ربطی ندارد. پس مدلی با پنجره‌ی یک میلیون توکنی هم، اگر حافظه نداشته باشد، گفتگوی دیروز شما را به یاد نمی‌آورد.
یک میلیون توکن تقریباً چند صفحه متن فارسی است؟ +
دقیق نمی‌شود گفت، چون شمارش توکن به متن و مدل بستگی دارد و فارسی معمولاً هر کلمه را به بیش از یک توکن می‌شکند. با فرض دو تا سه توکن برای هر کلمه‌ی فارسی، چیزی در حدود هزار تا دو هزار صفحه‌ی متنی درمی‌آید؛ رقم بزرگی است، ولی خیلی کمتر از آنچه آن عدد در نگاه اول نشان می‌دهد. برای PDF اسکن‌شده و تصویر، همین ظرفیت خیلی زودتر پر می‌شود.
چرا مدل بندی را که وسط سند است گاهی نمی‌بیند؟ +
در متن‌های خیلی بلند، توجه مدل به ابتدا و انتها بیشتر می‌چسبد و آنچه در میانه نشسته راحت‌تر از قلم می‌افتد؛ اسم این پدیده «گم شدن در وسط» است. سه کار جلویش را می‌گیرد: پرسش را در انتهای پیام بگذارید، سند را به بخش‌های کوچک‌تر بشکنید، و برای هر ادعا شماره‌ی صفحه و نقل‌قول مستقیم بخواهید. اگر باز هم جواب‌ها ناقص بود، یعنی سند برای یک‌جا خوانده شدن بلند است.
هزینه‌ی کار با سند بلند چطور بالا می‌رود؟ +
محاسبه بر اساس تعداد توکن ورودی و خروجی است و در هر نوبت کل گفتگو دوباره برای مدل فرستاده می‌شود. یعنی سندی که یک بار پیوست کرده‌اید، در پیام دهم هم دارد هزینه می‌سازد و هر پیام از قبلی گران‌تر تمام می‌شود. برای همین بهتر است هر سند در گفتگوی خودش بماند و به‌محض عوض شدن موضوع، از نو شروع کنید.
با پنجره‌ی بزرگ دیگر به بازیابی از سند نیازی نیست؟ +
نه، این دو جایگزین هم نیستند. وقتی چند سند مرتبط دارید و می‌خواهید کل متن با هم دیده شود، پنجره‌ی بزرگ بهتر جواب می‌دهد؛ وقتی آرشیوی از صدها یا هزاران سند دارید و پرسش‌ها نقطه‌ای است، بازیابی هم ارزان‌تر است و هم دقیق‌تر. بسیاری از سامانه‌های جدی هر دو را کنار هم استفاده می‌کنند.
#پنجره‌ی زمینه #یک میلیون توکن #تحلیل سند بلند با هوش مصنوعی #گم شدن در وسط #توکن چیست
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است