مدل کوچک یا بزرگ؟ کِی ارزان‌تر بهتر جواب می‌دهد

برای دسته‌بندی، استخراج فیلد و خلاصه‌ی کوتاه، مدل ارزان تقریباً همان کار را می‌کند و چند برابر سریع‌تر است. اینجا مرز دقیق را با جدول و یک روش آزمون ساده مشخص می‌کنیم.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
دو مسیر جداشده از یک نقطه، یکی سبک و سریع و دیگری سنگین و کندتر

یک تیم پشتیبانی روزی چند صد پیام می‌گیرد و می‌خواهد هرکدام را برچسب بزند: شکایت، پیگیری سفارش، پرسش فنی، یا چیز دیگر. برای این کار گران‌ترین مدل بازار را برداشته‌اند، چون «بهتر است». نتیجه صورت‌حسابی چند برابر آنچه لازم بود، و جوابی که چند ثانیه دیرتر می‌رسد — برای کاری که مدل ارزان هم تقریباً همان‌قدر خوب انجام می‌داد.

انتخاب مدل بزرگ برای بیشتر آدم‌ها پیش‌فرض است، نه تصمیم. حال آنکه بخش بزرگی از کارهای روزمره اصلاً استدلال عمیق نمی‌خواهد؛ فقط باید متن ورودی را به شکلی معین بازچینی کند.

مثلثی که هر سه ضلعش بلند نمی‌شود

هزینه، سرعت، کیفیت. هر انتخاب مدل جایی روی این مثلث می‌نشیند و هر سه رأس با هم بالا نمی‌روند: مدل بزرگ کیفیت را در کار سخت بالا می‌برد و بابتش گران‌تر و کندتر است، مدل کوچک عکس آن.

نکته اینجاست: منحنی کیفیت خطی نیست. در کار ساختاریافته مدل کوچک به سقفِ کار می‌رسد و از آن به بعد پول بیشتر چیزی اضافه نمی‌کند. حساب این هزینه در هزینه‌ی واقعی کار با هوش مصنوعی باز شده، و اینکه چرا فارسی گران‌تر تمام می‌شود در توکن چیست آمده است.

کارهایی که مدل کوچک کافی است

این فهرست از کار واقعی درآمده، نه از حدس:

  • دسته‌بندی: برچسب زدن به تیکت، نظر مشتری، ایمیل ورودی
  • استخراج فیلد: نام، شماره، مبلغ و تاریخ از متن نامرتب
  • مرتب‌سازی و اولویت‌بندی بر پایه‌ی قاعده‌ی روشن
  • بازنویسی کوتاه: رسمی کردن پیام، کوتاه کردن یک پاراگراف
  • خلاصه‌ی یک صفحه متن با ساختار مشخص
  • تبدیل قالب: متن آزاد به فهرست، فهرست به جدول

وجه مشترک همه‌شان یکی است: جواب داخل خودِ ورودی هست و مدل فقط باید پیدایش کند. هوش بیشتر اینجا جایی برای اثر گذاشتن ندارد.

کارهایی که مدل کوچک در آن‌ها می‌بازد

اینجا صرفه‌جویی به ضرر تمام می‌شود. در استدلال چندمرحله‌ای که هر قدم به قدم قبل وابسته است، یک لغزش کوچک تا انتها بزرگ می‌شود. در ابهام‌زدایی، مدل کوچک ساده‌ترین معنای درخواست را برمی‌دارد و رد می‌شود. سند بلند فرق دارد: پنجره‌ی زمینه‌ی مدل کوچک لزوماً کوتاه‌تر نیست، ولی هرچه متن طولانی‌تر شود دقتش زودتر افت می‌کند. کد پیچیده، دیباگ و تصمیم پرریسک — قرارداد، سلامت، مالیات — هم همین‌جا هستند. سازوکارش در استدلال زنجیره‌ای باز شده است.

کارمدلدلیل
دسته‌بندی و برچسب‌زنیکوچکجواب در خود متن است
استخراج فیلد از فاکتورکوچکالگو ثابت و تکرارشونده
بازنویسی و خلاصه‌ی کوتاهکوچکسریع، ارزان، قابل قبول
تحلیل سند بلندبزرگدقت در متن طولانی افت می‌کند
استدلال چندمرحله‌ایبزرگخطای هر قدم ضرب می‌شود
درخواست مبهم کاربربزرگتشخیص منظور فاصله می‌سازد
قرارداد و متن پرریسکبزرگ + بازبینی انسانهزینه‌ی خطا بالاست

مسیریابی: هر کار به مدل خودش

جواب درست «یکی را انتخاب کن» نیست؛ «هر دو را داشته باش و درست پخش کن» است. یک فروشگاه اینترنتی را در نظر بگیرید: برچسب‌زدن به انبوه پیام‌های روزانه با مدل ارزان، و پاسخ به شکایت تشدیدشده یا خواندن قرارداد تأمین‌کننده با مدل گران. در نارنگی چند رده مدل زیر یک حساب هست و جابه‌جایی چند ثانیه است؛ انتخاب رده بر اساس نوع کار هم در کدام مدل برای چه کاری جمع شده.

پرامپت زیر نمونه‌ی همان کاری است که مدل کوچک در آن کم نمی‌آورد:

نقش: دسته‌بند پیام‌های پشتیبانی.
ورودی: متن پیام مشتری.
خروجی: فقط یکی از این برچسب‌ها، بدون توضیح:
شکایت | پیگیری سفارش | پرسش فنی | مرجوعی | سایر

قاعده‌ها:
- اگر پیام دو موضوع داشت، موضوع اصلی را بردار.
- اگر هیچ برچسبی نخواند، «سایر» بنویس.
- هرگز برچسب تازه نساز.

متن پیام:
«[پیام مشتری]»

تأخیر، گاهی از کمی کیفیتِ بیشتر مهم‌تر است

این را زیاد دیده‌ام و کم جدی گرفته می‌شود. کاربری که پشت یک فرم منتظر پیشنهاد خودکار است، جوابی را که چند ثانیه دیرتر می‌آید اصلاً نمی‌بیند؛ قبلش خودش تایپ کرده. در تکمیل خودکار و چت پشتیبانی زنده، سرعت خودش بخشی از کیفیت است.

عکسش هم درست است: برای گزارشی که هفته‌ای یک بار ساخته می‌شود، چند ثانیه تأخیر اهمیتی ندارد؛ آنجا بهترین کیفیت را بخرید.

آزمون بیست نمونه

به‌جای بحث نظری یک بار اندازه بگیرید. بیست نمونه‌ی واقعی از کار خودتان بردارید — نه نمونه‌ی ساختگی و تمیز، بلکه همان پیام‌های شلوغ و بی‌نقطه‌گذاری که هر روز می‌آیند. یک پرامپت را به هر دو مدل بدهید، چهل خروجی را در یک فایل قاطی کنید بی‌آنکه معلوم باشد کدام از کدام است، بعد یکی‌یکی نمره بدهید.

💡 چرا مقایسه باید کور باشد

اگر بدانید کدام خروجی از مدل گران آمده، ناخودآگاه نمره‌ی بهتری می‌دهید. ستون مدل را پنهان کنید، نمره بدهید، بعد رونمایی کنید. اگر اختلاف کمتر از یکی دو نمونه از بیست تا بود، مدل کوچک را بردارید و پولش را جای دیگری خرج کنید.

اشتباهی که با لحن مطمئن گفته می‌شود

یک چیز را صریح بگویم: مدل کوچک وقتی اشتباه می‌کند، با همان لحن مطمئن اشتباه می‌کند. تاریخ را غلط درمی‌آورد و با اطمینان می‌نویسد؛ برچسب اشتباه می‌زند و توضیح قانع‌کننده هم می‌دهد. ریشه‌ی این رفتار در توهم هوش مصنوعی باز شده، و اگر کنجکاو مکانیزم هستید مدخل مدل زبانی بزرگ در ویکی‌پدیا شروع خوبی است.

و یک راه اصلاً جواب نمی‌دهد: پرسیدن «مطمئنی؟» از خود مدل. با فشار حرفش را عوض می‌کند، نه اینکه درست‌تر شود. راهش فقط بازبینی دستی نمونه‌هاست.

جمع‌بندی

پیش‌فرض را برعکس کنید: از مدل کوچک شروع کنید و فقط جایی که واقعاً کم آورد بالا بروید. برای دسته‌بندی، استخراج، بازنویسی کوتاه و خلاصه‌ی یک صفحه، مدل ارزان کار را تمام می‌کند.

و اگر مانده‌اید، بحث نکنید؛ بیست نمونه بردارید و کور مقایسه کنید. یک ساعت وقت می‌گیرد و ماه‌ها تصمیم را روشن می‌کند.

برای ادامه:

پرسش‌های پرتکرار

از کجا بفهمم کارم به مدل بزرگ نیاز دارد؟ +
اگر جواب درست داخل خود متن ورودی هست و مدل فقط باید آن را پیدا و بازچینی کند، مدل کوچک کافی است. اگر مدل باید چند قدم پشت سر هم استدلال کند، منظور مبهم شما را حدس بزند، یا از دانش بیرون از متن استفاده کند، مدل بزرگ لازم است. ساده‌ترین آزمون این است که کار را یک بار به مدل کوچک بدهید و خروجی را با دقت بخوانید.
اختلاف هزینه‌ی مدل کوچک و بزرگ چقدر است؟ +
بسته به سرویس و رده‌ی مدل فرق می‌کند، ولی معمولاً چند برابر است و بین دورترین رده‌ها اختلاف خیلی بیشتر می‌شود. برای یک کاربر عادی که روزی چند پرسش می‌پرسد این اختلاف محسوس نیست، اما برای کاری که روزانه صدها بار تکرار می‌شود مستقیم روی صورت‌حساب می‌نشیند. اگر حجم کارتان بالاست، پیش از انتخاب مدل حساب سرانگشتی ماهانه بکنید.
مدل کوچک فارسی را بدتر می‌فهمد؟ +
در کارهای ساختاریافته تفاوت معمولاً کم است، ولی در فارسی محاوره‌ای و جمله‌های پیچیده فاصله بیشتر می‌شود. مدل‌های کوچک در نیم‌فاصله، اصطلاح عامیانه و لحن غیررسمی زودتر می‌لغزند. اگر ورودی شما پیام واقعی کاربر است نه متن تمیز اداری، حتماً روی نمونه‌های واقعی امتحان کنید.
می‌شود از هر دو مدل همزمان استفاده کرد؟ +
بله و این معمولاً بهترین کار است. کارهای پرتکرار و ساده را به مدل ارزان بسپارید و فقط موارد سخت یا مشکوک را به مدل گران بفرستید. حتی بدون برنامه‌نویسی هم می‌شود این عادت را داشت: پیش‌فرض را مدل کوچک بگذارید و وقتی خروجی قانع‌کننده نبود همان درخواست را به مدل بزرگ‌تر بدهید.
وقتی مدل کوچک اشتباه می‌کند، چطور بفهمم؟ +
سخت‌ترین بخش همین است، چون خروجی اشتباه با همان لحن مطمئن نوشته می‌شود و ظاهرش با خروجی درست فرقی ندارد. برای کارهای تکراری، هر از چند وقت نمونه‌ای تصادفی را دستی بازبینی کنید. برای کارهای حساس، بازبینی انسانی را حذف نکنید؛ ابزار پیش‌نویس می‌دهد و مسئولیت با شماست.
#مدل کوچک #مدل بزرگ #هزینه مدل هوش مصنوعی #سرعت پاسخ مدل #انتخاب مدل هوش مصنوعی
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است