بنچمارک هوش مصنوعی: چطور بخوانیم و کجا گمراه می‌کند

هر مدل تازه‌ای با نموداری می‌آید که نشان می‌دهد از همه بهتر است. این راهنما توضیح می‌دهد آن نمودارها چه چیزی را می‌سنجند، چه چیزی را نمی‌سنجند، و چطور خودتان بسنجید.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
نمودار مقایسه‌ی امتیاز چند مدل هوش مصنوعی در آزمون‌های استاندارد

هر بار مدل تازه‌ای منتشر می‌شود، یک نمودار میله‌ای هم با آن می‌آید. میله‌ی مدل جدید همیشه بلندتر است. چند هفته بعد، شرکت رقیب نموداری منتشر می‌کند که در آن میله‌ی خودش بلندتر است. هر دو راست می‌گویند.

مسئله این نیست که کسی دروغ می‌گوید. مسئله این است که این اعداد چیزی را می‌سنجند که معمولاً همان چیزی نیست که شما لازم دارید.

بنچمارک چه چیزی را می‌سنجد

بنچمارک مجموعه‌ای از سؤال با جواب مشخص است. مدل را با آن آزمون می‌گیرند و درصد جواب‌های درست، امتیازش می‌شود. مزیتش این است که مقایسه را ممکن می‌کند؛ عیبش این است که هر چیزی که قابل نمره‌دادن نیست، بیرون می‌ماند.

نوع بنچمارکچه چیزی را می‌سنجدبرای چه کسی مهم است
دانش عمومی چندگزینه‌ایاطلاعات در حوزه‌های مختلفکاربر عمومی، ولی سقفش زود پر می‌شود
کدنویسی و رفع باگحل مسئله‌ی برنامه‌نویسی واقعیتوسعه‌دهنده
ریاضی و استدلالزنجیره‌ی چندمرحله‌ای منطقکارهای تحلیلی و مهندسی
متن بلندپیدا‌کردن اطلاعات در سند طولانیحقوقی، پژوهشی، اسناد
رأی انسانی (آرنا)ترجیح کاربر بین دو جوابحس کلی کیفیت مکالمه
ابزار و عاملیتانجام کار چندمرحله‌ای با ابزارخودکارسازی فرایند

چهار دلیل که رتبه‌ها گمراه می‌کنند

یک: آلودگی داده. وقتی سؤال‌های یک بنچمارک سال‌ها در اینترنت بوده‌اند، احتمال اینکه در داده‌ی آموزشی مدل هم بوده باشند بالاست. مدل آن‌وقت به‌جای حل‌کردن، چیزی را به‌یاد می‌آورد. این مشکل شناخته‌شده است و به همین دلیل بنچمارک‌های تازه مدام ساخته می‌شوند.

دو: انتخاب‌گری در گزارش. هیچ شرکتی نموداری منتشر نمی‌کند که در آن بازنده باشد. آزمون‌هایی که در آن‌ها عملکرد ضعیف بوده، معمولاً در اسلاید معرفی نیستند.

سه: شرایط آزمون یکسان نیست. همان مدل با پرامپت متفاوت، با اجازه‌ی استفاده از ابزار، یا با چند بار تلاش و انتخاب بهترین، امتیازهای متفاوتی می‌گیرد. مقایسه‌ی دو عدد که در دو شرایط مختلف گرفته شده‌اند، مقایسه نیست.

چهار: فارسی در هیچ‌کدام نیست. تقریباً همه‌ی بنچمارک‌های مهم انگلیسی‌اند. مدلی که در انگلیسی عالی است، ممکن است در فارسی ساختار جمله را خراب کند یا نیم‌فاصله را بلد نباشد. هیچ نموداری این را به شما نمی‌گوید.

⚠️ اختلاف‌های کوچک را جدی نگیرید

وقتی دو مدل امتیازهای نزدیک دارند، آن فاصله معمولاً در استفاده‌ی روزمره محسوس نیست. تفاوتی که واقعاً حس می‌کنید از جای دیگری می‌آید: سرعت، پایداری، کیفیت فارسی، و اینکه در کار خاص شما چقدر خوب است.

رتبه‌بندی‌های رأی‌محور: نزدیک‌تر، ولی نه بی‌عیب

سامانه‌هایی مثل LMArena دو جواب را بدون نام مدل به کاربر نشان می‌دهند و او انتخاب می‌کند. این به تجربه‌ی واقعی نزدیک‌تر است.

ولی سوگیری دارد: جواب بلندتر، با فهرست و تیتر و ایموجی، معمولاً رأی بیشتری می‌گیرد — حتی وقتی جواب کوتاه‌ترِ رقیب دقیق‌تر بوده. برای مقایسه‌ی سرعت و هزینه‌ی مدل‌ها، سایت‌هایی مثل Artificial Analysis داده‌ی مفیدتری می‌دهند، چون چیزی را می‌سنجند که قابل اندازه‌گیری عینی است.

بنچمارک خودتان را بسازید

این عملی‌ترین توصیه‌ی این مقاله است و نیم ساعت بیشتر وقت نمی‌برد. ده تا بیست کار واقعی از کارهای خودتان بردارید — نه سؤال‌های سخت، بلکه سؤال‌های معمول — و همه را به هر مدلی که در نظر دارید بدهید.

مجموعه‌ی آزمون شخصی — نمونه برای یک تولیدکننده‌ی محتوا:

۱) یک متن ۸۰۰ کلمه‌ای فارسی را در ۵ بولت خلاصه کن
۲) از این خلاصه، سه عنوان بنویس زیر ۱۰ کلمه
۳) این پاراگراف انگلیسی را روان فارسی کن
۴) این ایمیل شکایت را جواب بده، حداکثر ۱۰۰ کلمه
۵) این جدول را بخوان و بگو کدام ماه افت داشته
۶) این متن را ویرایش کن بدون تغییر معنا
۷) پنج ایده‌ی محتوا برای [موضوع] بده، بدون تکرار

معیار امتیازدهی (هرکدام ۰ تا ۳):
— فارسی طبیعی است یا بوی ترجمه می‌دهد
— دستور را کامل رعایت کرده یا نصفه
— چیزی از خودش ساخته یا نه

خروجی‌ها را کنار هم بگذارید و نمره بدهید. نتیجه‌ی این نیم ساعت، از هر نموداری برای تصمیم شما معتبرتر است. اگر می‌خواهید از یک نقطه‌ی شروع حرکت کنید، مقایسه‌ی چت جی‌پی‌تی، جمینای و کلاد تفاوت‌های کلی را جمع کرده است.

چک‌لیست خواندن یک ادعای بنچمارک

  • چه کسی منتشرش کرده؟ اگر سازنده‌ی مدل است، انتظار انتخاب‌گری داشته باشید.
  • روی چه آزمونی؟ اگر آزمون به کار شما ربطی ندارد، عدد هم ندارد.
  • با چه شرایطی؟ با ابزار یا بدون ابزار، یک تلاش یا چند تلاش.
  • فاصله چقدر است؟ چند درصد اختلاف معمولاً در عمل حس نمی‌شود.
  • زبان چه بوده؟ اگر انگلیسی بوده، درباره‌ی فارسی چیزی نمی‌گوید.

همین چک‌لیست را وقتی معرفی‌های نسل جدید مثل GPT-5.6 یا کلاد اوپوس ۵ را می‌خوانید به کار ببرید. و اگر می‌خواهید بدانید این اعداد از کجا می‌آیند، نحوه‌ی کار مدل‌های هوش مصنوعی پیش‌زمینه‌ی لازم را می‌دهد.

جمع‌بندی

بنچمارک بی‌فایده نیست؛ فقط جواب سؤال دیگری است. جواب می‌دهد که «کدام مدل در این آزمون خاص بهتر بود»، نه «کدام مدل برای کار من بهتر است».

موضع عملی: نمودارها را برای فهمیدن جهت کلی بازار بخوانید، و انتخاب نهایی را با آزمون خودتان بگیرید. ده کار واقعی، دو مدل، نیم ساعت. می‌توانید همین حالا در نارنگی شروعش کنید.

مطالب مرتبط:

پرسش‌های پرتکرار

بنچمارک هوش مصنوعی دقیقاً چیست؟ +
مجموعه‌ای از سؤال‌های استاندارد با جواب مشخص که همه‌ی مدل‌ها با آن سنجیده می‌شوند تا قابل مقایسه باشند. مثل کنکور: عدد می‌دهد، ولی عدد فقط بخشی از توانایی را نشان می‌دهد.
چرا مدلی که در بنچمارک اول است، در کار من بهتر نیست؟ +
چون بنچمارک کارِ شما را نمی‌سنجد. اگر بیشتر کارتان نوشتن متن فارسی و خلاصه‌کردن گزارش است، امتیاز بالای یک مدل در حل مسائل المپیاد ریاضی تقریباً هیچ چیزی درباره‌ی تجربه‌ی روزمره‌ی شما نمی‌گوید.
آلودگی داده در بنچمارک یعنی چه؟ +
یعنی سؤال‌های آزمون یا نمونه‌های خیلی شبیه به آن‌ها، در داده‌ی آموزشی مدل بوده‌اند. در این حالت مدل بخشی از جواب را به‌خاطر می‌آورد نه اینکه حلش کند. این مشکل شناخته‌شده است و باعث می‌شود امتیازهای بالا همیشه معنای واقعی نداشته باشند.
بنچمارک فارسی وجود دارد؟ +
مجموعه‌های پژوهشی محدودی هست، ولی چیزی در حد اعتبار و پوشش بنچمارک‌های انگلیسی وجود ندارد. برای کاربر فارسی‌زبان، ساختن یک آزمون کوچک شخصی عملاً قابل اتکاتر از دنبال‌کردن رتبه‌های جهانی است.
رتبه‌بندی‌های مبتنی بر رأی کاربران بهتر است؟ +
به موضوع نزدیک‌تر است چون آدم واقعی قضاوت می‌کند، ولی سوگیری خودش را دارد: جواب‌های بلندتر و خوش‌قالب‌تر معمولاً رأی بیشتری می‌گیرند، حتی وقتی دقیق‌تر نیستند. آن را در کنار بقیه ببینید، نه به‌جای بقیه.
#بنچمارک هوش مصنوعی #مقایسه مدل هوش مصنوعی #انتخاب مدل #آزمون مدل زبانی #رتبه‌بندی مدل‌ها
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است