بنچمارک هوش مصنوعی: چطور بخوانیم و کجا گمراه میکند
هر مدل تازهای با نموداری میآید که نشان میدهد از همه بهتر است. این راهنما توضیح میدهد آن نمودارها چه چیزی را میسنجند، چه چیزی را نمیسنجند، و چطور خودتان بسنجید.
هر بار مدل تازهای منتشر میشود، یک نمودار میلهای هم با آن میآید. میلهی مدل جدید همیشه بلندتر است. چند هفته بعد، شرکت رقیب نموداری منتشر میکند که در آن میلهی خودش بلندتر است. هر دو راست میگویند.
مسئله این نیست که کسی دروغ میگوید. مسئله این است که این اعداد چیزی را میسنجند که معمولاً همان چیزی نیست که شما لازم دارید.
بنچمارک چه چیزی را میسنجد
بنچمارک مجموعهای از سؤال با جواب مشخص است. مدل را با آن آزمون میگیرند و درصد جوابهای درست، امتیازش میشود. مزیتش این است که مقایسه را ممکن میکند؛ عیبش این است که هر چیزی که قابل نمرهدادن نیست، بیرون میماند.
| نوع بنچمارک | چه چیزی را میسنجد | برای چه کسی مهم است |
|---|---|---|
| دانش عمومی چندگزینهای | اطلاعات در حوزههای مختلف | کاربر عمومی، ولی سقفش زود پر میشود |
| کدنویسی و رفع باگ | حل مسئلهی برنامهنویسی واقعی | توسعهدهنده |
| ریاضی و استدلال | زنجیرهی چندمرحلهای منطق | کارهای تحلیلی و مهندسی |
| متن بلند | پیداکردن اطلاعات در سند طولانی | حقوقی، پژوهشی، اسناد |
| رأی انسانی (آرنا) | ترجیح کاربر بین دو جواب | حس کلی کیفیت مکالمه |
| ابزار و عاملیت | انجام کار چندمرحلهای با ابزار | خودکارسازی فرایند |
چهار دلیل که رتبهها گمراه میکنند
یک: آلودگی داده. وقتی سؤالهای یک بنچمارک سالها در اینترنت بودهاند، احتمال اینکه در دادهی آموزشی مدل هم بوده باشند بالاست. مدل آنوقت بهجای حلکردن، چیزی را بهیاد میآورد. این مشکل شناختهشده است و به همین دلیل بنچمارکهای تازه مدام ساخته میشوند.
دو: انتخابگری در گزارش. هیچ شرکتی نموداری منتشر نمیکند که در آن بازنده باشد. آزمونهایی که در آنها عملکرد ضعیف بوده، معمولاً در اسلاید معرفی نیستند.
سه: شرایط آزمون یکسان نیست. همان مدل با پرامپت متفاوت، با اجازهی استفاده از ابزار، یا با چند بار تلاش و انتخاب بهترین، امتیازهای متفاوتی میگیرد. مقایسهی دو عدد که در دو شرایط مختلف گرفته شدهاند، مقایسه نیست.
چهار: فارسی در هیچکدام نیست. تقریباً همهی بنچمارکهای مهم انگلیسیاند. مدلی که در انگلیسی عالی است، ممکن است در فارسی ساختار جمله را خراب کند یا نیمفاصله را بلد نباشد. هیچ نموداری این را به شما نمیگوید.
وقتی دو مدل امتیازهای نزدیک دارند، آن فاصله معمولاً در استفادهی روزمره محسوس نیست. تفاوتی که واقعاً حس میکنید از جای دیگری میآید: سرعت، پایداری، کیفیت فارسی، و اینکه در کار خاص شما چقدر خوب است.
رتبهبندیهای رأیمحور: نزدیکتر، ولی نه بیعیب
سامانههایی مثل LMArena دو جواب را بدون نام مدل به کاربر نشان میدهند و او انتخاب میکند. این به تجربهی واقعی نزدیکتر است.
ولی سوگیری دارد: جواب بلندتر، با فهرست و تیتر و ایموجی، معمولاً رأی بیشتری میگیرد — حتی وقتی جواب کوتاهترِ رقیب دقیقتر بوده. برای مقایسهی سرعت و هزینهی مدلها، سایتهایی مثل Artificial Analysis دادهی مفیدتری میدهند، چون چیزی را میسنجند که قابل اندازهگیری عینی است.
بنچمارک خودتان را بسازید
این عملیترین توصیهی این مقاله است و نیم ساعت بیشتر وقت نمیبرد. ده تا بیست کار واقعی از کارهای خودتان بردارید — نه سؤالهای سخت، بلکه سؤالهای معمول — و همه را به هر مدلی که در نظر دارید بدهید.
مجموعهی آزمون شخصی — نمونه برای یک تولیدکنندهی محتوا:
۱) یک متن ۸۰۰ کلمهای فارسی را در ۵ بولت خلاصه کن
۲) از این خلاصه، سه عنوان بنویس زیر ۱۰ کلمه
۳) این پاراگراف انگلیسی را روان فارسی کن
۴) این ایمیل شکایت را جواب بده، حداکثر ۱۰۰ کلمه
۵) این جدول را بخوان و بگو کدام ماه افت داشته
۶) این متن را ویرایش کن بدون تغییر معنا
۷) پنج ایدهی محتوا برای [موضوع] بده، بدون تکرار
معیار امتیازدهی (هرکدام ۰ تا ۳):
— فارسی طبیعی است یا بوی ترجمه میدهد
— دستور را کامل رعایت کرده یا نصفه
— چیزی از خودش ساخته یا نه
خروجیها را کنار هم بگذارید و نمره بدهید. نتیجهی این نیم ساعت، از هر نموداری برای تصمیم شما معتبرتر است. اگر میخواهید از یک نقطهی شروع حرکت کنید، مقایسهی چت جیپیتی، جمینای و کلاد تفاوتهای کلی را جمع کرده است.
چکلیست خواندن یک ادعای بنچمارک
- چه کسی منتشرش کرده؟ اگر سازندهی مدل است، انتظار انتخابگری داشته باشید.
- روی چه آزمونی؟ اگر آزمون به کار شما ربطی ندارد، عدد هم ندارد.
- با چه شرایطی؟ با ابزار یا بدون ابزار، یک تلاش یا چند تلاش.
- فاصله چقدر است؟ چند درصد اختلاف معمولاً در عمل حس نمیشود.
- زبان چه بوده؟ اگر انگلیسی بوده، دربارهی فارسی چیزی نمیگوید.
همین چکلیست را وقتی معرفیهای نسل جدید مثل GPT-5.6 یا کلاد اوپوس ۵ را میخوانید به کار ببرید. و اگر میخواهید بدانید این اعداد از کجا میآیند، نحوهی کار مدلهای هوش مصنوعی پیشزمینهی لازم را میدهد.
جمعبندی
بنچمارک بیفایده نیست؛ فقط جواب سؤال دیگری است. جواب میدهد که «کدام مدل در این آزمون خاص بهتر بود»، نه «کدام مدل برای کار من بهتر است».
موضع عملی: نمودارها را برای فهمیدن جهت کلی بازار بخوانید، و انتخاب نهایی را با آزمون خودتان بگیرید. ده کار واقعی، دو مدل، نیم ساعت. میتوانید همین حالا در نارنگی شروعش کنید.
مطالب مرتبط: