چطور بفهمیم به خروجی هوش مصنوعی می‌شود اعتماد کرد

«دقت کنید» راهکار نیست. روال مشخص این است: ریسک جواب را در سه سطح بسنجید، نشانه‌های ادعای ساختگی را بشناسید و با سه آزمون کوتاه صحتش را بیازمایید.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
دو نسخه از یک متن کنار هم؛ روی یکی چند جمله برای بازبینی علامت خورده است

وکیلی لایحه می‌نویسد و شماره‌ی پرونده‌ای را که مدل ساخته عیناً داخلش می‌گذارد. کارمندی عدد فروش سه‌ماهه را از جدول خروجی برمی‌دارد و سر جلسه می‌خواند. هر دو متن درست به‌نظر می‌رسد: روان، مرتب، بدون ذره‌ای تردید.

خروجی مدل درست یا غلط نیست؛ طیف است. بخشی دقیق، بخشی محتمل، بخشی خالی‌بندی خوش‌ظاهر — و چون هر سه یک لحن دارند، چشم مرزشان را نمی‌بیند. «حواستان باشد» هم گرهی باز نمی‌کند.

روال درست دو قدم دارد: اول بپرسید اگر این جواب غلط باشد چه از دست می‌رود، بعد به‌اندازه‌ی همان ضرر وقت بگذارید. نه بیشتر، نه کمتر.

سه سطح ریسک، سه رفتار متفاوت

جواب را در یکی از سه خانه بگذارید: غلط بودنش هیچ اثری ندارد، فقط وقت می‌خورد، یا پول و آبرو و سلامت را درگیر می‌کند. قاطی کردن این سه گران تمام می‌شود: کسی نیم‌ساعت سرِ اسم برندش کلنجار می‌رود و همان روز ماده‌ی قانونی را چشم‌بسته کپی می‌کند.

اگر غلط باشد چه می‌شودنمونهرفتار درست
هیچطوفان فکری، ایده‌ی اسم، بازنویسی لحنبازبینی نکنید؛ فقط انتخاب کنید
وقت تلف می‌شودکد، فرمول اکسل، مسیر سفر، پیش‌نویس ایمیلاجرا یا تست کنید؛ خطا خودش را نشان می‌دهد
پول، آبرو، سلامتعدد قرارداد، ماده‌ی قانونی، دوز دارو، آمار عمومیهر ادعا را از منبع اصلی تأیید بگیرید

ریسک به کل کار نمی‌چسبد، به تک‌تک جمله‌ها می‌چسبد. توضیح کالای یک فروشگاه اینترنتی سطح یک است، تا جایی که مدل جنس پارچه یا ابعاد بسته را از خودش دربیاورد؛ همان جمله سطح سه است. دنبال همان چند جمله بگردید، نه کل خروجی — خطاهای پرتکرار در ۱۵ اشتباه رایج در کار با هوش مصنوعی فهرست شده.

نشانه‌های خروجی مشکوک

مدل وقتی چیزی را نمی‌داند سکوت نمی‌کند؛ محتمل‌ترین ادامه را می‌نویسد. مکانیزمش در توهم هوش مصنوعی چیست باز شده. چهار نشانه‌ی عملی:

عددی که صاحب ندارد. عددِ سرراست و رُند بوی حدس می‌دهد؛ عددِ بیش از اندازه دقیق بوی اعتبارسازی. آمار واقعی نام منتشرکننده و سال را با خودش می‌آورد؛ «حدود ۶۸ درصد کسب‌وکارها» بی‌ارجاع، زینت است نه داده.

نام منبع بدون نشانی. ارجاع به پژوهش یا ماده‌ی قانونی، بی‌لینک و بی‌شماره‌ی قابل جست‌وجو. خطرناک‌ترین حالت همین است، چون ظاهر مستند دارد بی‌آنکه مستند باشد؛ نمونه‌هایش در هوش مصنوعی برای وکلا آمده.

اطمینان یکنواخت. وقتی مدل درباره‌ی پایتخت فرانسه و نرخ عوارض گمرکی امسال با یک لحن حرف می‌زند، لحن دیگر سرنخی نیست.

جزئیات بیش از حد مشخص. ساعت دقیق، شماره‌ی بند و صفحه، نام کامل با سِمت. هرچه تأیید یک جزئیات سخت‌تر باشد، احتمال ساختگی بودنش بیشتر است.

سه آزمون که پنج دقیقه وقت می‌برد

یک: بپرسید منبعش کجاست. نه «منبع بده»، بلکه «این جمله را از کجا آوردی؟ اگر مطمئن نیستی صریح بنویس مطمئن نیستم.» جواب سالم بی‌منبع‌ها را علامت می‌زند؛ جواب ناسالم برای همه چیز منبع می‌تراشد. بعد نشانی را باز کنید و دنبال همان جمله بگردید؛ صفحه‌ای که باز نمی‌شود یا آن جمله در آن نیست، ادعا را بی‌پشتوانه می‌گذارد.

دو: همان سؤال را جور دیگری بپرسید. گفت‌وگوی تازه، کلمات متفاوت، بدون نشان دادن جواب قبلی. عوض شدن عدد یعنی حدس بوده. تکرار در همان گفت‌وگو جواب نمی‌دهد، چون جواب قبلی جلوی چشم مدل است؛ بازنویسی پرسش در پرامپت‌نویسی فارسی آمده.

سه: از مدل دیگری بپرسید. دو مدل از دو خانواده معمولاً یک اشتباه مشترک نمی‌سازند، پس اختلافشان همان‌جایی است که باید نگاه کنید. تفاوتشان در مقایسه‌ی چت‌جی‌پی‌تی و جمنای و کلاد باز شده، و در نارنگی چند مدل زیر یک حساب‌اند.

چرا گفتن «مطمئنی؟» کافی نیست

این عادت شایع است و کار نمی‌کند. مدل‌ها با بازخورد آدم‌ها تنظیم می‌شوند و جوابِ خوشایند امتیاز گرفته؛ حاصلش همراهی است، نه ایستادن پای حرف. روی جوابی که می‌دانید درست است بنویسید «مطمئنی؟» — احتمالاً عذرخواهی می‌کند و حرفش را عوض می‌کند. عقب‌نشینی‌اش شاهد چیزی نیست. به‌جای تردید، منبع بخواهید یا بازبینی قدم‌به‌قدم.

چک‌لیست دو دقیقه‌ای

برای متنی که منتشر می‌شود یا تصمیمی رویش سوار است:

  • هر عدد و تاریخ منبع دارد؟
  • هر اسم خاص قابل جست‌وجوست؟
  • هر لینک را باز کرده‌ام و جمله را داخلش دیده‌ام؟
  • جمله‌ای هست که خودم نتوانم توضیحش بدهم؟
  • اگر غلط دربیاید، جوابگو کیست؟

بعد این پرامپت را بدهید:

جواب بالا را بازبینی کن.
۱) هر ادعای عددی، تاریخی یا حقوقی را جدا فهرست کن.
۲) جلوی هرکدام بنویس: از منبع مشخص / برداشت من / مطمئن نیستم.
۳) برای دسته‌ی اول نشانی منبع را بیاور و هر ادعای بی‌سند را علامت بزن.
۴) سه جای پرخطر این جواب را نام ببر.
متن را دوباره ننویس.

وقتی مدل ادعاها را یکی‌یکی برچسب می‌زند، بخشی را همان‌جا پس می‌گیرد. ولی برچسب‌ها را قطعی نگیرید: همان مدل گاهی جلوی ادعای ساختگی خودش هم می‌نویسد «از منبع مشخص». این کار فهرست بازبینی را کوتاه می‌کند، جایش را نمی‌گیرد.

جایی که این روش هم کافی نیست

هیچ آزمونی خطا را صفر نمی‌کند؛ سه مدل هم می‌توانند یک اشتباه مشترک بسازند و توافقشان تأیید دروغین باشد. برای موضوع محلی و تازه — نرخ امسال، بخشنامه‌ی ماه پیش — چیزی جای سایت رسمی را نمی‌گیرد. راستی‌آزمایی و توهم مدل در ویکی‌پدیا شرح داده شده‌اند.

⚠️ سه جا که خروجی را بدون تأیید انسان به کار نبرید

دارو و درمان، متن حقوقی که امضا می‌شود، و هر عددی که به اداره‌ی مالیات یا صورت مالی می‌رود. ابزار در بهترین حالت پیش‌نویس و فهرست سؤال می‌دهد؛ مسئولیت با پزشک، وکیل و حسابدار می‌ماند. یک ماده‌ی ساختگی در لایحه از تمام وقت صرفه‌جویی‌شده گران‌تر درمی‌آید.

جمع‌بندی

اعتماد کلید روشن و خاموش نیست؛ درجه‌ای است که با ریسک تنظیم می‌شود. برای ایده آزاد باشید؛ برای چیزی که اجرا می‌شود، اجرایش کنید تا خطا خودش را نشان دهد؛ برای جمله‌ای که وارد قرارداد می‌شود، سراغ منبع اصلی بروید.

و اگر فقط یک عادت قرار است بماند، این: هر منبعی را که مدل نام می‌برد باز کنید. بیشتر خطاهای گران از همین یک کارِ نکرده بیرون آمده‌اند.

برای ادامه:

پرسش‌های پرتکرار

از کجا بفهمم مدل دارد از خودش درمی‌آورد؟ +
مطمئن‌ترین نشانه، ادعای مشخصی است که منبع قابل جست‌وجو ندارد: عدد درصدی، شماره‌ی ماده‌ی قانونی، عنوان پژوهش یا تاریخ دقیق. همان پرسش را در یک گفت‌وگوی تازه و با کلمات دیگر بپرسید؛ اگر جزئیات عوض شد، مدل حدس زده بوده. ادعایی که در دو بار پرسیدن ثابت می‌ماند لزوماً درست نیست، ولی احتمالش بیشتر است.
گفتن «مطمئنی؟» جواب می‌دهد؟ +
معمولاً نه، چون مدل‌ها تمایل دارند با کاربر همراه شوند و در برابر تردید عقب می‌نشینند. حتی وقتی جواب اولشان درست بوده، ممکن است پس بگیرند و نسخه‌ی اشتباهی جایگزین کنند. به‌جای آن بخواهید ادعا را با منبع مشخص کند یا صریح بنویسد کدام بخش را نمی‌داند.
یعنی باید هر جوابی را راستی‌آزمایی کنم؟ +
خیر، و اگر این کار را بکنید خیلی زود از ابزار دست می‌کشید. شدت بازبینی باید با ریسک بالا برود: برای طوفان فکری و بازنویسی لحن اصلاً لازم نیست، برای کد و فرمول خودِ اجرا کردن کافی است، و فقط برای ادعایی که وارد قرارداد، گزارش عمومی یا تصمیم مالی و درمانی می‌شود باید سراغ منبع اصلی بروید.
اگر مدل به وب وصل باشد و لینک بدهد باز هم خطر هست؟ +
خطر کمتر می‌شود ولی از بین نمی‌رود. لینک ممکن است واقعی باشد اما محتوایش آن چیزی نباشد که مدل خلاصه کرده، یا از منبعی بی‌اعتبار بیاید. لینک را باز کنید و دنبال همان جمله بگردید؛ اگر پیدا نشد، ادعا را دور بیندازید.
برای پرسش پزشکی و حقوقی می‌شود از این روش استفاده کرد؟ +
برای فهمیدن صورت مسئله و آماده کردن پرسش‌هایتان بله، برای تصمیم‌گیری خیر. در این حوزه‌ها خروجی مدل در حد پیش‌نویس و نقطه‌ی شروع است و مسئولیت تصمیم با پزشک، وکیل یا حسابدار می‌ماند. متن تولیدشده را به‌عنوان سؤال نزد متخصص ببرید، نه به‌عنوان جواب.
#راستی‌آزمایی خروجی هوش مصنوعی #توهم هوش مصنوعی #اعتبارسنجی جواب مدل #خطای هوش مصنوعی #بازبینی جواب چت‌بات
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است