استدلال زنجیره‌ای: چرا «قدم‌به‌قدم فکر کن» جواب می‌دهد

یک محاسبه‌ی ساده را غلط جواب می‌دهد؛ همان سؤال را با یک جمله‌ی اضافه می‌پرسید و درست می‌شود. دلیل این اتفاق، چیزی درباره‌ی نحوه‌ی کار مدل‌ها می‌گوید.

🍊 تیم نارنگی ⏱ 5 دقیقه مطالعه
نمایش مرحله‌به‌مرحله‌ی حل یک مسئله توسط مدل زبانی

این را امتحان کنید: «یک محصول ۲ میلیون و ۴۰۰ هزار تومان است. اول ۱۵ درصد تخفیف می‌خورد، بعد روی مبلغ تخفیف‌خورده ۱۰ درصد مالیات بر ارزش افزوده اضافه می‌شود. مشتری چقدر می‌پردازد؟»

مدل‌های سبک‌تر این را گاهی غلط جواب می‌دهند — معمولاً چون تخفیف و مالیات را جابه‌جا اعمال می‌کنند یا مالیات را روی مبلغ اولیه حساب می‌کنند. حالا همان سؤال را بپرسید و آخرش اضافه کنید: «قدم‌به‌قدم حساب کن، بعد جواب نهایی را بگو.» احتمال درست‌بودن جواب محسوس بالا می‌رود.

این تکنیک اسم دارد: استدلال زنجیره‌ای یا chain of thought. و دلیل کار کردنش، چیزی درباره‌ی ماهیت این مدل‌ها به ما می‌گوید.

چرا این یک جمله فرق می‌کند

مدل زبانی هر بار یک واحد از متن را تولید می‌کند و برای تولید هر واحد، مقدار مشخصی محاسبه انجام می‌دهد. وقتی مجبورش کنید مستقیم عدد نهایی را بگوید، تمام مراحل باید در همان یک قدم فشرده شود.

وقتی اجازه‌ی نوشتن مراحل می‌دهید، هر مرحله چند ده واحد متن می‌شود و هر کدام سهم محاسبه‌ی خودشان را می‌گیرند. علاوه بر این، نتیجه‌ی هر گام روی صفحه می‌ماند و گام بعدی می‌تواند به آن تکیه کند — چیزی شبیه کاغذ چرک‌نویس. جزئیات این سازوکار در مقاله‌ی نحوه‌ی کار مدل‌ها آمده است.

این ایده اولین بار در پژوهشی از تیم گوگل در سال ۲۰۲۲ صورت‌بندی شد و در آزمون‌های ریاضی و منطقی بهبود چشمگیری نشان داد؛ متن اصلی مقاله اینجا در دسترس است.

کجا جواب می‌دهد، کجا نه

نوع کاراثر استدلال زنجیره‌ای
محاسبه‌ی چندمرحله‌ایزیاد
مقایسه با چند شرط هم‌زمانزیاد
پیداکردن باگ در کدزیاد
برنامه‌ریزی و زمان‌بندیمتوسط تا زیاد
تحلیل متن حقوقی یا قراردادمتوسط
ترجمه‌ی کوتاهتقریباً هیچ
تولید عنوان و کپشنهیچ، فقط پرحرف می‌کند

قاعده‌ی ساده: اگر خودتان برای حل مسئله کاغذ لازم دارید، مدل هم لازم دارد. اگر جواب را یک‌نگاهی می‌دهید، این تکنیک فقط خروجی را طولانی می‌کند.

مدل‌های استدلالی: قاعده عوض شد

تا مدتی پیش، این جمله را باید خودتان می‌نوشتید. نسل جدید مدل‌ها — همان‌هایی که «استدلالی» نامیده می‌شوند — پیش از جواب دادن، به‌طور خودکار مراحل میانی را طی می‌کنند و اغلب هم آن را به کاربر نشان نمی‌دهند.

نتیجه‌ی عملی: در این مدل‌ها نوشتن «قدم‌به‌قدم فکر کن» معمولاً چیزی اضافه نمی‌کند. آنچه هنوز کمک می‌کند، مشخص‌کردن چه چیزی را باید بررسی کند است، نه اینکه بررسی کن. برای نمونه، رفتار مدل‌های تازه را در معرفی کلاد اوپوس ۵ توضیح داده‌ایم.

⚠️ تله‌ی استدلال قانع‌کننده

زنجیره‌ای که مرتب و شماره‌دار نوشته شده، حس درستی می‌دهد. ولی مدل می‌تواند گام سوم را غلط بردارد و بقیه را با کمال دقت روی همان بسازد. متن منظم، مدرک نیست. عادت کنید فقط یک گام میانی را دستی چک کنید — همان کافی است تا بیشتر خطاها لو برود.

چهار روش که واقعاً کار می‌کند

یک: صورت مسئله را بازگو کند. قبل از حل، بخواهید سؤال را با کلمات خودش بنویسد. اگر بازگویی غلط بود، همان‌جا فهمیده‌اید که سؤالتان مبهم بوده.

دو: دو مسیر مستقل. بخواهید مسئله را دو بار و با دو روش متفاوت حل کند و بعد بگوید نتایج یکی شدند یا نه. اختلاف بین دو مسیر، بهترین نشانه‌ی خطاست.

سه: خودسنجی هدفمند. «بعد از جواب، فرض کن اشتباه کرده‌ای و بگرد دنبال جایی که ممکن است غلط باشد» بهتر از «جوابت را چک کن» عمل می‌کند. دومی معمولاً به تأیید خودش ختم می‌شود.

چهار: گام‌ها را خودتان تعیین کنید. اگر می‌دانید مسئله چه مراحلی دارد، همان‌ها را بنویسید. این از هر تکنیک عمومی‌تری مؤثرتر است و اصولش در راهنمای پرامپت‌نویسی آمده.

این مسئله را حل کن.
مرحله ۱: داده‌های عددی موجود را فهرست کن.
مرحله ۲: بگو چه چیزی خواسته شده و واحدش چیست.
مرحله ۳: محاسبه را انجام بده و در هر خط واحد را بنویس.
مرحله ۴: جواب را با یک تخمین سرانگشتی بسنج.
اگر داده‌ی لازم کم است، محاسبه نکن و بگو چه چیزی کم است.

آن خط آخر جلوی رایج‌ترین خطا را می‌گیرد: ساختن عددی که در صورت مسئله نبوده. این و چند خطای مشابه را در مقاله‌ی اشتباهات رایج فهرست کرده‌ایم.

ربطش به ایجنت‌ها

سامانه‌هایی که چند مرحله کار می‌کنند و بین گام‌ها ابزار صدا می‌زنند، در واقع همین ایده را در مقیاس بزرگ‌تر اجرا می‌کنند: تصمیم، اقدام، مشاهده‌ی نتیجه، تصمیم بعدی. توضیح این معماری در مقاله‌ی ایجنت‌های هوش مصنوعی آمده است.

آزمایش دو دقیقه‌ای

همان مسئله‌ی تخفیف و مالیات ابتدای مقاله را دو بار بپرسید — یک بار خالی، یک بار با گام‌های مشخص‌شده — و خروجی‌ها را کنار هم بگذارید. اگر تفاوتی ندیدید، یعنی مدلی که استفاده می‌کنید استدلالی است. در نارنگی می‌توانید همین مقایسه را انجام بدهید.

جمع‌بندی

استدلال زنجیره‌ای ترفند نیست؛ نتیجه‌ی مستقیم این است که این مدل‌ها با نوشتن فکر می‌کنند. هرچه فضای بیشتری برای نوشتن بدهید، در مسائل چندگامی دقیق‌تر می‌شوند.

ولی همین‌جا مرزش را هم بدانید: زنجیره‌ی خوانا تضمین درستی نیست. یک گام میانی را خودتان بررسی کنید — کم‌هزینه‌ترین بیمه‌ای است که می‌توانید بخرید.

مطالب مرتبط:

پرسش‌های پرتکرار

استدلال زنجیره‌ای دقیقاً یعنی چه؟ +
یعنی مدل به‌جای پریدن مستقیم به جواب، مراحل میانی را هم بنویسد. همین نوشتن، فضای محاسباتی بیشتری در اختیارش می‌گذارد و احتمال خطا در مسائل چندمرحله‌ای را پایین می‌آورد. در عمل با یک جمله در پرامپت فعال می‌شود: «قدم‌به‌قدم استدلال کن و بعد جواب نهایی را بگو».
آیا در مدل‌های جدید هم لازم است این جمله را بنویسم؟ +
برای مدل‌های استدلالی نسل جدید معمولاً نه؛ خودشان قبل از جواب مرحله‌های میانی را طی می‌کنند. برای مدل‌های سبک و سریع همچنان مفید است. راه فهمیدنش ساده است: یک سؤال چندمرحله‌ای را با و بدون این جمله بپرسید و خروجی را مقایسه کنید.
اگر مراحل درست به‌نظر برسند، جواب حتماً درست است؟ +
نه، و این مهم‌ترین سوءتفاهم است. مدل می‌تواند زنجیره‌ای بنویسد که خواندنش قانع‌کننده است ولی یکی از گام‌هایش غلط باشد و بقیه روی همان غلط ساخته شوند. متن مرتب، دلیل درستی نیست؛ باید خودِ گام‌ها را نگاه کنید.
برای چه کارهایی این تکنیک بی‌فایده است؟ +
برای کارهایی که مرحله‌ی میانی ندارند: بازنویسی یک جمله، ترجمه‌ی کوتاه، تولید عنوان یا خلاصه‌کردن. آنجا فقط خروجی را طولانی و پرحرف می‌کند. این تکنیک برای مسائل چندگامی است — محاسبه، مقایسه‌ی شرطی، دیباگ و برنامه‌ریزی.
آیا استدلال زنجیره‌ای هزینه دارد؟ +
بله، هم توکن بیشتر مصرف می‌شود و هم جواب دیرتر می‌آید، چون متن بیشتری تولید می‌شود. برای سؤال‌های ساده این هزینه توجیهی ندارد. یک راه میانه این است که بخواهید استدلال کند ولی فقط جواب نهایی و خلاصه‌ی گام‌ها را نشان بدهد.
#استدلال زنجیره‌ای #chain of thought #مدل استدلالی #دقت پاسخ هوش مصنوعی #تکنیک پرامپت
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است