اجرای مدل هوش مصنوعی روی کامپیوتر شخصی خودتان

مدل محلی یعنی داده از دستگاه بیرون نمی‌رود و هزینه‌ی هر درخواست صفر است. در عوض چیزهایی را از دست می‌دهید که کمتر کسی از قبل درباره‌شان حرف می‌زند.

🍊 تیم نارنگی ⏱ 4 دقیقه مطالعه
اجرای یک مدل زبانی به‌صورت محلی روی کامپیوتر شخصی بدون اینترنت

یک شرکت حسابداری قراردادهای مشتریانش را باید خلاصه کند. متن‌ها محرمانه‌اند و مدیر اجازه نمی‌دهد چیزی روی سرور خارجی برود. اینجا سؤال دیگر «کدام سرویس بهتر است» نیست؛ سؤال این است که می‌شود مدل را روی همان کامپیوتر دفتر اجرا کرد یا نه.

جواب کوتاه: بله، و ساده‌تر از چیزی است که فکر می‌کنید. جواب بلندتر این است که چند چیز را از دست می‌دهید و بهتر است از قبل بدانید کدام‌ها.

سه دلیل درست و یک دلیل نادرست

دلایلی که واقعاً موجه‌اند:

  • محرمانگی. داده از دستگاه بیرون نمی‌رود. برای پرونده‌ی پزشکی، قرارداد و اطلاعات پرسنلی، این تنها استدلالی است که لازم دارید.
  • آفلاین بودن. جایی که اینترنت پایدار نیست یا شبکه بسته است، مدل محلی کار می‌کند.
  • هزینه‌ی حجم بالا. اگر روزی هزاران متن کوتاه را دسته‌بندی می‌کنید، هزینه‌ی فراخوانی ابری جمع می‌شود؛ اجرای محلی بعد از خرید سخت‌افزار، هزینه‌ی متغیر ندارد.

دلیلی که معمولاً نادرست است: سرعت. مدل محلی روی سخت‌افزار خانگی تقریباً هیچ‌وقت از سرویس ابری سریع‌تر نیست. اگر به‌خاطر سرعت این کار را می‌کنید، احتمالاً ناامید می‌شوید.

سخت‌افزار: چه چیزی واقعاً لازم است

عامل تعیین‌کننده حافظه است، نه قدرت پردازنده. مدل باید کامل در حافظه جا شود؛ اگر جا نشود، سیستم شروع به جابه‌جایی می‌کند و سرعت به حدی می‌افتد که عملاً بی‌استفاده می‌شود.

شرایطچه انتظاری داشته باشید
پردازنده، حافظه‌ی ۸ گیگابایتفقط مدل‌های خیلی کوچک، کند
پردازنده، حافظه‌ی ۱۶ گیگابایتمدل‌های کوچک، قابل استفاده برای کار پس‌زمینه
کارت گرافیک با حافظه‌ی اختصاصی ۸ گیگابایتمدل‌های میان‌رده با کوانتیزه‌سازی، روان
کارت گرافیک با حافظه‌ی ۱۶ گیگابایت به بالامدل‌های بزرگ‌تر، نزدیک به تجربه‌ی ابری

روی مک‌های سری اپل سیلیکون وضعیت متفاوت است، چون حافظه بین پردازنده و گرافیک مشترک است و مدل‌های بزرگ‌تری جا می‌شوند.

کوانتیزه‌سازی به زبان ساده

وزن‌های یک مدل عددهای اعشاری‌اند. کوانتیزه‌سازی یعنی همان عددها را با دقت کمتری ذخیره کنیم تا حجم کمتری بگیرند. نتیجه: مدلی که در حالت اصلی جا نمی‌شد، حالا جا می‌شود.

هزینه‌اش افت کیفیت است، ولی این افت خطی نیست. در سطوح متوسط معمولاً به‌سختی حس می‌شود؛ در فشرده‌سازی‌های شدید، اول جایی خودش را نشان می‌دهد که مدل ضعیف‌تر است — یعنی استدلال چندمرحله‌ای و زبان‌هایی مثل فارسی. برای فهم دقیق‌تر اینکه این وزن‌ها چه هستند، توضیح کارکرد مدل‌ها را ببینید.

ابزارهای اجرا

چند ابزار این کار را به چند کلیک تبدیل کرده‌اند. رایج‌ترین‌شان مدل را دانلود می‌کند، حافظه را مدیریت می‌کند و یک رابط شبیه چت یا یک اندپوینت محلی در اختیارتان می‌گذارد.

# نصب و اجرای یک مدل کوچک با Ollama
ollama pull qwen3:4b
ollama run qwen3:4b

# یا فراخوانی از کد، روی اندپوینت محلی
POST http://localhost:11434/api/generate

همین اندپوینت محلی مهم‌ترین بخش ماجراست: هر کدی که برای سرویس ابری نوشته‌اید، معمولاً با عوض‌کردن آدرس روی مدل محلی هم کار می‌کند. مستندات و فهرست مدل‌ها در کتابخانه‌ی Ollama در دسترس است.

⚠️ انتظار واقع‌بینانه

مدل محلی جایگزین مدل بزرگ ابری نیست. برای خلاصه‌سازی، دسته‌بندی و استخراج اطلاعات خوب کار می‌کند. برای نوشتن متن فارسی روان، کد پیچیده و استدلال چندمرحله‌ای، فاصله هنوز واقعی است — و پنهان‌کردنش فقط باعث ناامیدی بعدی می‌شود.

فارسی، ضعیف‌ترین حلقه

اینجا باید صریح بود. مدل‌های کوچکِ محلی فارسی را می‌فهمند، ولی وقتی خودشان فارسی می‌نویسند، ساختار جمله بوی ترجمه می‌دهد و نیم‌فاصله و اصطلاح‌ها را به‌هم می‌ریزند.

پس تقسیم عملی این است: درک متن فارسی را به مدل محلی بسپارید (دسته‌بندی، استخراج فیلد، جست‌وجوی معنایی)، و تولید متن فارسی منتشرشدنی را نه. اگر دنبال گزینه‌های ابری بدون دردسر دسترسی هستید، این راهنما گزینه‌ها را مقایسه کرده است.

کاربردهایی که واقعاً می‌ارزند

سه الگو در عمل جواب داده‌اند. اول، پرسش‌وپاسخ روی اسناد داخلی سازمان؛ ترکیب مدل محلی با بازیابی اسناد که ساختارش را در توضیح RAG آورده‌ایم. دوم، دسته‌بندی انبوه — مثلاً برچسب‌زدن هزاران تیکت پشتیبانی. سوم، پیش‌پردازش داده‌ی حساس قبل از اینکه نسخه‌ی بی‌نام آن به سرویس ابری برود.

اگر می‌خواهید مدل را به دامنه‌ی خودتان نزدیک‌تر کنید، توضیح فاین‌تیونینگ نشان می‌دهد کِی این کار به‌صرفه است و کِی نه — که اغلب نیست. ملاحظات محرمانگی داده را هم در امنیت اطلاعات جمع کرده‌ایم.

جمع‌بندی

اجرای محلی دیگر کار متخصص نیست؛ یک دستور نصب و چند گیگابایت دانلود است. ولی «می‌شود اجرا کرد» با «به‌صرفه است» یکی نیست.

اگر داده‌ی حساس دارید، اینترنت پایدار ندارید، یا حجم درخواست‌تان بالاست، سراغش بروید. اگر فقط کنجکاوید، یک بار امتحان کنید و انتظارتان را واقع‌بینانه نگه دارید — به‌ویژه برای فارسی.

برای ادامه، این مقاله‌ها را ببینید:

پرسش‌های پرتکرار

با یک لپ‌تاپ معمولی می‌شود مدل محلی اجرا کرد؟ +
مدل‌های کوچک بله، اگر حافظه‌ی کافی داشته باشید. روی پردازنده هم اجرا می‌شوند ولی کند؛ تفاوت با کارت گرافیک محسوس است. تجربه‌ی قابل قبول معمولاً از حافظه‌ی ۱۶ گیگابایت به بالا شروع می‌شود.
کیفیت مدل محلی با مدل‌های ابری قابل مقایسه است؟ +
برای کارهای ساده مثل خلاصه‌سازی و دسته‌بندی، فاصله کم شده است. برای استدلال چندمرحله‌ای، کدنویسی جدی و متن فارسی روان، فاصله هنوز واقعی است. اگر کسی خلافش را گفت، از او بخواهید همان کار را جلوی چشمتان اجرا کند.
فارسی مدل‌های محلی چطور است؟ +
ضعیف‌ترین بخش ماجراست. مدل‌های کوچک فارسی را می‌فهمند ولی خروجی‌شان اغلب ساختار جمله‌ی ترجمه‌ای دارد و در نیم‌فاصله و اصطلاح‌ها می‌لنگد. برای درک و دسته‌بندی متن فارسی خوب‌اند؛ برای تولید متن منتشرشدنی، نه.
کوانتیزه‌سازی یعنی چه و چقدر کیفیت را پایین می‌آورد؟ +
یعنی ذخیره‌ی وزن‌های مدل با دقت عددی کمتر تا حافظه‌ی کمتری بگیرد. افت کیفیت در سطوح متوسط معمولاً محسوس نیست، ولی در فشرده‌سازی‌های خیلی زیاد خودش را در استدلال و زبان‌های کم‌داده مثل فارسی نشان می‌دهد.
برای چه کاری واقعاً به‌صرفه است؟ +
سه مورد: پردازش اسناد محرمانه که نباید از سازمان خارج شوند، کارهای تکراری با حجم بالا که هزینه‌ی فراخوانی ابری را بالا می‌برند، و محیط‌هایی که اینترنت پایدار ندارند. بیرون از این سه، معمولاً سرویس ابری ساده‌تر است.
#مدل محلی #اجرای آفلاین مدل #کوانتیزه سازی #سخت افزار هوش مصنوعی #حریم خصوصی داده
به‌دردِ کسی می‌خورد؟ تلگرام واتساپ
🍊

خواندنش خوب بود — حالا امتحانش کن

هرچه در این صفحه خواندی، همین حالا داخلِ نارنگی قابلِ اجراست. ثبت‌نام با شماره‌ی موبایل، نارنگیِ رایگانِ شروع، بدونِ نیاز به کارت یا تحریم‌شکن.

بدونِ نصب هم کار می‌کند — ولی در اپ سریع‌تر است