اجرای مدل هوش مصنوعی روی کامپیوتر شخصی خودتان
مدل محلی یعنی داده از دستگاه بیرون نمیرود و هزینهی هر درخواست صفر است. در عوض چیزهایی را از دست میدهید که کمتر کسی از قبل دربارهشان حرف میزند.
یک شرکت حسابداری قراردادهای مشتریانش را باید خلاصه کند. متنها محرمانهاند و مدیر اجازه نمیدهد چیزی روی سرور خارجی برود. اینجا سؤال دیگر «کدام سرویس بهتر است» نیست؛ سؤال این است که میشود مدل را روی همان کامپیوتر دفتر اجرا کرد یا نه.
جواب کوتاه: بله، و سادهتر از چیزی است که فکر میکنید. جواب بلندتر این است که چند چیز را از دست میدهید و بهتر است از قبل بدانید کدامها.
سه دلیل درست و یک دلیل نادرست
دلایلی که واقعاً موجهاند:
- محرمانگی. داده از دستگاه بیرون نمیرود. برای پروندهی پزشکی، قرارداد و اطلاعات پرسنلی، این تنها استدلالی است که لازم دارید.
- آفلاین بودن. جایی که اینترنت پایدار نیست یا شبکه بسته است، مدل محلی کار میکند.
- هزینهی حجم بالا. اگر روزی هزاران متن کوتاه را دستهبندی میکنید، هزینهی فراخوانی ابری جمع میشود؛ اجرای محلی بعد از خرید سختافزار، هزینهی متغیر ندارد.
دلیلی که معمولاً نادرست است: سرعت. مدل محلی روی سختافزار خانگی تقریباً هیچوقت از سرویس ابری سریعتر نیست. اگر بهخاطر سرعت این کار را میکنید، احتمالاً ناامید میشوید.
سختافزار: چه چیزی واقعاً لازم است
عامل تعیینکننده حافظه است، نه قدرت پردازنده. مدل باید کامل در حافظه جا شود؛ اگر جا نشود، سیستم شروع به جابهجایی میکند و سرعت به حدی میافتد که عملاً بیاستفاده میشود.
| شرایط | چه انتظاری داشته باشید |
|---|---|
| پردازنده، حافظهی ۸ گیگابایت | فقط مدلهای خیلی کوچک، کند |
| پردازنده، حافظهی ۱۶ گیگابایت | مدلهای کوچک، قابل استفاده برای کار پسزمینه |
| کارت گرافیک با حافظهی اختصاصی ۸ گیگابایت | مدلهای میانرده با کوانتیزهسازی، روان |
| کارت گرافیک با حافظهی ۱۶ گیگابایت به بالا | مدلهای بزرگتر، نزدیک به تجربهی ابری |
روی مکهای سری اپل سیلیکون وضعیت متفاوت است، چون حافظه بین پردازنده و گرافیک مشترک است و مدلهای بزرگتری جا میشوند.
کوانتیزهسازی به زبان ساده
وزنهای یک مدل عددهای اعشاریاند. کوانتیزهسازی یعنی همان عددها را با دقت کمتری ذخیره کنیم تا حجم کمتری بگیرند. نتیجه: مدلی که در حالت اصلی جا نمیشد، حالا جا میشود.
هزینهاش افت کیفیت است، ولی این افت خطی نیست. در سطوح متوسط معمولاً بهسختی حس میشود؛ در فشردهسازیهای شدید، اول جایی خودش را نشان میدهد که مدل ضعیفتر است — یعنی استدلال چندمرحلهای و زبانهایی مثل فارسی. برای فهم دقیقتر اینکه این وزنها چه هستند، توضیح کارکرد مدلها را ببینید.
ابزارهای اجرا
چند ابزار این کار را به چند کلیک تبدیل کردهاند. رایجترینشان مدل را دانلود میکند، حافظه را مدیریت میکند و یک رابط شبیه چت یا یک اندپوینت محلی در اختیارتان میگذارد.
# نصب و اجرای یک مدل کوچک با Ollama
ollama pull qwen3:4b
ollama run qwen3:4b
# یا فراخوانی از کد، روی اندپوینت محلی
POST http://localhost:11434/api/generate
همین اندپوینت محلی مهمترین بخش ماجراست: هر کدی که برای سرویس ابری نوشتهاید، معمولاً با عوضکردن آدرس روی مدل محلی هم کار میکند. مستندات و فهرست مدلها در کتابخانهی Ollama در دسترس است.
مدل محلی جایگزین مدل بزرگ ابری نیست. برای خلاصهسازی، دستهبندی و استخراج اطلاعات خوب کار میکند. برای نوشتن متن فارسی روان، کد پیچیده و استدلال چندمرحلهای، فاصله هنوز واقعی است — و پنهانکردنش فقط باعث ناامیدی بعدی میشود.
فارسی، ضعیفترین حلقه
اینجا باید صریح بود. مدلهای کوچکِ محلی فارسی را میفهمند، ولی وقتی خودشان فارسی مینویسند، ساختار جمله بوی ترجمه میدهد و نیمفاصله و اصطلاحها را بههم میریزند.
پس تقسیم عملی این است: درک متن فارسی را به مدل محلی بسپارید (دستهبندی، استخراج فیلد، جستوجوی معنایی)، و تولید متن فارسی منتشرشدنی را نه. اگر دنبال گزینههای ابری بدون دردسر دسترسی هستید، این راهنما گزینهها را مقایسه کرده است.
کاربردهایی که واقعاً میارزند
سه الگو در عمل جواب دادهاند. اول، پرسشوپاسخ روی اسناد داخلی سازمان؛ ترکیب مدل محلی با بازیابی اسناد که ساختارش را در توضیح RAG آوردهایم. دوم، دستهبندی انبوه — مثلاً برچسبزدن هزاران تیکت پشتیبانی. سوم، پیشپردازش دادهی حساس قبل از اینکه نسخهی بینام آن به سرویس ابری برود.
اگر میخواهید مدل را به دامنهی خودتان نزدیکتر کنید، توضیح فاینتیونینگ نشان میدهد کِی این کار بهصرفه است و کِی نه — که اغلب نیست. ملاحظات محرمانگی داده را هم در امنیت اطلاعات جمع کردهایم.
جمعبندی
اجرای محلی دیگر کار متخصص نیست؛ یک دستور نصب و چند گیگابایت دانلود است. ولی «میشود اجرا کرد» با «بهصرفه است» یکی نیست.
اگر دادهی حساس دارید، اینترنت پایدار ندارید، یا حجم درخواستتان بالاست، سراغش بروید. اگر فقط کنجکاوید، یک بار امتحان کنید و انتظارتان را واقعبینانه نگه دارید — بهویژه برای فارسی.
برای ادامه، این مقالهها را ببینید: