قطعی اینترنت در ایران یک اتفاق نادر نیست؛ تجربه‌ای تکراری است که بارها دسترسی کاربران را به سرویس‌های آنلاین هوش مصنوعی مانند ChatGPT و Gemini قطع کرده است. اما امروز راه‌حلی واقعی برای این مشکل وجود دارد: اجرای محلی مدل‌های هوش مصنوعی.

مدل‌های زبانی کوچک یا همان SLMها، نسخه‌های فشرده‌شده‌ای از هوش مصنوعی هستند که می‌توانند مستقیماً روی سخت‌افزار شخصی شما اجرا شوند. نکته مهم این است که در این حالت، داده‌های شما از دستگاه خارج نمی‌شوند و حریم خصوصی‌تان حفظ خواهد شد.

آیا سیستم شما توانایی اجرای هوش مصنوعی محلی را دارد؟

پیش از هر چیز باید بدانید که اجرای هوش مصنوعی عمدتاً به میزان حافظه رم و به‌ویژه VRAM یا حافظه اختصاصی کارت گرافیک بستگی دارد. هرچه مدل پارامترهای بیشتری داشته باشد، به حافظه بیشتری نیاز خواهد داشت.

مک‌بوک‌های اپل با تراشه‌های سری M از معماری حافظه یکپارچه (Unified Memory) بهره می‌برند؛ یعنی CPU و GPU از یک استخر حافظه مشترک استفاده می‌کنند. به این ترتیب یک مک‌بوک با ۳۲ گیگابایت رم، عملاً همان مقدار حافظه را هم در اختیار GPU قرار می‌دهد.

راهنمای انتخاب مدل مناسب بر اساس سخت‌افزار

اگر سخت‌افزار قوی ندارید، تکنیک کوانتیزیشن (Quantization) به کمک شما می‌آید. این فرایند با کاهش دقت اعداد داخل مدل، حجم آن را به‌شدت کم می‌کند. مثلاً یک مدل ۷ میلیارد پارامتری که معمولاً حدود ۱۵ گیگابایت حجم دارد، با کوانتیزیشن به حدود ۴ تا ۵ گیگابایت فشرده می‌شود و روی سیستمی با ۸ گیگابایت رم هم اجرا می‌شود.

  • کمتر از ۴ گیگابایت رم: مدل‌های زیر ۱ میلیارد پارامتر مانند Gemma 4 E2B
  • ۴ تا ۸ گیگابایت: مدل‌های ۲ تا ۴ میلیارد پارامتری کوانتایزشده مانند Gemma 4 E4B
  • ۸ تا ۱۶ گیگابایت: مدل‌های ۷ تا ۸ میلیارد پارامتری کوانتایزشده مانند Llama یا Qwen
  • بیش از ۱۶ گیگابایت: مدل‌های ۱۲ میلیارد پارامتر و بالاتر مانند نسخه‌های بزرگ‌تر Gemma یا Qwen

برای شناسایی سریع مدل‌های سازگار با سیستم خود، ابزار رایگان TurboLLM با وارد کردن میزان رم و VRAM، فهرست مدل‌های مناسب را در اختیارتان قرار می‌دهد.

داخل خبر (468x60)

نصب و اجرای هوش مصنوعی روی لپ‌تاپ

دو ابزار رایگان اجرای محلی هوش مصنوعی را بسیار ساده کرده‌اند:

Ollama: پرطرفدارترین ابزار متن‌باز در این حوزه است که از نسخه ۰.۱۰ به بعد رابط گرافیکی ارائه کرده است. کافیست به وب‌سایت ollama.com بروید، نسخه مخصوص سیستم‌عامل خود را دانلود و نصب کنید. پس از باز کردن اپلیکیشن، محیطی شبیه ChatGPT مشاهده خواهید کرد. برای اجرای آفلاین باید مدل‌های فاقد برچسب Cloud را انتخاب کنید. همچنین از نسخه ۰.۱۴ به بعد، Ollama با API آنتروپیک سازگار شده و امکان اتصال Claude Code به مدل‌های محلی را فراهم می‌کند.

LM Studio: این اپلیکیشن رایگان روی ویندوز، مک و لینوکس نصب می‌شود و نیازی به ثبت‌نام ندارد. مزیت اصلی آن داشتن فروشگاه مدل داخلی متصل به Hugging Face است؛ با جست‌وجو در اپلیکیشن و با یک کلیک مدل دلخواه را دانلود و اجرا کنید.

اجرای هوش مصنوعی روی گوشی موبایل

روی گوشی‌های اندرویدی، اپلیکیشن Ollama از طریق گوگل‌پلی در دسترس است. همچنین ابزار متن‌باز ChatterUI امکان اجرای مدلهای گوناگون را روی گوشی فراهم می‌کند. برای آیفون، اپلیکیشن Enchanted Lite به‌صورت رایگان از App Store قابل دانلود است و اتصال به Ollama اجراشده روی لپ‌تاپ را ممکن می‌سازد.

در گوشی‌های میان‌رده با ۴ تا ۶ گیگابایت رم، مدل‌های ۱ تا ۲ میلیارد پارامتری عملکرد قابل قبولی دارند. در پرچمدارانی مانند گلکسی S24 اولترا با ۱۲ گیگابایت رم، می‌توان مدل‌های بزرگ‌تری را اجرا کرد.

آیا اجرای آفلاین هوش مصنوعی ارزش دارد؟

این ابزارها قرار نیست جایگزین دستیارهای ابری قدرتمند شوند. اما برای لحظاتی که اینترنت قطع است، برای کارهایی که حریم خصوصی در آن‌ها اهمیت دارد، و برای کسانی که نمی‌خواهند هزینه اشتراک سرویس‌های ابری بپردازند، گزینه‌ای واقعی و در دسترس هستند. با توجه به مشکلات مکرر اینترنت در ایران، آشنایی با این روش‌ها می‌تواند تجربه کاربری شما را به‌طور محسوسی بهبود ببخشد.