برای اجرای هوش مصنوعی محلی لازم نیست تعداد زیادی مدل روی کامپیوتر نصب کنید. معمولاً بهتر است چند مدل با اندازه و توانایی متفاوت داشته باشید و هر کدام را برای کاری مشخص استفاده کنید. یک مدل کوچک می‌تواند برای پرسش‌های روزمره سریع‌تر باشد و یک مدل بزرگ‌تر برای کدنویسی یا استدلال پیچیده‌تر انتخاب شود.

در اجرای محلی، رم و VRAM کارت گرافیک اهمیت زیادی دارند. مدل‌های کوانتایز شده نیز به کاهش مصرف حافظه کمک می‌کنند. به عنوان مثال Google برای Gemma 4 نشان می‌دهد که نسخه ۱۲B در حالت Q4 حدود ۶.۷ گیگابایت حافظه برای بارگذاری مدل نیاز دارد و مقدار واقعی مصرف حافظه بسته به ابزار اجرا و تنظیمات می‌تواند بیشتر باشد.

برای اجرای مدل های هوش مصنوعی محلی چه سخت افزاری لازم است؟

برای مدل‌های محلی، داشتن GPU انویدیا با VRAM مناسب می‌تواند سرعت اجرای مدل را به شکل محسوسی افزایش دهد. KoboldCpp از مدل‌های GGUF استفاده می‌کند و در ویندوز امکان استفاده از شتاب‌دهی CUDA و انتقال لایه‌های مدل به GPU را دارد. هرچه لایه‌های بیشتری در VRAM قرار بگیرند، سرعت تولید پاسخ می‌تواند بیشتر شود؛ البته تا زمانی که حافظه کارت گرافیک کافی باشد.

یک سیستم با ۳۲ گیگابایت رم، کارت گرافیک انویدیا با ۱۲ گیگابایت VRAM و یک SSD سریع می‌تواند برای بسیاری از مدل‌های کوانتایز شده در محدوده متوسط مناسب باشد. مدل‌های بزرگ‌تر ممکن است به رم بیشتر یا اجرای ترکیبی CPU و GPU نیاز داشته باشند.

KoboldCpp چیست و چرا برای اجرای مدل محلی کاربردی است؟

KoboldCpp یک نرم‌افزار نسبتاً ساده برای اجرای مدل‌های GGUF روی کامپیوتر شخصی است. نسخه ویندوز آن به صورت یک فایل اجرایی ارائه می‌شود و برای شروع معمولاً نیازی به نصب پیچیده ندارد. این برنامه از شتاب‌دهی GPU و تنظیم تعداد لایه‌های منتقل‌شده به GPU پشتیبانی می‌کند.

مسیر کلی استفاده:

KoboldCpp > انتخاب مدل GGUF > تنظیم GPU Layers > Launch

برای کارت‌های گرافیک انویدیا می‌توان از شتاب‌دهی CUDA استفاده کرد. اگر VRAM کافی نباشد، بخشی از مدل می‌تواند در رم سیستم باقی بماند؛ در این حالت سرعت اجرا معمولاً پایین‌تر خواهد بود.

Qwen3.6 27B برای کدنویسی و پروژه های پیچیده

Qwen3.6 27B یک مدل متراکم با حدود ۲۷ میلیارد پارامتر است که قابلیت‌های چندوجهی و تمرکز ویژه‌ای روی کدنویسی عامل‌محور دارد. Qwen برای این مدل زمینه متنی بومی ۲۵۶ هزار توکن را اعلام کرده و امکان گسترش آن تا بیش از یک میلیون توکن نیز ذکر شده است.

نسخه‌های کوانتایز شده آن برای اجرای محلی جذاب‌تر هستند. برای کدنویسی، دیباگ، بازنویسی و بررسی پروژه‌های بزرگ می‌توان از یک مدل ۲۷B استفاده کرد؛ البته سرعت آن به کوانتایز، VRAM و مقدار لایه‌های قرارگرفته روی GPU بستگی دارد.

برای سیستمی با VRAM محدود، نسخه‌های Q4 یا Q5 معمولاً نقطه شروع عملی‌تری نسبت به اجرای مدل با دقت بالاتر هستند.

بهترین مدل های هوش مصنوعی لوکال برای کامپیوتر؛ Qwen3.6، Gemma 4 و GPT-OSS

Gemma 4 12B برای استفاده روزمره و پاسخ سریع

Gemma 4 12B برای اجرای محلی در لپ‌تاپ‌ها و کامپیوترهای شخصی طراحی شده و علاوه بر متن، از ورودی تصویر و صدا نیز پشتیبانی می‌کند. گوگل برای این مدل پنجره زمینه ۲۵۶ هزار توکن را اعلام کرده است.

برای پرسش‌های روزمره، خلاصه‌سازی، توضیح مفاهیم، ایده‌پردازی و بعضی کارهای کدنویسی می‌توان از آن استفاده کرد. مزیت مهم نسخه ۱۲B نسبت به مدل‌های بزرگ‌تر، نیاز کمتر به منابع است.

گوگل برای Gemma 4 12B حدود ۶.۷ گیگابایت حافظه در Q4_0 و حدود ۱۳.۴ گیگابایت در SFP8 را به عنوان نیاز تقریبی بارگذاری مدل اعلام کرده است. این اعداد شامل برآورد مشخصی از سربار اجرای مدل هستند و مصرف واقعی می‌تواند با توجه به نرم‌افزار و اندازه Context تغییر کند.

بهترین مدل های هوش مصنوعی لوکال برای کامپیوتر؛ Qwen3.6، Gemma 4 و GPT-OSS

GPT-OSS 20B برای استدلال و حل مسائل چندمرحله ای

GPT-OSS 20B یکی از مدل‌های OpenAI برای اجرای محلی است. این مدل در مجموع حدود ۲۱ میلیارد پارامتر دارد اما فقط حدود ۳.۶ میلیارد پارامتر در هر توکن فعال می‌شوند. OpenAI آن را برای اجرای محلی و سناریوهایی که به تأخیر پایین‌تر نیاز دارند معرفی کرده است.

قابلیت تنظیم سطح استدلال در این مدل باعث می‌شود برای مسائل چندمرحله‌ای، تحلیل، کدنویسی و کارهایی که نیاز به بررسی دقیق‌تر دارند کاربردی باشد. نسخه رسمی آن نیز با قالب MXFP4 ارائه شده و OpenAI اعلام کرده که مدل ۲۰B با حدود ۱۶ گیگابایت حافظه قابل اجرا است.

برای اجرای محلی، این مدل را می‌توان با ابزارهایی مانند llama.cpp و برخی رابط‌های اجرای مدل استفاده کرد. در انتخاب نسخه GGUF یا کوانتایز شده باید سازگاری آن با نرم‌افزار مورد استفاده را بررسی کنید.

بهترین مدل های هوش مصنوعی لوکال برای کامپیوتر؛ Qwen3.6، Gemma 4 و GPT-OSS

Llama 3.3 برای نویسندگی و ایده پردازی مناسب است؟

اینجا باید یک اصلاح مهم در نام مدل انجام داد: Llama 3.3 رسمی در اندازه ۷۰B عرضه شده است و مدل رسمی ۸B مربوط به نسل‌های قبلی Llama است. فهرست رسمی Meta نیز Llama 3.3 را در اندازه ۷۰B معرفی می‌کند.

بنابراین اگر فایلی با نام Llama 3.3 8B می‌بینید، احتمالاً با یک نسخه تغییر یافته، مدل مشتق شده یا نام‌گذاری غیررسمی روبه‌رو هستید و نباید آن را با مدل رسمی Llama 3.3 اشتباه گرفت.

برای اجرای محلی سبک‌تر، مدل‌های ۸B از خانواده Llama همچنان می‌توانند برای نویسندگی، ایده‌پردازی و گفت‌وگوی روزمره کاربرد داشته باشند. مدل رسمی Llama 3 نیز در اندازه ۸B و ۷۰B عرضه شده بود.

بهترین مدل های هوش مصنوعی لوکال برای کامپیوتر؛ Qwen3.6، Gemma 4 و GPT-OSS

آیا برای هوش مصنوعی محلی فقط یک مدل کافی است؟

معمولاً داشتن چند مدل با کاربردهای متفاوت منطقی‌تر از استفاده اجباری از یک مدل برای همه کارهاست. می‌توانید یک مدل کوچک را برای پاسخ‌های سریع نگه دارید و مدل‌های بزرگ‌تر را فقط زمانی اجرا کنید که به کدنویسی، استدلال یا پردازش طولانی‌تر نیاز دارید.

ترکیب پیشنهادی می‌تواند چنین ساختاری داشته باشد:

  • مدل کوچک: پرسش‌های روزمره و پاسخ سریع
  • مدل متوسط: خلاصه‌سازی، کدنویسی معمولی و تحلیل
  • مدل بزرگ‌تر: پروژه‌های پیچیده و کدنویسی سنگین
  • مدل استدلالی: مسائل چندمرحله‌ای و تحلیل عمیق

این روش باعث می‌شود VRAM و رم سیستم فقط زمانی درگیر مدل‌های سنگین شوند که واقعاً به آنها نیاز دارید.

بهترین مدل های هوش مصنوعی لوکال برای کامپیوتر؛ Qwen3.6، Gemma 4 و GPT-OSS

جمع بندی بهترین مدل های هوش مصنوعی محلی

انتخاب مدل به جای استفاده از یک گزینه برای همه کارها بهتر است بر اساس اندازه مدل، مقدار VRAM، سرعت موردنیاز و نوع کار انجام شود. Qwen3.6 27B برای کدنویسی و کارهای چندوجهی گزینه‌ای قدرتمند در رده مدل‌های ۲۷B است. Gemma 4 12B برای اجرای محلی روی کامپیوترهای شخصی طراحی شده و GPT-OSS 20B نیز برای استدلال و استفاده محلی گزینه‌ای مهم است.

برای اجرای این مدل‌ها نیز KoboldCpp یکی از گزینه‌های ساده برای مدل‌های GGUF است و امکان استفاده از GPU و تنظیم GPU Layers را فراهم می‌کند.