برای اجرای هوش مصنوعی محلی لازم نیست تعداد زیادی مدل روی کامپیوتر نصب کنید. معمولاً بهتر است چند مدل با اندازه و توانایی متفاوت داشته باشید و هر کدام را برای کاری مشخص استفاده کنید. یک مدل کوچک می‌تواند برای پرسش‌های روزمره سریع‌تر باشد و یک مدل بزرگ‌تر برای کدنویسی یا استدلال پیچیده‌تر انتخاب شود.

در اجرای محلی، رم و VRAM کارت گرافیک اهمیت زیادی دارند. مدل‌های کوانتایز شده نیز به کاهش مصرف حافظه کمک می‌کنند. به عنوان مثال Google برای Gemma 4 نشان می‌دهد که نسخه ۱۲B در حالت Q4 حدود ۶.۷ گیگابایت حافظه برای بارگذاری مدل نیاز دارد و مقدار واقعی مصرف حافظه بسته به ابزار اجرا و تنظیمات می‌تواند بیشتر باشد.