مدل‌های هوش مصنوعی محلی به دلیل اجرای مستقیم روی کامپیوتر می‌توانند بدون ارسال داده به سرویس ابری کار کنند و برای کارهایی مثل تولید متن، کدنویسی و خلاصه‌سازی گزینه‌ای کاربردی باشند. با این حال سرعت اجرای آن‌ها فقط به قدرت پردازنده یا تعداد پارامترهای مدل بستگی ندارد. مقدار VRAM کارت گرافیک و تنظیمات مربوط به Context نیز تأثیر زیادی بر سرعت تولید پاسخ دارند.

اگر مدل نتواند به‌طور کامل در حافظه کارت گرافیک قرار بگیرد و بخشی از پردازش به رم سیستم منتقل شود، سرعت تولید توکن می‌تواند به شکل محسوسی کاهش پیدا کند. در Ollama نیز افزایش Context باعث مصرف بیشتر حافظه می‌شود و به همین دلیل انتخاب یک مقدار مناسب برای num_ctx یکی از تنظیمات مهم برای سیستم‌های دارای VRAM محدود است.