مدلهای هوش مصنوعی محلی به دلیل اجرای مستقیم روی کامپیوتر میتوانند بدون ارسال داده به سرویس ابری کار کنند و برای کارهایی مثل تولید متن، کدنویسی و خلاصهسازی گزینهای کاربردی باشند. با این حال سرعت اجرای آنها فقط به قدرت پردازنده یا تعداد پارامترهای مدل بستگی ندارد. مقدار VRAM کارت گرافیک و تنظیمات مربوط به Context نیز تأثیر زیادی بر سرعت تولید پاسخ دارند.
اگر مدل نتواند بهطور کامل در حافظه کارت گرافیک قرار بگیرد و بخشی از پردازش به رم سیستم منتقل شود، سرعت تولید توکن میتواند به شکل محسوسی کاهش پیدا کند. در Ollama نیز افزایش Context باعث مصرف بیشتر حافظه میشود و به همین دلیل انتخاب یک مقدار مناسب برای num_ctx یکی از تنظیمات مهم برای سیستمهای دارای VRAM محدود است.
