وقتی یک مدل هوش مصنوعی را با Ollama اجرا می‌کنید، مقدار حافظه موردنیاز فقط به حجم فایل مدل بستگی ندارد. اندازه پنجره Context نیز می‌تواند مقدار قابل‌توجهی از RAM یا VRAM را مصرف کند، حتی اگر در عمل از تمام ظرفیت آن استفاده نکنید. بنابراین اگر معمولاً با مکالمه‌های کوتاه چند هزار توکنی کار می‌کنید، کاهش Context می‌تواند یکی از ساده‌ترین روش‌ها برای آزاد کردن حافظه و جلوگیری از کندشدن سیستم باشد.