وقتی یک مدل هوش مصنوعی را با Ollama اجرا میکنید، مقدار حافظه موردنیاز فقط به حجم فایل مدل بستگی ندارد. اندازه پنجره Context نیز میتواند مقدار قابلتوجهی از RAM یا VRAM را مصرف کند، حتی اگر در عمل از تمام ظرفیت آن استفاده نکنید. بنابراین اگر معمولاً با مکالمههای کوتاه چند هزار توکنی کار میکنید، کاهش Context میتواند یکی از سادهترین روشها برای آزاد کردن حافظه و جلوگیری از کندشدن سیستم باشد.