اجرای مدل‌های زبانی بزرگ (LLM) روی کامپیوتر شخصی، بدون ارسال اطلاعات به سرویس‌های آنلاین، به یکی از کاربردهای جذاب هوش مصنوعی محلی تبدیل شده است. با این حال، اجرای مدل‌های بزرگ روی کارت گرافیک‌های قدیمی یا اقتصادی همیشه ساده نیست؛ زیرا حافظه گرافیکی محدود می‌تواند اندازه مدل قابل اجرا و سرعت تولید پاسخ را محدود کند.

یکی از راهکارهای کاربردی برای عبور از این محدودیت، استفاده از معماری Mixture of Experts یا MoE است. این معماری به مدل اجازه می‌دهد برای پردازش هر ورودی فقط از بخشی از شبکه استفاده کند. در نتیجه، بعضی مدل‌های MoE با وجود داشتن تعداد پارامترهای بسیار زیاد، می‌توانند روی سیستم‌هایی با حافظه گرافیکی محدود نیز قابل اجرا باشند؛ البته سرعت نهایی به مدل، میزان فشرده‌سازی، حافظه رم و تنظیمات نرم‌افزار بستگی دارد.