راهنمای نصب FreeToken برای اجرای Qwen 3.6 روی یک GPU
خلاصهٔ کاملتر
FreeToken یه ابزار سرو مدله که مخصوص مدلهای mixture of experts (MoE یعنی مدلهایی که بهجای فعال کردن کل شبکه، برای هر توکن فقط چند تا زیرشبکه یا «اکسپرت» رو فعال میکنن) طراحی شده. مدلهایی مثل GLM، DeepSeek و Qwen از همین معماری استفاده میکنن و معمولاً چند صد میلیارد پارامتر دارن. ترفند FreeToken اینه که بیشتر مدل رو تو RAM سیستم نگه میداره و فقط اکسپرتهای موردنیاز رو موقع نیاز روی GPU میآره، در نتیجه با یک کارت گرافیک معمولی هم میشه مدلهایی رو اجرا کرد که معمولاً چند GPU قوی میخوان.
قبل از سرو کردن مدل، FreeToken یه بنچمارک روی سختافزار خودت میگیره: سرعت پردازش CPU رو در برابر سرعت انتقال از طریق PCIe (باس ارتباطی بین CPU و GPU) میسنجه و بر اساس نتیجه، بین حالت hybrid (تقسیم محاسبات بین CPU و GPU) یا حالت offload (انتقال اکسپرت از طریق PCIe به GPU) یکی رو خودکار انتخاب میکنه، بدون تنظیم دستی.
تو نمونهٔ این راهنما، با یه مدل Qwen 3.6 کوانتیزهشده روی کارت A6000، بارگذاری وزنها حدود ۳۰ ثانیه طول کشید، حدود ۲۱ گیگابایت VRAM فقط برای کش KV (حافظهٔ نگهداری context مکالمه) کنار گذاشته شد و مصرف نهایی VRAM به حدود ۴۴ گیگابایت رسید. بعدش با یه درخواست ساده میشه مطمئن شد کدوم مدل داره سرو میشه.
بعد از بالا اومدن سرور، میشه با دستور FT shell وارد یه محیط چت ترمینالی شد که یه نوار وضعیت زنده هم داره: سرعت تولید توکن در ثانیه، وضعیت کش اکسپرتها روی GPU و میزان استفادهٔ دوباره از اون، میزان استفاده از کش KV و مصرف کلی VRAM. یعنی دیگه لازم نیست از ابزار مانیتورینگ جدا استفاده کنی تا بفهمی سیستمت داره درست کار میکنه یا داره به سقف حافظه میخوره.
FreeToken میتونه بهجای API ابری، بکاند محلی ابزارهای کدنویسی مثل Claude Code، Codex، Hermes agent، OpenClaw و OpenCode هم باشه؛ کافیه این ابزارها رو با آدرس سرور محلی FreeToken اجرا کنی. نویسنده تأکید میکنه این راهحل هنوز به ظرفیت RAM سیستم و سرعت PCIe یا CPU وابستهست، پس مدلهای بزرگتر مثل GLM یا DeepSeek به رم و دیسک بیشتری نیاز دارن، اما برای اجرای محلی مدلهای بزرگ روی یه GPU تککاربره، راهحل عملیه.
نکات کلیدی:
- FreeToken با نگهداشتن اکسپرتهای غیرفعال روی RAM و بارگذاری موردی روی GPU، مدلهای صدها میلیارد پارامتری رو روی یک GPU قابل اجرا میکنه
- یه بنچمارک خودکار بین حالت hybrid (محاسبه روی CPU) و offload (انتقال از PCIe) تصمیم میگیره
- در نمونهٔ Qwen 3.6 روی A6000: بارگذاری در ۳۰ ثانیه، حدود ۲۱ گیگ VRAM برای KV cache، مصرف نهایی حدود ۴۴ گیگ
- شل ترمینالی FT shell آمار زندهای مثل توکن بر ثانیه، وضعیت کش اکسپرت و مصرف VRAM رو نشون میده
- قابل اتصال به ابزارهای کدنویسی مثل Claude Code، Codex، Hermes agent، OpenClaw و OpenCode بهجای API ابری




