سرور مدل محلی روی Mac mini با ۴۸ گیگ رم
خلاصهٔ کاملتر
نویسنده تو این پست نوشته که کل استکش روی یه Mac mini با تراشهٔ M4 Pro و ۴۸ گیگابایت رم بالا میاد و راهاندازیش حدود نیم ساعت طول میکشه. مدل اصلیش Qwen3.6-35B-A3B با کوانتیزهٔ ۴ بیتیه و برای کارهای سبک سراغ Gemma-4-E4B میره. سرور inference هم oMLX هست و همهٔ دستگاهها، یعنی مک مینی و آیفون و مکبوک، از طریق Tailscale روی یه شبکهٔ خصوصی به هم وصلن بدون اینکه چیزی روی اینترنت عمومی باز بشه.
به گفتهٔ نویسنده دلیل اصلی رفتن سراغ محلی اینه که APIهای ابری «زمین اجارهای»ان: قیمت، سقف مصرف و حتی خود مدلی که پشت صحنه سرو میشه هر وقت بخوان عوض میشه. کنارش حریم دادهٔ کد و اطلاعات مشتری رو هم مطرح میکنه، و اینکه عرضهٔ مدلها میتونه به تصمیمهای دولتی گره بخوره. مزیتهای عملیترش هم هزینهٔ ثابت، تأخیر کمتر، کار کردن بدون اینترنت و نبود rate limit هستن.
فنیترین بخش پست دربارهٔ فرق مدل dense و MoE (یعنی مدلی که وزنهاش بین چندین «متخصص» پخش شده و برای هر توکن فقط بخشیشون فعال میشه) نوشته شده. توی Qwen3.6-35B-A3B عدد 35B کل پارامترهاست، ولی A3B یعنی برای هر توکن فقط حدود ۳ میلیارد پارامتر فعال میشه. همین باعث میشه این مدل روی ۴ بیت حدود ۲۰ گیگ رم بگیره و ۲۸ گیگ برای context و سیستمعامل باقی بمونه، در حالی که یه مدل dense ۲۷ میلیاردی روی یه دستگاه ۱۶ گیگی عملاً جا نمیشه.
از نظر سرعت، Qwen حدود ۳۲۵ توکن بر ثانیه توی پردازش prompt و ۳۴ توکن بر ثانیه توی تولید میده. پهنای باند حافظهٔ M4 Pro هم ۲۷۳ گیگابایت بر ثانیهست که بین M2 Pro و M3 Max میشینه و توضیح میده چرا سرعت «قابل استفاده ولی نه آنی» حس میشه. نویسنده میگه افت کیفیت نسخهٔ ۴ بیتی نسبت به BF16 (یعنی همون نسخهٔ فشردهنشدهٔ ۱۶ بیتی) حدود ۱ تا ۲ واحد توی بنچمارکهاست و به نظرش این معاملهٔ خوبیه.
نکات کلیدی:
- سختافزار: Mac mini با M4 Pro، ۴۸ گیگ رم یکپارچه و ۲۷۳ گیگابایت بر ثانیه پهنای باند حافظه
- مدل اصلی Qwen3.6-35B-A3B روی ۴ بیت حدود ۲۰ گیگ رم میگیره، Gemma-4-E4B حدود ۲.۴ گیگ
- توی MoE فقط پارامتر فعال (A3B یعنی ۳ میلیارد) مهمه، نه عدد کل
- کارایی: ۳۲۵ توکن بر ثانیه پردازش prompt و ۳۴ توکن بر ثانیه تولید
- کوانتیزهٔ ۴ بیتی فقط ۱ تا ۲ واحد نسبت به BF16 افت بنچمارک داره
- قاعدهٔ سرانگشتی: حجم مدل + context باید با ۱۰ تا ۱۵ درصد حاشیه توی رم جا بشه، وگرنه میره روی SSD




