کدوم مک برای اجرای لوکال مدلهای زبانی؟
خلاصهٔ کاملتر
این راهنمای خرید vettedconsumer میگه برای اجرای لوکال مدلهای زبانی روی مک، اول ظرفیت unified memory مهمه؛ یعنی حافظهای که CPU و GPU با هم ازش استفاده میکنن و جای VRAM کارت گرافیک رو میگیره. عدد دوم پهنای باند حافظهست. حافظه تعیین میکنه چه مدلی اصلاً لود میشه و پهنای باند تعیین میکنه چقدر سریع توکن تولید میشه. حافظه هم لحیمشدهست و بعداً ارتقا نمیگیره، پس باید حافظهٔ دو سال آینده رو بخری.
بر اساس جدول مقاله، ۱۶ تا ۳۲ گیگ فقط برای مدلهای ۷ تا ۱۴ میلیاردی جواب میده. ۶۴ گیگ نقطهٔ شیرین بازاره: مک مینی M4 Pro با ۱٬۵۹۹ دلار و ۲۷۳ گیگابایت بر ثانیه، که یه مدل ۷۰B کوانتیزهٔ ۴ بیتی رو با کانتکست واقعی جا میده. ۱۲۸ گیگ (مک استودیوی M5 Max، ۲٬۴۹۹ دلار، تا ۶۱۴ گیگابایت بر ثانیه) برای ۷۰B راحته، و ۵۱۲ گیگ M5 Ultra با ۱.۲ ترابایت بر ثانیه تنها راه اجرای DeepSeek 671B ـه. مک استودیوهای M5 هم ۲۲ سپتامبر میرسن، پس مقاله میگه برای استودیو صبر کن ولی مینی رو همین حالا بخر.
نقطهٔ قوت واقعی مک همینه: مدلهای sparse MoE، یعنی مدلهایی که هر توکن فقط بخشی از پارامترهاشون فعال میشه (DeepSeek-V3 با ۶۷۱ میلیارد پارامتر ولی ۳۷ میلیارد فعال)، کامل تو حافظه جا میشن. کاربرها روی M3 Ultra ۵۱۲ گیگی حدود ۶ تا ۱۸ توکن بر ثانیه گرفتن و Qwen3-235B رو تا ۲۴ توکن بر ثانیه روی MLX. اونم زیر ۲۰۰ وات، در حالی که یه رَک چند کارتی کیلووات مصرف میکنه.
ضعفش دو تاست و هر دو از یه ریشه میان: حافظهٔ زیاد ولی توان محاسباتی متوسط. اول اینکه مدلهای dense غولپیکر لاکپشتی میشن؛ روی همون M3 Ultra، مدل Llama 3.1 405B فقط ۱.۲۵ توکن بر ثانیه داده. دوم و مهمتر، خوندن پرامپت (prefill) محاسبهمحوره و مک اینجا میلنگه: M2 Ultra حدود ۵ تا ۸ برابر کندتر از RTX 4090 پرامپت میخونه و یه M3 Ultra حدود ۱۴.۸ دقیقه طول کشیده تا فقط یه پرامپت ۸ هزار توکنی رو بخونه.
سمت نرمافزار، MLX یعنی فریمورک خود اپل حالا پیشفرض سریعتره: ۱.۴ تا ۱.۸ برابر سریعتر از llama.cpp روی مدلهای dense و تا حدود ۳ برابر روی MoE، و Ollama از مارس ۲۰۲۶ بکاند MLX اضافه کرده. llama.cpp برای کانتکست خیلی بلند و سازگاری با GGUF هنوز برندهست، پس بهتره هر دو رو نصب کنی. یه نکته هم رو برگهٔ مشخصات نیست: macOS پیشفرض فقط ۷۰ تا ۷۵ درصد رم رو به GPU میده و با کلید iogpu.wired_limit_mb میشه این سقف رو بالا برد.
نکات کلیدی:
- ۶۴ گیگ حافظهٔ یکپارچه نقطهٔ شیرین خریده؛ مک مینی M4 Pro با ۱٬۵۹۹ دلار و ۲۷۳ گیگابایت بر ثانیه.
- M5 Ultra با ۵۱۲ گیگ و ۱.۲ ترابایت بر ثانیه تنها گزینه برای اجرای لوکال DeepSeek 671B ـه.
- پردازش پرامپت روی مک ۵ تا ۸ برابر کندتر از RTX 4090 ـه؛ برای RAG و کدبیس بزرگ ضعف جدیه.
- MLX روی مدلهای dense حدود ۱.۴ تا ۱.۸ برابر و روی MoE تا ۳ برابر سریعتر از llama.cpp ـه.
- سقف حافظهٔ GPU در macOS حدود ۷۰ تا ۷۵ درصد رمه و با کلید iogpu.wired_limit_mb بالا میره.




