TurboFieldfare؛ مدل ۲۶ میلیاردی با ۲ گیگ رم
خلاصهٔ کاملتر
TurboFieldfare یه پروژهٔ تحقیقاتی مستقله که اندری میخایلوف، مهندس iOS و متال، نوشته. به گفتهٔ نویسنده ایدهٔ اصلی ساده بوده: حافظه گرون شده، پس بیا یه مدل ۲۶ میلیارد پارامتری رو با بودجهٔ حدوداً ۲ گیگابایتی اجرا کنیم. این رانتایم مخصوص همین یه مدل نوشته شده و صرفاً پوستهای دور MLX یا llama.cpp نیست.
ترفند کار اینه که کل مدل ۱۴.۳ گیگابایتی توی رم لود نمیشه. فقط هستهٔ مشترک ۱.۳۵ گیگابایتی و کش KV با دقت FP16 مقیم حافظه میمونن و بقیهاش استریم میشه. توی هر لایهٔ ترنسفورمر، متال توجه و روتر رو حساب میکنه، بعد CPU با آیدی ۸ اکسپرت برترِ روتر سراغ یه کش ۱۶ اسلاته میره و هرچی توش نیست رو با خوندن موازی از SSD میآره.
عددهاش هم اعلام شده: وزنها با کوانتیزهٔ ۴ بیتی MLX ذخیره میشن، حدود ۳.۸۸ میلیارد پارامتر برای هر توکن فعاله، و روی مکبوک ایر M2 با ۸ گیگ رم بین ۵.۱ تا ۶.۳ توکن بر ثانیه دیکد میشه؛ روی M5 Pro با ۲۴ گیگ این عدد به ۳۱ تا ۳۵ توکن میرسه. نویسنده تأکید میکنه اینا نقطهٔ مرجعن، نه سقف کارایی.
بسته شامل یه اپ نیتیو مک، یه CLI و یه سرور لوپبکِ سازگار با API اوپنایآیه که همه از یه پوشهٔ مدل با فرمت .gturbo استفاده میکنن. نصبکننده هم کل چکپوینت رو یکجا پیاده نمیکنه؛ بازههای بایتی رو از هاگینگ فیس میگیره و همون لحظه به فرمت .gturbo بازبستهبندی میکنه تا نسخهٔ دوم مدل روی دیسک نیفته. پیشنیازها هم macOS 26، متال ۴ و سوئیفت ۶.۲ به بالاست.
فعلاً فقط متنه — تصویر و صدا و ویدیو پشتیبانی نمیشه — و رانتایم به یه چکپوینت پینشده قفله. نویسنده میگه ۱۰۳ نتیجهٔ اندازهگیریشده از آزمایشها روی کرنلها، کش، I/O و دیکد رو مستند کرده و قدم بعدی رو ساخت نسخهٔ آیفون و آیپد میدونه.
نکات کلیدی:
- اجرای Gemma 4 26B-A4B با حدود ۲ گیگ رم روی مکهای اپل سیلیکون
- هستهٔ مشترک و کش KV مقیم حافظه، اکسپرتها استریم از SSD
- ۵.۱ تا ۶.۳ توکن بر ثانیه روی M2 هشت گیگی، ۳۱ تا ۳۵ توکن روی M5 Pro
- اپ مک، CLI و سرور سازگار با اوپنایآی، همه با سوئیفت و متال
- فقط متن، فقط arm64، نیازمند macOS 26 و متال ۴




