چرا مدلهای لوکال برنده نمیشن
خلاصهٔ کاملتر
Sean Goedecke تو این پست سراغ یه ادعای پرتکرار رفته: هر بار یه مدل open-weight جدید منتشر میشه، عدهای میگن آیندهٔ هوش مصنوعی لوکاله و دیگه چه نیازی به میلیاردها دلار دیتاسنتر. نویسنده معتقده این ایده محکوم به شکسته و هرقدر هم مدلهای open-weight قوی بشن، بیشترِ inference همچنان تو دیتاسنترها اتفاق میافته.
استدلال اولش اینه که مدل لوکال هیچوقت به قدرت مدل دیتاسنتری نمیرسه. مدلهای frontier امروز — چه بسته و چه open-weight — اونقدر بزرگن که فقط روی یه کلاستر کامل GPU اجرا میشن. درسته که مدلهای کوچیک هم دارن باهوشتر میشن، ولی به گفتهٔ نویسنده تا وقتی بتونی مدل امروزی رو روی لپتاپت بیاری، همون مدل به چشمت ضعیف میاد. ترجیح واقعیِ تقریباً همه، قویترین مدل توی بودجهشونه.
استدلال دوم دربارهٔ هزینهست و نویسنده میگه اینجا خیلیها اشتباه حساب میکنن — شبیه کسی که رانندگی با اوبر رو «پول مفت» میدونه و سوخت و استهلاک ماشین رو نادیده میگیره. فقط قیمت راهاندازی یه هوملبِ ساده معادل چند سال اشتراک یه سرویس هوش مصنوعیه و بالاش ماهی ۵۰ تا ۳۰۰ دلار هم پول برق میدی. inference دیتاسنتری هم اصلاً سوبسیدی نیست؛ ذاتاً کارآمدتره.
دلیل فنیش batchingه: یه GPU صدها هزار عملیات ریاضی رو تقریباً به همون سرعتِ یه عملیات انجام میده، ولی توکنهای یه کاربر وابسته به همن و batch نمیشن؛ چیزی که batch میشه inference صدها کاربر کنار همه، با تقریباً همون زمان و برقی که خرج یه نفر میشه. خونه چیزی برای batch کردن نداری، پس utilization افتضاحه. سختافزار هم فرق داره: یه B200 در برابر RTX 4090 حدود سه برابر flops و نزدیک چهار برابر پهنایباند حافظه با همون برق میده. جمعش میشه حدود ۳۰ برابر منابع بیشتر برای اجرای لوکال.
نویسنده سناریوهای برگشت ورق رو هم میشمره: ممنوعیت دولتی دیتاسنترها، یا توقف پیشرفت مدلهای بزرگ در حالی که کوچیکها جلو میرن — که خودش هم بعیده. در عین حال قبول داره مدل لوکال بیفایده نیست: برای کارهای حساس به تأخیر مثل چت صوتی، یه مدل کوچیک و سریع حرف میزنه و فکر سنگین رو به مدل بزرگ میسپره. کنترل کامل زیرساخت یا اینترنت ضعیف هم دلیل موجهیه، ولی به نظرش اینها یه بازار niche باقی میمونن.
نکات کلیدی:
- ادعای نویسنده: بیشتر inference همیشه تو دیتاسنتر میمونه
- آدمها عملاً قویترین مدلِ توی بودجهشون رو انتخاب میکنن
- batching بزرگترین مزیت دیتاسنتره؛ کاربر خانگی چیزی برای batch کردن نداره
- B200 در برابر RTX 4090: حدود ۳ برابر flops و ~۴ برابر پهنایباند حافظه با همون برق
- رویهمرفته اجرای لوکال حدود ۳۰ برابر منابع بیشتر مصرف میکنه
- جای واقعی مدل لوکال: تأخیر پایین، کنترل کامل، اینترنت ناپایدار




