چرا مدلهای اوپنسورس هنوز غولها رو نکشتن
خلاصهٔ کاملتر
کارتیک راوی که خودش داره یه نئوکلاد میسازه، میگه تو جلسههاش با سرمایهگذارها یه سؤال مدام تکرار میشه: اگه مدلهای اوپنسورس اینقدر خوب شدن، چرا هنوز OpenAI و Anthropic اینهمه پول در میارن؟ جواب کوتاهش اینه که وزن باز با اینفرنس قابلاستفاده یکی نیست. یه مدل میتونه رایگان دانلود بشه و همزمان سرویسدادن پایدارش گرون و اعصابخردکن باشه.
حساب سرانگشتی مقاله اینه: یه H100 ساعتی حدود ۲.۹۹ دلار در میاد و اگه تماموقت توکن تولید کنه، از خریدن همون تعداد توکن از API ارزونتر تموم میشه. ولی مصرف واقعی صاف و یکنواخت نیست؛ آدمها میرن ناهار، آخر هفته میرسه و کارت بیکار میمونه. به گفتهٔ نویسنده تو بهرهوری حدود ۲۵ درصد ورق برمیگرده و همون کارت از API گرونتر در میاد.
نکتهٔ دوم اینه که کارت اجارهای، API نیست. باید وزنها رو دانلود کنی، تو حافظه جاشون بدی، یه رانتایم مثل vLLM یا SGLang بالا بیاری و بعد تازه اندپوینت رو از بیرون قابلدسترس کنی: رمزنگاری اتصال، کلید API، ریتلیمیت، صف، بچینگ پیوسته و مِتریک. نویسنده میگه هرچی از اجارهٔ خام GPU میری سمت دیپلوی مدیریتشده و سرورلس، محصولت بیشتر شبیه همون API میزبانی میشه که میخواستی ازش فرار کنی.
برای یه مثال واقعی سراغ Llama 3.3 70B میره با همون بنچمارک NVIDIA: دو تا H100، دقت FP8، ۵۰ درخواست همزمان و حدود ۸۱۴ توکن خروجی در ثانیه، که ماهی حدود ۶٬۰۳۴ دلار اجاره میشه. بعد یه دیپلوی بکاپ، نصف وقت یه مهندس اینفرنس و هزینههای جانبی مثل استوریج و لاگ و مانیتورینگ رو اضافه میکنه و رقم میرسه به حدود ۲۴ هزار دلار در ماه — تقریباً همون چیزی که Together AI برای همون حجم توکن میگیره.
بخش آخر مقاله میگه بیشتر شرکتها اصلاً مدل نمیخوان، اندپوینت میخوان. برای همین سرویسهایی مثل Fireworks و Baseten و Together یه راه وسط ساختن: مدل باز، ولی زیرساختش مال یکی دیگه. به نظر نویسنده خطر واقعی برای غولها وقتی جدی میشه که سه چیز همزمان جفتوجور بشه — کیفیت مدل باز بهقدر کافی نزدیک، سرویسدهیش آسون، و قیمت نهایی بهطور معنادار پایینتر.
نکات کلیدی:
- وزن باز یعنی مدل رایگانه، نه اینکه سرویسدادنش رایگانه
- سربهسر شدن با API به بهرهوری بالای GPU گره خورده، نه به قیمت ساعتی کارت
- رانتایم، احراز هویت، ریتلیمیت، بچینگ و مانیتورینگ همه جزو هزینهٔ اینفرنس حساب میشن
- تو مثال مقاله هزینهٔ کامل سلفهاست تقریباً با API میزبان برابر در میاد
- سلفهاست وقتی میصرفه که سختافزار مدام مشغول باشه و تیم زیرساخت از قبل وجود داشته باشه




