لانچ روز صفر مدلهای متنباز چطور جمع میشه
خلاصهٔ کاملتر
«لانچ روز صفر» یعنی یه مدل متنباز همون لحظهای که آزمایشگاه منتشرش میکنه درست کار کنه، نه چند هفته بعد که اکوسیستم خودشو برسونه. برای پلتفرمی مثل Ollama این یعنی مدل روی Apple silicon و Nvidia و AMD و Intel درست اجرا بشه، به هارنسهایی (یعنی همون SDK یا فریمورک ایجنتی که توسعهدهنده واقعاً باهاش کار میکنه) وصل باشه، و همون کیفیتی رو بده که بنچمارک خود آزمایشگاه وعده داده. Jeffrey Morgan، همبنیانگذار و مدیرعامل Ollama، تو پادکست Latent Space این کارو یه «پلیبوک» تمرینشده توصیف میکنه.
دلیل وجود این پلیبوک هم فشرده شدن دورهٔ انتشاره. Morgan میگه قبلاً نسخههای اصلی تقریباً هر شش ماه میاومدن، ولی حالا Deepseek تو یه تابستون سه نسخه از خانوادهٔ Flash رو بیرون داده. آزمایشگاههای چینی مثل Deepseek و Kimi و GLM و MiniMax تند حرکت میکنن و انتشارهای غربی هم دارن همین شتاب رو میگیرن. هر نسخه ممکنه معماری، مکانیزم tool calling یا حتی مودالیتهٔ متفاوتی بیاره؛ مثلاً اولین مدل چندمودالهٔ Deepseek نیاز داشت هارنس خودش هم موازی آپدیت بشه.
آمادهسازی هر مدل سه تکه داره. اول پشتیبانی موتور inference: مدل باید هم سریع اجرا بشه هم عددهاش با پیادهسازی مرجع خود آزمایشگاه بخونه، و Morgan میگه این تکه حتی بدون عجله هم چند هفته کار میبره. دوم هارنس و ابزار: پروژههایی مثل هارنس متنباز Codex یا OpenCode باید روز اول با مدل جدید کار کنن. سوم بهینهسازی سختافزار و ارائهدهندهها، جایی که همکاری با Nvidia و استک سیلیکون اپل تعیین میکنه مدل فقط اجرا بشه یا سریع اجرا بشه.
Morgan صادقانه میگه تیم اگه شانس بیاره چند هفته زودتر به مدل دسترسی میگیره، ولی بیشتر کار واقعی ادغام و تست تو ۲۴ ساعت آخر جمع میشه؛ خودش اسمشو میذاره «مانور آتشنشانی». روز صفر هم معمولاً بزرگترین جهش مصرف همون مدله، پس ظرفیت سمت کلاود باید قبل از عمومی شدن آماده باشه. او کل این ساختار رو به یه سیستمعامل تشبیه میکنه که سختافزار، لایهٔ سرو مدل و هارنسها رو به هم میچسبونه؛ چون تو دنیای متنباز این لایهها دست سازمانهای مختلفن که تقویم انتشار مشترکی ندارن.
دربارهٔ fine-tuning هم نظرش دوپهلوئه: سرعت انتشار توجیه سرمایهگذاری روی مدل اختصاصی رو سختتر کرده چون ممکنه چند هفته بعد یه مدل پایهٔ جدید ازش جلو بزنه، ولی ابزارهای fine-tuning هم خیلی بهتر شدن و اجراش ارزونتر شده. به گفتهٔ او چیزی که کسبوکارها رو اول سمت مدل متنباز میکشونه هزینهست، ولی «ستارهٔ شمالی» واقعی کنترل و امکان سفارشیسازیه. ایجنتهای کدنویسی هم بیشترین بار مصرف توکن رو ساختن.
نکات کلیدی:
- دورهٔ انتشار از حدود شش ماه به چند هفته رسیده؛ Deepseek تو یه تابستون سه نسخهٔ Flash داده
- سه تکهٔ آمادهسازی: موتور inference، هارنسها و بهینهسازی سختافزار با Nvidia و اپل
- دسترسی زودهنگام چند هفتهست، ولی بیشتر ادغام و تست تو ۲۴ ساعت آخر جمع میشه
- روز صفر بزرگترین جهش مصرف هر مدله، پس ظرفیت کلاود باید از قبل آماده باشه
- انگیزهٔ اول کسبوکارها هزینهست ولی هدف بلندمدت کنترل و سفارشیسازیه
- به گزارشی که Morgan اشاره کرده، AT&T حدود ۴۰٪ مصرف توکنش رو به مدلهای متنباز برده




