کارخانهٔ مدل poolside؛ خط تولید خودکار مدلهای پایه
خلاصهٔ کاملتر
poolside تو یه پست فنی توضیح داده چرا سراغ ساخت Model Factory رفته، چارچوب داخلیای برای ترین و مقیاسدهی و آزمایش مدلهای پایه. به گفتهٔ نویسندهها، تو روش سنتی آدمها باید دستی هر مرحله رو راه بندازن و آخرش هم فقط loss curve دستشونه، که سیگنال کافی برای بهتر کردن مدل نیست. استدلالشون اینه که استخدام مهندس بیشتر فقط رشد خطی میده، ولی سرعت پیشرفت AI دستکم نماییه، پس باید با مهندسی مقیاس گرفت نه با نیروی بیشتر.
مقاله طراحی Factory رو تو شش تکرار روایت میکنه. اول ترین سادهٔ یه معماری ثابت، بعد اضافه شدن ارزیابی خودکار وسط pre-training و نه فقط آخر کار، بعد یادگیری تقویتی از اجرای کد، یعنی یه محیط ایزوله با حدود یک میلیون ریپازیتوری گیتهاب که تستهاشون قابل اجراست و مدل روشون خودبازی میکنه. سه تکرار آخر هم ablation خودکار معماری (یعنی عوض کردن یه جزء و سنجیدن اثرش)، پالایش خودکار داده و تعیین خودکار ترکیب دیتاستهان.
زیرساختش یه ارکستریتور Kubernetes روی کلاستر ۱۰ هزارتایی GPU از نوع H200 هست که وابستگی بین کارها رو میفهمه، مثلاً اینکه ارزیابی باید منتظر چکپوینت ترین بمونه. کارهای بینیاز به GPU مثل حذف دادههای تکراری میرن رو نودهای CPU. دیتاست هم بهجای اینکه یهجا ساخته و پخش بشه مستقیم استریم میشه تو ترین، و نسخه و lineage دیتاستها تو جدولهای Apache Iceberg نگه داشته میشه، با Dagster بهعنوان ارکستریتور داده.
کتابخانهٔ pre-training خودشون Titan روی PyTorch سوار شده و موتور inference یعنی Atlas روی سختافزار NVIDIA و AMD و Trainium اجرا میشه. عددهایی که تیم میده ملموسه: حذف دادههای تکراری که قبلاً بیشتر از یه هفته وقت مهندسی میخورد حالا با یه کلیک انجام میشه، و یه sweep روی batch size یا learning rate کمتر از ده دقیقه راه میافته. یه پلتفرم داخلی هم به اسم Podium ساختن که باهاش کل شرکت، نه فقط مهندسها، مدل تازه رو دستی وارسی میکنن.
نکات کلیدی:
- Model Factory چارچوب داخلی poolside برای ترین و آزمایش مدلهای پایهست و روی کلاستر ۱۰ هزارتایی GPU از نوع H200 اجرا میشه.
- محیط یادگیری تقویتی حدود یک میلیون ریپازیتوری گیتهاب رو با تستهای قابل اجرا کانتینری کرده.
- ارزیابیها بهشکل خودکار هر ۱۰۰ تا ۱۰۰۰ استپ ترین اجرا میشن و مقدارش تو فایل config همون آزمایش تنظیمه.
- Dagster ارکستراسیون داده و ترین، Iceberg نسخهبندی دیتاست، Neptune متریک ترین و Grafana سلامت سیستم رو برعهده دارن.
- راه انداختن یه sweep روی batch size یا learning rate از چند روز به کمتر از ده دقیقه رسیده.




