Petals: اجرای مدلهای غولپیکر به سبک تورنت
خلاصهٔ کاملتر
ایدهٔ Petals سادهست: بهجای اینکه یه مدل چندصد میلیارد پارامتری رو کامل روی سختافزار خودت جا بدی، فقط بخشی از مدل رو لود میکنی و به شبکهای از افرادی وصل میشی که بقیهٔ بخشها رو سرو میکنن. همین ساختار همتابههمتا باعث میشه اجرای مدلهایی مثل Llama 3.1 (تا ۴۰۵ میلیارد پارامتر)، Mixtral (8x22B)، Falcon و BLOOM با یه GPU معمولی یا حتی Google Colab شدنی بشه — هم برای تولید متن و هم برای فاینتیون روی کار خودت.
سرعتی که پروژه اعلام میکنه برای inference تکبچی تا حدود ۶ توکن بر ثانیه برای Llama 2 با ۷۰ میلیارد پارامتر و تا حدود ۴ توکن بر ثانیه برای Falcon با ۱۸۰ میلیارد پارامتره؛ یعنی برای چتبات و اپلیکیشن تعاملی کافیه، هرچند با تأخیر APIهای متمرکز قابل مقایسه نیست.
تفاوت مهمش با APIهای معمولی LLM اینه که دستت بازتره: میتونی هر روش فاینتیون و نمونهبرداریای رو به کار ببری، مسیرهای دلخواه خودت رو از داخل مدل عبور بدی و حتی حالتهای پنهان (hidden states) رو ببینی. به بیان خود پروژه، راحتی یه API رو با انعطاف PyTorch و کتابخانهٔ Transformers ترکیب میکنه. کد و مستنداتش روی گیتهاب زیر چتر BigScience منتشر شده و هر کسی میتونه GPU خودش رو به شبکه اضافه کنه تا ظرفیت کل بالا بره.
نکات کلیدی:
- هر شرکتکننده فقط بخشی از وزنهای مدل رو نگه میداره و سرو میکنه
- اجرا و فاینتیون مدلهای خیلی بزرگ با GPU مصرفی یا Colab ممکن میشه
- سرعت اعلامشده حدود ۶ توکن بر ثانیه برای Llama 2 با ۷۰ میلیارد پارامتره
- برخلاف API بسته، دسترسی به hidden states و مسیرهای دلخواه مدل داری
- پروژه متنبازه و بخشی از کارگاه پژوهشی BigScience محسوب میشه




