اکستروپیک ترنسفورمر رو روی تراشهٔ احتمالاتی Z1 اجرا کرد
خلاصهٔ کاملتر
اکستروپیک تو این پست میگه هدف اصلیش ساختن سختافزار احتمالاتی برای هوش مصنوعیه، ولی چون امروز بار اصلی دیتاسنترها روی ترنسفورمرهاست رفته سراغ همین معماری. نتیجه مدلیه به اسم Z1T که روی تراشهٔ Z1 اجرا میشه؛ تراشهای از جنس CMOS زیرآستانه که بهجای بیت قطعی، pbit داره (یعنی بیتهایی که مقدارشون تصادفیه و احتمالش با همسایهها تنظیم میشه). هر Z1 حدود ۲۶۹٬۵۶۸ تا pbit و ۲٬۱۳۵٬۹۰۴ اتصال سختافزاری داره.
محدودیت اصلی اینه که اتصالها تو خود سیلیکون ثابتن و هر گره فقط ۱۶ همسایه داره، پس هر عملیاتی که روش میذاری باید اسپارس باشه. برای همین تو Z1T لایههای متراکم ترنسفورمر با واحدهای tanh-linear جایگزین شدن، RMSNorm جاش رو به Dynamic Tanh داده و بهجای attention کلاسیک از gated convolutional attention استفاده شده. عددهای پیوسته هم روی ۴ تا pbit کوانتیزه میشن و میانگین نمونهها مقدار نهایی رو میسازه.
تیم یه قانون مقیاسپذیری هم برای این مدلها درآورده و نسخههای مختلف رو با اندازه و میزان اتصال متفاوت روی OpenWebText آموزش داده. جمعبندیشون اینه که به ازای هر پارامتر، FLOPهای متراکم کارآمدترن و Z1T برای رسیدن به همون خطای GPT-2 حدود یک مرتبهٔ بزرگی FLOP بیشتر لازم داره. ولی به گفتهٔ نویسندهها قیمت هر FLOP روی همهٔ سختافزارها یکی نیست و همین جاست که Z1 جلو میافته.
تو تخمینهاشون هر توکن روی سیستم Z1T حدود ۲۹۴٫۵ نانوژول انرژی میبره که فقط ۸٫۷ نانوژولش مال نمونهگیری Z1 ـه و بقیهش مال FPGA همراهشه. نسبت به H100 با بهرهوری ۱۰ درصدی، این یعنی حدود ۱۳۹ برابر کممصرفتر و اگه فقط لایههای روی Z1 رو حساب کنی به حدود ۴٬۶۸۰ برابر میرسه. تأخیر هر توکن هم حدود ۵۸٫۸ میکروثانیه تخمین زده شده. حواست باشه اینا تخمین نظرین، نه اندازهگیری روی سختافزار نهایی.
جالبترین نکتهٔ خود گزارش اینه که بیشتر از ۹۵٪ انرژی رو FPGA میبره، نه Z1. یعنی اگه تراشهٔ بعدی از اول برای همین مدلها طراحی بشه و کار بیشتری از دوش FPGA برداشته بشه، به گفتهٔ تیم میشه تا هزار برابر صرفهجویی انرژی نسبت به GPU رسید. وزنهای یکی از بزرگترین رانهای آموزشی روی Hugging Face و رسپی آموزش روی GitHub منتشر شده.
نکات کلیدی:
- هر تراشهٔ Z1 حدود ۲۶۹٬۵۶۸ pbit و ۲٬۱۳۵٬۹۰۴ اتصال ثابت داره؛ درجهٔ هر گره ۱۶ ـه
- Z1T بهجای attention کلاسیک از gated convolutional attention و بهجای RMSNorm از Dynamic Tanh استفاده میکنه
- انرژی هر توکن حدود ۲۹۴٫۵ نانوژول: ۸٫۷ نانوژول روی Z1 و بقیه روی FPGA
- نسبت به H100 با MFU ده درصد حدود ۱۳۹ برابر صرفهجویی انرژی؛ فقط لایههای Z1 حدود ۴٬۶۸۰ برابر
- تأخیر تخمینی هر توکن ۵۸٫۸ میکروثانیه در برابر ۱۰۲ میکروثانیهٔ H100
- وزنها روی Hugging Face و رسپی آموزش روی GitHub منتشر شده




