بنچمارک مستقل TPUv7 گوگل منتشر شد
خلاصهٔ کاملتر
گوگل بیش از یه دههست رو تراشههای اختصاصی TPU برای جستجو، تبلیغات، یوتیوب و مدلهای Gemini خودش سرمایهگذاری کرده، و آنتروپیک هم بزرگترین مصرفکننده بیرونی TPUه (بیش از یک میلیون تراشه، بین خرید مستقیم و اجاره از GCP). تا حالا کسی جز خود گوگل عملکرد واقعی این تراشهها رو تست نکرده بود. حالا SemiAnalysis، رو پلتفرم InferenceX، اولین بنچمارک مستقل نسل هفتم TPU یعنی Ironwood (TPUv7) رو منتشر کرده و اونو با GPUهای B200 و B300 انویدیا مقایسه کرده.
طبق این تست، با مدل باز Qwen3.5 (۳۹۷ میلیارد پارامتر، با دقت FP8)، TPUv7 تا ۵۰ درصد توکن بیشتر بهازای هر دلار نسبت به B200 و B300 تولید میکنه. برای مثال، با سرعت ۱۰۰ توکن در ثانیه برای هر کاربر، هزینه هر میلیون توکن رو Ironwood حدود ۰.۱۸۱ دلاره، در حالی که رو B200 حدود ۰.۲۲۲ و رو B300 حدود ۰.۲۷۶ دلاره؛ یعنی ۱۹ تا ۳۴ درصد ارزونتر. دلیل اصلیش قیمت پایینتر ساعتی TPUه، نه لزوماً سرعت خامش.
البته این برتری همیشگی نیست. رو حالت FP4 (که دقت مدل رو کم میکنه ولی سرعت رو بالا میبره) انویدیا هنوز جلوتره، چون این نسل از TPU از FP4 پشتیبانی نمیکنه؛ نویسنده انتظار داره نسل بعدی (TPUv8i) این عقبموندگی رو جبران کنه. همچنین تو مقایسه سرویسدهی «disaggregated» (که گوگل هنوز رو TPU کامل بهینهش نکرده)، پلتفرم NVL72 انویدیا تو بخشی از بازه تاخیر هنوز جلوتره.
بخش مهم دیگه مقاله، معرفی TorchTPUه: یه لایه نرمافزاری جدید که برخلاف روش قبلی (TorchAX که کد PyTorch رو به JAX ترجمه میکرد)، به توسعهدهنده اجازه میده مستقیم و بهصورت بومی از PyTorch رو TPU استفاده کنه، درست مثل کاری که الان رو GPU انجام میشه. این باعث میشه موتورهای سرویسدهی معروف مثل vLLM و SGLang راحتتر از TPU پشتیبانی کنن. طبق مقاله، TorchTPU همین الان تو نسخه بتای خصوصیه و قراره اواسط اکتبر امسال متنباز بشه.
نکات کلیدی:
- TPUv7 (ایرونوود) گوگل تو تست مستقل SemiAnalysis تا ۵۰ درصد توکن بیشتر بهازای هر دلار نسبت به B200/B300 انویدیا تولید میکنه
- برتری TPU از اختلاف قیمت ساعتی میاد نه سرعت خام؛ رو حالت FP4 انویدیا هنوز جلوتره
- آنتروپیک بزرگترین مشتری بیرونی TPUه، با تعهد به بیش از یک میلیون تراشه (خرید مستقیم و اجاره)
- لایه نرمافزاری جدید TorchTPU جایگزین TorchAX میشه و اجازه میده PyTorch مستقیم رو TPU اجرا بشه؛ قراره اواسط اکتبر متنباز بشه
- گوگل قراره پشتیبانی از مدلهای باز دیگه مثل Kimi K3 و GLM 5.3 رو هم به این استک اضافه کنه




