گراندو: ۷۶۸ گیگ VRAM روی یه میز
خلاصهٔ کاملتر
تو این مقاله یه ورکاستیشن به اسم Camino Grando رو عملی تست کردن: هشت تا کارت Nvidia RTX Pro 6000 Blackwell نسخهٔ سرور، هر کدوم ۹۶ گیگ VRAM، جمعاً ۷۶۸ گیگابایت، کنار یه CPU مدل AMD EPYC 9474F با ۴۸ هسته و ۵۱۲ گیگ رم DDR5. هر کارت حدود ۱۵ هزار دلاره، یعنی فقط همین هشت کارت میشه حدود ۱۲۰ هزار دلار. هدف این جعبه ساختن یه کیس گیمینگ سریعتر نیست؛ اینه که مدلهای open-weight بزرگ رو کامل و محلی سرو کنی.
به گفتهٔ نویسنده مدل GLM 5.2 با حجم ۴۳۳ گیگابایت تو حدود ۴.۵ دقیقه لود شد و نزدیک ۹۵ درصد کل VRAM رو گرفت. سرعت تولید توکن به معماری مدل بستگی داشت: GLM 5.2 حدود ۴۸ توکن بر ثانیه، Qwen 3 235B حدود ۸۵ و سریعترین مدل یعنی Qwen 3.8 Flash Next حدود ۱۲۶ توکن. نکتهٔ خوب اینه که با بلند شدن context سرعت تولید تقریباً ثابت موند، چیزی که روی سیستمهای کوچیکتر معمولاً افت میکنه.
prompt processing (یعنی همون مرحلهای که مدل ورودی رو میخونه و رمزگذاری میکنه، قبل از اینکه حتی یه کلمه بنویسه) برای کار با کد مهمتره. اینجا فاصلهٔ مدلها خیلی بیشتر بود: از حدود ۲۲۰۰ توکن بر ثانیه روی GLM 5.2 تا ۱۲۶۰۰ توکن روی Flash Next. با یه پرامپت ۱۲۸ هزار توکنی، اولین توکن روی Flash Next بعد از حدود ۱۴.۵ ثانیه میاومد ولی روی GLM 5.2 حدود ۵۰ ثانیه طول میکشید.
نویسنده میگه محدود کردن توان هر کارت به ۳۰۰ وات به جای ۶۰۰ وات پیشفرض تقریباً هیچ اثری روی سرعت نداشت، چون گلوگاه این بار کاری پهنای باند حافظهست نه توان محاسباتی؛ ۶۰۰ وات فقط گرما اضافه کرد و حتی باعث کرش شبانهٔ سیستم شد. NVLink هم نداره و همهٔ ارتباط کارتها از PCIe میگذره، برای همین Qwen 3 235B روی چهار کارت ۵۸ توکن بر ثانیه میداد ولی روی هشت کارت فقط ۳۷ توکن.
نکات کلیدی:
- ۷۶۸ گیگابایت VRAM روی هشت کارت RTX Pro 6000 بلکول، تو یه شاسی ۴U آبخنک با وزن ۵۵ کیلو
- مدل GLM 5.2 با ۴۳۳ گیگابایت حجم تو ۴.۵ دقیقه لود شد و حدود ۹۵ درصد کل VRAM رو گرفت
- سریعترین مدل تستشده Qwen 3.8 Flash Next بود: ۱۲۶ توکن تولید و ۱۲۶۰۰ توکن پردازش پرامپت در ثانیه
- ۳۰۰ وات در برابر ۶۰۰ وات به ازای هر کارت، تفاوت معناداری تو سرعت نداشت
- بدون NVLink، پخش کردن Qwen 3 235B روی هشت کارت نسبت به چهار کارت کندتر شد: ۳۷ در برابر ۵۸ توکن بر ثانیه
- prefix caching تو vLLM زمان اولین توکن یه مکالمهٔ ۱۶ هزار توکنی رو از ۵.۹ ثانیه به ۰.۸۳ ثانیه رسوند
- مصرف بیکار سیستم با یه مدل لودشده حدود ۷۰۰ واته




