مرکز توسعهٔ AMD Ryzen AI؛ پایان جنگ با ROCm و درایور
خلاصهٔ کاملتر
تو این مقاله اومده که مرکز توسعهٔ AMD Ryzen AI یه نرمافزاره که همراه ماشینهای مبتنی بر تراشهٔ Ryzen AI Max Plus 395 (که با اسم Ryzen AI Halo بازاریابی میشه) عرضه میشه و دقیقاً همون کارهایی رو انجام میده که سازندههای AI محلی معمولاً دستی و با درد و خوندل انجام میدن: پارتیشنبندی درایو لینوکس، نصب ROCm و پیداکردن نسخهٔ درایوری که با بیلد PyTorch جور دربیاد.
بهجاش دستگاه با استک از قبل پیکربندیشده میرسه و داشبوردی میده که توش میبینی چی نصب شده، تخصیص حافظه بین CPU و GPU رو تنظیم میکنی و پلیبوکهای راهنما رو اجرا میکنی. خود ماشین ۱۶ هستهٔ CPU، یه GPU رادئون 8060S حدود ۶۰ ترافلاپس در FP16 و یه NPU نزدیک ۵۰ TOPS داره که همهشون از یه استخر حافظهٔ مشترک استفاده میکنن.
همین حافظهٔ یکپارچه (Unified Memory) قلب ماجراست: تا ۱۲۸ گیگابایت LPDDR5X بین CPU و GPU تقسیم میشه و کاربر خودش سهم هرکدوم رو مشخص میکنه. چون بیشتر اپلیکیشنهای AI رم سیستمی زیادی نمیخوان، تو تستها حدود ۷۵ درصد استخر به GPU داده شده — و همین باعث میشه مدلی مثل GPT OSS 120B یا نسخههای بزرگتر Qwen 3 که رو یه کارت ۳۲ گیگی اصلاً جا نمیشن، اینجا لود بشن.
پلیبوکها بر اساس سطح مهارت و سیستمعامل (ویندوز یا لینوکس) دستهبندی شدن. سطح مقدماتی راهاندازی ComfyUI با مدلهای از پیش نصبشده و سرو کردن LLM با LM Studio رو پوشش میده، سطح متوسط میره سراغ فاینتیون با Unsloth و تنظیم تخصیص حافظهٔ گرافیکی برای بارهای کاری مختلف، و سطح پیشرفته خوشهکردن چند ماشین Halo کنار هم و نوشتن کرنلهای اختصاصی GPU رو توضیح میده.
نویسنده پنهون نمیکنه که این کتابخونه کامل نیست؛ پلیبوکهای پیشرفته در مقایسه با سطح مقدماتی هنوز کمتعدادن. ولی پوششی که هست، همون کارهاییه که اکثر خریدارهای چنین ماشینی واقعاً میخوان انجام بدن: اجرای LLM محلی، تولید تصویر و ویدیو، و فاینتیون بدون کلنجار رفتن با استک زیرین.
از نظر سرعت هم تو تستها یه مدل dense نهمیلیاردی نزدیک ۴۰ توکن بر ثانیه، یه مدل mixture-of-experts (کوئن ۳.۶ با حدود ۳ میلیارد پارامتر فعال) بالای ۵۰ توکن بر ثانیه و GPT OSS 120B حدود ۳۰ توکن بر ثانیه جواب داده — سرعتی که برای چت، RAG و کارهای سبکتر ایجنتی قابل استفادهست. تولید تصویر با ComfyUI هم حدود ۱۹ تا ۲۰ ثانیه برای هر رندر طول کشیده.
چندتا نکتهٔ عملی دیگه: نرمافزار از دسترسی ریموت با SSH پشتیبانی میکنه، پس ماشین میتونه headless گوشهٔ اتاق بهعنوان سرور استنتاج کار کنه؛ AMD نسخهٔ Pro 395 با حافظهٔ تا ۱۹۲ گیگابایت رو هم اعلام کرده؛ و NPU فعلاً تو استکهای رایج LLM استفادهٔ جدی نداره چون پشتیبانی نرمافزاریش هنوز نرسیده.
جمعبندی نویسنده اینه که این ابزار هر گردشکاری رو پوشش نمیده، ولی برای موارد رایج ساعتها راهاندازی محیط رو تبدیل به یه فرایند راهنمادار و تکرارپذیر میکنه — و این برای کسی که میخواد وقتشو صرف ساختن روی استک بکنه نه دیباگکردنش، فرق بزرگیه.
نکات کلیدی:
- ماشین با ROCm و PyTorch از پیش پیکربندیشده میرسه و نصب دستی لازم نیست
- داشبورد، تقسیم حافظهٔ یکپارچهٔ ۱۲۸ گیگابایتی بین CPU و GPU رو کنترل میکنه
- پلیبوکها سه سطح دارن: ComfyUI و LM Studio، فاینتیون با Unsloth، و کلاسترینگ و کرنلنویسی
- سرعتها بین ۳۰ تا ۵۰+ توکن بر ثانیه بسته به معماری مدل
- دسترسی SSH برای اجرای headless و نسخهٔ Pro 395 با ۱۹۲ گیگابایت در راهه
- NPU پنجاه TOPS فعلاً تو استنتاج LLM عملاً بیکار مونده




