همکاری NVIDIA و AWS برای اجرای هوش مصنوعی در مقیاس بزرگ
خلاصهٔ کاملتر
ساختن سیستمهای هوش مصنوعی تو مقیاس بزرگ نیازمند استنتاج کمتأخیر، جستوجوی برداری سریع و صرفهٔ خوب GPU هست. انویدیا تو تازهترین همکاریش با AWS میگه رو هر سهتای این محدودیتها کار کرده و میخواد مسیر عملیتری برای اجرای هوش مصنوعی تو مقیاس تولید بده. این کار سه بخش داره: اینستنسهای محاسباتی جدید، جستوجوی برداری سریعتر، و تأیید عملکرد آموزش.
اولین بخش، اینستنسهای EC2 G7 هست که GPUهای RTX PRO 4500 Blackwell رو میارن رو AWS. اینها برای استنتاج هوش مصنوعی، گرافیک، رندر و تحلیل داده ساخته شدن. نسبت به نسل قبلی G6، تا ۴.۶ برابر استنتاج سریعتر و تا ۲.۱ برابر گرافیک بهتر میدن. هر اینستنس تا ۸ تا GPU، ۲۵۶ گیگابایت حافظهٔ GPU، شبکهٔ ۷۰۰ گیگابیت بر ثانیه و تا ۷.۶ ترابایت فضای NVMe محلی داره.
به گفتهٔ انویدیا، جذابیت G7 اینه که چند نوع کار رو با یه اینستنس پوشش میده؛ تیمهای هوش مصنوعی استنتاج کمتأخیر میگیرن، تیمهای رسانه و رندر جریان کاری ویدیوی باکیفیت، و تیمهای داده هم میتونن از حافظه و شبکهٔ بهتر برای خطلولههای تحلیلی و پایگاههای دادهٔ برداری استفاده کنن. این اینستنسها رو میشه از طریق AMIهای یادگیری عمیق، EMR، EKS و ECS استفاده کرد.
بخش دوم دربارهٔ جستوجوی برداریه. نسل بعدی OpenSearch Serverless حالا نمایهسازی برداری روی GPU رو با کتابخونهٔ cuVS بهعنوان انتخاب پیشفرض همهٔ مجموعههای برداری گذاشته. برای تیمهایی که RAG، جستوجوی معنایی، سیستمهای پیشنهاد و عاملهای هوش مصنوعی میسازن، این یعنی جستوجوی برداری روی GPU از یه پروژهٔ تخصصی به یه قابلیت استاندارد AWS تبدیل میشه.
به گفتهٔ انویدیا، تأثیرش مستقیمه: نمایهسازی برداری تا ۱۰ برابر سریعتر و با یکچهارم هزینه نسبت به ساخت فقط با CPU. این یعنی میشه پایگاههای دادهٔ برداری در مقیاس میلیاردی رو زیر یه ساعت ساخت، اونهم با مقیاسپذیری serverless که وقتی کاری نیست بار عملیاتی رو کم میکنه.
بخش سوم اینه که AWS برای بارهای کاری آموزش روی GB300 وضعیت Exemplar Cloud انویدیا رو گرفته؛ یعنی از آستانههای سختگیرانهٔ عملکردی که انویدیا نسبت به معماری مرجعش میسنجه رد شده. انویدیا میگه جمع این سه پیشرفت، هر لایهٔ پشتهٔ زیرساخت هوش مصنوعی رو روی AWS تقویت میکنه، بدون اینکه بار عملیاتی تیمها بیشتر بشه.
نکات کلیدی:
- اینستنسهای EC2 G7 با GPUهای RTX PRO 4500 Blackwell تا ۴.۶ برابر استنتاج سریعتر میدن
- هر اینستنس تا ۸ تا GPU، ۲۵۶ گیگابایت حافظهٔ GPU و شبکهٔ ۷۰۰ گیگابیت بر ثانیه داره
- کتابخونهٔ cuVS جستوجوی برداری روی GPU رو تو OpenSearch Serverless پیشفرض کرده
- نمایهسازی برداری تا ۱۰ برابر سریعتر و با یکچهارم هزینهٔ حالت فقط-CPU انجام میشه
- AWS برای آموزش روی GB300 وضعیت Exemplar Cloud انویدیا رو گرفته




