دیپمایند اولین ارزیابی دوسوکور مدل هوش مصنوعی رو انجام داد
خلاصهٔ کاملتر
نویسنده این مطلب، سومایا شرابونی، یه تجربه شخصی تعریف میکنه: چهل تا سوال برای تست یه ابزار متنبهDAX (یعنی تبدیل توضیح فارسی به فرمول Power BI) نوشته بود و توی همون فضای کاری مشترکی ذخیره کرده بود که فروشنده هم بهش دسترسی Viewer داشت. تا جلسه سوم دمو، مدل هر چهل سوال رو درست جواب میداد؛ ولی چون ست سوالاش لو رفته بود، دیگه نمیتونست بفهمه ابزار واقعاً خوبه یا نه. یه شنبه رو صرف نوشتن چهل سوال تازه کرد و بازبینی پروژه دو هفته عقب افتاد.
گوگل دیپمایند به همراه انستیتو ایمنی هوش مصنوعی سنگاپور، OpenMined، AVERI و MLCommons، ۲۷ آگوست ۲۰۲۶ اولین ارزیابی دوسوکور (یعنی نه ارزیاب مدل رو میبینه، نه صاحب مدل سوالهای تست رو) رو روی یه مدل اختصاصی ردهبالا اجرا کردن. این کار با Confidential Space گوگل انجام شد؛ یه محیط اجرای ایزوله که حتی اپراتوری که سیستمو اجرا میکنه هم به دادهها دسترسی نداره. مدلی که تست شد Gemini Flash Lite بود، نه پرچمدار شرکت؛ یعنی این پایلوت بیشتر اثبات زیرساخته تا اثبات حلشدن ارزیابی مدلهای ردهبالا.
به گفته نویسنده، آلودگی بنچمارک یه مشکل رتبهبندیه که برای رگولاتورها مهمه، ولی خودش هیچ بحث پایلوتی رو سر عدد بنچمارک از دست نداده؛ بیشتر پایلوتها رو سر پنجره رفرش دیتا یا پشتیبانی بعد از راهاندازی از دست داده. مشکل واقعی شرکتها آلودگی دسترسیه نه دیتای آموزشی: معمار فروشنده برای پیکربندی دسترسی Viewer به فضای کاری میگیره، یا سوالهای تست تو کانال مشترک میره. فروشنده لازم نیست تقلب کنه؛ همین که کمککننده باشه کافیه که امتیاز بالا بره ولی دیگه چیزی رو نسنجه.
نویسنده یه مثال عملی هم میزنه: رو ظرفیت Power BI مدل F64، حداکثر حافظه ۲۵ گیگه، و طبق مستندات مایکروسافت موقع رفرش این عدد بیشتر از دو برابر میشه چون کپی قدیم دیتا هم نگه داشته میشه. پس تست تو پنجره رفرش یعنی سنجیدن یه ظرفیت دستوپا بسته، و تست ساعت ۲ بامداد یعنی سنجیدن ظرفیتی که کاربرات هیچوقت ندارن. Power BI هم رندر ویژوال رو بعد ۲۲۵ ثانیه قطع میکنه؛ فرمول درستی که ۲۴۰ ثانیه طول بکشه، قبول نیست.
طبق تحقیق کپجمینا رو ۱۵۰۰ مدیر ارشد تو ۱۴ کشور، فقط ۲٪ سازمانها ایجنت هوش مصنوعی رو در مقیاس واقعی اجرا میکنن و ۶۱٪ هنوز فقط بررسی میکنن. گارتنر هم پیشبینی کرده تا پایان ۲۰۲۷ بیش از ۴۰٪ پروژههای ایجنتی لغو میشن؛ دلیلش هزینه بالا و ارزش کسبوکاری نامشخصه. نویسنده میگه ساختن یه ست ارزیابی نگهداشتهشده که فروشنده هیچوقت نبینتش، حدود هشت ساعت وقت میبره؛ بیشترش صرف تایید جواب درسته، نه نوشتن سوال.
نکات کلیدی:
- ارزیابی دوسوکور دیپمایند رو Gemini Flash Lite و با Confidential Space گوگل، ۲۷ آگوست ۲۰۲۶ اجرا شد
- طبق کپجمینا فقط ۲٪ سازمانها ایجنت رو در مقیاس واقعی اجرا میکنن؛ گارتنر پیشبینی کرده ۴۰٪ پروژهها تا ۲۰۲۷ لغو بشن
- Power BI مدل F64 حداکثر ۲۵ گیگ حافظه داره و موقع رفرش این عدد دو برابر میشه
- Power BI رندر ویژوال رو بعد ۲۲۵ ثانیه قطع میکنه؛ Azure Data Factory سقف ۵۰۰۰ موجودیت داره
- ساخت ست ارزیابی ۴۰ سوالی که فروشنده نبینتش، حدود هشت ساعت وقت میبره




