بنچمارک AIMAC: کد هوش مصنوعی چقدر دسترسپذیره؟
خلاصهٔ کاملتر
بنیاد GAAD با همکاری ServiceNow پروژهای به اسم AIMAC راه انداخته که یه سؤال ساده رو جواب میده: حالا که بخش بزرگی از کد دنیا رو مدلهای هوش مصنوعی مینویسن، این کد برای آدمهای دارای معلولیت قابل استفاده هست یا نه؟ روش کار اینه که از ۳۷ مدل خواستن تو ۲۸ دستهٔ مختلف صفحهٔ وب بسازن، بعد صفحهها رو با ابزار axe-core ممیزی کردن و همهشون رو هم منتشر کردن تا کنار هم مقایسه بشن.
طبق این جدول، GPT 5.4 Mini شرکت OpenAI رتبهٔ اوله؛ میانهٔ «بدهی دسترسپذیری» صفر با هزینهٔ ۰.۹۵ دلار. GPT 5.3 Codex هم میانهٔ صفر داره و حتی تخلف کمتری ثبت کرده، ولی چون گرونتره دوم شده. جالب اینکه هزینه و کیفیت رابطهٔ مستقیمی ندارن: مدل ۱۲۸ دلاری GPT 5.5 Pro رتبهٔ چهارمه و مدل متنباز gpt oss 120b با ۹ سنت رتبهٔ پنجم. بیرون از OpenAI، Qwen علیبابا و GLM 4.7 Flash قویترین نتیجهها رو گرفتن.
نویسندگان گزارش دربارهٔ مدلهای Anthropic صریحتر نوشتن: بهترین نتیجهٔ Claude مال Haiku 4.5 تو رتبهٔ ۱۱ه، Opus 4.8 رتبهٔ ۱۴ و Sonnet 4.6 رتبهٔ ۲۹ با ۱۱۸۶ تخلف، یعنی بیش از دو برابر و نیم میانگین میدان. به گفتهٔ اونها Claude Fable 5 هم که بهعنوان مدلی بسیار توانمند معرفی شده، تو دسترسپذیری وسط جدول و رتبهٔ ۱۷ میایسته، و همین رو دستمایهٔ این پرسش کردن که اگه مدلها واقعاً دارن به این حد از توانایی میرسن، چرا این توانایی به خروجی دسترسپذیرتر ترجمه نشده.
گوگل هم مسیر معکوس رو رفته: نسخهٔ قبلی Gemini آخر جدول بود و Gemini 3.1 Pro Preview حالا رتبهٔ هشتمه.
پشت این رتبهها یه تصویر بزرگتر هست. طبق گزارش WebAIM، ۹۵.۹ درصد از یک میلیون سایت پربازدید دنیا تستهای پایهٔ دسترسپذیری رو رد میکنن و در سال ۲۰۲۶ بعد از شش سال بهبود تدریجی، خطاها ۱۰ درصد بیشتر شدن. شایعترین ایراد تو خروجی مدلها هم دقیقاً همون ایراد سایتهای انسانیه: کنتراست پایین متن با ۸۴.۲ درصد، بعد لینکهای خالی و برچسبهای جاافتادهٔ فرم. نویسنده جمعبندی کرده که هرچی مدلها تو طراحی بصری بهتر میشن، انتخاب بین زیبایی و دسترسپذیری جدیتر میشه و رسیدن به هر دو، تلاش عامدانه میخواد.
نکات کلیدی:
- ۳۷ مدل از ۱۴ شرکت، ۲۸ دستهٔ صفحهٔ وب، ممیزی با axe-core و انتشار همهٔ خروجیها
- GPT 5.4 Mini رتبهٔ اول با میانهٔ بدهی صفر و هزینهٔ ۰.۹۵ دلار؛ OpenAI صاحب هر پنج رتبهٔ اول
- گرونی مدل تضمینکنندهٔ کیفیت نیست؛ ۲۱ مدل از ۳۷ مدل زیر یک دلار هزینه داشتن
- بهترین نتیجهٔ Claude رتبهٔ ۱۱ (Haiku 4.5)؛ Sonnet 4.6 با ۱۱۸۶ تخلف ته جدولتر
- کنتراست پایین متن با ۸۴.۲٪ شایعترین ایراد، درست مثل سایتهای ساخت انسان
- طبق WebAIM، ۹۵.۹٪ سایتهای پربازدید دنیا تست پایهٔ دسترسپذیری رو رد میکنن




