آپدیت شاخصهای تخصصی Artificial Analysis: Claude Fable 5.1 همهجا اوله
خلاصهٔ کاملتر
شرکت Artificial Analysis که کارش سنجش و رتبهبندی مدلهای هوش مصنوعیه، نسخه ۱.۱ از Capability Index رو معرفی کرد. این شاخصها وظایف شغلهای مختلف (طبق دیتابیس O*NET) رو به بنچمارکهای مشخص وصل میکنن و بر اساس اینکه هر مهارت چقدر تو اون شغل کاربرد داره، وزندهی میشن. شش حوزه پوشش داده میشه: مالی و حسابداری، استراتژی و عملیات، حقوقی، سلامت و پزشکی، مهندسی، و اقتصاد.
تو این آپدیت یه قابلیت جدید به اسم Agentic Tool Use (یعنی توانایی مدل تو استفاده درست از ابزارهای بیرونی حین انجام کار) به چند تا از این حوزهها اضافه شده، در حالی که ارزیابی قدیمیتر Agentic Customer Interaction از همهشون حذف شده. یه بنچمارک جدید به اسم GDP.pdf هم که توانایی خوندن و تحلیل اسناد طولانی رو میسنجه، به بخش Long-Context Reasoning اضافه شده.
طبق نتایج تازه، Claude Fable 5.1 (نسخه max) تو هر شش حوزه رتبه اول رو گرفته، و GPT-6 Astra (max) تو چهار حوزه از شش تا (مالی، استراتژی، حقوقی و مهندسی) دومه. نکته جالب اینه که مدلهای وزنباز (open weights) هم دارن خودشونو نشون میدن: Kimi K3 تو مالی، حقوقی و اقتصاد اول شده، DeepSeek V4.1 Flash تو استراتژی و عملیات، و GLM-5.3 تو سلامت و مهندسی.
نکات کلیدی:
- شش حوزه پوشش داده میشن: مالی و حسابداری، استراتژی و عملیات، حقوقی، سلامت، مهندسی، اقتصاد
- Claude Fable 5.1 تو هر شش حوزه رتبه یکمه
- GPT-6 Astra تو چهار حوزه از شش تا دومه
- مدلهای وزنباز مثل Kimi K3، DeepSeek V4.1 Flash و GLM-5.3 هم تو بعضی حوزهها رتبه اول رو گرفتن




