Agnes 3.0 Flash: مدل 33 میلیاردی با وزنهای باز
خلاصهٔ کاملتر
شرکت Agnes AI نسخهی open-weight مدل Agnes-3.0-Flash رو با لایسنس Apache 2.0 روی Hugging Face گذاشته. این چکپوینت 33 میلیارد پارامتر داره، تا 262,144 توکن context قبول میکنه و multimodal هست، یعنی کنار متن، تصویر و ویدیو رو هم میفهمه. tool calling رو پشتیبانی میکنه و میشه شدت reasoning رو روی high، medium، low یا off تنظیم کرد.
جذابترین بخشش معماری hybrid attention ـه. از 72 لایهی decoder، 54 تاشون با gated delta rule کار میکنن (یعنی یه مکانیزم بازگشتی که بهجای کشِ رو به رشد، یه حافظهی داخلی با اندازهی ثابت نگه میداره) و فقط 18 لایه attention کامل با KV cache دارن، با الگوی تکرارشوندهی 3 به 1. یعنی هرچی ورودی بلندتر بشه، فقط همون 18 لایه حافظه میخورن. همین ترفنده که اجازه میده context انقدر بلند بشه بدون اینکه مصرف حافظه مثل یه ترنسفورمر معمولی بترکه.
بخش تصویری مدل هم یه vision tower ـه، یعنی شبکهای که تصویر رو تیکهتیکه میکنه و به همون فضای برداری متن میبره. اینجا 27 لایهست و تصویر رو 16x16 پچ میکنه. اطلاعات موقعیت هم از یه rotary embedding سهمحوره میاد که کنار متن، ارتفاع و عرض تصویر رو هم میشناسه، برای همین قاطی کردن توکن متنی و تصویری راحتتره.
نتایج بنچمارکها متوسطن، نه بینظیر، که برای یه مدل 33 میلیاردی مقابل سیستمهای خیلی بزرگتر طبیعیه. تو IFBench نمرهی 74.20 گرفته، جلوتر از Qwen3.6-35B-A3B با 64.4 ولی عقبتر از MiniMax M3 با 82.9. تو GPQA Diamond عدد 85.05 ثبت کرده و تو SciCode با 38.08 ته جدوله. جایی که واقعاً جلو میزنه AA-Omniscience ـه با 23.00، بالاتر از مدلهای بزرگتری مثل Qwen3.8 با 18.4.
خود Agnes AI تو مستنداتش میگه این اعداد از harnessهای مختلف و اسنپشاتهای متفاوت اومدن، پس نقطهی مرجعن نه یه مقایسهی کنترلشده. یه هشدار مهمتر هم داده: این چکپوینت Preview با نسخهی production/API همنام یکی نیست. اون یکی کانفیگ فرق داره و تا 1 میلیون توکن میده، برای همین اعداد این دوتا رو نباید قاطی کرد.
برای اجرا، Agnes AI یه GPU تکی H200 با 141 گیگ یا H100 با 80 گیگ حافظه با دقت bf16 پیشنهاد میده؛ خود چکپوینت bf16 حدود 66 گیگ روی دیسک جا میگیره و 128 گیگ یا بیشتر رم هاست توصیه شده. برای لود شدن با Transformers نسخهی 5.12 به بالا و trust_remote_code=True لازمه، چون مدل پیادهسازی اختصاصی خودشو همراه داره.
نکات کلیدی:
- 33 میلیارد پارامتر، لایسنس Apache 2.0، منتشرشده روی Hugging Face
- پنجرهی context چکپوینت Preview برابر 262,144 توکنه؛ نسخهی production تا 1 میلیون میره
- 54 لایه از 72 لایه با gated delta rule کار میکنن و فقط 18 لایه KV cache دارن
- IFBench برابر 74.20 و GPQA Diamond برابر 85.05؛ SciCode با 38.08 ضعیفترین نتیجهشه
- اجرا روی یک H200 یا H100 با bf16؛ حدود 66 گیگابایت روی دیسک
- برای لود شدن به Transformers نسخهی 5.12 به بالا و trust_remote_code=True نیاز داره




