Nex-N2.5: رقیب متنباز Claude که فقط تو کدنویسی میبازه
خلاصهٔ کاملتر
شرکت Nex-AGI مدل جدید خودش، یعنی Nex-N2.5، رو تو سه سایز mini، Pro و Max منتشر کرده و برخلاف Claude و GPT که بستهان، وزنهای هر سه سایز رو به صورت متنباز رو Hugging Face و ModelScope گذاشته. سایز Max، بزرگترین عضو این خانواده، رو یه مدل Mixture-of-Experts با ۱.۶ تریلیون پارامتر ساخته که اولین مدل نکسایجیآی تو این مقیاسه.
تو بنچمارکهای کدنویسی، Nex-N2.5-Max یه پله عقبتر از رقباست. مثلا رو SWE-Bench Pro (که کارهای واقعی مهندسی نرمافزار رو میسنجه) نمرهش ۶۵.۷ ـه در حالی که Claude Opus 5 نمرهی ۷۹.۲ رو گرفته و حتی GPT-5.6 و Kimi-K3 هم جلوترن. این فاصله رو Terminal-Bench 2.1 کمتره (۸۶.۱ در برابر ۸۹.۱ Claude) ولی رو DeepSWE دوباره زیاد میشه.
از طرف دیگه، تو کارهای ایجنتی و جستجوی وب داستان فرق میکنه. رو بنچمارک BrowseComp (یعنی توانایی مدل تو جستجو و جمعبندی اطلاعات از وب زنده) Nex-N2.5-Max با نمرهی ۹۲.۶ بالاترین امتیاز رو گرفته، حتی از Claude Opus 5 (۹۰.۸) و GPT-5.6 (۹۰.۴) هم جلوتره. رو AutomationBench هم تقریبا با Claude برابره (۵۰.۲ در برابر ۵۰.۳).
تو کارهای کنترل دسکتاپ (OSWorld) و مرور وب هم نتیجهها مخلوطه؛ Nex-N2.5-Pro بعضی جاها عقبه ولی رو تست grounding به اسم OSWorld-G رتبهی اول رو میگیره. نویسنده میگه فرقی که هیچ جدول بنچمارکی نشونش نمیده اینه که Nex-N2.5 متنبازه و میشه خودتون هاستش کنید یا فاینتیونش کنید، در حالی که Claude و GPT و Kimi فقط از راه API بسته در دسترسن.
نکات کلیدی:
- Nex-N2.5 تو سه سایز mini، Pro و Max با وزنهای متنباز عرضه شده؛ Max یه مدل ۱.۶ تریلیون پارامتری MoE ـه.
- رو SWE-Bench Pro نمرهش ۶۵.۷ ـه در برابر ۷۹.۲ Claude Opus 5؛ فاصلهی زیادی تو کدنویسی سخت.
- رو BrowseComp با ۹۲.۶ بالاترین امتیاز بین همهی مدلهای مقایسهشده رو گرفته.
- Max نیاز به کلاستر دو نودی با ۱۶ کارت H200 داره؛ Pro و mini سبکترن.
- برخلاف Claude و GPT، وزنهای هر سه سایز رو Hugging Face و ModelScope در دسترسه.




