دو مدل ایجنتیک در دو مقیاس؛ Nanbeige4.2-3B و Laguna S 2.1
خلاصهٔ کاملتر
به گفتهٔ نویسنده، این دو مدل با اینکه هر دو برای کارهای ایجنتیک (استدلال چندمرحلهای، استفاده از ابزار و تعامل با محیط) ساخته شدن، دو رویکرد کاملاً متفاوت دارن: Nanbeige روی یه مجموعهٔ کوچیک از وزنها محاسبهٔ تکراری انجام میده، ولی Laguna به یه استخر خیلی بزرگتر از پارامترها دسترسی پراکنده (sparse) داره.
نکتهٔ جالب Nanbeige4.2-3B معماری Looped Transformer هست: بهجای داشتن لایههای زیاد و یکتا، فقط ۲۲ لایهٔ دیکودر داره که دو بار اجرا میشن و همون وزنها تو پاس دوم دوباره استفاده میشن. این کار مصرف حافظهٔ وزن رو کم میکنه، ولی نویسنده تأکید میکنه محاسبات کم نمیشه؛ هر توکن باید دو بار از کل استک رد بشه. برای همین پیشنهاد میده اسمگذاریای مثل «3B-2P» (دو پاس) باب بشه تا کاربر انتظار سرعت یه مدل ۳ میلیاردی رو نداشته باشه.
به گفتهٔ نویسنده، مصرف KV-cache این مدل بالاست (حدود ۱۷۶ کیلوبایت برای هر توکن) و تو کانتکست کامل ۲۵۶ هزار توکنی میتونه به ۴۴ گیگابایت برسه؛ با این حال یه GPU ۱۶ گیگابایتی هم میتونه اجراش کنه. طبق ارزیابیهای منتشرشده، Nanbeige تو بیشتر تسکهای ایجنت، کدنویسی و استدلال از Qwen3.5-9B و روی بنچمارکهایی مثل SWE-Bench Verified از Gemma 4 12B جلو زده.
Laguna S 2.1 اما یه مدل تخصصیتر و بزرگتره: ۱۱۸ میلیارد پارامتر کل، ۲۵۶ اکسپرت مسیریابیشده بهعلاوهٔ یه اکسپرت مشترک، و انتخاب ۱۰ اکسپرت برتر برای هر توکن. از ۴۸ لایهش، ۱۲ لایه اتنشن سراسری و ۳۶ لایه اتنشن پنجرهٔ لغزان دارن تا هزینهٔ کانتکست بلند کم بمونه. هدف اصلیش مهندسی نرمافزار طولانیمدته و روی یه GPU از نوع B300 اجرا میشه؛ نسخههای INT4 و NVFP4 هم زیر ۸۰ گیگ جا میشن.
نویسنده میگه Laguna مدل خیلی خوبی به نظر میرسه، ولی بازخورد جامعه تا الان مختلط بوده و خودش هم قراره یه مدتی باهاشون کار کنه و احتمالاً بعداً یه مقاله دربارهٔ استفاده ازشون برای کدنویسی ایجنتیک بنویسه.
نکات کلیدی:
- دو مدل تازهٔ ایجنتیک در دو مقیاس: Nanbeige4.2-3B کوچیک و Laguna S 2.1 بزرگ
- Nanbeige با Looped Transformer، ۲۲ لایه رو دو بار اجرا میکنه؛ حافظهٔ کمتر ولی محاسبات همونقدر
- Nanbeige تو چند بنچمارک از Qwen3.5-9B و Gemma 4 12B جلو زده، ولی KV-cache سنگینی داره
- Laguna S 2.1 یه MoE با ۱۱۸ میلیارد پارامتر و فعالسازی ۸ میلیاردیه که روی کدنویسی تمرکز داره
- Laguna روی یه GPU از نوع B300 اجرا میشه؛ بازخورد جامعه فعلاً مختلطه




