Macaron-V1: با ۴ میلیارد پارامتر از GLM-5.2 جلو زد
خلاصهٔ کاملتر
Mind Lab، شرکتی که اکتبر ۲۰۲۵ تأسیس شده و تیمش از xAI، DeepMind، DeepSeek و ByteDance Seed اومدن، ۲۱ ژوئیه نسخهٔ کامل Macaron-V1 رو منتشر و متنباز کرد. تو گفتوگو با ۳۶Kr، اندرو چن بنیانگذار شرکت میگه مسیر اصلیشون از اول یادگیری مداوم بوده، حتی وقتی هنوز اسمشو نمیدونستن. به گفتهٔ چن پسآموزش (post-training) کمکم داره خودش به یک صنعت جدا تبدیل میشه.
این انتشار دو مدل داره: Venti با ۷۴۸ میلیارد پارامتر که ۷۴۴ میلیاردش همون GLM-5.2ِ فریزشدهست و فقط ۴ میلیارد پارامترش تو چهار آداپتور LoRA آموزشدیدهٔ Mind Lab قرار داره — هر کدوم مسئول یکی از چت، ایجنت، کدنویسی و ساخت رابط کاربری. مدل دوم، Tall، نسخهٔ سبک ۵۰ میلیارد پارامتریه که روی Qwen 3.6 پسآموزش شده و برای اجرای محلی درنظر گرفته شده. هر دو بهصورت بومی از پنجرهٔ متن دو میلیون توکنی پشتیبانی میکنن.
روش پشت این مدل MoL یا ترکیب آداپتورهای LoRAست: سیستم موقع هر کار بهصورت پویا سراغ ماژول مناسب همون کار میره، و دادهٔ استفادهٔ کاربر هم میتونه تو یک آداپتور اختصاصی تقطیر بشه. شرکت میگه یک بار ۲۰۰ آداپتور رو با ۲۰۰ دیتاست جدا آموزش داده و همه رو روی یک مدل سوار کرده؛ هرچی تعداد آداپتورهای همکار بیشتر شده عملکرد بهشکل لگاریتمی-خطی بهتر شده، و اون مدل حدود ۲۵٪ بهتر از مدلی بوده که فقط یک آداپتور آموزشدیده روی هر ۲۰۰ دیتاست داشته.
دسامبر ۲۰۲۵ این تیم روی Kimi K2 — یک مدل MoE هزارمیلیاردپارامتری — آموزش LoRA-RL سرتاسری انجام داد و با ۶۴ کارت H800 انویدیا به نتیجهای نزدیک آموزش تمامپارامتر رسید، اون هم با حدود ۱۰٪ منابع GPU. سختترین بخشش اختلاف دقت بین آموزش و استنتاج بود که با یک موتور آموزش موازیِ ترکیبی و نمونهگیری اهمیتِ برشخورده حلش کردن. چن میگه سنگر واقعی شرکت همین زیرساخته؛ پلتفرم MinTشون بیش از یک میلیون مدل LoRA رو مدیریت میکنه.
به گفتهٔ چن درآمد سالانهٔ تکرارشوندهٔ شرکت به ۱۰ میلیون دلار رسیده و مشتریهای سازمانیش بیشتر سازندههای سختافزار AI هستن، چون دادهٔ هر کاربر متفاوته و برای یادگیری مداوم تو یک حوزهٔ خاص ارزش داره. با این حال میگه عجلهای برای تجاریسازی ندارن و نمیخوان همهٔ منابع محاسباتیشون صرف انجام سفارش بشه، چون اولویت هنوز باید تحقیق باشه.
نکات کلیدی:
- Macaron-V1 متنباز شده و شامل Venti (۷۴۸ میلیارد پارامتر، روی GLM-5.2) و Tall (۵۰ میلیارد، روی Qwen 3.6) میشه
- فقط ۴ میلیارد پارامتر تازه، پخششده تو چهار آداپتور LoRA برای چت، ایجنت، کدنویسی و ساخت UI
- هر دو مدل بهصورت بومی پنجرهٔ متن دو میلیون توکنی دارن
- آزمایش ۲۰۰ آداپتوره: همکاری چند LoRA حدود ۲۵٪ بهتر از یک LoRA آموزشدیده روی همهٔ دادهها بود
- LoRA-RL روی مدل هزارمیلیاردی Kimi K2 با حدود ۱۰٪ منابع GPU به نتیجهٔ نزدیک آموزش کامل رسید




