Union Alpha: مدل مخفیای که هیچکس صاحبش نیست
خلاصهٔ کاملتر
تو این مقاله اومده که Union Alpha یه مدل ناشناسه که بیسروصدا روی پلتفرمهای روتینگ مدل (مثل OpenRouter که درخواستها رو بین مدلهای مختلف پخش میکنه) ظاهر شده و هیچ آزمایشگاهی هم نگفته مال منه. چندوجهیه، پنجرهی متنش ۲۶۲ هزار توکنه و برای کدنویسی، پژوهش و کارهای agentic معرفی شده. همین ناشناس بودنش بخشی از دلیل سروصداشه.
تست کدنویسی روی یه اپلیکیشن واقعی انجام شده؛ یه اپ ردیابی رفتار روزانه که یه نمرهی ریسک بحران درمیآره. باگ عمدی ظریف بود: اپ بدون خطا بالا میاومد و همهی endpointها کد ۲۰۰ برمیگردوندن، ولی منطق امتیازدهی به جای هفت روز آخر، کل تاریخچهی کاربر رو میانگین میگرفت. یعنی هر چی کاربر بیشتر از اپ استفاده میکرد، نمره بیخاصیتتر میشد. مدل دقیقاً همین رو پیدا کرد و منطق رو بازنویسی کرد تا نمره فقط رفتار اخیر رو نشون بده.
استک این تست ساده نبود: دیتابیس Postgres، API با Flask، کش Redis و کدی که بین پایتون و جاوااسکریپت پخش شده بود، همه روی چند کانتینر Docker. یه نکتهی جالب هم این بود که مدل چند جا استدلال و تست کدش رو با پایتون انجام داد، حتی جایی که اپ هدف جاوااسکریپتی بود؛ عادتی که نویسنده میگه تو مدلهای دیگهی همین تستها کمتر دیده.
رو نمودار بنچمارک، مدلهای ردهبالای GPT و Opus حدود ۷۴ درصد گرفتن ولی به ترتیب حدود ۶.۵ و ۱۱.۸ دلار برای هر تسک خرج برمیدارن. Union Alpha با حدود ۷۳ درصد عملاً همونجا وایستاده ولی نزدیک ۰.۶۵ دلار خرج داره، یعنی چیزی حدود ۲۰ برابر ارزونتر از گرونترین گزینه. نویسنده تأکید میکنه این عددها هنوز مستقل بررسی نشدن و باید نشونه حسابشون کرد، نه حکم قطعی.
تو تست بینایی، مدل از روی یه تصویر با یه موقعیت اخلاقی سنگین جواب داده و به جای طفره رفتن، با استدلال شمارهگذاریشده و اشاره به نشونههای تصویری مثل زبان بدن و جهت نگاه آدمها، یه جواب قطعی داده. تست دوم که خوندن یه نمودار تیتراسیون و درآوردن غلظت اسید بود اصلاً انجام نشد، چون دسترسی پیشنمایش بهشدت throttle میشد، یعنی تعداد درخواستها رو سفت محدود کرده بودن. پس توان استدلال علمیش هنوز نامعلومه، قیمت و زمان انتشار رسمیش هم همینطور.
نکات کلیدی:
- پنجرهی متن ۲۶۲ هزار توکن و قابلیت چندوجهی، بدون اینکه سازندهش مشخص باشه
- نمرهی حدود ۷۳ درصد در بنچمارک مهندسی نرمافزار، در برابر حدود ۷۴ درصد مدلهای ردهبالا
- هزینهی تقریبی ۰.۶۵ دلار برای هر تسک در برابر ۶.۵ و ۱۱.۸ دلار رقبا
- باگ میانگینگیری یه اپ روی استک Postgres و Flask و Redis و چند کانتینر Docker رو درست پیدا کرد
- تست استدلال علمی روی نمودار تیتراسیون بهخاطر throttle شدن دسترسی ناتموم موند
- عددهای بنچمارک از پلتفرمهای روتینگ اومده و هنوز مستقل تأیید نشده




