یه مدل ۲.۸ مگابایتی که فرمهای گرافیکی رو پر میکنه
خلاصهٔ کاملتر
تو این مقاله اومده که تیم CUA یه مدل به اسم CUA S1 Forms منتشر کرده که کارش فقط یه چیزه: به یه فیلد فرم نگاه میکنه و به یه لیست کوتاه از مقدارهایی که از یه سند بیرون کشیده شده، بعد تصمیم میگیره پرش کنه، تیک بزنه، کلیک کنه یا کلاً ردش کنه. نه زنجیرهٔ فکر داره، نه چند مرحله گفتگو، نه تماس با یه مدل زبانی بزرگ. روی هاگینگفیس با نام cua-ai/cua-s1-forms و لایسنس MIT منتشر شده.
چیزی که مدل رو انقدر کوچیک نگه داشته معماریشه: یه ترنسفورمر byte-level (یعنی متن رو کاراکتر به کاراکتر میخونه و اصلاً tokenizer نداره) با دو لایه، عرض ۱۲۸ و چهار تا attention head. نبودِ tokenizer و جدول واژگان، که معمولاً بخش بزرگی از پارامترهای یه مدل زبانیه، باعث شده کل مدل زیر ۳ مگابایت جا بشه. عملاً یه دستهبندیکنندهست که لباس ترنسفورمر تنش کردن.
طبق عددهای کارت هاگینگفیس، مدل روی تصمیمهای واقعی فرم ۹۹.۷ درصد دقت داره، در حالی که یه API مدل زبانی عمومی به عنوان مبنا حدود ۸۳.۶ درصد گرفته. تو تست عملی مقاله یه فیلد با برچسب emergency contact phone بهش داده شد، کنارش دو تا مقدار خیلی شبیه هم: یه شمارهٔ تلفن معمولی و یه شمارهٔ تماس اضطراری. مدل درست دومی رو انتخاب کرد، که نشون میده داره معنی برچسب رو میخونه نه فقط شکل ظاهری مقدارها.
خود مدل به پیکسل و پنجره کاری نداره. این کارو CUA driver انجام میده، همون بخشی که accessibility tree (یعنی درختی که سیستمعامل از عناصر روی صفحه میسازه) رو از برنامهٔ در حال اجرا میخونه و کلیک و تایپ رو اجرا میکنه. مدل تصمیم میگیره، درایور دستهاست. نویسنده میگه موقع تست حتی با وجود GPU، مصرف حافظهٔ گرافیک عملاً تکون نخورد؛ یعنی برای production لازم نیست GPU بخری.
به گفتهٔ نویسنده اگه کارت پر کردن چند تا فرم پراکندهست، همون مدل زبانی بزرگ منعطفتره. این مدل جایی میارزه که حجم بالا و تکراری باشه: فرمهای پذیرش، ثبتنام، خط لولههای ورود داده که مدام یه شکل فرم تکرار میشه و سرعت و هزینهٔ هر تصمیم مهمتر از استدلال بازه.
نکات کلیدی:
- ۷۰۶ هزار پارامتر و حدود ۲.۸ مگابایت روی دیسک، با لایسنس MIT روی هاگینگفیس
- معماری: ترنسفورمر byte-level با ۲ لایه، عرض ۱۲۸ و ۴ تا attention head، بدون tokenizer
- دقت اعلامشده ۹۹.۷ درصد در برابر حدود ۸۳.۶ درصد برای یه API مدل زبانی عمومی
- خروجی مدل فقط چهار حالته: fill، check، click یا skip
- برای اجرا فقط PyTorch و Git LFS لازمه و GPU هیچ مزیت عملی نمیده




