مدل کوچیک آموزشدیده، جلوتر از مدلهای مرزی
خلاصهٔ کاملتر
تو این مقاله اومده که از ۲۰۲۲ تا حالا شرکتها کلی وقت و توکن روی هوش مصنوعی خرج کردن ولی خروجی قابلاندازهگیری در مقیاس کم بوده. به دادهٔ Ramp که مقاله بهش استناد میکنه، درآمد یکچهارم بالاییِ شرکتهای سرمایهگذار روی AI بین نوامبر ۲۰۲۲ تا دسامبر ۲۰۲۵ بیش از دو برابر شده، ولی شرکتهایی که هیچ هزینهٔ AI نداشتن تو همون بازه فقط حدود ۱۵٪ رشد کردن.
نویسنده پنج دلیل این شکاف رو میشمره: بازطراحی خودِ فرایند بهجای خودکارسازی یه تسک (تو نظرسنجی مککینزی فقط ۲۱٪ سازمانها اصلاً فرایندی رو بازطراحی کرده بودن)، پاداش دادن به آزمونوخطا، رسوندن کانتکست کسبوکار به مدل، اندازهگیری واقعی اثر بهجای حسِ تیم، و هدفگذاری روشن روی بودجهای که حالا بهجای هر کاربر، به ازای هر توکن حساب میشه.
به گفتهٔ نویسنده، برندهها روی یه نسخهٔ مشترک همگرا شدن: مدل متنباز، دادهٔ اختصاصیِ همون کار، و یه مرحلهٔ یادگیری تقویتی روی نسخهٔ امتیازدهیشدهٔ همون workflow. نمونههاش بریجواتر (حدود ۳۰٪ خطای کمتر از بهترین مدل مرزی)، هاروی (عبور از GPT-5.5 و Claude Opus 4.8 روی روبریک خودش) و اینترکام با مدل Fin Apex هستن. مقاله تأکید میکنه این یعنی کنار گذاشتن مدلهای مرزی نیست؛ اول باهاشون شروع میکنی و همون فراخوانیها دادهٔ آموزش مدل تخصصی رو میسازن.
خود تیم هم همین دستورالعمل رو روی بازبینی کاتالوگ فروشگاهی اجرا کرده: یه «دوقلوی دیجیتال» از فرایند ساختن، با ۱۷۷٬۷۶۷ اپیزود بازبینی از دیتاست Amazon Berkeley Objects، تاکسونومی حدوداً ۱۳٬۰۰۰ دسته، و یه امتیازدهنده که خروجی درست رو پاداش میده و تخلفِ ازدسترفته رو ۷ برابر گرونتر از هشدار اشتباه جریمه میکنه.
نتیجهای که گزارش شده: مدل ۹ میلیاردیِ آموزشدیده با GRPO به ۸۷.۳٪ سقف امتیاز رسیده، در برابر ۷۶.۹٪ برای بهترین ترکیب مدل مرزی و ۶۴.۲٪ برای همون مدل قبل از آموزش. آموزش روی دو کارت RTX PRO 6000 و با فریمورک متنباز prime-rl، هزار قدم، سه روز و نیم و حدود ۵۰۰ دلار طول کشیده و مدل بعد از حدود ۲۵۰ قدم از باند مدلهای مرزی رد شده. هزینهٔ هر هزار محصول هم ۰.۵ دلار در برابر ۳۴ دلار بوده.
نویسنده میگه شرط اصلی این روش «قابلارزیابی بودن» تصمیمه: اگه بشه درستی هر خروجی رو با یه قاعده، تست یا روبریک سنجید، مدل میتونه تمرینش کنه؛ اگه فقط قابل بحث باشه، نه. کارهای پرتکرار مثل مسیریابی تیکت، استخراج فیلد از سند، بررسی انطباق با سیاستها و دستهبندی محصول گزینههای خوبیان. فقط حواست باشه این مقاله رو خودِ شرکتی نوشته که همین سرویس رو میفروشه و عددها گزارش خودشه.
نکات کلیدی:
- طبق دادهٔ Ramp، یکچهارم بالاییِ خرجکنندههای AI درآمدشون بیش از دو برابر شده و بیخرجها حدود ۱۵٪
- نسخهٔ مشترک برندهها: مدل متنباز + دادهٔ اختصاصی + یادگیری تقویتی روی workflow امتیازدهیشده
- مدل ۹ میلیاردی آموزشدیده ۸۷.۳٪ سقف امتیاز، بهترین مدل مرزی ۷۶.۹٪
- هزینه: ۰.۵ دلار در برابر ۳۴ دلار به ازای هر هزار محصول بازبینیشده
- آموزش کامل: دو GPU، هزار قدم، سه روز و نیم و حدود ۵۰۰ دلار
- شرط ورود: تصمیم باید با قاعده، تست یا روبریک قابلسنجش باشه




