همه به مدلهای فرانتیر نیاز ندارن
خلاصهٔ کاملتر
نویسنده تو یه برنامهٔ رادیویی شنیده که مدلهای فرانتیر مثل فراریان و بیشتر آدمها کرولا سوار میشن، و همین جمله جرقهٔ این مقاله شده. به گفتهٔ اون ما روی ردهٔ فرانتیر میسازیم چون توجه اونجاست، نه چون کار واقعاً بهش نیاز داره. حرف اصلی مقاله اینه که برای کاری مثل نگاه کردن به تقویم یا تصمیم گرفتن دربارهٔ جواب دادن به یه ایمیل، ردهٔ ارزون کافیه.
تو محصول خودشون، Pepper، تقریباً همهٔ کار ایجنتی روی ارزونترین مدلهای آزمایشگاههای بزرگ میچرخه: ارکستراسیون عمدتاً روی Gemini Flash Lite 3.5 و تکههای کوچیکی هم روی Claude Haiku 4.5 و GPT-5.6 Luna، که هم وابستگی به یه فروشنده کم بشه هم مبنای مقایسه داشته باشن. حدود ۱۵۰ میلیون توکن با نزدیک ۴۰ دلار از سیستم رد شده؛ عددی که یه هارنس ردهٔ Opus تو چند دقیقه خرج میکنه.
برای جواب دادن به این ایراد که «مدلهای کوچیک توهم میزنن»، ۹ نوبت واقعی از محیط production رو روی سه رده (lite، mid و Pro) با سه نمونه و یه داورِ فروشندهٔ دیگه بازپخش کردن. نتیجه بر خلاف انتظار تخت بود. وقتی ابزار داده برمیگردونه، هر سه رده درست جواب میدن؛ وقتی داده نیست، رفتار به نحوهٔ اعلام نبودِ داده بستگی داره. با دستور مبهم «با همون چیزی که داری ادامه بده» هر سه محتوای جعلی میسازن و مدل بزرگتر جعل شیکتری تحویل میده.
دو یافتهٔ دیگه هم داشتن: یکی «دُم بههمریخته»، جایی که جواب تا آخر درسته و بعد چند کلمهٔ پایانی تکرار یا خراب میشه و هیچ لاگی هم گیرش نمیندازه، که روی همهٔ مدلها از جمله Pro دیده شد. دیگری اینکه ردهٔ میانی امن نیست و رو ابزار خالی جزئیات جعلی بیشتری مثل عدد دما و ساعت میسازه. تنها موردی که با بزرگتر شدن مدل بهتر شد، false completion بود، یعنی وقتی ایجنت وسط کار گزارش میده تموم شد.
نویسنده منکر هزینهٔ این انتخاب نیست: ۱۰ ماژول تو هارنس Pepper فقط برای گرفتن بدرفتاری مدلها نوشته شده، حدود ۲۵۰۰ خط کد بهعلاوهٔ تست، و شش تاشون فقط تشخیص میدن و چیزی رو عوض نمیکنن. هر شب هم یه مدل قوی کل کارهای روز رو نمره میده و باگها رو فایل میکنه. به گفتهٔ اون فراری یه کار داره، ولی کارش جواب دادن به کاربر نیست.
سمت قیمت هم به نظرش شکاف داره باز میشه نه بسته: تابستون امسال قیمت Luna هشتاد درصد و ردهٔ میانی بیست درصد کم شد، و کاهش ردهٔ بالا سه هفته بعد و اون هم بهصورت یه تخفیف سهماهه اومد. با پایان تخفیف، نسبت قیمت فلگشیپ به ردهٔ ارزون از ۵ برابر به ۲۵ برابر میرسه. ولی ارزون بودن همهجا نجاتت نمیده: جستجوی گراندینگ بعد از ۵۰۰۰ درخواست رایگان ماهانهٔ گوگل هزارتایی ۱۴ دلاره و نوشتن skill هم به مدل بزرگتر نیاز داره.
نکات کلیدی:
- ارکستراسیون Pepper روی Gemini Flash Lite 3.5 با تکههایی از Claude Haiku 4.5 و GPT-5.6 Luna
- حدود ۱۵۰ میلیون توکن با نزدیک ۴۰ دلار
- مدل جدید gemini-3.1-flash-lite تو معیار solve^5 مقدار ۷۴٫۱٪ و gemini-2.5-flash قدیمیتر ۵۷٫۴٪ گرفته
- تنها بردِ واقعی مدل بزرگتر: false completion؛ دُم بههمریخته روی Pro هم دیده شد
- بعد از پایان تخفیف، فاصلهٔ قیمت فلگشیپ و ردهٔ ارزون از ۵ برابر به ۲۵ برابر میره
- مدل محلی gemma4:e4b تو ردهٔ آسون ۱۰۰٪ و تو ردهٔ دوم به ۱۵٪ سقوط میکنه




