مدلهای کوچیک از راه رسیدن
خلاصهٔ کاملتر
نویسندهٔ وبلاگ calv.info چند هفتهست داره با gpt-5.6-luna (یکی از مدلهای کوچیک و سریع OpenAI) کار میکنه و میگه معمولاً حدود ۱۰۰ توکن در ثانیه ازش میبینه. ولی نکتهٔ اصلی از نگاه اون سرعت نیست، هزینهست: حتی وقتی مدل رو روی هزاران ایمیل میگردونه، صورتحساب API در حد چند ده سنت درمیاد. به گفتهٔ نویسنده چون خودش برای کدنویسی همیشه سراغ گرونترین و تواناترین مدلها میره، پیشرفت مدلهای کوچیک رو تا حالا ندیده بود.
چند سرمایهگذار ازش پرسیدن چرا شرکتهای مصرفی AI انقدر کمان، و جواب کوتاهش هزینهٔ توکنه. تو دنیای قبل از AI نسخه این بود: یه سایت جذاب و ارزون بساز، کاربر جذب کن، پول بگیر و بزرگ شو، بعد یه بازار تبلیغات راه بنداز. ولی وقتی AI رو وسط محصول میذاری، هر درخواست کاربر یه هزینهٔ inference (یعنی همون پولی که بابت اجرای مدل میدی) داره و سرمایهٔ لازم یهو چند برابر میشه.
معیار شخصی نویسنده برای سنجیدن مدلها ساختن یه سایت خبری روزانهٔ شخصیسازیشدهست: مدل باید دربارهٔ خودش تحقیق کنه، از hn و reddit و twitter بگرده و یه میکروسایت با خبرهای امروز بسازه. با نسل قبلی مدلها (کلاس Sonnet) هر اجرا حدود ۱ دلار خرج برمیداشت که با اشتراک ماهی ۳۰ دلار اصلاً جور درنمیاد. با luna نتیجه قابلقبوله و میانگین هزینه حدود ۰.۱ دلاره. تو نمودار artificialanalysis هم GLM 5.3 یه گزینهٔ تازه روی مرز پارتو (بهترین نسبت هزینه به توانایی) اضافه کرده.
بخش جالبتر ماجرا از نظر نویسنده کسبوکاره. اون از همبنیانگذار Segment، پیتر، نقل میکنه که کار دو جنس داره: کار «IQ 180» که یه ذهن نابغه باید یه راهحل عجیب پیدا کنه، و کار «token spewer» یعنی فوقالعاده پاسخگو بودن و جلو بردن دهها جبههٔ کوچیک همزمان. پیتر که چند شرکت رو همزمان میگردونه میگه حدود ۹۵ درصد کار خودش از نوع دومه، هرچند بدون اون ذهن فنی نابغه شرکتهاش اصلاً سرپا نمیموندن.
جمعبندی نویسنده اینه که تقاضا برای مدلهای فرانتیر تو حوزههایی مثل مهندسی، علوم پایه و آموزش مدل بازم بیشتر میشه، ولی بازار مدلهای «سریع و ارزون و بهاندازهٔ کافی خوب» تازه داره میترکه. چون بیشتر آدمهایی که روزانه باهاشون سروکار داریم هم دقیقاً همینان: کسی که سریع جواب میده و کارو راه میندازه. البته هنوز کلی کار مونده تا این مدلها تو شرکتها قابلاستفاده بشن: هارنسهای جدید، ایمنی در برابر prompt injection، و مدیریت نقشها و دسترسیها.
نکات کلیدی:
- تو تجربهٔ نویسنده gpt-5.6-luna حدود ۱۰۰ توکن در ثانیه سرعت داره و جستوجو روی هزاران ایمیل چند ده سنت خرج برمیداره
- ساختن سایت خبری شخصیسازیشده با نسل Sonnet حدود ۱ دلار بود، با luna حدود ۰.۱ دلار
- GLM 5.3 یه گزینهٔ جدید روی مرز پارتوی هزینه به توانایی اضافه کرده
- پیتر، همبنیانگذار Segment، میگه ۹۵٪ کار روزمرهش از جنس «token spewer» ـه نه حل مسئلهٔ نابغهوارانه
- برای استفادهٔ کاری از مدلهای کوچیک هنوز هارنس، ایمنی prompt injection و کنترل نقش و دسترسی لازمه




