مدلهای زبانی دارن به کالا تبدیل میشن
خلاصهٔ کاملتر
نویسندهها میگن معرفی GPT-6 دو تا فکر رو براشون زنده کرده: اینکه خود مدل هر روز کماهمیتتر از کاربردشه، و اینکه آزمایشگاههای بزرگ دارن روی بهترین مدل برای کاربردهای خاص تمرکز میکنن. همین شد که یادداشت ۲.۵ سال پیش خودشون رو دوباره منتشر کردن. سؤال باز به زبون ۲۰۲۶ اینه که آیا harness (یعنی همون لایهٔ ابزار و ارکستریشن دور مدل) از خود موتور هوش جدا میشه یا نه، و شرط خودشون اینه که آره.
متن اصلی از اینجا شروع میشه که کیفیت مدل دیگه وجه تمایز روشنی نیست. تو یه بازهٔ کوتاه، Claude-3 Opus به GPT-4 Turbo رسید، Llama 3 تا حدود ۴ درصدیش اومد و Gemini-1.5 Pro تا ۱.۵ درصدی GPT-4o. برای مقایسه، قانون مور میگفت قدرت تراشه هر ۱۸ ماه دو برابر میشه، ولی GPT-4o با کیفیت مشابه GPT-4 Turbo هزینه و تأخیر رو فقط تو ۶ ماه نصف کرد.
نویسندهها میگن تو استارتاپ خودشون، RunLLM، بخشهایی از خط استنتاج پروداکشن رو بردهن روی Llama-3 (هم ۸ و هم ۷۰ میلیارد پارامتری) و هم تأخیر کمتر گرفتن هم هزینهٔ کمتر، با کیفیت برابر یا بهتر از ترکیب قبلی GPT-3.5 و GPT-4. یعنی جابهجایی بین مدلها دیگه یه تصمیم بزرگ معماری نیست.
جواب اول برای تمایز، چندوجهی بودن (multimodality) به نظر میرسه، ولی به گفتهٔ نویسندهها اون هم زود کالا میشه؛ Gemini پیشتر همین رو نشون داده بود و با یکپارچگی اندروید بهتر هم به دست کاربر رسونده بودش. برای کاربر عادی چیزی که میمونه تجربهٔ محصوله، و برای سازمانها فقط بهترین کیفیت با کمترین قیمت مهمه. رقابت روی قیمت هم یعنی مسابقهٔ نزولی: همیشه یکی زیر قیمت تو میده و اون کسی برندهست که جیبش عمیقتره، مثل ماجرای Uber و Lyft.
تعهد متا به وزنهای باز یه پیچ جالبه: به گفتهٔ نویسندهها اگه Llama-3 نبود، معلوم نبود مدلهای open-weight اصلاً این حجم استفاده رو داشته باشن، و بازار میزبانهای شخص ثالث مثل Together.AI و Fireworks.AI تقریباً یکتنه روی همین سواره. جمعبندیشون اینه که کالایی شدن و زیادی شدن گزینهها باعث میشه بیشتر آدمها پیش همون چیزی که میشناسن بمونن، پس بازندهٔ اصلی تازهواردهان.
برای بقیه، راهحلی که پیشنهاد میدن اینه که یه niche برای خودت پیدا کنی: چه از راه اندازهٔ مدل، چه یه کاربرد خاص، چه تخصص روی یه حوزه. به تعبیر خودشون ساختن مدل زبانی غیرعمومی نهفقط اشکالی نداره، احتمالاً حرکت درسته. نکتهٔ مهم برای خوندن این متن اینه که دادههاش مال دورهٔ GPT-4o و Llama 3 هستن و نویسندهها عمداً بازنشرش کردن تا بگن استدلال هنوز سرجاشه.
نکات کلیدی:
- GPT-4o با کیفیت مشابه GPT-4 Turbo، هزینه و تأخیر رو تو فقط ۶ ماه ۲ برابر کم کرد
- Llama 3 تا حدود ۴٪ و Gemini-1.5 Pro تا ۱.۵٪ اختلاف Elo به مدل پیشتاز نزدیک شدن
- RunLLM بخشی از خط استنتاجش رو از GPT-3.5/4 برد روی Llama-3 8B و 70B
- رقابت روی قیمت به نفع کسیه که سرمایهٔ بیشتری داره، نه کسی که مدل بهتری داره
- Llama-3 عملاً بازار میزبانی شخص ثالث مثل Together.AI و Fireworks.AI رو سرپا نگه داشته




