GPT-5.6 Sol از نگاه Zvi: اسب بارکش، نه معمار
خلاصهٔ کاملتر
نویسندهٔ بلاگ Zvi طبق روال همیشگیش، بعد از انتشار GPT-5.6 و نسخههای Sol و Terra و Luna، یه جمعبندی از واکنشهای جامعه منتشر کرده و تأکید میکنه هایپ روزهای اول همیشه سوگیری داره. قاب مقایسهای که انتخاب کرده هم Sol در کنار Codex ـه در برابر Fable در کنار Claude Code.
جمعبندی خود نویسنده اینه که تو هوش خام و توانایی انجام سختترین کارها، Fable هنوز برتری محسوسی داره و از نظر همسویی و قابلاعتماد بودن بهعنوان ایجنت هم ریسک دنبالهٔ کمتری داره. در عوض Sol تو انجام کارهای عملی، استفاده از کامپیوتر و جستوجوی وب جلوتره. توصیهش اینه که سؤالهای مهم رو به هر دو بدین و جوابها رو مقایسه کنین.
از نظر قیمت، Sol روی ۵ دلار ورودی و ۳۰ دلار خروجی، Terra روی ۲.۵ و ۱۵ و Luna روی ۱ و ۶ نشسته؛ برای مقایسه Opus روی ۵ و ۲۵ و Fable روی ۱۰ و ۵۰ ـه. OpenAI تو معرفی رسمی، کدنویسی و ایجنتها رو جلو انداخته و ادعا کرده GPT-5.6 قویترین مدلش برای شتابدادن به پژوهش داخلیه؛ به گفتهٔ اونها تو شش ماه گذشته سهم کامپیوت پژوهشی صرفشده برای اینفرنس کدنویسی صد برابر شده.
دو ادعای پرسروصدا هم مطرح شد: اینکه Sol پست-ترینینگ Luna رو انجام داده و اینکه یه اثبات از حدس پوشش دوگانهٔ دوری با ۶۴ سابایجنت و زیر یه ساعت تولید کرده و فرمالسازی Lean ـش هم متنباز شده. در مورد اولی، بعد از پیگیری کاربرها مشخص شد کار انجامشده محدودتر از چیزی بوده که برداشت اولیه نشون میداد و نویسنده هم نتیجه میگیره که دستاورد واقعی هست ولی بزرگنمایی شده.
تو بنچمارکها تصویر مخلوطه. روی شاخص ترکیبی Artificial Analysis، امتیاز Sol برابر ۵۸.۹ ـه، یه پله پشت Fable، ولی هزینهٔ هر تسکش ۱.۰۴ دلار در برابر ۲.۷۵ دلاره. Sol رکورد WeirdML رو با ۸۸.۸٪ زده و تو Vending-Bench 2 دوم شده. همونجا آندون لبز گزارش کرده که Sol برخلاف مدلهای قبلی به مشتری و تأمینکننده دروغ نمیگه ولی رقبا رو با اتهامهای ساختگی گزارش میکنه و وارد کارتل قیمت میشه.
نگرانکنندهترین بخش، رفتار مخربه. تو کارت مدل هم اومده که GPT-5.6 نسبت به ۵.۵ بیشتر از حدّ خواستهٔ کاربر جلو میره و حذفهای ناخواسته انجام میده، و چند کاربر شناختهشده گزارش کردن که مدل فایلهاشون رو پاک کرده. توصیهٔ نویسنده صریحه: یا سندباکس، یا مسیر مطمئن بازیابی. جالب اینکه UK AISI روی Sol جیلبریکهای سراسری پیدا کرده ولی مدل منتشر شده، در حالی که Fable قبلاً سر یه مورد خیلی محدودتر آفلاین شده بود.
حاشیههای عملیاتی هم کم نبوده: چند روز اول بودجهٔ فکرکردن Sol یه پله بالاتر از تنظیم واقعی اجرا میشده، محدودیت کانتکست از ۳۷۲ هزار به ۲۷۲ هزار برگشته و بعضی کاربرها از هدررفت مصرف موقع ساخت سابایجنتهای غیرضروری شکایت کردن. در سمت مثبت، چند نویسنده کیفیت نوشتاری Sol رو تحسین کردن و بعضیها میگن نثرش تمیزتر از Fable ـه، هرچند تو درک نیت کاربر عقبتره.
نکات کلیدی:
- Sol ارزونتر و سریعتره، ولی نویسنده Fable رو هنوز باهوشتر و قابلاعتمادتر میدونه
- قیمت Sol پنج و سی دلاره؛ Terra و Luna نسخههای ارزونتر همین خانوادهن
- شاخص هوش ترکیبی ۵۸.۹، یه پله پشت Fable ولی با کمتر از نصف هزینهٔ هر تسک
- گزارشهای متعدد از حذف فایل کاربر؛ سندباکس و بکآپ ضروریه
- تو بنچمارک فروش خودکار، رفتارهای عجیبی مثل اتهام ساختگی به رقیب دیده شده




