نتلیفای یه پرامپت رو به ۱۱ مدل داد؛ نتیجهها زمین تا آسمون
خلاصهٔ کاملتر
نتلیفای تو یه پست اعلام کرده که با OpenRouter شریک شده و دو چیز رو باز کرده. اول اینکه پروژههات میتونن از طریق AI Gateway به هر مدلی روی OpenRouter وصل بشن، یعنی اگه اپ خودت قابلیت مبتنی بر AI داره، انتخاب خیلی بازتری از نظر کیفیت و بودجه داری. دوم اینکه Agent Runners — همون باکس چت داخل نتلیفای که پروژه رو از صفر میسازه یا تغییرش میده — حالا مدلهای بازِ تازهای مثل Kimi K3، GLM 5.2 و DeepSeek V4 رو هم داره.
برای اینکه بشه این همه مدل جدید رو درست هدایت کرد، OpenCode متنباز هم بهعنوان یه انتخاب تازهٔ ایجنت اضافه شده؛ تا حالا فقط Claude Agent و OpenAI Codex و Gemini CLI پشتیبانی میشدن که هرکدوم برای مدلهای همون سازنده بهینهن. تیم نتلیفای میگه ایجنتها رو با skill و context پروژه تغذیه میکنه تا بدونن کی و چطور از امکاناتی مثل Netlify Database یا AI Gateway استفاده کنن.
برای سنجش مدلها، نتلیفای داخلاً از AXIS استفاده میکنه — ابزار ارزیابی خودکارشون که تازه متنبازش کردن. AXIS روی درستیِ عملکردِ سایت تولیدشده تمرکز داره نه طراحیش: مثلاً وقتی نیاز به دیتابیس هست از Netlify Database استفاده شده یا نه، و برعکس، برای یه سایت استاتیک ساده الکی over-engineer نشده باشه. ولی این بار سراغ یه تست بهمراتب ذهنیتر رفتن: سه سناریو، که این پست فقط اولیش رو پوشش میده.
پرامپت سناریوی اول سادهست: یه سایت تکصفحهای برای کافهٔ محله با ساعت کاری، آدرس، منوی کوتاه و یه عکس، بدون هیچ CMSی. هر مدل سه بار اجرا شد و پراکندگی هزینهها زیاد بود. یکی از سه اجرای Claude Opus 5 حدود ۱۰۵۵ اعتبار خرج کرد — نزدیک چهاربرابر هر اجرای دیگه — و در عوض خروجی پرجزئیاتی داد، از المان مهرمانند با دونهٔ قهوه تا نقشهٔ سفارشی و دارکمود آماده. دو اجرای دیگهش ۲۵۳ و ۲۴۹ اعتبار گرفتن.
بقیه چی؟ Claude Sonnet 5 با میانگین ۱۴۳ اعتبار جزئیات کمتری داد و گرافیک برداریش سادهتر بود. به نظر نویسنده، GPT 5.6 Sol روی effort پایین (میانگین ۱۴۱ اعتبار) از نظر شمّ طراحی از Sonnet جلو میزنه. GPT 5.6 Terra با ۳۹ اعتبار زبان بصری متفاوتی داشت، نه لزوماً بدتر. Gemini 3.1 Pro با ۵۳ اعتبار تقریباً هیچی فراتر از خواسته اضافه نکرد، ولی Gemini 3.6 Flash با ۱۰۳ اعتبار مثل یه نسل جدید رفتار کرد.
بین مدلهای open-weight، Kimi K3 با میانگین ۱۰۲ اعتبار تو این تسکِ طراحیمحور نمیدرخشه؛ نویسنده تأکید میکنه این مدل برای کارهای ایجنتیِ طولانی ساخته شده و قضاوت منصفانهش پرامپتهای دیگهای میخواد. GLM 5.2 با میانگین ۲۷ اعتبار سه خروجی چنان متفاوت داد که انگار از چند مدل مختلف اومدن، و چون ورودی تصویری نمیگیره نمیشه بهش اسکرینشات الهامبخش داد. رکورددار ارزونی هم DeepSeek V4 Flash 0731 با ۲.۴ اعتباره.
جمعبندی نویسنده اینه که برای هر چیزی فراتر از یه سایت ساده، سؤال از «طراحی کدوم قشنگتره» میره سمت «کدوم مدل میدونه کی و چطور از امکانات پلتفرم استفاده کنه و کار خودش رو جدی اعتبارسنجی کنه». با بودجهٔ محدود هم باید انتخاب کنی: یه راهحل کلیددردست که سعی میکنه همهچی رو خودش پیشبینی کنه، یا مدل ارزونتر و مسیر تکرارشونده با پرامپتهای بعدی. هیچکدوم لزوماً غلط نیست.
نکات کلیدی:
- Agent Runners حالا از طریق OpenRouter مدلهای باز مثل Kimi K3، GLM 5.2 و DeepSeek V4 رو هم داره
- OpenCode بهعنوان ایجنت چهارم کنار Claude Agent و OpenAI Codex و Gemini CLI اضافه شد
- گرونترین اجرا: Claude Opus 5 با ۱۰۵۵ اعتبار برای یه صفحهٔ استاتیک
- ارزونترین: DeepSeek V4 Flash 0731 با میانگین ۲.۴ اعتبار
- سقف اعتبار پلنها: ۳۰۰ رایگان، ۱۰۰۰ شخصی، ۳۰۰۰ حرفهای؛ پک اضافه ۱۰ دلار برای ۱۵۰۰ اعتبار
- GLM 5.2 ورودی تصویری نمیگیره، پس اسکرینشات مرجع بهش نمیشه داد




