فروپاشی حاشیه سود در هوش مصنوعی نزدیکه
خلاصهٔ کاملتر
این نوشته قسمت اول از یه سری دو قسمتیِ مارتین آلدرسونه دربارهی یه تغییر که به نظرش کمتر کسی تو اقتصاد هوش مصنوعی درکش کرده. نویسنده میگه لحظهی واقعیِ «دیپسیک» تازه داره میرسه.
استدلال پایهایش دربارهی جای واقعیِ هزینههاست. به گفتهش وقتی بازار سر مدل R1 دیپسیک ترسید و سهام Nvidia ریخت، برداشت اشتباهی داشت. آموزش مدل یه هزینهی ثابت و یکبارهست؛ چند صد میلیون خرج میکنی و تموم میشه. ولی inference (یعنی اجرای مدل برای جوابدادن به کاربر) با تقاضا بالا میره و هزینهی نهاییِ واقعی داره. نویسنده تخمین میزنه وقتی آزمایشگاهها حدود ۲۵ دلار بهازای هر میلیون توکن میگیرن، احتمالاً چیزی حدود ۹۰٪ حاشیهی سود ناخالص روی هزینهی محاسبات دارن. کل مدل کسبوکارشون همینه: خرج زیاد برای آموزش، بعد سرشکنکردن اون هزینه روی کلی inferenceِ پرسود.
حالا نکتهی اصلی مقاله اینه: نویسنده چند هفته با GLM 5.2 از Z.ai کار کرده و میگه این اولین مدل وزنبازیه که واقعاً به «حدِ» یه رقیب جدی برای Opus و GPT رسیده. به گفتهش گاهی سخت میتونه فرقش رو با Opus که ابزار روزمرهشه تشخیص بده. البته چند ضعف هم میشمره: کنده چون زیاد فکر میکنه، پشتیبانی از تصویر نداره، و قابلیت جستوجوی وبش ضعیفه که برای کارهای agentic یه مشکل واقعیه.
چیزی که به گفتهی نویسنده برای آزمایشگاههای پیشرو ترسناکه، آسونیِ مهاجرته. هم Z.ai و هم Fireworks هم endpoint سازگار با OpenAI دارن و هم سازگار با Anthropic. برای همین استفادهش تو Claude Code و Codex بیدردسره؛ کافیه base URL رو به ارائهدهندهی inference بدی، کلید API بذاری و بگی از GLM 5.2 استفاده کنه. نویسنده تأکید میکنه این هزینهی جابهجایی مثل قفلشدگیِ Microsoft یا Salesforce نیست که سالها برنامهریزی بخواد؛ هزینهی سوییچکردن خیلی پایینه.
صرفهجویی هم چشمگیره: قیمت رایج GLM 5.2 حدود ۴٫۴۰ دلار بهازای هر میلیون توکنه، یعنی کمتر از ۲۰٪ قیمت خردهفروشیِ Opus و حدود ۱۵٪ هزینهی GPT 5.5. نویسنده میگه چون این مدل برای هر کار توکن بیشتری مصرف میکنه مقایسه دقیقاً سیببهسیب نیست، ولی مطمئنه برای تقریباً همهی جریانهای کاری بیش از ۵۰٪ ارزونتر درمیاد. به گفتهش این هزینهها هم قراره باز پایینتر بیان؛ مثلاً یه گزارش میگه اجرای این مدل روی سختافزار AMD حدود ۲٫۷۵ برابر ارزونتر از Blackwellِ Nvidia درمیاد.
نویسنده به نگرانیِ حریم خصوصی و امنیت داده هم اشاره میکنه: استفاده از API رسمیِ Z.ai بهخاطر شرایطش و پیوند عمیقش با چین برای خیلیها قبولکردنی نیست، ولی چون وزنها بازن، ارائهدهندههای دیگهای هم هستن که تعهدات قراردادیِ درست دارن، یا حتی میشه خودت روی سرور خودت میزبانیش کنی. قسمت دوم قراره دربارهی این باشه که فروپاشیِ حاشیهی سودِ inference چه بلایی سر صنعت میاره و کی برنده و بازنده میشه؛ نویسنده جملهی معروف بزوس رو یادآوری میکنه: «حاشیهی سود تو، فرصت منه.» (افشاگری: Fireworks برای نوشتن این مقاله بهش اعتبار رایگان داده.)
نکات کلیدی:
- هزینهی اصلی هوش مصنوعی آموزش نیست، inference هست که با تقاضا بالا میره
- نویسنده تخمین میزنه حاشیهی سود ناخالصِ inferenceِ آزمایشگاهها شاید حدود ۹۰٪ باشه
- GLM 5.2 اولین مدل وزنبازیه که به کیفیت نزدیک Opus و GPT رسیده، ولی حدود یکپنجم قیمت
- endpointهای سازگار با OpenAI و Anthropic، جابهجایی رو تو Claude Code و Codex بیدردسر میکنن
- ضعفهای فعلیش: کندی، نبود پشتیبانی تصویر و جستوجوی وبِ ضعیف




