بازار اینفرنس AI داره تکهتکه میشه
خلاصهٔ کاملتر
بازار اینفرنس هوش مصنوعی در حال تجربهکردن یه تحول بزرگه — همون تحولی که قبلاً دیتابیسها از سرگذروندن. یهروزی همه از یه دیتابیس واحد استفاده میکردن، ولی کمکم بازار به رابطهای، سندمحور، کلید-مقدار، گراف، سری زمانی و برداری تقسیم شد. حالا داریم همین اتفاق رو برای اینفرنس AI میبینیم.
درآمد بخش مراکز داده NVIDIA تا پایان ۲۰۲۲ تقریباً ثابت بود. بعد ChatGPT اومد و همهچیز عوض شد. درآمد از ۳.۶ میلیارد دلار در کوارتر چهارم ۲۰۲۲ به ۶۲.۳ میلیارد دلار در کوارتر چهارم ۲۰۲۵ رسید — یعنی ۱۷ برابر رشد در سه سال. این عدد نشون میده که AI inference دیگه یه نیچ نیست، یه بازار غولآساست.
دلیل اصلی تکهتکهشدن اینه که بار کاریها (workloads) با هم فرق دارن. تولید تصویر و ویدیو compute-heavy هستن. مدلهای زبانی با پنجرههای کانتکست بلندتر به حافظه بیشتری برای KV cache نیاز دارن. دستگاههای لبه (edge) محدودیت مصرف برق دارن. هیچ معماری واحدی نمیتونه همه اینها رو با هم بهینه کنه.
از نظر تأخیر (latency)، بازار به سه لایه تقسیم شده: اول، real-time یا زیر ۱۰۰ میلیثانیه که برای دستیارهای صوتی، ترجمه زنده و خودروهای خودران به کار میره و به زیرساخت جغرافیایی توزیعشده نیاز داره. دوم، near-real-time یا ۱۰۰ میلیثانیه تا ۲ ثانیه که بیشتر اپهای LLM امروزی مثل چتباتها و تکمیل کد اینجا کار میکنن. سوم، batch یا ثانیهها تا ساعتها که برای پردازش انبوه اسناد و تولید محتوا استفاده میشه و هدفش کاهش هزینهست نه سرعت.
برای مدلهای چندوجهی (multimodal) هم گلوگاه فرق داره. در چتباتها مشکل اصلی حافظهست؛ مدل باید کل مکالمه رو نگه داره و با هر پیام حجمش بیشتر میشه. ولی در تولید تصویر و ویدیو مشکل اصلی قدرت خام محاسباتیه — یه تصویر تکی ممکنه به ۵۰ پاس متوالی از مدل نیاز داشته باشه. این یعنی معماریهای کاملاً متفاوت.
اینفرنس روی دستگاه (on-device) هم بخش جداگانهایه. نیازهای حریم خصوصی، محدودیت اتصال به اینترنت و حساسیت به تأخیر، پردازش رو به سمت دستگاههای لبه میبره. Apple یه مدل ۳ میلیارد پارامتری رو برای Apple Intelligence روی خود دستگاه اجرا میکنه. Tesla هم مدلهای بینایی رو روی چیپهای FSD با مصرف ۷۲ وات اجرا میکنه. مدلهای کوانتایزشده، چیپهای تخصصی و حافظه محدود، چالشهای بهینهسازی کاملاً متفاوتی نسبت به cloud inference ایجاد میکنن.
اکوسیستم مدلها هم این تنوع رو نشون میده. تعداد کمی LLM غالب با عمر طولانی در کنار بیش از ۹۰ هزار مدل تولید تصویر روی Hugging Face وجود دارن که روزانه واریانتهای جدیدی بهشون اضافه میشه. هر نوع مدل نیازمندیهای serving متفاوتی داره و همین زیرساخت رو تکهتکه میکنه.
بازار دیتابیس در نهایت Oracle، MongoDB، Databricks و Snowflake تولید کرد. یه بازار ۱۰۰ میلیارد دلاری از اینفرنس AI که داره همین مسیر رو طی میکنه، جای مشابهی برای بازیگران بزرگ آینده باز میکنه.
نکات کلیدی:
- درآمد مراکز داده NVIDIA از لانچ ChatGPT تا ۲۰۲۵ حدود ۱۷ برابر شده
- بازار اینفرنس AI مثل دیتابیسها داره به بخشهای تخصصی تقسیم میشه
- سه لایه تأخیر: real-time (زیر ۱۰۰ms)، near-real-time (تا ۲s) و batch (ثانیه تا ساعت)
- گلوگاه مدلهای زبانی حافظهست؛ گلوگاه تولید تصویر/ویدیو قدرت محاسباتی
- on-device inference با چالشهای کاملاً متفاوتی روبروست: چیپ تخصصی، مدل کوانتایزشده، حافظه محدود
- بیش از ۹۰ هزار مدل تولید تصویر روی Hugging Face نشوندهنده تنوع شدید اکوسیستمه
- ارزش کنونی بازار اینفرنس AI حدود ۹۷ میلیارد دلار برآورد شده




