پرامپت کشینگ برای مدلهای متنباز در Databricks
خلاصهٔ کاملتر
در استفاده از مدلهای زبانی بزرگ (LLM)، معمولاً هزاران درخواست با یک System Prompt مشترک ارسال میشن. مشکل اینجاست که مدل باید این پیشوند یکسان رو برای هر درخواست از صفر پردازش کنه — این یعنی هدر دادن محاسبات، افزایش تأخیر، و بالا رفتن هزینه. پرامپت کشینگ این مشکل رو حل میکنه: با ذخیرهسازی نتیجه پردازش بخشهای تکراری (بهاصطلاح KV Cache)، دفعه بعد که همون پیشوند اومد، مرحله prefill کاملاً نادیده گرفته میشه و پردازش سریعتر انجام میگیره.
Databricks این قابلیت رو پیشتر برای مدلهای اختصاصی مثل GPT، Gemini و Claude ارائه داده بود. حالا این ویژگی به مدلهای متنباز (Open-Weight) موجود در Foundation Model APIs هم رسیده و شامل بارکاریهای batch inference، pay-per-token و provisioned-throughput میشه.
مدلهایی که الان از پرامپت کشینگ بهرهمند میشن:
- GPT-OSS 20B و 120B
- Gemma 3 12B
- Llama 3.1 8B و 3.3 70B
- Fine-tuned Llama 3.1 8B (از طریق PEFT serving)
یکی از نکات مهم اینه که این قابلیت کاملاً خودکار (implicit) عمل میکنه — یعنی کاربر نیازی به هیچ تنظیم یا کانفیگ اضافهای نداره. Databricks همچنین تأکید میکنه که کشها فقط در حافظه موقت (volatile memory) نگه داشته میشن، هیچوقت ذخیرهی دائم نمیشن و کاملاً ایزولهان — پس از نظر امنیتی نگرانی وجود نداره.
نتایج واقعی روی یکی از pipelineهای production مبتنی بر GPT-OSS نشون داد که حتی با نرخ کشهیت نسبتاً پایین (۳۰٪)، توان عملیاتی per-replica برای توکنهای ورودی ۲.۵ برابر افزایش پیدا کرده و تأخیر P50 سه برابر کاهش یافته — اعدادی که در محیط production خیلی قابلتوجهان.
این قابلیت برای سرویسهای سطح بالاتری مثل Agent Bricks، Genie و AI Functions هم بهطور خودکار فعاله، چون اونها روی همین Foundation Modelها کار میکنن.
نکات کلیدی:
- پرامپت کشینگ بخشهای تکراری پرامپت رو کش میکنه تا پردازش مجدد حذف بشه
- بدون نیاز به هیچ تنظیمی — سیستم خودکار عمل میکنه
- مدلهای پشتیبانیشده: GPT-OSS، Llama 3.1/3.3، Gemma 3، و Llama fine-tuned
- در production: توان عملیاتی ۲.۵ برابر بالاتر و تأخیر P50 سه برابر کمتر
- کشها ایزوله و فقط در حافظه موقت — بدون خطر امنیتی




