اکوسیستم استوریج Databricks برای دادهی محلی
خلاصهٔ کاملتر
Databricks میگه سالها استراتژی دادهٔ سازمانی ساده بود: همهچیز رو به کلاد ببر و حاکمیت داده هم دنبالش میآد. ولی به گفتهٔ اونها، پیشرفتهترین شرکتها حالا صریح میگن که نمیتونن و نمیخوان همهٔ دادهشونو به کلاد ببرن. مثالهاش هم واقعیان: سازندهٔ نیمههادی که مدلهاشو روی دادهٔ مهندسیِ طبقهبندیشده آموزش میده که نباید از محل خارج شه، یا بانکهایی که استراتژی «Hybrid Forever» گرفتن.
نویسنده این رو یه تغییر ساختاری میدونه: گذار از «همهچیز رو منتقل کن» به «همهچیز رو حاکمیت کن». چند عامل پشت این تغییره: قوانین حاکمیت و مقررات داده مثل GDPR، HIPAA و NIS2 که گاهی انتقال به کلاد رو قانوناً ممنوع میکنن؛ data gravity و هزینه، یعنی تو مقیاس پتابایت و اگزابایت، هزینهٔ egress و انتقال اصلاً نمیصرفه و بعضی شرکتها دارن کارها رو از کلاد به on-premise برمیگردونن؛ نیاز به تأخیر کم برای کارهای لبه (edge)؛ و حجم عظیم «دادهی تاریک» (dark data) که ارزش هوش مصنوعی داره ولی حاکمیت بهش نرسیده.
راهحل، Databricks Storage Ecosystem هست؛ یه دستهٔ شریک جدید که پلتفرم Databricks رو به دادهٔ سازمانی هرجا که باشه — on-premise، کلاد خصوصی و لبه — وصل میکنه. قلب این اکوسیستم، OpenSharing هست؛ یه پروتکل متنباز برای اشتراکگذاری امن و تحتحاکمیتِ داده.
مسیر کار سادهست: شریک استوریج یه endpoint از نوع OpenSharing بالا میآره، تو اونو به Unity Catalog وصل میکنی، و بلافاصله به دادهٔ on-premiseت دسترسی امن و تحتحاکمیت پیدا میکنی، بدون هیچ مهاجرت دادهای. این یه کاتالوگ واحد روی کل محیط هیبریدی میده.
مهمترین نکتهٔ فنی، معماری zero-copy هست: میشه Databricks Serverless Compute، ابزار Genie، AgentBricks و حتی آموزش مدل رو مستقیم روی دادهای اجرا کرد که هیچوقت از محل خارج نمیشه. نتیجهش به گفتهٔ Databricks اینه: صفر جابهجایی داده، بدون تکرار داده و بدون ریسک انطباق. به نقل از مدیر محصول Databricks، این کار siloهای داده رو میشکنه و کل دارایی داده و هوش مصنوعی رو زیر یه حاکمیت واحد میآره.
شریکهای راهانداز شامل MinIO (در دسترس عمومی)، Everpure (سابقاً Pure Storage)، Qumulo و VAST Data هستن که در ماههای آینده بهصورت preview میآن. شرکتهایی مثل Cohesity، HPE، NetApp و Nutanix هم تا آخر سال یکپارچهسازی بومی میسازن. به گفتهٔ Databricks این تازه روز اوله و قدم بعدی، گسترش OpenSharing با Volumes API برای دادهٔ بدونساختار مثل عکس، PDF و ویدیوئه تا برای pipelineهای RAG و مدلهای fine-tuneشده آماده شه.
نکات کلیدی:
- Databricks Storage Ecosystem استوریج on-premise و هیبریدی رو با پروتکل باز OpenSharing به Databricks وصل میکنه
- انگیزهش: حاکمیت و مقررات داده، هزینهٔ egress، data gravity و نیاز به تأخیر کم
- معماری zero-copy یعنی اجرای Serverless Compute، Genie و LLM روی داده بدون کپی حتی یه بایت
- اتصال از طریق Unity Catalog یه کاتالوگ واحد روی کل محیط هیبریدی میده
- شریکهای راهانداز: MinIO، Everpure، Qumulo و VAST Data؛ گام بعدی پشتیبانی از دادهٔ بدونساختار




