گزارش فنی: Grok Build کل مخزن کد رو آپلود میکرد
خلاصهٔ کاملتر
پژوهشگری با نام cereblab یه تحلیل سطح شبکه از grok، یعنی CLI کدنویسی رسمی xAI، منتشر کرده. روش کارش پروکسی کردن ترافیک HTTPS خود ماشین شخصیاش بوده، روی یه مخزن آزمایشی که فایلهاش نشانههای یکتای ساختگی («کِیناری») داشتن تا هر رشتهای که تو ترافیک ظاهر میشه دقیقاً به یه فایل ردیابی بشه. تأکید میکنه هیچ اعتبارنامهٔ واقعیای در کار نبوده.
یافتهٔ اول اینه که وقتی Grok فایلی رو میخونه، محتواش بدون هیچ پنهانسازی به xAI فرستاده میشه — و فایل .env هم مثل بقیه رفتار میشه. نویسنده میگه محتوای فایل رمزها هم تو بدنهٔ درخواست مدل (/v1/responses) و هم داخل یه آرشیو session_state دیده شده که با پاسخ ۲۰۰ روی /v1/storage پذیرفته شده.
یافتهٔ دوم مهمتره: به گفتهٔ نویسنده یه کانال جدا وجود داره که کل فضای کاری رو، مستقل از اینکه ایجنت چی خونده، آپلود میکنه. شاهد قاطعش اینه که با پرامپت صریح «فقط بنویس OK و هیچ فایلی رو باز نکن»، کل مخزن به شکل یه بستهٔ گیت آپلود شده و از روی همون بسته میشه فایلی رو که ایجنت اجازهٔ بازکردنش رو نداشته، با نشانهٔ یکتاش و بهعلاوهٔ کل تاریخچهٔ گیت بازیابی کرد. همین آزمون روی یه مخزن دوم هم تکرار شده.
برای نشون دادن مقیاس، روی یه مخزن ۱۲ گیگابایتی از فایلهای تصادفیِ خواندهنشده، کانال ذخیرهسازی ۵.۱ گیبیبایت داده جابهجا کرده در حالی که کانال گفتوگو با مدل فقط ۱۹۲ کیلوبایت بوده؛ نسبتی حدود ۲۷٬۸۰۰ برابر که به گفتهٔ نویسنده ثابت میکنه حجم آپلود به اندازهٔ مخزن گره خورده، نه به چیزی که مدل خونده. هیچکدوم از این آپلودها هم شکست نخورده.
مقصد، طبق رشتههای داخل باینری و یه فایل متادیتای مرحلهای، یه باکت گوگل کلاود استوریج به اسم grok-code-session-traces بوده. نویسنده میگه این سازوکار تو اسکریپت نصب و راهنمای شروع سریعِ CLI توضیح داده نشده بود و بهصورت پیشفرض فعال بوده. نکتهٔ حساستر اینکه خاموش کردن گزینهٔ «بهبود مدل» جلوش رو نمیگرفته: تنظیمات برگشتی از سرور همچنان trace_upload_enabled رو true نشون میداده.
نویسنده روی مرز ادعاهاش صادقه و یه بخش کامل به «چیزی که ثابت نکردیم» اختصاص داده. تأکید میکنه آپلود و ذخیرهسازی مساوی آموزش دادن مدل روی این دادهها نیست، بعضی لاگهای میانی نگهداشته نشدن، و ادعای «مستند نبودن» فقط به مواد نصب همون CLI محدوده. حتی یه نتیجهگیری اولیهٔ اشتباه خودش رو هم پس گرفته و توضیح داده چرا اندازهگیری قبلی گمراهکننده بوده.
تو یادداشت بهروزرسانی اومده که این تحلیل مربوط به نسخهٔ ۰.۲.۹۳ بوده و از زمان انتشار، xAI آپلود رو سمت سرور غیرفعال کرده و یه گزینهٔ انصراف اضافه کرده — که نویسنده میگه تستش نشون داده تنظیمِ نگهداری دادهست نه توقف ارسال. ایلان ماسک هم علناً قول حذف دادههای آپلودشدهٔ قبلی رو داده که هنوز تأیید نشده.
نکات کلیدی:
- محتوای فایلهای خواندهشده، از جمله .env، بدون پنهانسازی ارسال میشده
- یه کانال جدا کل مخزن رو به شکل بستهٔ گیت آپلود میکرده، حتی فایلهای باز نشده
- مقصد یه باکت گوگل کلاود به اسم grok-code-session-traces بوده
- خاموش کردن «بهبود مدل» آپلود مخزن رو متوقف نمیکرده
- نویسنده تأکید میکنه آپلود ثابت شده، ولی آموزش مدل روی این دادهها ثابت نشده
- یافتهها مختص نسخهٔ ۰.۲.۹۳ (جولای ۲۰۲۶) هست و بعدش xAI آپلود رو غیرفعال کرده




