ادعای نشت چتهای مدل لوکال Codex به سمت OpenAI
خلاصهٔ کاملتر
تو مخزن openai/codex یه issue باز شده (شمارهٔ ۴۱۷۱۱) که ادعا میکنه قابلیت Memories محتوای چتهایی که با مدل لوکال انجام شدن رو به OpenAI میفرسته. به گفتهٔ گزارشدهنده، وقتی Codex میخواد خاطره بسازه یکی از گفتگوهای قبلی رو انتخاب میکنه (تو Codex به این گفتگوهای ذخیرهشده rollout میگن)، ولی انتخابش به provider سازندهٔ همون گفتگو مقید نیست؛ بعد متن اون گفتگو رو با provider فعالِ جلسهای که خاطرهسازی رو تریگر کرده میفرسته.
گزارشدهنده میگه با نسخهٔ ویندوزی 0.150.0-alpha.12.2 یه تست کنترلشده انجام داده و ترافیک خروجی خودش رو ضبط کرده: یه درخواست WebSocket حدود ۳۸ کیلوبایتی با request_kind = "memory" به endpoint خاطرهٔ ChatGPT رفته. پنجتا از شش آیتم گفتگوی مبدا عینا داخلش بوده؛ پیام کاربر، جواب دستیار، اسم و آرگومانهای tool call، خروجی و خطای tool همراه با مسیرهای لوکال، و پیام environment context با working directory و shell و timezone.
به گفتهٔ گزارش، جوابی که سرور برگردونده (مدل gpt-5.6-luna، مجموعا ۸۳۲۰ توکن) نشانههای یکتای متن مبدا رو چند بار تکرار کرده، یعنی محتوا واقعا اونور پردازش شده نه فقط یه اتصال ساده برقرار شده. ریشهٔ فنیش هم سه مرحلهست: انتخاب کاندید با model_providers: None صدا زده میشه و به provider مبدا مقید نیست، ورکر خاطره کلاینتش رو از config.model_provider جلسهٔ جاری میسازه، و گفتگوی انتخابشده داخل یه پیام کاربر جدید سریالایز و ارسال میشه.
تابع redact_secrets که قبل از ارسال اجرا میشه هم به گفتهٔ گزارشدهنده فقط چندتا الگوی شناختهشدهٔ کلید و توکن رو میگیره. تو یه تست جدا، ایمیل، شمارهٔ تلفن، مسیر ویندوزی، هدر کلید خصوصی و متن خصوصی سالم رد شدن. غیرفعال کردن analytics و همهٔ exporterهای OpenTelemetry هم جلوی این مسیر رو نمیگیره، چون این ترافیک، درخواست inference مدله نه تلهمتری. تنها کنترل قطعی فعلی [features] memories = false هست.
نویسنده میگه این ماجرا رو بعد از گرفتن یه اخطار حساب بابت «cyber abuse» دنبال کرده، در حالی که به گفتهٔ خودش اون فعالیت فقط تو چتهای لوکالش وجود داشته. خواستههاش اینه که انتخاب و ارسال به provider مبدا مقید بشه، پردازش بینprovider اگه قراره بمونه opt-in و شفاف باشه، و OpenAI اقدامات انضباطی حسابهایی که ممکنه بر پایهٔ این دادهها انجام شده باشه رو بازبینی و اعلام کنه. issue هنوز بازه و جواب رسمی از OpenAI ثبت نشده.
نکات کلیدی:
- issue شمارهٔ ۴۱۷۱۱ تو مخزن openai/codex، با برچسبهای bug و memory و custom-model، هنوز بازه.
- تست روی باینری ویندوزی 0.150.0-alpha.12.2 انجام شده و یه فریم WebSocket حدود ۳۸ کیلوبایتی با request_kind = "memory" ضبط شده.
- پنج آیتم از شش آیتم گفتگوی مبدا، شامل خروجی و آرگومان tool و مسیرهای لوکال، عینا ارسال شده.
- علت ادعایی: انتخاب کاندید با model_providers: None و ساخت کلاینت از config.model_provider جلسهٔ جاری.
- خاموش کردن analytics و OpenTelemetry کافی نیست؛ تنها کنترل قطعی فعلی [features] memories = false هست.




