اتهام تازه: OpenAI دو سال دادگاه رو گمراه کرد
خلاصهٔ کاملتر
ماجرا سر یه پرونده کپیرایت پرحاشیهست: نیویورکتایمز و گروهی از رسانهها از OpenAI شکایت کردن که مدلهاشون روی مقالههای اونها آموزش دیده و کاربرا میتونن با prompt دادن، عین متن مقالههای پولی رو از چتجیپیتی بیرون بکشن. لاگهای خروجی چتجیپیتی دقیقاً همون مدرکیه که میتونه یه طرف رو ببره بالا: یا نقض آشکار رو ثابت کنه، یا استفاده منصفانه (fair use) بودن کار OpenAI رو نشون بده.
طبق درخواست جریمهای که رسانهها پنجشنبه ثبت کردن، OpenAI سالها دروغ گفته تا این مدرک رو مخفی کنه. به گفته شاکیها، این دروغها وقتی لو رفت که دادگاه یه مهندس حریم خصوصی OpenAI به اسم وینسنت موناکو رو مجبور کرد دوباره شهادت بده؛ اون تو بازجویی آوریل ناخواسته فاش کرد که شرکت دو سال درباره هزینه و سختی جستوجوی لاگها دادگاه رو گمراه کرده.
تکوندهندهترین بخش اینه که OpenAI ظاهراً از همون اول وانمود کرده توان فنی جستوجو تو نمونههای بزرگ ناشناسشده رو نداره، در حالی که قبل از شروع دعوا همین کارو کرده بود. شاکیها میگن شرکت دو نمونه آماده و ناشناسشده با حجم ۱۰ و ۷۸ میلیون لاگ داشته که میتونست زود در اختیارشون بذاره، ولی هیچوقت وجودشون رو اعلام نکرد؛ اون هم در حالی که خودش این نمونهها رو برای ساختن فیلتری برای جلوگیری از بازتولید محتوای کپیرایتدار گشته بوده.
به جای شفاف بودن، به گفته شاکیها OpenAI اونها رو مجبور کرده هشت ماه تو یه محیط محدود («sandbox») فقط روی یه نمونه ۲۰ میلیونیِ بهشدت سانسورشده کار کنن. بعد هم با کمک هوش مصنوعی ۱۹ میلیارد مورد سانسور (redaction) روی همون نمونه اعمال کرده، اونقدر که دادگاه نمونه رو «غیرقابلاستفاده» دونسته. شاکیها میگن حتی بعد از حذف بخشی از سانسورها، هنوز اسمها و دامنههای رسانهها پوشونده مونده.
نویسنده گزارش اضافه میکنه که اتهامها به همینجا ختم نمیشه: شاکیها میگن OpenAI بخشهایی از همون نمونه محدود رو هم تصادفی پاک کرده و میلیاردها لاگ دیگه رو، برخلاف دستور صریح دادگاه برای نگهداری، حذف یا فشرده کرده. به روایت شهادت موناکو، شرکت به این نتیجه رسیده که رعایت دستور نگهداری «سخته» و برای همین اصلاً قدمی برنداشته.
رسانهها میگن جریمه سبک جواب نمیده و «جریمه جدی» لازمه؛ میخوان دادگاه استفاده از همون نمونه ۲۰ میلیونی رو ممنوع کنه، بپذیره که لاگهای پنهانشده شامل بازتولید گسترده محتوای اونها بوده، و به هیئتمنصفه بگه OpenAI میلیاردها لاگ رو پاک کرده. از اون طرف سخنگوی OpenAI این اتهامها رو «کاملاً دروغ» میخونه و میگه تایمز فقط دنبال دسترسی به لاگ بیشتر و نقض حریم خصوصی کاربرهاست و پرونده خودش داره ضعیف میشه.
نکات کلیدی:
- شکایت کپیرایت نیویورکتایمز و چند رسانه از OpenAI حالا وارد فاز درخواست جریمه شده
- اتهام اصلی: OpenAI دو سال ادعا کرده توان فنی جستوجوی لاگهای بزرگ رو نداره، ولی قبلاً همین کارو کرده بود
- ادعا میشه نمونههای آماده ۱۰ و ۷۸ میلیونی پنهان مونده و یه نمونه ۲۰ میلیونی با ۱۹ میلیارد سانسور «غیرقابلاستفاده» شده
- OpenAI متهم شده برخلاف دستور دادگاه لاگها رو پاک یا فشرده کرده
- رد این نمونه سانسورشده میتونه ضربه بزرگی به دفاع «استفاده منصفانه» OpenAI بزنه




