گروبر: واترمارک متنی Claude تحریف نوشتنه
خلاصهٔ کاملتر
آنتروپیک اعلام کرده همهٔ مدلهای Claude، در سطح جهانی و نه فقط داخل اتحادیهٔ اروپا، متن تولیدشدهٔ بلندتر از حدود ۲۰۰ توکن (تقریباً ۱۵۰ کلمه) رو واترمارک میکنن. جان گروبر تو مقالهای با لحن تند میگه توضیح اولیهٔ شرکت عملاً هیچی از سازوکار نگفته بود و متن پشتیبانی فقط مدعی شده بود واترمارک «نامحسوس»ه و روی معنا، کیفیت و خوانایی هیچ اثری نداره.
سازوکار واقعی یهجور استگانوگرافی توی خودِ انتخاب توکنهاست: موقع تولید، کلمههای ممکن بهصورت لحظهای و با یه کلید مخفی به دو سبد «سبز» و «قرمز» تقسیم میشن و مدل کمی بیشتر به سبد سبز تمایل پیدا میکنه. مثل یه سکهٔ ۵۱ به ۴۹، نتیجهٔ هر بار قطعی نیست ولی در طول متن یه سوگیری آماری میمونه که با همون کلید قابل اندازهگیریه. متن هرچی بلندتر باشه، تشخیص مطمئنتره.
ایراد اصلی گروبر اینه که دو مترادف هیچوقت دقیقاً یه معنی ندارن، پس هر بار که الگوریتم مدل رو از بهترین کلمه به سمت کلمهٔ سبز هل میده، نوشته یه پله میاد پایین. به گفتهٔ او این اتفاق حتی توی گفتوگوی خصوصی کاربر با مدل هم میافته، جایی که قرار نیست هیچکس دیگهای متن رو بخونه. نویسنده اضافه میکنه چون کلید فقط دست سازندهٔ مدله، خودِ کاربر هم نمیتونه چیزی رو راستیآزمایی کنه.
گروبر سراغ SynthID گوگل و مقالهٔ Nature پشتش هم میره. اونجا کیفیت با نرخ لایک و دیسلایک حدود ۲۰ میلیون پاسخ سنجیده شده و اختلاف در حد ۰.۰۱ تا ۰.۰۲ درصد و از نظر آماری بیمعنی بوده. به گفتهٔ نویسنده این سنجه به درد ارزیابی کیفیت نوشته نمیخوره، چون کسی بهخاطر انتخاب «موز» بهجای «آناناس» دیسلایک نمیزنه، و «ناچیز» هم مترادف «نامحسوس» نیست.
پشت همهٔ اینها ضوابط شفافیت محتوای هوش مصنوعی اتحادیهٔ اروپاست که از ۲ اوت ۲۰۲۶ علامتگذاری متن تولیدشده رو الزامی کرده، و آنتروپیک میگه فعلاً راه بادوامی برای محدود کردنش به یه منطقهٔ خاص نداره. گروبر و چند نویسندهٔ دیگه مثل جیمز پادولسی و مایکل لاپ میگن این طرح بیشتر کاربر صادق رو گرفتار میکنه: کسی که متن خودش رو با Claude ویرایش میکنه ممکنه متهم بشه، ولی آدم متقلب با یه ابزار بازنویسی راحت از زیرش درمیره.
نکات کلیدی:
- واترمارک فقط روی متن بلندتر از حدود ۲۰۰ توکن (تقریباً ۱۵۰ کلمه) اعمال میشه.
- هیچ کاراکتر مخفی یا متادیتایی به متن اضافه نمیشه؛ نشانه توی خودِ انتخاب کلمههاست.
- تشخیص فقط با کلید مخفی سازندهٔ مدل ممکنه، پس Claude نمیتونه واترمارک Gemini رو بخونه و برعکس.
- کد کمتر از نثر واترمارک میگیره، چون معمولاً یه جواب درست بیشتر نداره؛ کامنتهای داخل کد استثنان.
- تو مقالهٔ SynthID-Text گوگل، اختلاف نرخ لایک و دیسلایک بین مدل واترمارکدار و بدون واترمارک ۰.۰۱ تا ۰.۰۲ درصد گزارش شده.




