دستهبند تازه برای کامنتهای هوش مصنوعی توی کد
خلاصهٔ کاملتر
نویسنده وبلاگ یه نسخهی جدید از دستهبند کامنتهای کد رو معرفی کرده که کارش تشخیص اینه که یه کامنت رو آدم نوشته یا هوش مصنوعی. نسخهی قبلی رو با دادهی خصوصی ساخته بود و نمیتونست کد و دادهشو منتشر کنه، ولی اینبار همهچی از دادهی عمومی اومده. تو رابط وب جدید، روی هر بخش از متن که کلیک کنی، میبینی کدوم ویژگی (feature) باعث شده مدل اون بخشو مشکوک به هوش مصنوعی بدونه.
دقت متعادل مدل، یعنی وقتی نصف کامنتها آدم و نصفشون ربات باشن، رو ۷۷٪ه. جالب اینجاست که خروجی مدل یه درصد اطمینان کالیبرهشده هم داره؛ یعنی وقتی میگه ۸۰٪ مطمئنم، واقعاً ۸۰٪ از این مواقع درست میگه. وقتی اطمینانش بالای ۸۰٪ باشه، احتمال اشتباهش فقط ۵٪ه، و روی یه سری کامنت واقعی (نه ساختهشده برای تست) دقتش حتی به ۸۸٪ هم رسیده.
سختترین بخش کار جمعآوری داده بوده. نویسنده از ریپوهای متنباز، فایلهایی با کامنت واقعی انسانی برداشته و بعد از چند مدل هوش مصنوعی مختلف (GPT، Gemini، Claude، Grok، Kimi و GLM) خواسته براش کامنت مشابه بنویسن. چندبار به خاطر مشکلاتی مثل نشت موضوعی بین فایلها (یعنی مدل به جای سبک نوشتار، موضوع فایلو یاد میگرفته) مجبور شده دادههاشو از اول جمع کنه، طوری که هزینهی پروژه خیلی بیشتر از ۳۰ دلاری شد که اولش تخمین زده بود.
برای انتخاب ویژگیها، از فراوانی کاراکترها گرفته تا الگوی دستوری کلمات (part-of-speech n-grams) رو امتحان کرده و قویترینهاشونو نگه داشته. مدل نهایی رو تا ۳۵۵ کیلوبایت فشرده کرده تا بشه توی مرورگر اجراش کرد، و برای همین بهجای ابزارهای قویتر پایتونی مثل nltk و spaCy، از کتابخونهی سبک wink-nlp استفاده کرده.
نکات کلیدی:
- دقت متعادل مدل روی دادهی cross-validation حدود ۷۷٪ و روی نمونههای واقعی حدود ۸۸٪ه.
- مدل اول بین هفت منبع (آدم و شش مدل زبانی) تشخیص میده و بعد به حالت سادهی آدم/ربات تبدیل میشه.
- اندازهی نهایی مدل برای اجرا توی مرورگر فقط ۳۵۵ کیلوبایته.
- کد و داده بهصورت عمومی منتشر شده تا هرکسی بتونه دستهبند خودشو بسازه.




