انگشتنگاری مدلها: از صفر یا مشتقشده؟
خلاصهٔ کاملتر
نویسندهی این مقاله دنبال جواب یه سؤال مشخصه: وقتی یه آزمایشگاه از مدل پایهی «کاملاً خودساخته» رونمایی میکنه، یه ناظر بیرونی فقط با فایلهای عمومی چطور میتونه ادعا رو بسنجه؟ ساختن مدل روی یه پایهی open-weight مثل Qwen یا Llama کار رایج و کاملاً مشروعیه، ولی با آموزش از صفر فرق داره و شرکتها همیشه این تفاوت رو شفاف نمیگن.
محور اول معماریه. هر چکپوینت transformers یه config.json داره و چند فیلد سادهش — مثل hidden_size، intermediate_size، num_hidden_layers و تعداد هدها — با هم یه امضای خیلی متمایزکننده میسازن. به گفتهی نویسنده یه فیلد مشترک هیچ معنایی نداره، ولی وقتی پنجتاش همزمان دقیقاً با یه مدل خارجی جور دربیاد، عملاً انگشتنگاریه.
محور دوم توکنایزره که مثل آزمایش پدری عمل میکنه: مجموعهی واژگان دو مدل از tokenizer.json استخراج و همپوشانیشون حساب میشه، اون هم با تقسیم بر اندازهی کوچکتر تا واژگان کوچکشدهای که زیرمجموعهی پایهست عددی نزدیک ۱ بگیره. همین محور چیزهایی رو لو میده که config پنهون میکنه؛ مثلاً یه مدل با معماری کاملاً منطبق بر Qwen، توکنایزری داشته با همپوشانی حدود ۰٫۳۸ — «مغز خارجی، زبان خودی».
محور سوم وزنهاست و دوتا تلهی آموزنده داره. شباهت کسینوسی سطر به سطر امبدینگها بیفایدهست، چون فضای پنهان ترنسفورمر پایهی ممتاز نداره و یه چرخش دلخواه، اطلاعات یکسان رو بیشباهت نشون میده. راه درستتر CKA خطیه که نسبت به چرخش و مقیاس ناوردا هست:
def linear_cka(X, Y):
X = X - X.mean(0, keepdim=True)
Y = Y - Y.mean(0, keepdim=True)
num = (X.T @ Y).norm() ** 2
den = (X.T @ X).norm() * (Y.T @ Y).norm()
return (num / den).item()ولی نویسنده صادقانه میگه CKA هم کافی نیست: مدلِ از صفر عدد نزدیک صفر میگیره، اما یه مدل ادامهپیشآموزشدیده فقط حدود ۰٫۲۵ میگیره که خیلی بالاتر از خط پایهی دو مدل بیربط (حدود ۰٫۲۱) نیست. برای همین محور وزنها شاهد پشتیبانه نه حکم، و مدرک اصلی همون config و توکنایزر میمونه. خروجی نهایی یه برچسب بین Native، Adapted، Mixed و Portedه که روی مدلهای پایهی عمومی ۹ سازمان کرهای اجرا شده و نتیجهش اصلاً یکدست نبوده.
نکات کلیدی:
- سه محور انگشتنگاری: معماری ، توکنایزر (همپوشانی واژگان) و وزنها (CKA امبدینگ)
- تطابق همزمان پنج فیلد شکل معماری با یه مدل باز، شاهد قوی اقتباس معماریه
- شباهت کسینوسی سطری بهخاطر ناوردایی چرخشی برای تشخیص تبار بیفایدهست
- CKA فقط «از صفر بودن» رو قطعی نشون میده و برای اثبات مشتقبودن ضعیفه
- خروجی نهایی چهار برچسب Native، Adapted، Mixed و Portedه که روی مدلهای ۹ سازمان کرهای اجرا شده
- نویسنده تأکید میکنه این ابزار تبار مدل رو گزارش میکنه، نه تخلف رو




