چرا دیکشنری کلود فقط ۱۶ هزار توکنه؟
خلاصهٔ کاملتر
به گزارش وبلاگ Ian Barber، یه علاقهمند به توکنایزرها به اسم Sander Land تونسته چیزی شبیه توکنایزر فعلی کلود رو بازسازی کنه و به این نتیجه رسیده که این توکنایزر فقط حدود ۱۵ هزار ورودی (token) داره. این عدد در مقایسه با مدلهای دیگه خیلی کمه؛ مثلا Qwen 3.8 که یه مدل قوی حساب میشه، حدود ۲۵۰ هزار توکن تو واژگانش داره. روند کلی صنعت هم همیشه به سمت بزرگتر شدن واژگان بوده، برای همین این عدد کوچیک برای کلود عجیبه.
نویسنده میگه یه توضیح احتمالی اینه که آنتروپیک داره دور یه گلوگاه به اسم softmax bottleneck میزنه که تو مقالهی «Lost in Backpropagation» بهش اشاره شده. تو آخرین لایهی مدل، باید از فضای پنهون مدل (ابعاد D) به فضای بزرگتر واژگان (ابعاد V) پروجکت بشه تا توکن بعدی انتخاب بشه. تو Qwen مثلا D حدود ۸۱۹۲ ـه ولی V حدود ۲۵۰ هزارتا. وقتی خطای مدل به عقب برمیگرده (backpropagation)، این اختلاف بین D و V باعث میشه بخشی از اطلاعات گم بشه، چون رتبهی تغییرات فقط تا ۲D میتونه بره.
اگه این فرضیه درست باشه، آنتروپیک داره از این هزینه فرار میکنه: واژگان کلود از حدود ۵۰ هزار تو Claude 3 به حدود ۱۶ هزار امروز رسیده، در حالی که بقیهی مدلها همش داره بزرگتر میشه. این کار چند تا فایده هم داره؛ دیگه لازم نیست کرنلهای سنگین محاسبهی cross-entropy تیکهتیکه (chunked) بشه و چون همهی توکنها به اندازهی کافی آموزش میبینن، مشکل توکنهای عجیب و غریب (glitch token) مثل ماجرای معروف solidgoldmagikarp هم پیش نمیاد.
هزینهش هم اینه که واژگان کوچیکتر یعنی هر متن باید به توکنهای بیشتری (زیرکلمه یا حتی UTF-8) بشکنه، که تو تستهای Land حدود ۱.۲ تا ۲ برابر بیشتر شده. یعنی توجه (attention) بیشتری لازمه و هم اجرا و هم هزینهش بالاتر میره. با این حال نویسنده معتقده این معامله بهاحتمال زیاد ارزششو داره.
نکات کلیدی:
- توکنایزر فعلی کلود حدود ۱۵ تا ۱۶ هزار توکن داره، در برابر حدود ۲۵۰ هزار توکن Qwen 3.8
- واژگان کلود از حدود ۵۰ هزار تو Claude 3 به حدود ۱۶ هزار امروز کاهش پیدا کرده
- فرضیهی اصلی: دور زدن «softmax bottleneck» که طبق مقالهی «Lost in Backpropagation» باعث گم شدن اطلاعات تو backpropagation میشه
- فایده: نبود glitch tokenهایی مثل solidgoldmagikarp، چون همهی توکنها آموزش میبینن
- هزینه: حدود ۱.۲ تا ۲ برابر شدن تعداد توکن به ازای هر متن، یعنی محاسبات و هزینهی بیشتر




