Spark X2.5 چطور با ۴ میلیارد پارامتر به یک میلیون توکن میرسه
خلاصهٔ کاملتر
Spark X2.5 یه مدل زبانی ۴ میلیارد پارامتریه که با لایسنس Apache 2.0 منتشر شده و روی حدود ۲۰ تریلیون توکن آموزش دیده. تو این مقاله اومده که این مدل ادعای یه context window یک میلیون توکنی داره، عددی که معمولاً مال مدلهای خیلی بزرگتر از اینه. یه نسخهٔ کوچیکتر ۱.۷ میلیارد پارامتری هم ازش هست.
ترفند کار معماری hybrid attention ـه. تو attention معمولی هر توکن به همهٔ توکنهای دیگه نگاه میکنه، و همین باعث میشه هزینه با طول متن به توان دو بالا بره. sliding-window attention (یعنی هر توکن فقط چند صد یا چند هزار توکن دور و بر خودشو میبینه) خیلی ارزونتره و مصرف حافظهشم قابل پیشبینی میمونه، ولی ارتباط بین دو سر یه سند طولانی رو راحت گم میکنه.
Spark X2.5 این دوتا رو قاطی میکنه: به ازای هر سه لایهٔ sliding-window، یه لایهٔ global میاد، و همین بلوک از embedding تا خروجی تکرار میشه. لایههای ارزون بیشتر کار محلی مثل دستور زبان و متن نزدیک رو انجام میدن و اون لایهٔ گرون گاهبهگاه کل دنباله رو به هم وصل میکنه. نویسنده میگه این یه شرطبندی روی بهرهوری محاسباتیه، نه معجزهای که فرق مدل کوچیک و بزرگ رو پاک کنه.
تو تست عملی، مدل با context محدودشده به ۶۵ هزار توکن بالا اومده، نه یک میلیون، تا تو حافظهٔ GPU جا بشه. یعنی عدد context ظرفیت رو میگه، نه کیفیت فهم تو اون ظرفیت. با یه harness ابزارمحور به اسم Hermes بهش یه استک چهارلایه (Postgres، FastAPI، Nginx و Docker Compose) دادن و بدون راهنمایی مرحلهبهمرحله ازش خواستن باگ رو پیدا کنه.
مدل درست فهمید سیستم triage داره حادثهها رو بر اساس کمترین آدم درگیر مرتب میکنه بهجای بیشترین، و ترتیبشو درست کرد. ولی سه چهار برابر مدلهای بزرگتر وقت برد و وسط استدلال چند بار تو حلقه گیر کرد. به گفتهٔ نویسنده ادعای پشتیبانی از بیش از ۲۰۰ زبان هم یکدست درنمیاد: ترجمه برای زبانهای اروپایی پرمنبع خوب بود ولی تو زبانهای هندی، جنوب شرق آسیا و آفریقایی خطها قاطی شد و حتی یه زبان کلاً بیمعنی درومد.
نکات کلیدی:
- مدل ۴ میلیارد پارامتری، لایسنس Apache 2.0، آموزش روی حدود ۲۰ تریلیون توکن.
- نسبت معماری ۳ لایهٔ sliding-window به ۱ لایهٔ global، تکرارشونده تو کل شبکه.
- ادعای context یک میلیون توکنی، ولی تو تست فقط با سقف ۶۵ هزار توکن اجرا شد.
- باگ ترتیب triage تو یه اپ چهارلایه رو درست پیدا کرد، با ۳ تا ۴ برابر زمان بیشتر.
- کیفیت ترجمه فقط تو زبانهای پرمنبع پایداره، نه تو همهٔ ۲۰۰ زبان ادعاشده.




