TimesFM-3 گوگل، پیشبینی سری زمانی چندمتغیره
خلاصهٔ کاملتر
گوگل تو بلاگ ریسرچش از TimesFM-3 رونمایی کرد، نسل سوم مدل پایهی سری زمانیش (foundation model یعنی مدلی که یهبار روی دادهی عظیم آموزش میبینه و بعد بدون آموزش دوباره رو کار جدید جواب میده). مدل ۳۳۰ میلیون پارامتر داره و روی بیشتر از یک تریلیون نقطهی زمانی واقعی و مصنوعی pre-train شده. تفاوت اصلیش با گذشته اینه که تا نسخهی ۲.۵، مدل فقط univariate بود؛ یعنی فقط تاریخچهی خودِ همون یه سری رو میدید.
به گفتهی نویسندهها بیشتر مسئلههای واقعی ذاتاً چندمتغیرهن. مثال خودشون فروش بستنیه: فروش گذشته بهتنهایی کل داستان رو نمیگه و باید فروش محصولات مرتبط، ترافیک مشتری و رویدادهای معلومِ آینده مثل تخفیف و تعطیلات و پیشبینی هوا هم دیده بشه. TimesFM-3 سه چیز رو بهصورت native پشتیبانی میکنه: چند هدف همزمان، past covariates (فقط گذشتهشون معلومه) و past-future covariates (آیندهشون هم از قبل معلومه، مثل تقویم تخفیف).
معماری همون decoder-only transformer نسخههای قبلیه، ولی این بار توکنها روی یه شبکهی دوبعدی حرکت میکنن. هر ۳۲ قدم زمانی به یه patch تبدیل میشه، بعد دو نوع attention پشت سر هم عوض میشن: causal temporal attention که افقی و فقط رو گذشتهی همون سری نگاه میکنه تا دادهی آینده لو نره، و full variate attention که عمودی تو همون لحظه بقیهی سریها رو میبینه و رابطهی بینشون رو یاد میگیره.
تغییر مهم دوم، حذف تولید تکهتکهست. نسخههای قبلی پیشبینی رو patch به patch میساختن که هم کند بود هم خطا روی هم انباشته میشد. حالا با روش Contiguous Patch Masking، مدل جای کل افق آینده توکن ماسکشده میذاره و همهشون رو تو یه forward pass پر میکنه. برای هر گام هم ۹ چندک (از صدک ۱۰ تا ۹۰) میده، یعنی بهجای یه عدد خشک، بازهی عدمقطعیت رو هم دستت میده.
گوگل مدل رو رو سه بنچمارک عمومی Gift-Eval و FEV-Bench و Time سنجیده و میگه بین مدلهای پایه هم تو معیارهای نقطهای و هم احتمالاتی رتبهی اول رو گرفته، حتی وقتی حالت چندمتغیره خاموشه و مثل یه مدل معمولی univariate ازش استفاده کنی. رقباش تو این مقایسه Chronos-2، خانوادهی Toto 2.0 و نسخهی قبلی خودشون TimesFM-2.5 بودن.
نکات کلیدی:
- ۳۳۰ میلیون پارامتر، آموزشدیده رو بیش از یک تریلیون نقطهی زمانی
- هر patch برابر ۳۲ قدم زمانی، با دو attention متناوب زمانی و بینسری
- کل افق پیشبینی تو یه forward pass، بدون حلقهی تکراری
- ۹ چندک از صدک ۱۰ تا ۹۰ برای هر هدف در هر گام
- رتبهی اول تو Gift-Eval و FEV-Bench و Time بین مدلهای پایه
- الان رو GitHub و Hugging Face هست؛ اتصال BigQuery چند هفتهی دیگه میرسه




