جیپیتی-6 آسترا و بحث ترنسفورمرهای حلقهای
خلاصهٔ کاملتر
OpenAI هفته پیش GPT-6 Astra رو منتشر کرد و به گفته نویسنده (سباستین راشکا) این بهترین مدلیه که تا حالا استفاده کرده، خصوصاً تو کارای گرافیکی، رندر سهبعدی و computer use (یعنی کنترل کردن رابط گرافیکی کامپیوتر با موس و کیبورد). رو بنچمارک ARC-AGI-3 به ۹۹.۹٪ رسیده در حالی که مدل قبلی، GPT-5.6 Sol، فقط ۷.۸٪ گرفته بود؛ ولی تو بنچمارکهای کدنویسی ایجنتی فاصلهاش با رقبا اونقدرا زیاد نیست.
دو روز قبل از انتشار رسمی، نشریه The Information با استناد به منابع داخلی نوشت Astra از تکنیکی به اسم «عمق بازگشتی» یا looped transformer استفاده میکنه، و همین خبر نگرانی درباره پنهون شدن زنجیره فکر (chain of thought) مدل رو دامن زد.
ایده looped transformer اینه که بهجای اضافه کردن بلوکهای ترنسفورمر جدید، همون بلوکها رو با وزنهای یکسان چندبار پشتسرهم اجرا کنی. مثلاً مدل Nanbeige4.2-3B، ۲۲ بلوک رو دوبار اجرا میکنه که میشه ۴۴ بار اجرای بلوک، اونهم فقط با نصف تعداد پارامترهایی که یه مدل معمولی ۴۴بلوکی نیاز داره. این ایده از مقاله Universal Transformer در سال ۲۰۱۸ میاد، و مدلهای جدیدتر مثل Ouro از بایتدنس (۴۸ بلوک، ۴ بار = ۱۹۲ اجرا) و Mixture-of-Recursions حتی تعداد حلقهها رو برای هر توکن جداگونه و پویا تعیین میکنن.
نویسنده تاکید میکنه این تکنیک رایگان نیست: کش KV باید برای هر پاس جدا نگه داشته بشه، پس صرفهجویی محاسباتی چندانی وجود نداره، فقط تعداد وزنهای ذخیرهشده کمتر میشه.
به نظر نویسنده، looped transformer به تنهایی نمیتونه توضیح قانعکنندهای برای «پنهون کردن» زنجیره فکر باشه، چون OpenAI از همون مدل o1 به بعد همیشه بیشتر ردپای استدلال رو از کاربر پنهون میکرده. به گفته اون، دلیل اصلی موفقیت Astra بیشتر به روش آموزش و دادههای بهتر برمیگرده تا این ترفند معماری؛ و اینکه Astra با توکن کمتر به همون دقت میرسه، لزوما نشونه غیرقابلتفسیر شدن مدل نیست، بلکه میتونه فقط نشونه توانمندتر شدنش باشه.
نکات کلیدی:
- GPT-6 Astra رو بنچمارک ARC-AGI-3 به ۹۹.۹٪ رسیده (مدل قبلی ۷.۸٪)
- شایعه: Astra از تکنیک looped transformer (عمق بازگشتی) استفاده میکنه
- نمونهها: Nanbeige4.2-3B (۲۲ بلوک × ۲)، Ouro-Thinking 2.6B (۴۸ بلوک × ۴)، Mixture-of-Recursions با روتینگ توکنبهتوکن
- looping تعداد وزنهای ذخیرهشده رو کم میکنه ولی هزینه محاسباتی و KV cache رو کاهش نمیده
- نویسنده: دلیل اصلی موفقیت Astra آموزش بهتره، نه صرفا این ترفند معماری




