تیم دتمرز: رنسانس تحقیقات هوش مصنوعی تو دانشگاهها شروع میشه
خلاصهٔ کاملتر
تیم دتمرز تو این پست از یه سؤال سر کلاسش شروع میکنه: از ۱۵۰ دانشجو، حدود ۸۰ درصد گفتن میترسن بعد از فارغالتحصیلی کار پیدا نکنن. از اون طرف، دانشجوهای دکترا بهش ایمیل میزنن که تحقیق دانشگاهی بیمعنیه و میخوان برن آزمایشگاههای فرانتیر. نویسنده میگه هر دو دیدگاه اشتباهن، چون فرض میکنن آینده مال کسیه که بیشترین GPU رو داره. به نظر اون، دانشگاهها دقیقاً بهخاطر منابع محدودشون قراره یه رنسانس رو تجربه کنن.
حرف اصلیش اینه که با ایجنتها (یعنی مدلهایی که خودشون یه کار چندمرحلهای رو جلو میبرن) پروژهای که قبلاً یه سال طول میکشید حالا چند هفته یا حتی چند روز وقت میبره. پس نوشتن یه مقالهٔ تکی دیگه سخت نیست. سختی رفته سمت ساختن یه اکوسیستم منسجم که هر تیکهش بقیه رو مفیدتر کنه. هفتهٔ متنباز آزمایشگاهش همین ایده رو با کد نشون میده: دو پروژهٔ متنباز و چهار مقاله که با هم منتشر میشن.
اولین تیکه یه harness ایجنته، یعنی لایهای که مدل رو به ابزارها وصل میکنه و کارش رو مدیریت میکنه. هارنس رو روی یه ریپو میذاری، مثلاً بهش میگی کرنلهای CUDA رو بهینه کن و میری. خودش بدون هیچ بازخوردی ادامه میده. با همین روش روی پیادهسازی Metal برای مک، مدل Qwen 3.6 35B-A3B با کوانتیزهسازی ۱.۵ بیت برای هر وزن به ۴۵۰ توکن در ثانیه رسیده. یعنی حدود یکدهم حافظهٔ نسخهٔ ۱۶ بیتی رو میخواد.
فریمورک استنتاجشون اجازه میده Qwen 3.8 Flash Next با ۱۲۵ میلیارد پارامتر روی یه GPU معمولی ۲۴ گیگی اجرا بشه، و DeepSeek V4.1 با ۵۵۰ میلیارد پارامتر روی AMD Strix، NVIDIA DGX Spark یا مکبوک ۱۲۸ گیگی. یه سیستم تحقیق خودکار هم ساختن که کاملاً لوکال و بدون اینترنت کار میکنه. به گفتهٔ نویسنده از deep research آزمایشگاههای بزرگ و سیستمهای Sakana AI و ScientistOne گوگل بهتره. تو یه آزمایش بیوانفورماتیک، تو حدود دو ساعت چهار نتیجه گرفت، از جمله یه ایراد تو دادههای ارزیابی اون حوزه.
تیکهٔ آخر CliffCompaction هست، یه روش auto-compaction (یعنی خلاصهکردن خودکار تاریخچهٔ گفتگو وقتی کانتکست پر میشه). نویسنده میگه خیلی قویتر از نسخهٔ Claude Code و Codex هست و جلسهها باهاش تا میلیونها توکن ادامه پیدا میکنن. هزینه رو حدود ۵۰ درصد کم میکنه و یکی از شرکاشون ۴۵ درصد کاهش تو کل بودجهٔ AI دیده. این صرفهجویی رو میشه خرج چند rollout موازی کرد، که پایهٔ روش test-time scaling اونهاست.
دتمرز در ادامه میگه تقاضا برای مهندس نرمافزار بیشتر از همیشهست، فقط مهارت کار با ایجنت و تخصص عمیقتر لازمه. توصیهش اینه که روش کارتون رو رها کنین، نه هویتتون رو: آکادمیکها مقاله رو بهعنوان واحد موفقیت کنار بذارن و دانشجوها اول مسئله رو بگیرن و تو مسیر یاد بگیرن. یه دورهٔ کوتاه چهارهفتهای تو CMU هم داره طراحی میکنه که قراره رو یوتیوب بیاد.
نکات کلیدی:
- Qwen 3.6 35B-A3B با ۱.۵ بیت برای هر وزن روی مک به ۴۵۰ توکن در ثانیه رسیده
- Qwen 3.8 Flash Next با ۱۲۵ میلیارد پارامتر روی یه GPU ۲۴ گیگی اجرا میشه
- CliffCompaction هزینه رو حدود ۵۰ درصد کم میکنه و بعضی جلسهها باهاش از ۱۰۰ میلیون توکن رد شدن
- هفتهٔ متنباز شامل دو پروژهٔ متنباز و چهار مقالهست که با هم منتشر میشن




