Periodic Neon: مدلی که از دادهی آزمایشگاههای واقعی یاد میگیره
خلاصهٔ کاملتر
Periodic Labs، شرکتی که آزمایشگاههای خودکار برای کشف مواد جدید راه انداخته، مدلی به اسم Periodic Neon معرفی کرده. طبق این پست، Neon الان تو آزمایشگاههای خودشون کار میکنه و نتایج آزمایشها رو برای پیدا کردن ابررساناها و آهنرباهای بهتر تحلیل میکنه. ادعای اصلی اینه که Neon تو تحلیل XRD از GPT-6 Astra و Claude Fable 5.1 بهتر عمل میکنه و هزینهی هر تحلیلش هم کمتره.
XRD یا پراش اشعهی ایکس یعنی به پودر یه ماده اشعهی ایکس بتابونی و ببینی چطور پخش میشه. هر فاز بلوری (یعنی هر ساختار اتمی منظم) یه الگوی قلهی مخصوص خودش داره، مثل اثر انگشت. ولی محصول یه آزمایش معمولاً ترکیبی از مادهی هدف، مواد اولیهی واکنشنداده و محصولات جانبیه و الگوهاشون روی هم میافتن. تحلیل این نمونهها حتی برای متخصصها چند ساعت طول میکشه و با بزرگ شدن آزمایشگاههای خودکار، دیگه نمیشه همه رو دستی بررسی کرد.
Neon روی FrontierXRD، سختترین تست داخلیشون با 134 نمونهی چندفازی، به نرخ موفقیت 55.3% رسیده. مدل پایهش Kimi K2.6 بوده، یه مدل open-weight (یعنی وزنهاش عمومی منتشر شده) با 1 تریلیون پارامتر که اولش فقط 2.7% موفقیت داشت. این حدود 20 برابر پیشرفت با midtraining (ادامهی آموزش مدل روی دادهی تخصصی) و reinforcement learning روی دادهی آزمایشگاه به دست اومده. آموزش نهایی روی 1,300 تا GPU مدل H200 انجام شده، ولی Astra طبق گزارشها با بیش از 100,000 GPU مدل Blackwell آموزش دیده.
روی 198 نمونه از سیستمهای شیمیایی که تو دادهی آموزش نبودن هم Neon از مدلهای پیشرو جلو زده. نویسندهها میگن این نشون میده مدل واقعاً مهارت تحلیل XRD رو یاد گرفته و فقط دادهی آموزش رو حفظ نکرده. البته خودشون اشاره میکنن که این تست از FrontierXRD سادهتره.
به گفتهی تیم Periodic، سه چیز دیگه هم کمک کرده. اول harness علمی، یعنی محیطی که مدل توش کار میکنه و به دیتابیسهای داخلی مواد و نرمافزارهای XRD دسترسی داره. در مقایسه با یه harness ساختهشده روی Claude Code با ابزارهای استاندارد XRD، این harness با هزینهی تقریباً یکسان 3.8 برابر موفقیت بیشتری داشته. برای همین همهی مقایسهی مدلها با همین harness انجام شده.
دوم RL بدون پاداش قابلتأیید: درستی تحلیل XRD رو نمیشه ارزون و خودکار چک کرد، پس یه LLM-judge ساختن که جای داوری متخصصها رو بگیره. متخصصها 77.2% مواقع با هم توافق داشتن و این داور 74.6% با متخصصها. سوم midtraining علمی روی ترکیبی از مقاله، کد و دادهی آزمایشگاهی که به گفتهی خودشون هر ماه دو برابر میشه و نتیجهی RL رو هم بهتر کرده.
نکات کلیدی:
- Neon روی FrontierXRD به 55.3% موفقیت رسیده، در برابر 2.7% مدل پایهی Kimi K2.6
- آموزش نهایی با 1,300 GPU مدل H200 انجام شده، در برابر بیش از 100,000 GPU مدل Blackwell برای GPT-6 Astra
- harness علمی Periodic نسبت به Claude Code با ابزارهای استاندارد XRD، 3.8 برابر موفقیت بیشتری داشته
- توافق LLM-judge با متخصصها 74.6% و توافق متخصصها با همدیگه 77.2% بوده
- روی 198 نمونه از سیستمهای شیمیایی دیدهنشده هم Neon از مدلهای پیشرو بهتر بوده




