جنجال تقطیر مدل K3 مونشات
خلاصهٔ کاملتر
مونشات پارسال K2 رو بیرون داد که تو شاخص هوش مصنوعی حدود ۱۹ گرفت، بعد K2.6 به ۴۴ رسید و آخرش K3 اومد و تا چند امتیازی بهترین مدل اون موقع (حدود ۶۰) خودش رو رسوند. همین جهش سریع باعث شد عدهای بگن مونشات مدلش رو از آزمایشگاههای آمریکایی تقطیر کرده، احتمالاً با جمعکردن خروجی از راه API. نویسنده معتقده این ادعا یه جواب فنی میخواد، نه واکنش سیاسی.
تقطیر تو معنای دقیقش به مقالهٔ ۲۰۱۵ هینتون، وینیالز و دین برمیگرده: مدل معلم فقط جواب نهایی نمیده، بلکه یه توزیع احتمال کامل روی همهٔ خروجیهای ممکن تولید میکنه که بهش میگن برچسب نرم. همون احتمالهای کوچیک، چیزی بود که هینتون اسمش رو گذاشت «دانش تاریک»، چون الگوهای تعمیم رو با خودش میبره. مدل دانشآموز یاد میگیره این توزیع نرمشده رو بازتولید کنه، نه فقط تکتوکن انتخابشده رو.
گره کار همینجاست: APIهای تجاری آنتروپیک، OpenAI و گوگل متن نمونهبرداریشده رو برمیگردونن، نه لاگپروب کل واژگان. بدون اون توزیع فقط «تقطیر سطحدنباله» ممکنه؛ یعنی جمعکردن خروجیها و فاینتیون روشون، همون کاری که پروژههایی مثل Alpaca و Vicuna کردن. تو مقاله اومده که گزارش آنتروپیک از حدود ۱۶ میلیون تبادل از طریق نزدیک ۲۴ هزار حساب، نشانهٔ نقض شرایط استفادهست، نه اثبات انتقال توانایی.
توانایی واقعی جای دیگه ساخته میشه: پیشآموزش، میانآموزش و یادگیری تقویتی بزرگمقیاس. دادهٔ پیشآموزش ماهها قبل از عرضه قفل میشه و یه دور RL در ابعاد فرانتیر دهها میلیون رولاوت میخواد؛ چیزی که با چند میلیون درخواست به یه API جور درنمیاد. تقطیر رویسیاست هم که بهمراتب از RL ساده کارآمدتره، باز به لاگپروب معلم نیاز داره، پس راه فراری از این محدودیت نیست.
تقویم انتشار هم به داد ادعا نمیرسه: مدل فرانتیر مورد بحث چند روز بعد از عرضه بهخاطر کنترلهای صادراتی از دسترس خارج شد و بعد حدود هجده روز قبل از K3 دوباره در دسترس قرار گرفت. نویسنده میگه این پنجره برای تغذیهٔ یه دور پیشآموزش چندتریلیونپارامتری بیمعنیه. این یعنی استفاده از یادگیری تقلیدی یا دادهٔ مصنوعی رد نمیشه، ولی ادعای مشخصِ تقطیر عمیق از راه API با واقعیت فنی جور درنمیاد.
نکات کلیدی:
- تقطیر واقعی یعنی تطبیق با توزیع احتمال کامل مدل معلم، نه کپی متن نهایی
- APIهای تجاری لاگپروب کل واژگان رو بیرون نمیدن
- تقطیر سطحدنباله بیشتر سبک و لحن منتقل میکنه تا توانایی استدلال
- گزارش ۱۶ میلیون تبادل آنتروپیک، نقض شرایط استفادهست نه اثبات کلونشدن مدل
- توانایی از پیشآموزش و RL بزرگمقیاس میاد که ماهها زمان میبره
- پنجرهٔ حدوداً هجدهروزه برای پیشآموزش مدلی در این ابعاد کافی نیست




