تقطیر مدل؛ رقابتی که کسی علنی قبولش نمیکنه
خلاصهٔ کاملتر
لیتپست (晚点) تو گزارشی که بر پایهٔ گفتوگو با نزدیک به ده پژوهشگر و مهندس مدل تو شرکتهای مختلف چینی نوشته شده، سراغ موضوعی رفته که به گفتهٔ نویسنده هیچکس علنی دربارهش حرف نمیزنه ولی همه زیرچشمی حواسشون بهشه: distillation یا تقطیر — یعنی مکرر از یه «مدل معلم» قوی سؤال بپرسی، جوابها رو جمع کنی و با همین جفتهای پرسش-پاسخ یه «مدل دانشآموز» رو آموزش بدی تا به عملکرد مشابه برسه. نویسنده از همون اول تکلیف رو روشن میکنه: این کار سرقت کد یا برداشتن وزنهای مدل نیست.
ایدهٔ تقطیر تازه نیست. سال ۲۰۱۵ جفری هینتون همراه جف دین و اوریول وینیالس مقالهٔ Distilling the Knowledge in a Neural Network رو منتشر کردن، ولی هدف اون موقع قویتر کردن مدل نبود، فشردهسازی بود: مدل کوچیکتر توزیع احتمال خروجی معلم (logits — همون نمرههای خام قبل از Softmax) رو یاد میگیره. به این میگن تقطیر نرم یا جعبهسفید. همین کاربرد هنوز زندهست؛ DeepSeek اوایل ۲۰۲۵ با حدود ۶۰۰ هزار دادهٔ استدلالی تولیدشده با R1، شش مدل کوچیک بر پایهٔ Qwen2.5 و Llama 3 رو fine-tune کرد.
چیزی که الان جنجالیه فرق داره: تقطیر سخت و جعبهسیاه. از ۲۰۱۶ که Yoon Kim تقطیر در سطح دنباله رو معرفی کرد، دیگه لازم نیست به احتمالهای داخلی مدل دسترسی داشته باشی؛ کافیه API رو صدا بزنی و فقط «جواب نهایی» رو برداری. با اومدن مدلهای استدلالی — اول o1 و بعد R1 — زنجیرهٔ فکر و مسیر استدلال هم به مادهٔ خام تقطیر اضافه شد. شرکتهای بسته این زنجیره رو از کاربر مخفی میکنن، ولی مقالهٔ تازهٔ پژوهشگرهای دانشگاه توبینگن نشون داده مسیرهای استدلال از خروجی مدل قابل بازسازیه.
از فوریهٔ ۲۰۲۶ گوگل و Anthropic کلمهٔ «حمله» رو کنار تقطیر گذاشتن؛ Anthropic مدعی شده DeepSeek، Moonshot AI، MiniMax و Qwen با حدود ۵۰ هزار حساب جعلی بیش از ۴۴٫۸ میلیون تعامل با Claude داشتن تا قابلیتهاش رو بیرون بکشن. پژوهشگرهایی که لیتپست باهاشون حرف زده تقریباً همنظرن که تقطیر برای شرکتهای ردهاول خندق دفاعی بلندمدت نمیسازه و مزیتش بیشتر مزیت پیشقدمبودنه. چیزی که واقعاً مزیت میسازه data flywheel هست: مدل قویتر کاربر بیشتری میآره و دادهٔ سختتر و اختصاصیتری بهش برمیگرده.
نویسنده تأکید میکنه تقطیر نه گلولهٔ نقرهایه نه راز. کیفیت نهایی یه مدل بیشتر از pre-training میآد و تقطیر صنعتی خودش یه پروژهٔ مهندسی سنگینه: باید بتونی پایدار و پرحجم مدلهای پیشرو رو صدا بزنی، کاربر واقعی با سؤالهای باکیفیت جذب کنی، و یه خط لولهٔ داده برای پالایش، حذف تکراریها و گسترش داده بسازی. رقمهایی که تو صنعت برای بودجهٔ سالانهٔ تقطیر نقل میشه از بیش از ۱۰۰ میلیون تا ۱ میلیارد دلار میره. به گفتهٔ یکی از سرمایهگذارها، تقطیر یه دکمهٔ ساده نیست که بزنی و عملکرد مدل یهو جهش کنه.
نکات کلیدی:
- تقطیر جعبهسفید از logits معلم یاد میگیره و کارش فشردهسازیه؛ تقطیر جعبهسیاه فقط با صدا زدن API و برداشتن جواب نهایی انجام میشه.
- تو آزمایش کنترلشدهٔ DeepSeek، Qwen2.5-32B بعد از fine-tune با ۸۰۰ هزار دادهٔ R1 تو AIME 2024 به ۷۲٫۶٪ رسید؛ همون مدل با یادگیری تقویتی ۴۷٫۰٪ گرفت.
- Anthropic از حدود ۵۰ هزار حساب جعلی و ۴۴٫۸ میلیون تعامل برای استخراج قابلیتهای Claude خبر داده.
- شیائومی روش MOPD یا تقطیر on-policy چندمعلمه رو معرفی کرده و گزارشهای فنی DeepSeek-V4 و Kimi K3 هم از ایدههای مشابه برای ادغام مدلهای متخصص گفتن.
- Phi-4 مایکروسافت با ۱۴ میلیارد پارامتر تو GPQA امتیاز ۵۶٫۱٪ در برابر ۵۰٫۶٪ GPT-4o گرفت — یعنی دانشآموز میتونه تو بعضی بنچمارکها از معلم جلو بزنه.




