ReViSQL؛ مدلی که در text-to-SQL از انسان جلو زد
خلاصهٔ کاملتر
تو این پست از Thinking Machines اومده که آدمها روی بنچمارک BIRD (یعنی یه بنچمارک واقعگرایانه برای تبدیل سؤال زبان طبیعی به SQL) حدود ۹۲.۹۶٪ درست جواب میدن، ولی بهترین LLMها تازه از زیر ۷۰٪ در ۲۰۲۴ به ۸۲٪ رسیدن. نویسندهها میگن مشکل کمبود دادهٔ آموزشی نیست، چون SQL تو دیتای پیشآموزش فراوونه. گیر کار سؤالهای مبهم و اسکیمای پرجزئیات دنیای واقعیه که گاهی میلیونها ستون داره.
راهحل رایج، داربست یا همون scaffold هست: یه مرحله ستونهای مرتبط رو غربال میکنه، یکی کوئری تولید میکنه، یکی خطای اجرا رو تعمیر میکنه و یکی بین کاندیداها رأی میگیره. به گفتهٔ نویسندهها این کار فقط یه دنبالهٔ دستورالعمل رو به مدل تحمیل میکنه و بهترین مدل داربستدار هم هنوز ۱۱ واحد از انسان عقبه. حرفشون اینه که تجربهٔ کار باید بره داخل خود آموزش مدل، نه داخل پرامپتهای داربست.
قدم اول پاکسازی داده بود، چون RLVR (یادگیری تقویتی با پاداش قابل راستیآزمایی) به برچسب غلط خیلی حساسه و پاداش تنها سیگنال یادگیریه. ممیزی ۲۵۰۰ نمونه از BIRD Train نشون داد ۵۲.۱٪ کوئریهای طلایی غلطن، ۲۶.۲٪ سؤالها ایراد دارن و در مجموع ۶۱.۱٪ نمونهها دستکم یه خطا دارن. نسخهٔ تمیزشده با اسم BIRD-Platinum منتشر شده و همین بهتنهایی مدل رو روی Arcwise-Plat-SQL به ۸۸.۵۵٪ رسوند.
قدم دوم تابع پاداش بود. پاداش استاندارد فقط چک میکنه خروجی کوئری با کوئری طلایی یکی باشه، ولی تو یه اجرای آزمایشی معلوم شد ۳۲.۸٪ پاداشهای مثبت به کوئریهایی رفته که معناً همارز نبودن و فقط رو همون یه دیتابیس جواب یکسان داده بودن. برای همین با ابزار VeriEQL همارزی معنایی رو میسنجن و پاداش این موارد رو کم میکنن. یعنی مدل یاد میگیره کوئریای بنویسه که روی هر دیتابیسی درست باشه.
مشکل دوم این بود که مدل دانش بیرونی همراه سؤال رو نادیده میگرفت و به حدس پیشآموزشی خودش تکیه میکرد، جایی که ۲۴.۲٪ شکستها از همین میاومد. راهحل یه پاداش فرایندی قاعدهمحوره: مدل باید هر تکه دانش بیرونی رو به یه قید صریح ترجمه کنه و بعد کوئری خودش رو در برابر همون قیدها ممیزی کنه. نتیجهٔ نهایی ReViSQL-K2.6 هست که با دیکود حریصانه ۹۱.۳۷٪ میگیره و با رأیگیری بین ۱۶ نمونه به ۹۲.۹۷٪ میرسه.
نکات کلیدی:
- ممیزی ۲۵۰۰ نمونه از BIRD Train: ۵۲.۱٪ کوئری طلایی غلط و ۶۱.۱٪ نمونهها دستکم یه خطا داشتن.
- آموزش روی BIRD-Platinum بهجای BIRD Train دقت رو ۱۶٪ روی Arcwise-Plat-SQL و ۱۴٪ روی Spider2-Snow بالا برد.
- در اجرای آزمایشی ۳۲.۸٪ پاداشهای مثبت به کوئریهای غیرهمارز رسیده بود؛ VeriEQL برای همین اضافه شد.
- ReViSQL-K2.6 با دیکود حریصانه ۹۱.۳۷٪ دقت با ۰.۰۳۵ دلار هر تسک میده، ۸.۴ واحد بهتر از OpenSearch.
- مدل پایه Kimi-K2.6 با LoRA rank ۳۲ و هدف CISPO روی Tinker آموزش دیده و کد و دیتا منتشر شده.




