تحقیق فنی با AI، بدون توهمِ فهمیدن
خلاصهٔ کاملتر
نویسندهٔ این پست تعریف میکنه موقع یاد گرفتن نحوهٔ کار مدلهای زبانی، از هوش مصنوعی نه برای گرفتن جواب آماده بلکه برای مسیریابی استفاده کرده: پیدا کردن اصطلاح درست، رسیدن به منابع مفید، به چالش کشیدن توضیحهای خودش و بیرون کشیدن چیزهایی که خیال میکرده بلده. به گفتهٔ اون، سوال اولیه یعنی «LLMها چطور کار میکنن؟» اونقدر پهنه که مدل میتونه یه تور خوشآبورنگ از آموزش و توکنسازی و اینفرنس و alignment تحویلت بده، بدون اینکه از هیچکدوم چیزی سرت بشه.
پس اولین کار تنگ کردن سواله. نویسنده موضوع رو محدود کرده به اینکه از لحظهای که کاربر پرامپت رو مینویسه تا لحظهای که مدل توکن بعدی رو پیشبینی میکنه چی اتفاق میافته. همین یه شروع و پایان به بحث داده و ترتیبش رو هم مشخص کرده: توکنسازی قبل از embedding، embedding قبل از اطلاعات موقعیتی و اون هم قبل از attention. فایدهٔ جانبیش پیدا کردن واژههای گمشدهست؛ سوال سادهای مثل «مدل از کجا میفهمه کدوم کلمه اول اومده؟» نویسنده رو رسونده به positional encoding و از اونجا به موقعیت مطلق، روشهای نسبی و RoPE.
مرحلهٔ بعد، یکییکی رفتن سراغ اجزاست تا جایی که بتونی بگی چی وارد هر جزء میشه و چی ازش بیرون میاد. مثال خود نویسنده multi-head attention بود: تصویر رایجی که میگه بردار توکن تیکهتیکه میشه و هر تیکه میره به یه head، آسون یادت میمونه ولی غلطاندازه، چون هر head پروجکشن یادگرفتهٔ خودش رو برای Query و Key و Value داره. تو یادداشتهاش هر بخش دو تیکه داره: ادعای فنی دقیق همراه با منبعش، و سادهترین توضیحی که مفهوم رو براش جا انداخته. نویسنده تأکید میکنه چت خودش منبع نیست؛ برای هر ادعای مهم باید خود مقاله یا مستندات یا کد رو باز کنی.
حلقهٔ آخر اینه که آدم بگرده دنبال دلیل علیه توضیح خودش: مدل ذهنی از کجا به بعد دیگه جواب نمیده، کدوم کلمه زیادی قاطعه، این حرف دربارهٔ همهٔ مدلهاست یا یه پیادهسازی خاص. به گفتهٔ نویسنده گفتن اینکه هدهای attention «تخصصی میشن» راحته، ولی «تا حدی تخصصی» دقیقتره. بعد از اون چت بسته میشه و کل مسیر از متن تا توکن بعدی روی کاغذ سفید بازسازی میشه؛ هر جا دو جزء کنار هم رو بلد بودی ولی نتونستی بگی بینشون چی عوض شد، همونجا شکافه. نوشتن مقاله تازه بعد از این مرحله شروع میشه، اون هم از روی یادداشتها نه از روی خود چت.
نکات کلیدی:
- سوال پهن رو تنگ کن تا یه شروع و پایان مشخص پیدا کنه
- ترتیب وابستگی مفهومها رو دربیار و هر بار یه جزء رو کامل کن
- ادعای فنی و منبعش رو جدا از توضیح سادهشده نگه دار
- از مدل نقد بخواه، نه بازنویسی؛ نسخهٔ خودت باید جلوی چشمت بمونه
- برای هر ادعای مهم منبع اصلی رو خودت باز کن و تاریخ و نسخهش رو چک کن
- آخر کار چت رو ببند و موضوع رو از صفر بازسازی کن تا شکافها معلوم بشن




