اصول مهندسی نرمافزار حالا مهمتر از همیشهست
خلاصهٔ کاملتر
heckj تو وبلاگ rhonabwy مینویسه که پشت سروصدای بازاریابی «ارائهدهندههای بزرگ مدل»، ترکیب harness و مدل — یعنی همون پوستهای که مدل رو به ابزارها و کد وصل میکنه — یه ابزار قدرت واقعیه. به گفتهٔ او جالبترین کارها رو کسایی میکنن که سروصدا راه نمیندازن؛ یه اهرم بزرگ پیدا کردن و دارن دنبال نقطهٔ تکیهگاهش میگردن.
به نوشتهٔ او تو یک سال گذشته harnessهای ایجنتی از مرز «آیا اصلاً میشه انجامش داد» رد شدن، و مدلهای open weight دارن همین توان رو روی کامپیوترهای شخصی قوی میآرن — هنوز بهاندازهٔ مدلهای بزرگ کارآمد نیستن، ولی به گفتهٔ او فاصلهشون تو زمان و توانایی زیاد نیست. همزمان میگه مدل اقتصادی مدلهای بزرگ تو هیچ گزارشی که دیده پایدار درنیومده، ولی خودِ این توانایی دیگه از بین نمیره.
نویسنده «میشه انجامش داد» رو فقط شروع کار میدونه و با تجربهٔ جوشکاریاش تو دههٔ بیست زندگیاش مقایسهش میکنه: زود چیزهایی ساخته که نه بلندشون میکرده نه از در کارگاه بیرون میرفتن. درسش اینه که «چطور اجزا کنار هم میشینن» همهچیزو تعیین میکنه. میگه با کمی آیندهنگری از ایجنت هم «کار میکنه» درمیاد هم «تستپذیره» — خودش زیاد از پرامپت «با TDD قرمز/سبز توسعه بده» استفاده میکنه — ولی بالاتر از این خیلی محکم نیست.
به گفتهٔ او درزها — نحوهٔ کار کد، APIاش و جوری که کنار بقیهٔ نرمافزار میشینه — بهاندازهٔ علم، هنرن و به تجربه و زاویهٔ دید آدم وابستهان. دیباگپذیر، نگهداشتپذیر، لایهلایه و ترکیبپذیر کردن نرمافزار هنوز کار سختیه و استدلال دقیق و حوصلهبر میخواد؛ همونجایی که به نظر او حتی مدلهای پیشرو هم کم میارن. تأکید میکنه LLMها استدلال نمیکنن، پیشبینی میکنن و عملاً دانش نوشتهٔ بشرن که فشرده شده — برای همین به مقالهٔ The Illusion of Thinking اپل ارجاع میده.
به گفتهٔ او بیشترین بردهای امروز از دادن دادهٔ خوب و فشرده در زمان درست میاد، بهعلاوهٔ ابزار اعتبارسنجی قطعی که بازخوردش به زبان طبیعی باشه تا مدل خودش رو تصحیح کنه. همزمان به «سهگانهٔ مرگبار» سایمون ویلیسون اشاره میکنه: مدلها حرف خوب و بد رو از هم تشخیص نمیدن و ذاتاً جلوی prompt injection رو نمیگیرن؛ sandbox و لایههای ایمنی فقط بدترین حالت رو کم میکنن. امیدش اینه که تو post-training، تمیزی رابطها و نگهداشتپذیری هم وارد ارزیابیها بشه.
نکات کلیدی:
- به گفتهٔ نویسنده harnessهای ایجنتی از مرز «میشه انجامش داد» رد شدن، ولی این فقط شروع کار مهندسیه.
- مدلهای open weight روی کامپیوتر شخصی قوی به مدلهای بزرگ نزدیک شدن؛ فاصلهٔ کیفیت کم شده.
- پرامپت «با TDD قرمز/سبز توسعه بده» کد تستپذیر میده، ولی طراحی درزها و API قضاوت انسانی میخواد.
- مقالهٔ The Illusion of Thinking اپل شاهدِ ضعف LLMها در استدلال معرفی شده.
- «سهگانهٔ مرگبار» سایمون ویلیسون: مدلها ذاتاً جلوی prompt injection رو نمیگیرن.




