وقتی بررسی تخصصی UX رو به هوش مصنوعی سپردم
خلاصهٔ کاملتر
نویسنده یه تسک بهظاهر ساده داشت: نوشتن بررسی تخصصی UX برای صفحات جستوجو، نتایج و جزئیات محصول یه پورتال. تصمیم گرفت فرضیهٔ رایج این روزها رو امتحان کنه — اینکه هوش مصنوعی برای این جور کارها انقدر خوب شده که طراح فقط باید خروجی رو یه نگاه بندازه. برای همین همون کارو همزمان به دو مدل سپرد و خودشم دستی انجامش داد تا مبنای مقایسه داشته باشه.
ورودی هر دو مدل کامل بود: بریف، پرسشوپاسخهای مخاطب هدف و USP، سند تحقیق صنعتی، خروجیهای Google Analytics و هیتمپ، اتنشنمپ و اسکرولمپهای Clarity. نویسنده تأکید میکنه که با یه پرامپت واحد کار نکرده؛ تسک رو مرحلهبهمرحله شکسته و از مدلها خواسته هر جا میشه یافتههاشون رو به دادهٔ GA و Clarity گره بزنن، نه اینکه صرفاً فرض بگیرن.
به گفتهٔ نویسنده هر دو مدل تحلیل تحویل دادن، ولی پر از مشکلات بیربط و حتی ناموجود؛ حتی مشاهدات مفیدشون بیشتر در حد جملهبندی و ساختار به کارش میومد. Claude از نظر او محسوستر دقیقتر بود و کل خروجی رو تو یه سند داد، در حالی که ChatGPT فقط بخشیشو تونست. چند مشکل بود که خودش ندیده بود، ولی چیزهایی که مدلها از قلم انداختن بیشتر بود. این با یه مطالعهٔ ۲۰۲۵ جور درمیاد که GPT-4o فقط حدود ۲۱٪ از مشکلات پیداشدهٔ متخصصها رو گرفته بود.
در نهایت نویسنده متن رو با کمک Claude جمع کرد؛ مشاهدات خودشو داد و مدل روی حذف و اضافهها، گرامر و انسجام کمکش کرد. حدس خودش اینه که تنهایی حدود ۱۵٪ بیشتر طول میکشید. به نظرش محدودیت مدل دسترسی به داده نیست، قضاوته: فهم زمینه و هدف، وزندهی به شدت مشکل و جدا کردن مشکل واقعی از نویز. قدم بعدیش هم ساختن یه agent skill اختصاصیه که هیوریستیکها و معیار شدت خودشو کد کنه — مثل Baymard که دقت ۹۵٪ رو از پایگاه دانش تخصصیش گرفت، نه از پرامپت بهتر.
نکات کلیدی:
- بررسی تخصصی UX یه پورتال همزمان با دو مدل و دستی انجام شد تا نتیجهها مقایسه بشن
- هر دو مدل مشکلات بیربط و ناموجود تولید کردن؛ چیزی که ندیدن بیشتر از چیزی بود که گرفتن
- مطالعهٔ ۲۰۲۵ روی GPT-4o هم به همین رسیده بود: پوشش حدود ۲۱٪ مشکلات متخصصها
- صرفهجویی زمان واقعی ولی محدود بود؛ حدود ۱۵٪ به حس نویسنده
- گلوگاه، قضاوت و اولویتبندیه، نه دسترسی به داده؛ راهحل پیشنهادی کدگذاری تخصص خودت تو یه skill قابلاستفادهٔ مجدده




