۱۵۰۰ دلار، یه اپ آسیبپذیر و یه مشت هوش مصنوعی
خلاصهٔ کاملتر
نویسنده که کارش تحقیقات امنیتی روی اپها و سایتهاست، میگه میخواست ببینه مدلهای زبانی (LLM) میتونن یه دسته باگ رایج رو که خودش بارها تو اپهای واقعی دیده بازتولید کنن یا نه. واسه همین یه اپ قلابی نقد کتاب ساخت — فرانتاندش با React Native و Expo و بکاندش با Python و FastAPI — و هدف رو گذاشت پیدا کردن یه «flag» مخفی توی نقدهای خصوصی یه کاربر. کل این آزمایش حدود ۱۵۰۰ دلار براش خرج برداشت.
به گفتهٔ نویسنده، خود API کاملاً امن بوده، ولی نقطهضعف از جای دیگهای میاومد: اپ از Firebase بهعنوان لایهٔ داده استفاده میکرد و فایل google-services.json داخل خود اپ، اطلاعات اتصال به Firebase رو لو میداد. مهاجم میتونست مستقیم از طریق Firebase ثبتنام کنه و دیتابیس Firestore رو بخونه، بدون اینکه اصلاً به API دست بزنه. این دقیقاً همون الگوییه که نویسنده تو دنیای واقعی هم دیده: API سفتوسخت ولی Firebaseِ کاملاً باز.
اسم فنی این مشکل بسته به سلیقهٔ آدمها Broken Access Control یا Missing Object-Level Authorization هست؛ همون چیزی که اپهای مبتنی بر Firebase و Supabase زیاد بهش دچار میشن. یه نکتهٔ تکرارشونده این بود که چند تا از مدلها Firebase رو پیدا میکردن ولی به جای استفادهٔ مستقیم ازش، سعی میکردن همون اعتبارنامه رو روی API امتحان کنن و به بنبست میخوردن.
تو نتایج، GPT-5.5 با ۷ موفقیت از ۱۰ اجرا بهترین عملکرد رو داشت. بعدش Deepseek V4 Pro با ۳ از ۱۰، و Claude Sonnet 4.6 و Claude Opus 4.8 هرکدوم ۲ از ۱۰. خیلی از مدلها مثل نسخههای Flash و Gemini و MiniMax هیچ موفقیتی نگرفتن. نویسنده تأکید میکنه این یه ارزیابی علمی نیست و فقط برای سرگرمی بوده، مخصوصاً که نزدیک نصف هزینه صرف اجراهای ناموفق و آزمایشی شده.
یکی از جالبترین مشاهدهها مربوط به رد کردن درخواست بود: مدلهای Gemini خیلی وقتها همون اول کار بهخاطر مسائل امنیتی درخواست رو رد میکردن (از روی مصرف توکن خیلی پایینشون هم معلومه). Claude Opus هم چند بار خیلی به جواب نزدیک میشد ولی محافظهای امنیتیش وسط راه جلسه رو تموم میکردن. نویسنده میگه حساب OpenAI خودش از قبل برای تحقیقات امنیتی تأیید شده بوده، واسه همین GPT اصلاً رد نمیکرد، و به گفتهٔ اون مدلهای چینی هم راحتتر سراغ حمله به دیتابیس میرفتن.
نکات کلیدی:
- باگ اصلی تو خود API نبود؛ Firebaseِ باز و فایل google-services.json لورفته مقصر بود.
- این دسته باگ همون Broken Access Control / Missing Object-Level Authorization رایج تو اپهای Firebase و Supabase هست.
- GPT-5.5 بهترین نتیجه (۷ از ۱۰) رو گرفت؛ خیلی از مدلها صفر شدن.
- مدلهای Gemini اغلب همون اول بهخاطر مسائل امنیتی درخواست رو رد میکردن.
- کل آزمایش حدود ۱۵۰۰ دلار خرج برداشت و نویسنده میگه یه ارزیابی علمی دقیق نیست.




