مدل ۲۷ میلیاردی Qwen که رو سیستم شخصی هم جواب میده
خلاصهٔ کاملتر
Qwen 3 27B یه مدل متنباز و متراکم (dense یعنی همه پارامترهاش همیشه فعالن، برخلاف مدلهای MoE) از تیم Qwen شرکت علیباباست که هم متن میفهمه هم عکس، و میتونی میزان «فکر کردنش» (reasoning effort) رو برای هر کار جدا تنظیم کنی. تو ایندکس عاملی هوش مصنوعی (AI agentic index) نمرهای حدود ۵۱ گرفته، یهکم عقبتر از Kimi 3 که ۲٫۸ تریلیون پارامتر داره؛ یعنی برای مدلی که رو یه ورکاستیشن معمولی هم جا میشه، نتیجه قابل توجهیه.
برای اجرا کردنش، انتخاب ابزار به سختافزارت بستگی داره: رو اپل سیلیکون نسخه MLX رو دانلود کن، رو لینوکس یا ویندوز با گرافیک انویدیا سراغ VLM (vLLM) یا SGLang برو. تو یه تست، نویسنده مدل رو با کوانتیزیشن NVFP4 (یعنی فشردهسازی وزنهای مدل برای کم کردن حجم حافظه) رو یه کلاستر دو-نودی DGX Spark اجرا کرده و رو یه ترد تنها ۱۵ تا ۲۰ توکن بر ثانیه گرفته، که با درخواستهای همزمان به ۶۰ تا ۷۰ توکن بر ثانیه رسیده.
مدل چهار سطح reasoning effort داره: خاموش، کم، متوسط و خیلی زیاد (سطح «زیاد» وجود نداره). به گفته نویسنده، خاموش کردنش خروجی ضعیف و پر از عدد ساختگی میده و سطح کم یه سایت تمیز و قابل استفاده میسازه.
سطح متوسط جلوههای بصری بهتری میده ولی مصرف توکنش به ۸۶۰ هزار تا و زمان اجراش به ۶۳ دقیقه میرسه، و سطح خیلی زیاد بهترین کیفیت رو با هزینه زمان و توکن حتی بیشتر (نزدیک ۵۰۰ هزار توکن و بیش از ۸۰ دقیقه) میده. نتیجهای که نویسنده میگیره اینه که reasoning effort بیشتر همیشه به معنی کیفیت بهتر نیست و میتونه کل بودجه تولید رو صرف «فکر کردن» کنه.
تو بخش بینایی هم مدل غافلگیرکننده خوب عمل کرده؛ تو تستی که نویسنده انجام داده، تونسته ماشینهای تو یه پارکینگ شلوغ رو با تقسیم تصویر به چند ناحیه بشمره و حتی مختصات کادر دور اشیا (bounding box) رو بدون کمک گرفتن از یه مدل تشخیص شیء جداگانه تولید کنه؛ دقتش کامل نبوده ولی برای این سایز مدل غیرمعموله.
چیزی که کار رو راحتتر میکنه، ابزار DeepSeek Harnessه که پلاگینمحوره و یه ویژگی به اسم trajectory داره: کل مسیر اجرای یه ایجنت رو، از system prompt گرفته تا هر tool call و زمانبندیش، قابل مشاهده میکنه. این یعنی وقتی یه ایجنت اشتباه میکنه، میتونی دقیقاً ببینی کجا خراب کرده، بدون اینکه یه ابزار ردیابی جدا نصب کنی. به گفته نویسنده این پروژه تو یه هفته اول دهها هزار ستاره تو گیتهاب گرفته، هرچند فعلاً مشارکت بیرونی قبول نمیکنه.
نکات کلیدی:
- Qwen 3 27B: مدل متنباز متراکم و چندوجهی از تیم Qwen، نمره حدود ۵۱ تو AI agentic index
- روی DGX Spark دو-نودی با کوانتیزیشن NVFP4: ۱۵ تا ۲۰ توکن بر ثانیه تکترد، ۶۰ تا ۷۰ همزمان
- چهار سطح reasoning effort؛ سطح متوسط تا ۸۶۰ هزار توکن و ۶۳ دقیقه مصرف میکنه
- تشخیص و شمارش اشیا در تصویر بدون مدل جداگانه تشخیص شیء
- DeepSeek Harness قابلیت trajectory برای دیباگ کامل ایجنتها داره




