پلاگینهای چندوجهی Qwen برای هر ایجنتی
خلاصهٔ کاملتر
توی مخزن Qwen-MM-Plugins اومده که هدف پروژه سادهست: هر هارنس ایجنتی رو بهصورت بومی چندوجهی کنه. ساختارش ماژولاره — هر قابلیت یه بستهی جداست که از دو تیکه تشکیل شده: یه skill که فقط به مدل خبر میده همچین جعبهابزاری وجود داره، و یه سرور MCP اختیاری که خود ابزارها توش هستن و موقع نیاز با uvx بالا میاد.
هشت قابلیت منتشر شده. core پایهی ورودی/خروجی محلیه: خوندن تصویر و ویدیو با رزولوشن پویا، نمایش بصری هر فایلی از سند تا مدل سهبعدی، بهعلاوهی برش و حاشیهنویسی و استخراج فریم. api سراغ APIهای ابری میره — چت تصویری، OCR، گراندینگ، کپشن زماندار، تفکیک گوینده و سگمنتیشن با SAM3. بقیه شامل جستوجوی وب و معکوسِ تصویر، حافظهی گرافی برای ویدیوهای خیلی بلند، ویرایش و تولید ویدیو، و کنترل Blender و FreeCAD میشن.
دو تا از قابلیتها thin client هستن: پلاگین بلندر با ۲۲ ابزار و فریکد با ۱۴ ابزار، یه نمونهی در حال اجرا از خود نرمافزار رو از راه پایتون هدایت میکنن — مدلسازی، متریال، نورپردازی و رندر، و توی فریکد ویرایش پارامتری، ورودی/خروجی STEP و STL و تحلیل FEM. یه قابلیت edu-agent هم هست که صورت مسئلهی ریاضی یا علوم رو به ویدیوی توضیحی گامبهگام تبدیل میکنه و برخلاف بقیه فقط skill ـه و سرور MCP نداره.
نصب یا با اسکریپت راهنماست — که نصب، پیکربندی، راستیآزمایی و حذف رو برای Claude Code، Codex، Qoder، OpenClaw، Qwen Code و Gemini CLI پوشش میده و یه فایل پیکربندی مشترک مینویسه تا هارنسهای گرافیکی و ترمینالی هر دو بخوننش — یا دستی از راه مارکتپلیس پلاگین هر هارنس. ابزارهای ابری به کلید نیاز دارن (DASHSCOPE_API_KEY و SERPER_API_KEY)، ولی خوندن محلی تصویر و ویدیو و سند هیچ کلیدی نمیخواد. ویندوز هم فعلاً فقط با WSL2 پشتیبانی میشه.
نکات کلیدی:
- هر قابلیت یعنی یه skill بهعلاوهی یه سرور MCP اختیاری که با uvx بالا میاد
- core خوندن محلی تصویر، ویدیو و سند رو با رزولوشن پویا میده
- api سراغ OCR، گراندینگ، رونویسی چندگوینده و سگمنتیشن SAM3 میره
- بلندر و فریکد از راه thin client با ۲۲ و ۱۴ ابزار هدایت میشن
- اسکریپت نصب شش هارنس رایج رو پوشش میده و لایسنس پروژه Apache-2.0 ـه




