ایجنت کدنویسی لوکال، بدون اشتراک ماهانه
خلاصهٔ کاملتر
سباستین راشکا تو این راهنما یه استک کاملاً لوکال برای ایجنت کدنویسی میچینه: یه LLM که خودت سرو میکنی، موتور استدلال و تولید کده، بهعلاوهٔ یه harness که محیط عملیاتیه و به مدل اجازه میده فایل بخونه، ویرایش کنه، دستور اجرا کنه و نتیجه رو بسنجه. به گفتهٔ خودش هنوز Codex و Claude Code رانندههای اصلیشن، ولی استک لوکال شفاف و قابل بازرسیه، بعد از خرید سختافزار عملاً مجانیه، حریم خصوصی داره (مثلاً برای پردازش رسیدها)، آفلاین کار میکنه و از تغییر قیمت API در امان میمونه.
انتخاب harness مهمه چون هر مدل معمولاً برای harness خودش بهینه شده. راشکا Qwen3.6 رو با کلاینت Qwen-Code جفت میکنه؛ چون اپنسورسه (برخلاف Claude Code)، مدلهای Qwen مخصوص همون تیون شدن و میشه همزمان Codex با مدل ابری و Qwen-Code با مدل لوکال رو کنار هم روی یه ماشین داشت. مقالهٔ Polar از انویدیا هم با بنچمارک نشون داده مدلهای Qwen تو harness خودشون بهترین عملکرد کدنویسی رو دارن.
مدل پیشنهادیش Qwen3.6 35B-A3B ـه: حدود ۲۲ گیگابایت دانلود، نیازمند ۳۰ تا ۴۰ گیگابایت رم، و روان روی مک مینی M4 و DGX Spark. به گفتهٔ نویسنده و بر اساس بنچمارکهای ژوئن Cohere، این مدل تو ردهٔ سایز خودش بهترینه و تنها رقیب جدیش North Mini Code 1.0 ـه. برای سرو کردن مدل هم گزینهها زیادن (LM Studio، vLLM، SGLang، MLX) ولی او Ollama رو برمیداره چون نصبش سادهست، رو هر سیستمعاملی از خط فرمان کار میکنه و برای مدلهایی که رو سختافزار خونگی جا نمیشن، نسخهٔ ابری هم داره.
قبل از اینکه به مدل دل ببندی، دو تا سنجش لازمه. اول سرعت: توکن بر ثانیه، پایداریش تو کانتکستهای طولانی و مصرف حافظه. تو تستهای راشکا با کانتکست ۵۰ هزار توکنی، Qwen3.6 و North Mini تا ۳۰ گیگابایت رم میگیرن و حدود ۴۰ توکن بر ثانیه رو مک مینی و ۳۰ توکن رو DGX تولید میکنن — و هر چیزی بالای ۲۰ تا ۳۰ توکن بر ثانیه برای کار ایجنتی قابل قبوله (تقریباً همسرعت GPT 5.5 با استدلال بالا).
سنجش دوم کیفیته و اینجا نتیجهها متواضعترن. رو مجموعه تسک شخصی خودش برای استدلال ابزاری، Qwen3.6 سه تا از پنج تسک رو پاس میکنه، North Mini یکی و Gemma 4 E2B هیچکدوم. یعنی مدل مفاهیم دیباگ و بازبینی امنیتی رو میگیره ولی سر «اول کدوم فایل، کدوم اکشن» هنوز میلنگه. جمعبندی راشکا اینه که این حد برای کار نیمهخودکار قابل استفادهست ولی برای ابزار استفادهٔ کاملاً خودمختار نه، و مدلهای خیلی کوچیک اصلاً ایجنت کدنویسی خوبی نمیشن.
مهمترین بخش مقاله اینه که harness خیلی خطرناکتر از خودِ مدله؛ مستقیم فایلهای تو رو میخونه و دستور اجرا میکنه. توصیهش اینه قبل از نصب، از یه ایجنت مورد اعتماد بخوای کد ایجنت جدید رو آدیت کنه: اسکریپتهای نصب، اجرای شل، مرزهای فایل، سکرتها و متغیرهای محیطی، سطح حملهٔ prompt injection، افزونهها و MCP، و خروج داده. یافتههاش برای Qwen-Code: اجرای شل پشت دروازهٔ تأیید، ورکاسپیس پیشفرض خوندنی، و مهمتر از همه — حتی با Ollama لوکال، تلمتری و متادیتا (شناسهٔ سشن، اطلاعات مدل) بیرون میره.
خبر خوب اینه که بیشترش با یه فایل تنظیمات قابل بستنه؛ راشکا این پیکربندی رو برای ~/.qwen/settings.json پیشنهاد میده:
{
"privacy": { "usageStatisticsEnabled": false },
"telemetry": { "enabled": false, "logPrompts": false },
"general": { "enableAutoUpdate": false },
"tools": { "approvalMode": "default", "sandbox": true },
"hooks": { "disableAllHooks": true }
}خاموش کردن آپدیت خودکار یه معاملهست (وصلهٔ امنیتی هم خودکار نصب نمیشه) ولی کنترل رو دست خودت میده. نویسنده میگه Codex و Cline و Claude Code هم پیشفرض تلمتری مشابهی دارن، و چون Claude Code نسخهٔ اپنسورس رسمی نداره اعتماد بهش سختتره. خودِ اتصال سادهست: تو Qwen-Code گزینهٔ Custom Provider و بعد OpenAI-compatible رو میزنی، آدرس رو میدی، مدلها رو اضافه میکنی و حالت thinking رو روشن میذاری. توصیهٔ آخرش هم اینه که ایجنت رو رو یه ماشین یا یوزر جدا اجرا کنی.
نکات کلیدی:
- استک لوکال یعنی یه مدل اوپنویت روی Ollama بهعلاوهٔ یه harness مثل Qwen-Code؛ جایگزین اشتراک Codex و Claude Code.
- Qwen3.6 35B-A3B حدود ۲۲ گیگ دانلود و ۳۰ تا ۴۰ گیگ رم میخواد و رو مک مینی M4 حدود ۴۰ توکن بر ثانیه میده.
- قبل از تعهد، هم سرعت (توکن بر ثانیه تو کانتکست بلند) و هم کیفیت رو با تسکهای واقعی خودت بسنج.
- harness خطرناکتر از مدله: کد ایجنت رو آدیت کن، رو ماشین یا یوزر جدا اجراش کن و ریپوهای ناشناس رو خصمانه فرض کن.
- حتی با مدل لوکال هم تلمتری و متادیتا بیرون میره؛ با فایل تنظیمات خاموشش کن.




