Orchard؛ پایهٔ باز مایکروسافت برای ایجنتها
خلاصهٔ کاملتر
مایکروسافت پروژهای به اسم Orchard رو متنباز کرده که خودش رو یه پایهٔ باز برای پژوهش روی مدلسازی ایجنتی معرفی میکنه. تو مستندات پروژه اومده که ایدهٔ اصلی اینه: لایهٔ محیط بهجای اینکه تیکهای از استک آموزش باشه، یه سرویس مستقل و پایدار باشه. اینجوری دیتاستها، دستورالعملهای آموزش و پروتکلهای ارزیابی بین هارنسها و دامنههای مختلف جابهجا میشن و برای هر مطالعهٔ جدید از صفر ساخته نمیشن.
خود Orchard Env یه سرویس سبک و Kubernetes-native هست با REST API برای چرخهٔ عمر سندباکس، SDK پایتون همزمان و ناهمزمان، و یه ایجنت داخل پاد که برای کمکردن تأخیر مستقیم از IP پاد کار میکنه. هر ایمیج پایهای قابل استفادهست و هارنسهای codex، claude، pi، opencode و hermes از قبل روی PATH نصبن. ایزولهسازی شبکه هم با NetworkPolicy کالیکو و بهصورت پیشفرض deny-egress انجام میشه.
اعدادی که تیم منتشر کرده قابل توجهن: میانگین تأخیر اجرای دستور ۰.۲۸ ثانیه، بالا آوردن هزار سندباکس موازی با موفقیت صددرصد در ۲۶ ثانیه، و هزینهٔ ۱۲۸ سندباکس برای ۲۴۰ ساعت حدود ۳۳۶۲ دلار (روی ظرفیت spot فقط ۶۷۳ دلار) در برابر ۷ تا ۱۰ هزار دلار سرویسهای مدیریتشده. جایگزینی داکر با Orchard Env روی Terminal-Bench 2.0 هم افت نتیجه نداشته.
شروع کار سادهست؛ کلاینت متغیرهای محیطی رو خودش میخونه و سندباکس رو با context manager میسازه و آخرش جمع میکنه:
from orchard_env import SandboxClient
with SandboxClient() as client:
with client.create_sandbox("python:3.11-slim") as sandbox:
result = sandbox.exec("echo hello")
print(result.stdout)روی همین پایه سه دستورالعمل آموزشی ساخته شده: Orchard-SWE با ۱۰۷ هزار مسیر تقطیرشده که به ۷۳ درصد SWE-bench Verified میرسه، Orchard-GUI که با ۰.۴ هزار دادهٔ SFT و ۲.۲ هزار تسک RL میانگین ۶۸.۴ درصد میگیره، و Orchard-Claw با pass@3 برابر ۵۹.۶ درصد. چیزی که نویسندهها روش تأکید میکنن تعمیمپذیریه، نه فقط عدد بالا: Orchard-SWE زیر هارنسی که هرگز باهاش آموزش ندیده هنوز ۴۵ درصد میگیره، جایی که رقیبش تا ۳.۶ سقوط میکنه.
نکات کلیدی:
- Orchard یه پایهٔ متنباز مایکروسافت برای پژوهش ایجنتیه، با مقاله و دیتاست روی arXiv و Hugging Face
- Orchard Env سرویس سندباکس Kubernetes-native با REST API و SDK پایتونه
- میانگین تأخیر اجرا ۰.۲۸ ثانیه و هزینه تا ده برابر کمتر از سرویسهای مدیریتشده
- سه دستورالعمل SWE، GUI و Claw روی همین محیط ساخته شدن؛ بهترینشون ۷۳ درصد SWE-bench Verified
- قدم بعدی سندباکسهای stateful با pause/resume و branching برای اعتباردهی دقیقتر به هر نوبته




