Ornith 1.5 9B تو تست واقعی رو زمین خورد
خلاصهٔ کاملتر
Ornith 1.5 9B یه مدل زبانی چگال (نه mixture-of-experts) با ۹ میلیارد پارامتره که شرکت ornith-ai ساخته و رو معماری Qwen3.5 بنا شده. قراره رو یه کارت گرافیک یا حتی موبایل (تو فرمت GGUF) اجرا بشه. به گفتهی نویسنده، این مدل با یه چرخهی یادگیری تقویتی خودبهبوددهنده آموزش دیده، یعنی خودش تسک و راهحل تولید میکنه بهجای اینکه رو یه مجموعهی ثابت انسانی تمرین کنه. نمرههای منتشرشدهش تو تستهای عاملی و استدلالی به Qwen 3.5 هماندازه نزدیکه و حتی به مدل ۳۵ میلیاردی mixture-of-experts کوئن هم میرسه.
نویسنده مدل رو رو یه سرور با کارت Nvidia A100 (۸۰ گیگ VRAM) از طریق vLLM اجرا کرد و ۲ تا تسک واقعی بهش داد: راهاندازی یه اینستنس رایگان Ubuntu رو AWS با یه کاربر IAM محدود، و ساخت یه فایل HTML ساده با انیمیشن جوجهکبابی. تو تسک اول، مدل رو انتخاب AMI درست از بین هزاران ایمیج عمومی گیر کرد، تو دستورهای CLI تایپو زد، و بعد از حدود ۷ دقیقه و ۴۳ هزار توکن هنوز قدم اول رو کامل نکرده بود. حتی وقتی تستر دستی AMI رو بهش داد، مدل باز هم تو صدا زدن ابزار شل مشکل داشت و آخرش یه تیکه متن چینی بیربط تحویل داد.
تو تسک دوم هم که ساخت یه فایل HTML بود، مدل خروجی خراب و بیکیفیت داد. این در حالیه که نسخهی بزرگتر و mixture-of-experts خانوادهی Ornith 1.5 همین کارو تو یه تست جدا تمیز انجام داده بود، یعنی مشکل فقط مخصوص کارهای عاملی پیچیده نبود و تو یه تسک سادهی کدنویسی هم خودشو نشون داد.
نویسنده معتقده این فاصله بین نمرهی بنچمارک و عملکرد واقعی یه یادآوریه که بنچمارکهای عاملی معمولا سناریوهای ساختاریافتهتری نسبت به یه کار باز مثل انتخاب AMI از بین دادههای بینظم رو تست میکنن. توصیهش اینه که هر کسی میخواد از این مدل برای کارهای عاملی، بهخصوص چیزی که به حسابهای کلود واقعی یا کد پروداکشن مربوطه، استفاده کنه، بهتره خودش تستهای اختصاصی انجام بده بهجای اعتماد به جدول بنچمارک.
نکات کلیدی:
- Ornith 1.5 9B یه مدل چگال ۹ میلیاردی از ornith-ai ـه که با یادگیری تقویتی خودبهبوددهنده آموزش دیده
- تو تست با A100 و vLLM حدود ۷۲ گیگ VRAM مصرف کرد
- تو تسک راهاندازی AWS بعد از ۷ دقیقه و ۴۳ هزار توکن هنوز شکست خورده بود و آخرش متن چینی هذیانی تولید کرد
- تو تسک سادهی HTML هم خروجی بیکیفیت داد، برخلاف نسخهی mixture-of-experts همین خانواده که موفق بود
- نتیجه نشون میده نمرهی بالای بنچمارک همیشه به معنی کارایی واقعی تو کارهای عاملی نیست




