AutoRound: کوانتیزاسیون پیشرفته برای مدلهای زبانی بزرگ
خلاصهٔ کاملتر
AutoRound یه ابزار متنباز برای کوانتیزاسیون مدلهای زبانی بزرگه که هدفش اینه بتونه با کمترین افت دقت، مدلهای سنگین رو به بیتهای پایینتر (۲ تا ۴ بیت) تبدیل کنه. این پروژه از Intel هست و بر اساس الگوریتم sign-gradient descent کار میکنه که جزئیاتش تو دو مقاله SignRoundV1 و SignRoundV2 منتشر شده.
مهمترین ویژگی AutoRound اینه که دقت بالایی رو حتی در بیتهای خیلی پایین مثل ۲ و ۳ بیت حفظ میکنه. به عنوان مثال، مدل DeepSeek-R1 با حجم حدود ۲۰۰ گیگابایت بعد از کوانتیزاسیون INT2-mixed، هنوز ۹۷.۹٪ از دقت اصلیش رو داره. این عدد برای یه فشردهسازی اینقدر شدید، واقعاً قابل توجهه.
از نظر سازگاری با اکوسیستم، AutoRound با ابزارهای اصلی دنیای LLM ادغام شده؛ از جمله Hugging Face Transformers، vLLM، SGLang و LLM-Compressor. فرمتهای خروجی هم متنوعه: auto_round، AutoAWQ، AutoGPTQ و GGUF همه پشتیبانی میشن.
برای استفاده از CLI، خیلی سادس:
auto-round \
--model Qwen/Qwen3-0.6B \
--scheme "W4A16" \
--format "auto_round" \
--output_dir ./tmp_autoroundبرای کسایی که ترجیح میدن با Python API کار کنن، کدش هم سادهست:
from auto_round import AutoRound
model_name_or_path = "Qwen/Qwen3-0.6B"
ar = AutoRound(model_name_or_path, scheme="W4A16")
ar.quantize_and_save(output_dir="./qmodel", format="auto_round")AutoRound سه رسپی مختلف داره تا بتونی بین سرعت و دقت تعادل برقرار کنی. حالت پیشفرض auto-round برای اکثر موارد مناسبه. حالت auto-round-best دقت بیشتری داره ولی حدود ۳ برابر کندتره. حالت auto-round-light هم ۲ تا ۳ برابر سریعتره ولی یه مقدار افت دقت داره، مخصوصاً در بیتپایین.
از نظر سختافزاری، این ابزار خیلی گستردهست: CPU های Intel Xeon، GPU های NVIDIA (CUDA)، Intel GPU (XPU) و حتی Intel Gaudi (HPU) همه پشتیبانی میشن. یه مدل ۷ میلیارد پارامتری رو میشه تو حدود ۱۰ دقیقه روی یه GPU کوانتیز کرد.
آخرین آپدیتهای جالب هم شامل پشتیبانی از Block-wise FP8، کوانتیزاسیون MTP layer برای DeepSeek، الگوریتم بهبودیافته GGUF و پشتیبانی از dtype های MXFP4 و NVFP4 میشه. این نشون میده پروژه خیلی فعاله و مدام داره رشد میکنه.
نکات کلیدی:
- کوانتیزاسیون LLM تا ۲-۴ بیت با حفظ دقت بالا
- مدل DeepSeek-R1 با وزن ۲۰۰ گیگ بعد از INT2، هنوز ۹۷.۹٪ دقت داره
- سازگار با Transformers، vLLM، SGLang و LLM-Compressor
- خروجی در فرمتهای auto_round، AutoAWQ، AutoGPTQ و GGUF
- مدل ۷B رو در ۱۰ دقیقه روی یه GPU کوانتیز میکنه
- سه رسپی برای تنظیم تعادل بین سرعت و دقت
- پشتیبانی از بیش از ۱۰ مدل VLM و سختافزارهای متنوع




