اجرای لوکال Hemmingway-1، مدل ۲۷ میلیاردی برای نوشتن
خلاصهٔ کاملتر
Hemmingway-1 یه مدل زبانی ۲۷ میلیارد پارامتریه که Altworld اونو روی Qwen3.8-27B فاینتیون کرده و با لایسنس Apache-2.0 منتشر کرده. کارش نوشتنِ روزمرهست: پیام، ایمیل، یا اون پیام سختی که مدتهاست داری عقبش میندازی. به جای اینکه یه فهرست گزینه و هشدار بده، مستقیم خود متن رو مینویسه. نسخه hosted تو hemmingway.io هست ولی وزنها هم روی Hugging Face عمومیان.
سریعترین راه اجرا vLLM هست (یه سرور inference که batching و مدیریت حافظه رو خودش انجام میده). model card فقط همین دستور رو میده:
vllm serve Altworld/Hemmingway-1 --max-model-len 262144فلگ --max-model-len مهمه. مدل تا ۲۶۲,۱۴۴ توکن (256K) context رو پشتیبانی میکنه و vLLM باید از اول بدونه تا KV cache (یعنی حافظهای که مدل برای توکنهای قبلی نگه میداره) رو درست رزرو کنه. اگه فقط پیام کوتاه مینویسی، یه عدد کوچیکتر بده تا مصرف حافظه خیلی پایین بیاد. سرور یه endpoint سازگار با OpenAI بالا میاره، یعنی ابزارهایی که با chat completions کار میکنن با کمترین تغییر بهش وصل میشن.
اگه بخوای مدل رو مستقیم تو یه اسکریپت پایتون بدون سرور جدا استفاده کنی، Transformers راه دیگهست. به گفته مقاله، apply_chat_template رو حذف نکن، چون مدل برای یه فرمت خاص جواب تنظیم شده و بدون اون رفتارش خراب میشه. این خلاصهای از نمونه model card هست:
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="auto")
ids = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(ids, max_new_tokens=512)device_map="auto" مدل رو بین GPUها پخش میکنه و dtype="auto" دقت رو از روی checkpoint انتخاب میکنه. دقیق VRAM نداده. نویسنده تخمین میزنه برای یه مدل dense با ۲۷ میلیارد پارامتر با دقت bf16/fp16 فقط وزنها حدود 54GB یا بیشتر جا میگیرن، بدون KV cache. نسخههای 4-bit یا 8-bit این رو خیلی کم میکنن و برای یه GPU خانگی واقعبینانهترن. مزیت self-host حریم خصوصی کامل، نبود محدودیت مصرف و آزادی استفاده تجاریه. ولی برای کاربر معمولی نسخه hosted و اپهای Mac و Android سادهترن.
طبق model card، مدل تو CommunicationBench با ۵۰ امتیاز از GPT-6 Astra جلو زده و Fable 5.1 رو هم شکست داده. ولی این بنچمارک و Human-Likeness و StoryBench رو خود Altworld ساخته و اجرا کرده. تنها نتیجه مستقل EQ-Bench 4 هست که مدل اونجا سوم شده، جلوتر از GPT-5.5 و Opus 4.7 و Opus 4.8 و با فاصله ۱۲ امتیاز از نفر اول. مدل انگلیسیمحوره، ممکنه با اعتمادبهنفس اشتباه کنه و برای تصمیم پزشکی، حقوقی یا مالی توصیه نمیشه.
نکات کلیدی:
- ۲۷ میلیارد پارامتر، فاینتیونشده روی Qwen3.8-27B با لایسنس Apache-2.0 و آزاد برای استفاده تجاری
- context تا ۲۶۲,۱۴۴ توکن، که با --max-model-len تو vLLM میشه کمش کرد تا حافظه کمتری بخوره
- با دقت bf16/fp16 فقط وزنها حدود 54GB یا بیشتر جا میخوان؛ نسخه 4-bit و 8-bit برای یه GPU واقعبینانهترن
- رتبه سوم تو بنچمارک مستقل EQ-Bench 4، با ۱۲ امتیاز فاصله از نفر اول
- بنچمارکهای CommunicationBench و StoryBench رو خود Altworld ساخته
- انگلیسیمحوره و تو داستاننویسی طولانی چندمرحلهای ضعیفتره




