Hemmingway-1: مدلی که مثل آدم مینویسه
خلاصهٔ کاملتر
Hemmingway-1 یه مدل open-weight (یعنی وزنهاش عمومی و قابل دانلوده) با ۲۷ میلیارد پارامتره که Altworld روی Qwen3.8-27B ساخته و با لایسنس Apache-2.0 منتشر کرده. تو این مقاله اومده که هدفش کدنویسی یا حل مسئله نیست. برای همون متنهایی ساخته شده که همه ازشون فرار میکنیم: ایمیل به صاحبخونه، پیام به همکار، یا جوابی که چهار بار بازنویسیش کردی چون لحنش درست درنمیومد. قراره همون دفعهٔ اول متنی بده که انگار یه آدم نوشته.
Altworld سه بنچمارک اختصاصی ساخته: CommunicationBench، تست Human-Likeness و StoryBench. هر سه مقایسهٔ کور دوتایی هستن: جواب Hemmingway-1 و یه مدل دیگه به یه سؤال یکسان کنار هم گذاشته میشه، ترتیبشون جابهجا میشه و یه مدل سوم که جزو رقبا نیست داوری میکنه. تو CommunicationBench با ۸۰ درخواست واقعی، پنجاه امتیاز از GPT-6 Astra جلو زده. تو Human-Likeness هم که داور باید حدس بزنه کدوم جواب رو آدم نوشته، ۲۶ امتیاز از نزدیکترین رقیب جلوتره.
بهترین عملکردش تو کارهای مالی و اداری، پیامهای کاری، متنهای متقاعدکننده و «درخواستهای سخت» هست؛ یعنی پیامهایی که چون حساس یا معذبکنندهان، آدم مدام بازنویسیشون میکنه. تو همین دستهٔ آخر، GPT-6 Astra فقط ۹٪ مقایسهها رو برده و Hemmingway-1 ۷۲٪. در عوض تو داستانهای خشن و داستاننویسی بلند به مدلهای مخصوص داستان میبازه، هرچند تو StoryBench همسطح Kimi K3 و جلوتر از Qwen3.8-Max و DeepSeek V4 Pro بوده.
یه ادعای جالب دیگه دربارهٔ شکل جوابه. خیلی از چتباتها وقتی ازشون یه پیام میخوای، چند نسخهٔ مختلف و کلی توضیح دربارهٔ لحن تحویل میدن. Altworld اندازه گرفته و دیده Fable 5، GLM-5.3 و Kimi K3 بیشتر از نُه بار از ده بار متن اصلی رو لای این توضیحات میپیچن. Hemmingway-1 طوری تنظیم شده که فقط خود متن رو بده؛ یعنی دیگه لازم نیست جواب رو از بین سه پیشنویس و یه مقاله دربارهٔ لحن بیرون بکشی.
تنها بنچمارکی که خود Altworld نساخته EQ-Bench 4 هست؛ یه بنچمارک عمومی برای سنجش هوش هیجانی مدلها. اینجا Hemmingway-1 سوم شده، جلوتر از GPT-5.5 و Opus 4.7 و 4.8، و فقط ۱۲ امتیاز با نفر اول فاصله داره. نویسنده تأکید میکنه که بقیهٔ عددها از تستهای خود سازندهست و هنوز کسی مستقل تکرارشون نکرده، پس بهتره نشونهٔ جهتگیری مدل دیده بشن نه حکم نهایی.
مدل context به طول ۲۶۲,۱۴۴ توکن داره (یعنی رشتهایمیلها یا سندهای بلند رو یهجا میخونه) و با vLLM یا کتابخونهٔ transformers لوکال اجرا میشه. اندازهٔ 27B یعنی روی سختافزار قوی خانگی جا میشه و دیتاسنتر نمیخواد. محدودیتهاش: اولویتش انگلیسیه، ممکنه با اطمینان اشتباه کنه و برای تصمیمهای پزشکی، حقوقی یا مالی توصیه نمیشه.
نکات کلیدی:
- مدل 27B روی Qwen3.8-27B با لایسنس Apache-2.0.
- پنجاه امتیاز جلوتر از GPT-6 Astra تو CommunicationBench با ۸۰ درخواست.
- ۲۶ امتیاز جلوتر از نزدیکترین رقیب تو تست Human-Likeness.
- تو دستهٔ درخواستهای سخت ۷۲٪ برد در برابر ۹٪ برای GPT-6 Astra.
- سوم تو بنچمارک مستقل EQ-Bench 4، با ۱۲ امتیاز فاصله از نفر اول.
- تو داستان خشن و داستان بلند از مدلهای مخصوص داستان ضعیفتره.




