کتابخانه ملی نروژ با ۲ پتابایت فلش Huawei، یک LLM بومی میسازه
خلاصهٔ کاملتر
کتابخانه ملی نروژ (Nasjonalbiblioteket) داره یک مدل زبانی بزرگ (LLM) بومی میسازه که تاریخ، فرهنگ و زبان نروژی رو میفهمه. ماریوس هاسنس، مسئول پلتفرم IT کتابخانه، در رویداد Huawei ID Forum 2026 در پاریس توضیح داد که هیچ ارائهدهنده تجاریای روی یک LLM محلی برای زبان نروژی کار نمیکنه. استدلالش اینه که هر کشوری که زبان خودش رو داشته باشه و LLM بومی نداشته باشه، در برابر مدلهای انگلیسیزبان جهانی که از تاریخ و فرهنگ اون کشور بیخبرن، در موضع ضعف قرار میگیره.
وزارت فرهنگ نروژ این مأموریت رو به کتابخانه ملی داد چون این نهاد بزرگترین مجموعه دیجیتال نروژی رو داره؛ از کتاب و روزنامه گرفته تا صفحات وب و محتوای رادیو و تلویزیون. کتابخانه از سال ۲۰۰۵ مجموعهاش رو دیجیتالی کرده و الان ۲۰ پتابایت داده منحصربهفرد داره که با فرمت ۳-۲-۱ (سه نسخه، دو نوع رسانه، یک نسخه آفسایت) نگهداری میشه و در مجموع به ۶۰ پتابایت میرسه. مهمتر از همه، توافقی با روزنامههای نروژی بسته که اجازه استفاده از محتوای دارای کپیرایت برای آموزش LLM رو میده — چیزی که هیچ شرکت خصوصیای بهش دسترسی نداره.
پایپلاین (pipeline) پردازش داده در دو مرحله اصلی کار میکنه. مرحله اول درونسازمانیه: دادهها با سیستم Nvidia DGX H200، یک خوشه CPU 384 هستهای و چند آرایه فلش Huawei OceanStor Dorado با ظرفیت کل ۲ پتابایت پردازش میشن. این استوریج کمتأخیر برای مراحل ورود داده، پاکسازی، حذف تکراریها، نرمالسازی فرمت و اعتبارسنجی طراحی شده. وقتی داده آماده شد، به ابرکامپیوتر ملی نروژ Sigma2 Olivia (سیستم HPE Cray با ۴۴۸ GPU و بیش از ۶۴ هزار هسته CPU) فرستاده میشه تا آموزش اصلی مدل انجام بشه.
هاسنس تأکید کرد که گلوگاه اصلی این پروژه محاسبات نیست — مشکل اصلی کیفیت داده، پاکسازی اون و توان عملیاتی پایپلاینه. یکی از چالشهای بزرگ، جمع کردن دو سیستم استوریج کاملاً متفاوت بود: آرشیو ۶۰ پتابایتی برای دوام و صرفه اقتصادی طراحی شده و تأخیر خواندن بالایی داره، در حالی که استوریج AI پایپلاین به توان عملیاتی بالا و تأخیر پایین نیاز داره. تیم هاسنس مجبور شد خودش راهحل انتقال دیتاستهای چند پتابایتی از آرشیو به پایپلاین رو پیدا کنه، چون کسی درباره این چالش حرف نزده بود.
پروژه هنوز در جریانه و تیم روی سه چالش باز کار میکنه:
- ارزیابی: ابزار استانداردی برای سنجش کیفیت یک LLM نروژی وجود نداره. زبان نروژی دو شکل نوشتاری، لهجههای متعدد و تغییرات تاریخی داره و تیم داره ابزار ارزیابی خودش رو از صفر میسازه.
- حکمرانی: اینکه چه کسی به یک LLM حاکمیتی دسترسی داشته باشه و برای چه اهدافی ازش استفاده بشه، سؤالات سیاسی و نهادی بدون جواب آسونن.
- هماهنگسازی: ادغام سه سیستم مجزا — آرشیو، محیط AI درونسازمانی و ابرکامپیوتر Sigma2 — یک پروژه در حال پیشرفته.
نکات کلیدی:
- نروژ داره یک LLM حاکمیتی برای حفظ زبان و فرهنگ خودش میسازه چون مدلهای تجاری این کار رو نمیکنن
- کتابخانه ملی با ۶۰ پتابایت داده و مجوز کپیرایت روزنامهها، منحصربهفردترین موقعیت ممکن رو داره
- ۲ پتابایت استوریج فلش Huawei OceanStor Dorado برای پایپلاین کمتأخیر پردازش داده استفاده میشه
- گلوگاه اصلی نه سختافزار، بلکه کیفیت داده و توان عملیاتی پایپلاینه
- این تجربه میتونه الگویی برای هر کشور غیر انگلیسیزبانی باشه که میخواد AI بومی بسازه




