LiteRT.js؛ اجرای مدلهای هوش مصنوعی مستقیم توی مرورگر
خلاصهٔ کاملتر
گوگل از LiteRT.js رونمایی کرد؛ یه binding جاوااسکریپتی از کتابخونهی on-device به اسم LiteRT که حالا اجازه میده هوش مصنوعی رو مستقیم داخل مرورگر اجرا کنی. به گفتهی گوگل، توسعهدهندههای وب میتونن مدلهای ML و AI رو کاملاً محلی اجرا کنن؛ نتیجهش حریم خصوصیِ بهتر، صفر هزینهی سرور و تأخیر خیلی کم برای تجربههای بلادرنگه. برای کسایی که مدل .tflite دارن، این ابزار بهعنوان تکامل TensorFlow.js معرفی میشه.
تفاوت کلیدی با راهحلهای قبلی مثل TensorFlow.js اینه که اونها به kernelهای کمبازدهی مبتنیبر جاوااسکریپت تکیه میکردن، ولی LiteRT.js رانتایم بومی و کراسپلتفرم رو با همهی بهینهسازیهاش از طریق WebAssembly در دسترس میذاره. همین باعث میشه مدل .tflite مستقیم توی مرورگر با شتاب سختافزاری سطحبالا اجرا شه.
پشتیبانی سختافزاری سهلایهست: روی CPU از XNNPACK (کتابخونهی بهینهی گوگل با پشتیبانی چندنخی)، روی GPU از ML Drift که با WebGPU شتاب میگیره، و برای NPU از WebNN API که فعلاً در Chrome و Edge آزمایشیه. چون LiteRT.js همون استک مشترک LiteRT رو داره، اپت خودکار از آخرین بهبودهای کوانتیزیشن و بهینهسازی سختافزاریِ اندروید و iOS و دسکتاپ بهره میبره.
دو قابلیت مهم دیگه هم داره. یک، تبدیل مدلهای PyTorch در یه مرحله با LiteRT Torch، بهعلاوهی AI Edge Quantizer که اجازه میده برای لایههای مختلف مدل، طرح کوانتیزیشن سفارشی بذاری و حجم و سرعت رو بهتر کنی بدون افت محسوس کیفیت. دو، همون شتاب سختافزاری بومی روی CPU و GPU و NPU که بالاتر گفته شد.
دربارهی کارایی، گوگل میگه LiteRT.js در مدلهای بینایی کلاسیک و پردازش صوت تا ۳ برابر سریعتر از رانتایمهای وب دیگهست. برای اپهای بلادرنگ مثل ردیابی اشیا یا رونویسی صوت، استفاده از GPU یا NPU از طریق WebGPU یا WebNN بین ۵ تا ۶۰ برابر نسبت به اجرای روی CPU سریعتره (بنچمارک روی مکبوک پرو با تراشهی M4).
شروع کار هم سادهست: پکیج @litertjs/core رو نصب میکنی و با چند خط، مدل رو بارگذاری و کامپایل و اجرا میکنی:
import { loadLiteRt, loadAndCompile, Tensor } from '@litertjs/core';
await loadLiteRt('path/to/wasm/directory/');
const model = await loadAndCompile('path/to/your/model.tflite', { accelerator: webgpu });
const results = await model.run(inputTensor);گوگل برای نشوندادن کاربردهای واقعی، چند دمو هم منتشر کرده: ادغام رسمی با Ultralytics YOLO برای تشخیص اشیا، تخمین عمق با مدل Depth Anything V2 که فید وبکم رو به یه ابر نقاط سهبعدی تبدیل میکنه، و بزرگنماییِ ۴برابری تصویر با Real-ESRGAN. طبق نقشهی راه، مراحل بعدی روی WebNN برای NPU و پشتیبانی از هوش مصنوعی مولد روی دستگاه (با LiteRT-LM.js) تمرکز داره.
نکات کلیدی:
- LiteRT.js یه binding جاوااسکریپتی از LiteRTه که مدلهای .tflite رو با WebAssembly مستقیم توی مرورگر اجرا میکنه.
- شتاب سختافزاری بومی: XNNPACK روی CPU، ML Drift/WebGPU روی GPU و WebNN (آزمایشی) برای NPU.
- تبدیل تکمرحلهای مدلهای PyTorch با LiteRT Torch و کوانتیزیشن سفارشی با AI Edge Quantizer.
- تا ۳ برابر سریعتر از رانتایمهای وب دیگه؛ GPU/NPU بین ۵ تا ۶۰ برابر سریعتر از CPU.




