Gemma Gem: دستیار AI که کامل تو مرورگرت اجرا میشه
خلاصهٔ کاملتر
این ریپازیتوری پروژهای به اسم Gemma Gem رو معرفی میکنه؛ یه دستیار هوش مصنوعی که مستقیم داخل مرورگر زندگی میکنه. نکتهٔ اصلیش اینه که مدل Gemma 4 گوگل رو کاملاً روی دستگاه خودت و از طریق WebGPU اجرا میکنه، پس نه کلید API میخواد، نه ابر و نه هیچ دادهای از ماشینت بیرون میره. کارهایی مثل خوندن صفحه، کلیک روی دکمه، پر کردن فرم و اجرای JavaScript از دستش برمیآد.
معماریش سه بخش داره که با هم پیام رد و بدل میکنن: یه «offscreen document» که مدل و حلقهٔ ایجنت رو با کمک @huggingface/transformers و WebGPU میزبانی میکنه؛ یه «service worker» که نقش مسیریاب پیامها رو داره و کارهایی مثل اسکرینشات و اجرای JS رو انجام میده؛ و یه «content script» که آیکن و رابط چت رو تو صفحه تزریق میکنه و ابزارهای کار با DOM رو اجرا میکنه.
ابزارهایی که در اختیار مدل میذاره شامل read_page_content، take_screenshot، click_element، type_text، scroll_page و run_javascriptه—یعنی هم میتونه صفحه رو بفهمه هم توش کار انجام بده. از تنظیمات هم میشه بین دو مدل E2B و E4B جابهجا شد، حالت thinking بومیِ Gemma رو روشن کرد، سقف تعداد فراخوانی ابزار رو گذاشت یا کلیدهای میانبر (پیشفرض Alt+G برای باز و بسته کردن) رو عوض کرد.
برای اجرا به کروم با پشتیبانی WebGPU و قابلیت shader-f16 نیاز داری؛ نسخهٔ سبک به حدود ۴ گیگابایت و نسخهٔ بزرگتر به حدود ۶ گیگابایت حافظهٔ گرافیکی احتیاج داره. روی GPUهای مجتمع مثل Intel Xe و Apple M1 به بعد هم کار میکنه، ولی سرعتش روی اینها کمتره. مدلها بهصورت ONNX با کوانتیزیشن q4f16 و کانتکست ۱۲۸هزارتایی اجرا میشن.
نکات کلیدی:
- Gemma Gem مدل Gemma 4 گوگل رو کاملاً روی دستگاه و با WebGPU اجرا میکنه؛ بدون ابر و بدون خروج داده.
- میتونه صفحه رو بخونه، کلیک کنه، فرم پر کنه، اسکرینشات بگیره و JavaScript اجرا کنه.
- معماریش سه بخشه: offscreen document (مدل)، service worker (مسیریاب) و content script (رابط + ابزار DOM).
- دو مدل E2B (~۵۰۰ مگابایت) و E4B (~۱.۵ گیگابایت) با کانتکست ۱۲۸هزارتایی داره.
- به کروم با WebGPU و قابلیت shader-f16 و دستکم ۴ گیگ حافظهٔ گرافیکی نیاز داره.




