ثبت بازخورد

لطفا میزان رضایت خود را از دیجیاتو انتخاب کنید.

Very satisfied Satisfied Neutral Dissatisfied Very dissatisfied
واقعا راضی‌ام
اصلا راضی نیستم
چطور میتوانیم تجربه بهتری برای شما بسازیم؟

نظر شما با موفقیت ثبت شد.

از اینکه ما را در توسعه بهتر و هدفمند‌تر دیجیاتو همراهی می‌کنید
از شما سپاسگزاریم.

گوگل
هوش مصنوعی

مدل چندوجهی EmbeddingGemma 2 گوگل برای اجرای آفلاین روی گوشی معرفی شد

این مدل چندوجهی ۷۴۰ میلیون پارامتر دارد و متن، کد، تصویر، صدا و ویدیو را روی دستگاه پردازش می‌کند.

آزاد کبیری
آزاد کبیری منتشر شده در 15 مهر 1405  |  11:03

در دیجیاتو ثبت‌نام کنید

جهت بهره‌مندی و دسترسی به امکانات ویژه و بخش‌های مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.

عضویت در دیجیاتو

گوگل از EmbeddingGemma 2، مدل چندوجهی و متن‌باز جدیدی با ۷۴۰ میلیون پارامتر رونمایی کرد که می‌تواند متن، کد، تصویر، ویدیو و صدا را در یک فضای مشترک به بردارهای معنایی تبدیل کند و به‌صورت آفلاین روی گوشی، لپ‌تاپ و دستگاه‌های مختلف اجرا شود.

این مدل با مجوز Apache 2.0 منتشر شده و گوگل آن را برای کاربردهایی مانند جست‌وجوی پیشرفته و بازیابی اطلاعات به‌صورت آفلان طراحی کرده است. در این مدل داده‌ها برای پردازش به سرورهای ابری ارسال نمی‌شوند.

EmbeddingGemma 2 دارای ۷۴۰ میلیون پارامتر است که برای پردازش متن به ۲۷۰ میلیون پارامتر نیاز دارد. همچنین این مدل با تبدیل انواع مختلف محتوا به یک فضای مشترک، امکان جست‌وجوی بین‌وجهی را فراهم می‌کند؛ برای مثال می‌توان با یک پیام صوتی به دنبال بخش خاصی از یک ویدیو گشت یا با یک عبارت متنی میان ساعت‌ها فایل صوتی جست‌وجو کرد.

مشخصات مدل چندوجهی آفلاین EmbeddingGemma 2 گوگل

گوگل می‌گوید EmbeddingGemma 2 برای اجرا روی دستگاه‌های دارای منابع محدود بهینه شده است. این مدل روی گوشی پیکسل ۱۱ پرو برای پردازش متن به حدود ۱۹۱ مگابایت رم فعال نیاز دارد. اجرای نسخه کامل چندوجهی نیز حدود ۵۶۷ مگابایت رم مصرف می‌کند.

این مدل بر پایه معماری Gemma 4 ساخته شده و توکنایزر متنی و رمزگذار صوتی مشترکی با آن دارد. به گفته گوگل، همین موضوع باعث می‌شود EmbeddingGemma 2 و Gemma 4 بتوانند در یک خط پردازش مشترک با مصرف حافظه ترکیبی پایین‌تر اجرا شوند.

EmbeddingGemma 2 همچنین پنجره زمینه ۸۱۹۲ توکنی دارد که چهار برابر نسخه اول EmbeddingGemma است. این ظرفیت امکان پردازش حداکثر ۲۹ تصویر، ۵۸ فریم ویدیو یا حدود ۵.۵ دقیقه صدا را فراهم می‌کند و می‌توان این ورودی‌ها را نیز با یکدیگر ترکیب کرد.

گوگل اعلام کرده EmbeddingGemma 2 در ارزیابی‌های مربوط به متن، تصویر و صدا برای مدلی با کمتر از یک میلیارد پارامتر عملکرد بالایی دارد و در برخی وظایف با مدل‌های بزرگ‌تر نیز برابری می‌کند یا عملکرد بهتری دارد.

این مدل در بخش کد از MTEB Code به امتیاز ۷۸.۶۸ رسیده است، درحالی‌که امتیاز EmbeddingGemma قبلی ۶۸.۷۶ بوده است. گوگل این افزایش ۹.۹۲ امتیازی را به‌عنوان بهبود عملکرد مدل در وظایف مرتبط با کد معرفی کرده است.

البته EmbeddingGemma 2 با وجود پشتیبانی از بیش از ۱۰۰ زبان، برای همه زبان‌ها عملکرد یکسانی ندارد و خود گوگل نیز این محدودیت را در مستندات مدل ذکر کرده است. این مدل همچنین فاقد تنظیمات ایمنی (Safety Tuning) و تعدیل خروجی (Output Moderation) است. گوگل می‌گوید اقدامات کاهشی مرتبط با ایمنی در مرحله آموزش داده‌ها اعمال شده‌اند.

EmbeddingGemma 2 با مجوز Apache 2.0 عرضه شده و وزن‌های آن از طریق Hugging Face و Kaggle در دسترس قرار گرفته‌اند.

آزاد کبیری
آزاد کبیری

دانش‌آموخته‌ زبان‌شناسی‌ هستم و همان‌قدر که به «کلمه» علاقه‌مندم، از سرک‌کشیدن به گوشه‌وکنارِ جهان تکنولوژی و علم هم حظ می‌کنم.

دیدگاه‌ها و نظرات خود را بنویسید
    مطالب پیشنهادی