ثبت بازخورد

لطفا میزان رضایت خود را از دیجیاتو انتخاب کنید.

Very satisfied Satisfied Neutral Dissatisfied Very dissatisfied
واقعا راضی‌ام
اصلا راضی نیستم
چطور میتوانیم تجربه بهتری برای شما بسازیم؟

نظر شما با موفقیت ثبت شد.

از اینکه ما را در توسعه بهتر و هدفمند‌تر دیجیاتو همراهی می‌کنید
از شما سپاسگزاریم.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان
هوش مصنوعی

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

مدل جدید Muse Voice Transcribe می‌تواند گفتار بیش از ۲۰ نفر و بیش از ۲۰ زبان را به‌صورت هم‌زمان رونویسی کند.

آزاد کبیری
آزاد کبیری منتشر شده در 11 شهریور 1405  |  14:44

در دیجیاتو ثبت‌نام کنید

جهت بهره‌مندی و دسترسی به امکانات ویژه و بخش‌های مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.

عضویت در دیجیاتو

متا مدل جدیدی برای رونویسی لحظه‌ای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت می‌تواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و هم‌زمان با چند زبان کار کند. این مدل همچنین می‌تواند هنگام تغییر زبان در میانه جمله، زبان‌های مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.

Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیت‌هایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه می‌کند.

مدل تبدیل گفتار به متن متا: Muse Voice Transcribe

«مارک زاکربرگ»، مدیرعامل متا، نمونه‌ای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم می‌تواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبت‌کردن افراد به زبان‌های مختلف، زبان گفتار را به‌صورت خودکار تغییر دهد.

این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی می‌کند؛ به این معنا که اگر فردی در یک جمله از واژه‌های چند زبان استفاده کند، سیستم می‌تواند این تغییر را تشخیص دهد و جمله را رونویسی کند.

زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم می‌گیرد چه زمانی گوش بدهد. برای واژه‌های دشوار کمی بیشتر صبر می‌کند و برای واژه‌های ساده سریع‌تر نتیجه را ثبت می‌کند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام می‌شود تا مدل بتواند توکن بعدی را پیش‌بینی و دقت رونویسی را افزایش دهد.

زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe می‌تواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini 3.5 Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامه‌ای برای استفاده از Muse Voice Transcribe در سرویس‌های اصلی خود دارد.

درحال‌حاضر، کاربران می‌توانند قابلیت‌های این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعه‌دهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.

آزاد کبیری
آزاد کبیری

دانش‌آموخته‌ زبان‌شناسی‌ هستم و همان‌قدر که به «کلمه» علاقه‌مندم، از سرک‌کشیدن به گوشه‌وکنارِ جهان تکنولوژی و علم هم حظ می‌کنم.

دیدگاه‌ها و نظرات خود را بنویسید
    مطالب پیشنهادی