
گوگل از مدل جمینای ۳.۵ برای تبدیل حرفهای صوت به متن رونمایی کرد
گوگل مدل جمینای ۳.۵ برای تبدیل صوت به متن را معرفی کرد؛ مدلی با پشتیبانی از ۸۵ زبان، ویرایش صوتی و تشخیص چند گوینده.
گوگل بهتازگی از جدیدترین مدل هوش مصنوعی تبدیل صوت به متن جمینای ۳.۵ رونمایی کرده است که در کنار قابلیتهای پیشرفته، امکان استفاده از آن در هر بخشی از مرورگر کروم را برای کاربران فراهم میکند.
مدل تبدیل صوت به متن جمینای ۳.۵ چه امکاناتی دارد؟
نسخه ۳.۵ مدل هوش مصنوعی جمینای Transcribe بهصورت تخصصی روی تبدیل صوت به متن تمرکز دارد که امکانات و قابلیتهای پیشرفتهتری در مقایسه با رقبا ارائه میدهد. گوگل ادعا دارد که تشخیص خودکار بیش از ۸۵ زبان دنیا، دقیقتر و سریعتر از گذشته شده و این فرایند بهشکل خودکار و بدون نیاز به دخالت کاربر انجام میگیرد.

یکی دیگر از ویژگیهای جدید مدل تبدیل صوت به متن جمینای ۳.۵، امکان تشخیص آواهای ناخواسته کاربر مانند «هممم» و مکثهای طولانی است. هوش مصنوعی میتواند بخشهای دارای چنین اصواتی را حذف یا جایگزین کند تا یکپارچگی متن همچنان حفظ شود. در نهایت، کاربر قادر خواهد بود بدون استفاده از دست یا کیبورد و تنها با فرمانهای صوتی، متن نوشتهشده را ویرایش کند.
طبق گفته گوگل، مدل جمینای ۳.۵ توانایی یادگیری کلمات شخصی و غیرمرسوم مختص به کاربر، همراه با تلفظ متفاوت آنها را نیز دارد. همچنین این مدل میتواند شمارههای خاص مانند کد پستی را هنگام دریافت ورودی تشخیص دهد و آنها را بهشکل صحیح به متن تبدیل کند. توانایی تشخیص سه صدای مختلف بهصورت همزمان نیز میتواند در شرایط خاص، مانند تبدیل یک پادکست کامل با چندین گوینده به متن، مفید واقع شود.

برخی از قابلیتهای جدید مدل تبدیل صوت به متن جمینای ۳.۵ تنها برای سری پیکسل ۱۱ گوگل عرضه میشوند و بعضی از امکانات نیز در ابتدا از طریق اپلیکیشن جمینای برای کاربران مک در دسترس قرار خواهند گرفت. البته گوگل وعده داده است که کاربران بهزودی میتوانند از ویژگیهای مورد اشاره در تمامی صفحات وب و از طریق مرورگر کروم بهرهمند شوند. پلتفرم Antigravity گوگل که بهمنظور توسعه ایجنتهای هوش مصنوعی کاربرد دارد نیز میزبان مدل جدید این شرکت خواهد بود و توسعهدهندگان امکان بهرهمندی از قابلیتهای تازه آن را خواهند داشت.
برای گفتگو با کاربران ثبت نام کنید یا وارد حساب کاربری خود شوید.