ثبت بازخورد

لطفا میزان رضایت خود را از دیجیاتو انتخاب کنید.

Very satisfied Satisfied Neutral Dissatisfied Very dissatisfied
واقعا راضی‌ام
اصلا راضی نیستم
چطور میتوانیم تجربه بهتری برای شما بسازیم؟

نظر شما با موفقیت ثبت شد.

از اینکه ما را در توسعه بهتر و هدفمند‌تر دیجیاتو همراهی می‌کنید
از شما سپاسگزاریم.

هوش مصنوعی

مدل هوش مصنوعی FLUX 3 معرفی شد؛ تولید همزمان ویدیو، تصویر و صوت [تماشا کنید]

مدل چندوجهی FLUX 3 قادر به تولید ویدیو ۲۰ ثانیه‌ای با صدا و هدایت ربات‌ها است.

جواد تاجی
جواد تاجی منتشر شده در 2 مرداد 1405  |  11:57

در دیجیاتو ثبت‌نام کنید

جهت بهره‌مندی و دسترسی به امکانات ویژه و بخش‌های مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.

عضویت در دیجیاتو

استارتاپ Black Forest Labs با معرفی مدل جدید FLUX 3، دامنه فعالیت‌های خود را از تولید تصویر به سوی مدل‌های پیشرو چندوجهی گسترش داده است. این مدل هوشمند نه‌تنها قادر به درک و تولید تصویر است، بلکه می‌تواند از طریق پرامپت متنی، کلیپ‌های ویدیویی تا سقف ۲۰ ثانیه همراه با صدای هماهنگ تولید کند. علاوه‌براین، معماری پایه این مدل به‌گونه‌ای طراحی شده که قابلیت استفاده در سیستم‌های رباتیک و فیزیکی را نیز دارد.

برخلاف رویکردهای رایج که مدل‌های مجزای تولید تصویر، ویدیو و صدا را در رابط کاربری خود ارائه می‌کنند، FLUX 3 به‌صورت همزمان روی تمام این داده‌ها آموزش دیده است. این آزمایشگاه آلمانی هدف خود را ارتقای «هوش بصری» (Visual Intelligence) اعلام کرده است؛ مفهومی که محیط‌های فیزیکی و دیجیتالی را یکپارچه می‌بیند.

مدل جدید در قالب چهار محصول ارائه می‌شود؛ FLUX 3 Video ،FLUX 3 Image ،FLUX 3 Action و نسخه متن‌باز که FLUX 3 Dev نام دارد. در‌حال‌حاضر دسترسی به برنامه‌های ویدیویی و اکشن تنها از طریق دسترسی زودهنگام محدود امکان‌پذیر است.

معماری FLUX 3 بر پایه روش اختصاصی این استارتاپ به نام Self-Flow توسعه یافته است. همچنین نسخه متن‌باز FLUX 3 Dev که قرار است اواخر سال جاری میلادی عرضه شود، برخلاف نسخه‌های قبلی که فقط به تصویر محدود بودند، یک هسته چندوجهی برای تولید ویدیو، صدا، تصویر و پیش‌بینی حرکت رباتیک خواهد بود.

عملکرد و بنچمارک‌های مدل هوش مصنوعی FLUX 3

در ارزیابی‌های اولیه روی ویدیوهای ۱۰ ثانیه‌ای با کیفیت 720p و همراه با صدا، مدل FLUX 3 نتایج قابل‌توجهی ثبت کرده است. این مدل در ۹۳ درصد موارد نسبت به Luma Ray 3.2 و در ۷۷ درصد موارد نسبت به Runway Gen-4.5 بهتر ظاهر شده است. همچنین در برابر Kling v3 Pro نرخ برتری ۶۰ درصدی، در برابر Grok Imagine Video نرخ ۶۹ درصدی و در برابر مدل Gemini Omni Flash گوگل نرخ ۵۲ درصدی را کسب کرده است. البته این بنچمارک‌ها داده‌های اولیه بوده و براساس نسخه‌های ارزیابی پیش از عرضه نهایی محاسبه شده‌اند.

READ  اسنپدراگون 670 چیپستی 10 نانومتری با هسته های نسل سوم Kryo خواهد بود

قابلیت‌های ویدیویی FLUX 3 شامل تولید ویدیو از متن، تبدیل تصویر به ویدیو، ویرایش ویدیو به ویدیو، انتقال Keyframe، دیالوگ‌های چندزبانه و متصل‌کردن کلیپ‌ها برای ساخت ویدیوهای چنددقیقه‌ای با حفظ ثبات شخصیت‌ها است. این ویژگی به یکی از چالش‌های اصلی سازندگان محتوا، یعنی حفظ یکپارچگی چهره و هویت شخصیت‌ها در سکانس‌های مختلف، پاسخ می‌دهد.

کاربرد این مدل در حوزه رباتیک نیز با معرفی پروژه FLUX-mimic نمایش داده شده است. با همکاری شرکت سوئیسی Mimic Robotics، این مدل به ربات‌ها کمک می‌کند تا صحنه‌ها را درک و پیامدهای حرکتی را پیش‌بینی کنند. به گفته سازندگان، تنظیم دقیق یک ربات برای انجام یک وظیفه جدید به لطف درک فیزیکی موجود در مدل پایه، به جای ۳۰ ساعت به تنها ۳۰ دقیقه داده حرکتی نیاز دارد. استارتاپ Black Forest Labs که هم‌اکنون ۳.۲۵ میلیارد دلار ارزش‌گذاری شده است، سعی دارد با عرضه وزن‌های مدل در آینده، استانداردهای جدیدی را در صنعت هوش مصنوعی پایه‌گذاری کند.

جواد تاجی
جواد تاجی

دوران حرفه‌ای من در دنیای فناوری تقریبا به ۱۰ سال قبل برمی‌گرده؛ مسیری که با سخت‌افزار شروع شد، با نرم‌افزار ادامه پیدا کرد و حالا با خبرنگاری حوزه فناوری توی دیجیاتو داره ادامه پیدا می‌کنه. من جوادم و بیشتر از سه دهه از عمرم می‌گذره و علاوه بر دنیای فناوری عاشق فیلم‌و‌سینما، موسیقی کلاسیک‌راک و رئال مادریدم.

دیدگاه‌ها و نظرات خود را بنویسید
مطالب پیشنهادی