پنجشنبه 09 مهر 1405

ارز دیجیتال
ارزهای خارجی
بورس
طلا و سکه
انرژی و فلزات

هوش مصنوعی جدید برای تشخیص دقیق ویدیوهای جعلی با استفاده از نور

21:23 - 1405/07/09 فناوری
1189کلمه 6 دقیقه
هوش مصنوعی جدید برای تشخیص دقیق ویدیوهای جعلی با استفاده از نور
به گزارش اطلاعات آنلاین
محققان UCLA یک هوش مصنوعی نوری توسعه داده‌اند که دیپ‌فیک‌ها را با دقت ۹۸ درصد تشخیص می‌دهد. این سیستم با تجزیه و تحلیل همزمان چندین ویدیو، سرعت و کارایی بالایی دارد.

به گزارش اطلاعات آنلاین به نقل از eLight، یک سیستم هوش مصنوعی جدید که از نور برای تجزیه و تحلیل همزمان بیش از دوازده ویدیو استفاده می‌کند و دیپ‌فیک‌ها (جعل عمیق) را با دقت تقریباً ۹۸ درصد تشخیص می‌دهد. سرعت، مصرف انرژی کم و مقاومت در برابر حملات می‌تواند آن را به ابزاری قدرتمند برای غربالگری سیل رو به رشد ویدیوهای تولید شده توسط هوش مصنوعی تبدیل کند.


محققان دانشگاه کالیفرنیا، لس‌آنجلس (UCLA) یک پردازنده نوری-عصبی جدید ساخته‌اند که از نور برای شناسایی سریع و دقیق ویدیوهای دیپ‌فیک یا جعل عمیق استفاده می‌کند. برخلاف سیستم‌های معمولی که معمولاً ویدیوها را یکی پس از دیگری با استفاده از سخت‌افزار دیجیتال بررسی می‌کنند، فناوری UCLA می‌تواند ۱۵ یا تعداد بیشتری از جریان‌های ویدیویی را به ‌طور همزمان تجزیه و تحلیل کند.


تفاوت کلیدی این است که بخشی از فرآیند تشخیص از طریق انتشار فیزیکی نور انجام می‌شود. این امر به بسیاری از ویدیوها اجازه می‌دهد تا به طور همزمان در طول یک عبور نوری واحد ارزیابی شوند؛ نه اینکه هر کدام نیاز به حرکت جداگانه از طریق یک خط لوله پردازش دیجیتال معمولی داشته باشند.


محققان سیستم هوش مصنوعی نوری را طوری طراحی کرده‌اند که به عنوان یک لایه دفاعی اولیه با توان عملیاتی بالا و مقاوم در برابر حمله برای غربالگری مقادیر زیادی از ویدیوهای دستکاری شده و تولید شده توسط هوش مصنوعی عمل کند.


چالش رو به رشد تشخیص دیپ ‌فیک


پیشرفت‌های سریع در هوش مصنوعی مولد، ویدیوهای مصنوعی را به طور فزاینده‌ای واقع ‌گرایانه کرده و نیاز به سیستم‌های تشخیصی را که هم دقیق و هم قادر به کار در مقیاس بزرگ باشند، افزایش داده است.


بسیاری از تشخیص ‌دهنده‌های پیشرفته دیپ‌فیک به حجم عظیمی از محاسبات دیجیتال وابسته هستند. یک تجزیه و تحلیل واحد می‌تواند به صدها میلیارد عملیات ممیز شناور نیاز داشته باشد و ویدیوها اغلب به صورت متوالی پردازش می‌شوند. با بررسی محتوای بیشتر، هم زمان پردازش و هم نیازهای انرژی می‌توانند به طور متناسب افزایش یابند.


سیستم‌های تشخیص دیجیتال با مشکل دیگری نیز مواجه هستند. مهاجمان می‌توانند عمداً ویدیوهای جعلی را به روش‌های ظریفی تغییر دهند تا یک آشکارساز را گیج کرده و فیلم‌های دستکاری شده را اصیل جلوه دهند.


پروفسور آیدوغان اوزجان و تیم او در دانشگاه UCLA یک سیستم ترکیبی دیجیتال-اپتیکی را توسعه دادند که برای رسیدگی به هر دو چالش در نظر گرفته شده است.


یک رمزگذار دیجیتال سبک وزن ابتدا اطلاعات فشرده‌ای در مورد هر ویدیو، از جمله ویژگی‌های مکانی، طیفی و زمانی، جمع‌آوری می‌کند. این اطلاعات به یک الگوی فاز تبدیل شده و روی یک مدولاتور نوری مکانی قابل برنامه‌ریزی نمایش داده می‌شود.


سپس جبهه موج نوری حاصل از طریق یک رمزگشای نوری غیرفعال مبتنی بر فضای آزاد حرکت می‌کند. در انتهای دیگر، آشکارسازهای نوری جفت شده مستقیماً برای هر ویدیو امتیاز اصالت تولید می‌کنند.


در واقع، این سیستم یک شبکه رمزگشایی دیجیتال با محاسبات سنگین را با یک فرآیند فیزیکی جایگزین می‌کند که می‌تواند جریان‌های زیادی را به صورت موازی مدیریت کند.


دقت تقریباً ۹۸ درصد در ۱۵ ویدیو به طور همزمان


در آزمایش‌هایی با استفاده از نور مرئی، پردازنده ۱۵ ویدیوی Celeb-DF را به طور همزمان در هر عبور نوری بررسی کرد.


این سیستم به طور متوسط ​​به دقت تشخیص ۹۷.۷۹ درصد، حساسیت ۹۹.۸۶ درصد و اختصاصیت ۹۵.۷۲ درصد دست یافت. حساسیت، میزان موفقیت سیستم در شناسایی ویدیوهای دستکاری‌شده را اندازه‌گیری می‌کند و این حساسیت بالا را برای یک ابزار غربالگری که برای جلوگیری از ورود محتوای جعلی طراحی شده است، بسیار مهم می‌کند.


حساسیت ۹۹.۸۶ درصد به نرخ منفی کاذب متوسط ​​حدود ۰.۱۴ درصد تبدیل شد. به عبارت دیگر، تنها بخش بسیار کمی از ویدیوهای دستکاری‌شده به اشتباه به عنوان معتبر طبقه‌بندی شدند.


محققان همچنین با افزایش ظرفیت سیستم به ۱۸ ویدیو در یک عبور نوری، آن را به سطح بالاتری رساندند. حتی در آن سطح، دقت تشخیص متوسط ​​در ۹۶.۱۳ درصد باقی ماند.



لایه‌های نوری بیشتر، عملکرد را افزایش می‌دهند


این تیم دریافت که پردازنده همچنین می‌تواند با افزایش عمق فیزیکی رمزگشای نوری غیرفعال خود، بدون افزایش قابل توجه مصرف انرژی یا تأخیر استنتاج، توانمندتر شود.


وقتی محققان دو لایه پراش غیرفعال بهینه‌شده را هنگام آزمایش دستکاری‌های پیچیده‌تر دیپ‌فیک اضافه کردند، دقت تشخیص حدود ۶.۸ درصد بهبود یافت.


این لایه‌های پراش فقط فاز می‌توانند به عنوان ساختارها/سطوح نوری غیرفعال و ایستا تولید شوند. آن‌ها محاسبات اضافی را از طریق پراش نور انجام می‌دهند؛ به این معنی که در حین انجام استنتاج توسط سیستم، به برق اضافی نیاز ندارند.


این رویکرد می‌تواند پردازش پیچیده‌تر را بدون هزینه‌های انرژی مشابه که معمولاً با شبکه‌های عصبی دیجیتال بزرگ‌تر همراه است، امکان‌پذیر کند.


آزمایش سیستم در برابر ویدیوهای Google VEO-۳


محققان آزمایش‌های خود را به دیپ‌فیک‌های تعویض چهره مرسوم محدود نکردند. آن‌ها همچنین پردازنده را با ویدیوهایی که با استفاده از مدل VEO-۳ گوگل تولید شده‌اند، به چالش کشیدند.


سیستم‌های هوش مصنوعی مولد جدیدتر می‌توانند فیلم‌هایی ایجاد کنند که فاقد بسیاری از مصنوعات آشکار مرتبط با فناوری دیپ‌فیک قبلی هستند و آن‌ها را به هدف دشوارتری برای آشکارسازهایی تبدیل می‌کند که عمدتاً بر روی اشکال قدیمی‌تر دستکاری آموزش دیده‌اند.


نتایج نشان می‌دهد که این رویکرد می‌تواند به طور بالقوه با تکامل فناوری هوش مصنوعی مولد سازگار شود.


یک آشکارساز دیپ‌فیک که طوری طراحی شده که فریب دادنش سخت‌تر باشد


سیستم نوری همچنین در برابر حملات جعبه سیاه خصمانه مقاومت نشان داده و محافظت ذاتی در برابر حملات جعبه سفید فراهم می‌کند.


بخشی از این امنیت از نحوه انجام فیزیکی محاسبات آشکارساز ناشی می‌شود. از آنجا که برخی از فرآیند استنتاج از طریق پراش انجام می‌شود، پارامترهای مهم مدل نوری به طور مؤثر در سخت‌افزار تعبیه شده‌اند.


اندازه‌گیری، بازتولید یا مهندسی معکوس این پارامترها برای یک مهاجم می‌تواند دشوار باشد. این امر بازسازی آشکارساز و طراحی تغییرات خصمانه با دقت تنظیم شده که می‌تواند از آن فرار کند را به طور قابل توجهی دشوارتر می‌کند.


پردازنده همچنین هنگامی که ویدیوها تحت تأثیر نویز تصویر، تاری، فشرده‌سازی JPEG و ناهماهنگی‌های تجربی قرار گرفتند، با اطمینان به کار خود ادامه داد. به گفته محققان، این نتایج نشان می‌دهد که چگونه محاسبات نوری می‌تواند پایه‌ای امن‌تر و قابل اعتمادتر برای برخی از سیستم‌های هوش مصنوعی فراهم کند.


خط اول دفاع در برابر دیپ‌فیک


پردازنده UCLA به جای جایگزینی کامل آشکارسازهای دیجیتال پیشرفته، به گونه‌ای طراحی شده است که به عنوان یک مرحله اول بسیار حساس از یک سیستم تشخیص بزرگتر عمل کند.


حجم عظیمی از ویدیو می‌تواند در ابتدا از پردازنده نوری موازی عبور کند. سپس محتوایی که به عنوان مشکوک شناسایی می‌شود، می‌تواند برای ارزیابی نهایی دقیق‌تر به مدل‌های دیجیتال با محاسبات پیچیده‌تر ارسال شود.


چنین سیستمی می‌تواند نقاط قوت هر دو رویکرد را با هم ترکیب کند. پردازش نوری می‌تواند عملکرد موازی، نیاز به انرژی کم برای رمزگشایی، حساسیت بالا، مقاومت در برابر حملات خصمانه و قابلیت سازگاری با مولدهای ویدیوی هوش مصنوعی جدیدتر را فراهم کند؛ در حالی که سیستم‌های دیجیتال معمولی می‌توانند در صورت لزوم تجزیه و تحلیل عمیق‌تری ارائه دهند.


محققان می‌گویند این ترکیب در نهایت می‌تواند برای تعدیل محتوا در مقیاس بزرگ، احراز هویت رسانه‌ای، نظارت و سایر برنامه‌های هوش مصنوعی با امنیت بالا مفید باشد.


📡منبـع خبـر: www.ettelaat.com

اطلاعات آنلاین

🏹لـینـک کـوتـاه: halohava.top/S7oPjN



بـرچـسب هـا:


اخبار مرتبط:


شمـا اولیـن نفـر هستـید کـه نظـر خـود را ثبـت مـی کنیـد.

🗩ثبـت نظر:


بازگشت به لیست اخبار