جمعه 27 شهریور 1405

ارز دیجیتال
ارزهای خارجی
بورس
طلا و سکه
انرژی و فلزات

آب‌بندی متن هوش مصنوعی می‌تواند مدل‌ها را در برابر دستورات مخرب آسیب‌پذیرتر کند

22:00 - 1405/06/26 فناوری
327کلمه 2 دقیقه
آب‌بندی متن هوش مصنوعی می‌تواند مدل‌ها را در برابر دستورات مخرب آسیب‌پذیرتر کند
به گزارش حال و هوا - برگردان توسط هوش مصنوعی
تحقیقات نشان می‌دهد که آب‌بندی متن هوش مصنوعی می‌تواند رفتار مدل‌های زبانی بزرگ را تغییر داده و آن‌ها را در برابر دستورات مخرب آسیب‌پذیرتر کند.


در پاسخ به قانون جدید اتحادیه اروپا، پلتفرم‌های هوش مصنوعی در حال اجرای طرح‌های جدیدی برای علامت‌گذاری محتوای تولید شده توسط خود هستند. Anthropic اخیراً اعلام کرد که مدل‌های Claude آینده از SynthID-Text استفاده خواهند کرد، رویکردی که گوگل ایجاد کرده و به عنوان منبع باز منتشر کرده است. این روش از یک کلید مخفی استفاده می‌کند که به طور ظریفی فرآیند انتخاب کلمه بعدی در یک جمله را تغییر می‌دهد. در حالی که بهترین انتخاب بعدی ممکن است "ابرآلود" باشد، کلید می‌تواند آن را به "پوشیده" تغییر دهد. هر کسی که کلید را بداند می‌تواند تعیین کند که آیا توسط پلتفرمی که از آن استفاده می‌کند تولید شده است یا خیر.


تحقیقات جدید نشان می‌دهد که SynthID-Text می‌تواند نه تنها انتخاب کلمات، بلکه ابزارهایی را که یک مدل فراخوانی می‌کند و شانس پایبندی یا نادیده گرفتن محافظ‌های ایمنی که برای پیروی از آن‌ها آموزش دیده است را نیز تغییر دهد. این تهدید می‌تواند در مواجهه با یک دستورالعمل مخرب، که در آن یک مهاجم سعی می‌کند باعث شود یک مدل یک عمل مضر، مانند افشای رمز عبور یا سایر اطلاعات حساس را انجام دهد، بیشتر شود. دستورالعمل‌هایی که به طور معمول دنبال نمی‌شوند، در برخی موارد پس از استقرار علامت‌گذاری انجام می‌شوند. این یافته بر نیاز توسعه‌دهندگان برای آزمایش کامل رفتار LLM و عامل‌های خود هنگام قرار دادن علامت‌گذاری تأکید می‌کند.


تغییر رفتار ایمنی


آندره سیپوسوا، محقق امنیت هوش مصنوعی در Lasso Security به Ars گفت: «در مقایسه با همان مدل‌ها بدون علامت‌گذاری، قطعاً رفتار آن‌ها تغییر خواهد کرد، به‌خصوص زمانی که آن را در شرایط نامطلوب قرار دهیم، یا این مدل‌ها را وادار به فراخوانی ابزارها کنیم زمانی که در حال تقویت یک عامل هستند. علامت‌گذاری برای این ساخته شده است که برای خواننده غیرقابل درک باشد، اما ما می‌دانیم که وقتی چیزی را در مورد آنچه مدل تولید می‌کند تغییر می‌دهیم، باعث ایجاد برخی از مصالحه ها می‌شود، در جایی نشان داده می‌شود.»


خواندن مقاله کامل


نظرات



📡منبـع خبـر: http://arstechnica.com

Ars Technica

🏹لـینـک کـوتـاه: halohava.top/A6HEVG



بـرچـسب هـا:


اخبار مرتبط:


شمـا اولیـن نفـر هستـید کـه نظـر خـود را ثبـت مـی کنیـد.

🗩ثبـت نظر:


بازگشت به لیست اخبار