منو

صفحه اصلی

اخبار

آب‌بندی متن هوش مصنوعی می‌تواند مدل‌ها را در برابر دستورات مخرب آسیب‌پذیرتر کند

تحقیقات نشان می‌دهد که آب‌بندی متن هوش مصنوعی می‌تواند رفتار مدل‌های زبانی بزرگ را تغییر داده و آن‌ها را در برابر دستورات مخرب آسیب‌پذیرتر کند.

در پاسخ به قانون جدید اتحادیه اروپا، پلتفرم‌های هوش مصنوعی در حال اجرای طرح‌های جدیدی برای علامت‌گذاری محتوای تولید شده توسط خود هستند. Anthropic اخیراً اعلام کرد که مدل‌های Claude آینده از SynthID-Text استفاده خواهند کرد، رویکردی که گوگل ایجاد کرده و به عنوان منبع باز منتشر کرده است. این روش از یک کلید مخفی استفاده می‌کند که به طور ظریفی فرآیند انتخاب کلمه بعدی در یک جمله را تغییر می‌دهد. در حالی که بهترین انتخاب بعدی ممکن است "ابرآلود" باشد، کلید می‌تواند آن را به "پوشیده" تغییر دهد. هر کسی که کلید را بداند می‌تواند تعیین کند که آیا توسط پلتفرمی که از آن استفاده می‌کند تولید شده است یا خیر.

تحقیقات جدید نشان می‌دهد که SynthID-Text می‌تواند نه تنها انتخاب کلمات، بلکه ابزارهایی را که یک مدل فراخوانی می‌کند و شانس پایبندی یا نادیده گرفتن محافظ‌های ایمنی که برای پیروی از آن‌ها آموزش دیده است را نیز تغییر دهد. این تهدید می‌تواند در مواجهه با یک دستورالعمل مخرب، که در آن یک مهاجم سعی می‌کند باعث شود یک مدل یک عمل مضر، مانند افشای رمز عبور یا سایر اطلاعات حساس را انجام دهد، بیشتر شود. دستورالعمل‌هایی که به طور معمول دنبال نمی‌شوند، در برخی موارد پس از استقرار علامت‌گذاری انجام می‌شوند. این یافته بر نیاز توسعه‌دهندگان برای آزمایش کامل رفتار LLM و عامل‌های خود هنگام قرار دادن علامت‌گذاری تأکید می‌کند.

تغییر رفتار ایمنی

آندره سیپوسوا، محقق امنیت هوش مصنوعی در Lasso Security به Ars گفت: «در مقایسه با همان مدل‌ها بدون علامت‌گذاری، قطعاً رفتار آن‌ها تغییر خواهد کرد، به‌خصوص زمانی که آن را در شرایط نامطلوب قرار دهیم، یا این مدل‌ها را وادار به فراخوانی ابزارها کنیم زمانی که در حال تقویت یک عامل هستند. علامت‌گذاری برای این ساخته شده است که برای خواننده غیرقابل درک باشد، اما ما می‌دانیم که وقتی چیزی را در مورد آنچه مدل تولید می‌کند تغییر می‌دهیم، باعث ایجاد برخی از مصالحه ها می‌شود، در جایی نشان داده می‌شود.»

خواندن مقاله کامل

نظرات

#آب بندی متن #SynthID #امنیت هوش مصنوعی #مدل های زبانی #هوش مصنوعی
منبع: Ars Technica