در پاسخ به قانون جدید اتحادیه اروپا، پلتفرمهای هوش مصنوعی در حال اجرای طرحهای جدیدی برای علامتگذاری محتوای تولید شده توسط خود هستند. Anthropic اخیراً اعلام کرد که مدلهای Claude آینده از SynthID-Text استفاده خواهند کرد، رویکردی که گوگل ایجاد کرده و به عنوان منبع باز منتشر کرده است. این روش از یک کلید مخفی استفاده میکند که به طور ظریفی فرآیند انتخاب کلمه بعدی در یک جمله را تغییر میدهد. در حالی که بهترین انتخاب بعدی ممکن است "ابرآلود" باشد، کلید میتواند آن را به "پوشیده" تغییر دهد. هر کسی که کلید را بداند میتواند تعیین کند که آیا توسط پلتفرمی که از آن استفاده میکند تولید شده است یا خیر.
تحقیقات جدید نشان میدهد که SynthID-Text میتواند نه تنها انتخاب کلمات، بلکه ابزارهایی را که یک مدل فراخوانی میکند و شانس پایبندی یا نادیده گرفتن محافظهای ایمنی که برای پیروی از آنها آموزش دیده است را نیز تغییر دهد. این تهدید میتواند در مواجهه با یک دستورالعمل مخرب، که در آن یک مهاجم سعی میکند باعث شود یک مدل یک عمل مضر، مانند افشای رمز عبور یا سایر اطلاعات حساس را انجام دهد، بیشتر شود. دستورالعملهایی که به طور معمول دنبال نمیشوند، در برخی موارد پس از استقرار علامتگذاری انجام میشوند. این یافته بر نیاز توسعهدهندگان برای آزمایش کامل رفتار LLM و عاملهای خود هنگام قرار دادن علامتگذاری تأکید میکند.
تغییر رفتار ایمنی
آندره سیپوسوا، محقق امنیت هوش مصنوعی در Lasso Security به Ars گفت: «در مقایسه با همان مدلها بدون علامتگذاری، قطعاً رفتار آنها تغییر خواهد کرد، بهخصوص زمانی که آن را در شرایط نامطلوب قرار دهیم، یا این مدلها را وادار به فراخوانی ابزارها کنیم زمانی که در حال تقویت یک عامل هستند. علامتگذاری برای این ساخته شده است که برای خواننده غیرقابل درک باشد، اما ما میدانیم که وقتی چیزی را در مورد آنچه مدل تولید میکند تغییر میدهیم، باعث ایجاد برخی از مصالحه ها میشود، در جایی نشان داده میشود.»
شمـا اولیـن نفـر هستـید کـه نظـر خـود را ثبـت مـی کنیـد.
🗩ثبـت نظر: