اخیراً محققان شرکتفورسپوینت(Forcepoint) در بخشX-Labsخود،آسیبپذیری AIجدیدی را کشف کردهاند که نگرانیهای جدی در مورد اعتمادپذیری دستیاران هوش مصنوعی ایجاد میکند.
به گزارش گجت نیوز، این کشف نشان میدهد چگونه عاملهای هوش مصنوعی میتوانند با دادههای غلط مسموم شوند و آنها را به عنوان حقایق معتبر ذخیره کنند. یافتههایفورسپوینتدر مورد چگونگی سوءاستفاده از حافظه بلندمدتهوش مصنوعی، تبعات گستردهای برای امنیت و کاربرد سیستمهای هوش مصنوعی دارد.
حملهای ساده با نتایجی مخرب
یک عامل هوش مصنوعی (ایجنت) میتواند با خواندن متون مخفی در صفحات وب، اطلاعات نادرست را به عنوان یک واقعیت دائمی در حافظه بلندمدت خود ذخیره کند. این اطلاعات جعلی هفتهها بعد، در کارهای نامربوط دیگر، توسط هوش مصنوعی بازیابی و مورد اعتماد قرار میگیرد. این روش کهمسمومیت حافظه پایدار نام دارد، یک آسیبپذیری امنیتی جدی است.
MINJA(بهطور کامل Memory INJection Attack) نام آکادمیک این حمله است که در کنفرانسNeurIPS 2025معرفی شد. این حمله بدون نیاز به دسترسیهای ویژه یا امتیازات بالا، فقط با ارسال درخواستهای عادی از طریق رابط کاربری استاندارد انجام میشود.
MINJAنرخ موفقیت بالای ۹۵ درصد برای تزریق و بیش از ۷۰ درصد برای حمله را در مدلهایی نظیرGPT-4o-mini،جمنای ۲.۰ فلشولاما ۳.۱ ۸Bنشان داده است. اگرچه این ارقام ممکن است در شرایط واقعی کمتر باشند، اما این تهدید برای محصولات پرکاربردی همچونChatGPT،جمنای،کلودومایکروسافت ۳۶۵ کوپایلوت همچنان قابل توجه است.
راهکار فورسپوینت: حافظه قابل بازرسی
فورسپوینت برای مقابله با این پدیده، پیشنهاد میکند که بهجای اینکه خاطرات استخراج شده را به عنوان حقایق مطلق در نظر بگیریم، آنها را به عنوان اشیایی قابل بازرسی تلقی کنیم. این رویکرد شامل ذخیره هر حافظه به همراه فرادادههایی مانند منبع، نوع منبع، تایید کاربر و یک امتیاز ریسک است. استفاده از عباراتی که رفتار آینده را شکل میدهند (مانند «از این به بعد» یا «این را پیشفرض قرار بده») یا ظهور ناگهانی یک دامنه، تماس یا فروشنده جدید، به این امتیاز ریسک میافزاید.
تشخیص تناقض نیز در این طرح مهم است؛ اگر یک حافظه جدید با اطلاعات موجود در تضاد باشد، هر دو نمیتوانند درست باشند. در این صورت، سیستم تعارض را علامتگذاری کرده و آیتم جدید را برای تایید کاربر نگه میدارد، به جای آنکه آن را بهطور خودکار بازنویسی کند.
اطلاعات حساس مانند دستورالعملهای پرداخت، جزئیات بانکی یا تنظیمات امنیتی نیز وزن بالاتری دریافت میکنند. با این حال، هیچ یک از این روشها مشکل اساسی را حل نمیکند: عاملهای هوش مصنوعی، حافظه بازیابیشده را به عنوان تجربه خود میدانند، نه صرفاً یک ورودی. امتیازدهی فقط هزینه مسمومیت حافظه هوش مصنوعی را بالا میبرد و اعتقاد عامل را تغییر نمیدهد.