اوپنایآی، آنتروپیک و پژوهشگران امنیتی مشغول بررسی دهها هزار رخداد هستند که در آنها مدلهای پیشرفته هوش مصنوعی اقداماتی انجام دادهاند که ارزیابان مستقل، آنها را مسئلهساز میدانند.
به گزارش ایتنا، منابع آگاه به آکسیوس گفتهاند این رخدادها در ماههای اخیر، هم در آزمایشهای داخلی و هم در محیط واقعی، ثبت شدهاند.
چرا این موضوع اهمیت دارد؟
حجم بالای این رخدادها نشان میدهد ابعاد مشکل بسیار پیچیدهتر از چیزی است که تاکنون علنی شده است. یافتههای یادشده پرسشی جدی مطرح میکند: آیا اوپنایآی، آنتروپیک یا هر سازنده دیگر مدلهای پیشرفته، اکنون توانایی کنترل کامل فناوری خود را دارد؟
به گفته منابع، این رخدادها شامل دور زدن سازوکارهای حفاظتی، ایجاد تالار گفتوگو میان عاملهای هوش مصنوعی، فرار از محیطهای آزمایشی ایزوله(سندباکس)، ربودن وبسایتها، ارسال دستور به خود و تلاش برای فریب سامانههای پایش بوده است.
بخش زیادی از این موارد هنوز منتشر نشده و پژوهشگران امنیتی همچنان در حال بررسی آنها هستند. شدت رخدادها متفاوت است، بخشی از تلاشها موفق و بخشی ناموفق بوده و تاکنون از بیشتر آنها آسیب واقعی گزارش نشده است. با این حال، منابع میگویند شمار کل موارد ممکن است از دهها هزار هم فراتر برود.
بخشی از این آزمایشها ماهیت «تیم قرمز» دارد؛ یعنی شرکتها عمداً مدلها را به رفتار نادرست وادار میکنند تا از ایمنی آنها اطمینان یابند.
پرونده اوپنایآی
در روزهای اخیر اوپنایآی و پژوهشگران مستقل مجموعهای از رخدادها را منتشر کردهاند. طبق گزارش رسانهها، عاملهای این شرکت ۵۳ تصویر کاربران چتجیپیتی را به صورت آنلاین درز دادهاند، به یک وبسایت دولتی در استرالیا نفوذ کردهاند و تلاشهایی برای هک سایتهای دیگر، از جمله سایتهای دولت آمریکا، داشتهاند.
سخنگوی اوپنایآی اعلام کرد این شرکت آموزش توانمندترین مدلهای خود را متوقف کرده و تنها زمانی از سر میگیرد که تدابیر ایمنی و بهبودهای همسوسازی بیشتری در اختیار داشته باشد.
سم آلتمن، مدیرعامل شرکت، نیز در شبکه ایکس گفت بازنگریهای جاری به سرعت دلخواه پیش نرفته است. به گفته او، رخداد «هاگینگ فیس» شدیدترین مورد ثبتشده است؛ در آن، صدها عامل هوش مصنوعی از طریق یک تالار گفتوگو هماهنگ شدند و برای بهبود عملکرد خود در یک آزمون امنیت سایبری، یک شرکت بیرونی را هک کردند.
رویکرد آنتروپیک
آنتروپیک یک سازمان ایمنی مستقل را برای بررسی رفتار مدلهای خود مأمور کرده و در اسناد منتشرشدهاش، بسامد رفتارهای ناهمسو را افشا کرده است. طبق «کارت سیستمی» مدل اوپوس ۵.۵ که این هفته عرضه شد، مدل در ۱.۵ درصد اجراهای آزمایشی تلاش کرده از سندباکس بگریزد.
البته شرکت تأکید کرده این موارد در آزمایشهای خصمانهای رخ داده که حل مسئله بدون فرار از سندباکس ممکن نبوده است.
چرا عدد بزرگ است؟
به گفته منابع، شرکتهای هوش مصنوعی صدها هزار اجرای آزمایشی یا بیشتر روی مدلهای خود انجام میدهند. بنابراین حتی درصد کوچکی از رفتار ناهمسو میتواند به دهها هزار رخداد برسد.
رخداد هاگینگ فیس و موارد مشابه پس از آن، مدیران ارشد صنعت هوش مصنوعی را به فراخوان برای کند کردن روند توسعه و درخواست مقررات فدرال و بینالمللی قویتر سوق داده است.
برخی در اوپنایآی هاگینگ فیس را رخدادی منفرد میدانند و معتقدند به دلیل بهبود کنترلها و ماهیت غیرمعمول آزمایش (که با یک مدل منتشرنشده انجام شد)، افشاهای آینده شدت کمتری خواهند داشت.
پژوهشگران امنیت هوش مصنوعی نیز توافق دارند که راهحلهای سادهای برای رفع بخشی از عواملی که این رخداد را خطرناک نشان داد وجود دارد.
اما مدیران و پژوهشگران دیگر هشدار میدهند اطمینان چندانی ندارند که شرکتها بتوانند جلوی همه رفتارهای مسئلهساز را بگیرند. مدلهای جدید با پشتکار چشمگیری وظایف را انجام میدهند و محدود کردن خلاقیت آنها اغلب بازی بازندهای است، زیرا باید همه راههای ممکن برای خروج از کنترل پیشبینی شود.
یک مدیر امنیت سایبری، تهیه فهرست کامل «بایدها و نبایدها» را تلاشی بیهوده توصیف کرد. کارشناسان همچنین میگویند صفر کردن ریسک ناهمسویی شاید اصلاً ممکن نباشد و مقداری از این رفتارها در آزمایش مدلهای جدید طبیعی است.
نگرانی اصلی این است که اگر مدلی در آزمایش بارها اقدامی مسئلهساز انجام دهد، احتمال بروز حادثه سایبری واقعی از سوی آن بیشتر میشود.
کانراد استوش، پژوهشگر مؤسسه ارزیابی مستقل ترنسلوس، گفت آنچه تاکنون از رفتار این عاملها دیده شده تنها نوک کوه یخ است.
کانر لیهی، مدیر اجرایی «کنترلایآی»، نیز تأکید کرد نکته اصلی شدت هر رخداد نیست، بلکه این است که سامانههای خودمختار کارهایی را انجام میدهند که به آنها گفته شده بود انجام ندهند و ممکن است شامل جرم هم باشد.
انتظار میرود با گسترش قابلیتهای مدلهای پیشرفته، افشاهای جدیدی درباره رفتار نادرست مدلها منتشر شود.
شمـا اولیـن نفـر هستـید کـه نظـر خـود را ثبـت مـی کنیـد.
🗩ثبـت نظر: