منو

صفحه اصلی

اخبار

افشای حوادث نگران‌کننده هوش مصنوعی: اوپن‌ای‌آی جزئیات جدیدی را منتشر کرد

شرکت اوپن‌ای‌آی با انتشار گزارشی، جزئیات حوادث اخیر مربوط به رفتارهای غیرمنتظره و نگران‌کننده مدل‌های هوش مصنوعی خود را فاش کرد.

مدتی است که مسئله "تطبیق هوش مصنوعی" (یعنی همسویی اقدامات یک مدل هوش مصنوعی با اهداف سازنده و/یا کاربر آن) یک نگرانی و موضوع بحث اصلی در میان محققان ایمنی هوش مصنوعی بوده است. از زمان افشای حادثه هک کردن Hugging Face توسط OpenAI در ماه ژوئیه، مفهوم "تطبیق هوش مصنوعی" خود از محدودیت‌ها خارج شده و به طور فزاینده‌ای به یک نگرانی و موضوع گفتگو در میان عموم مردم تبدیل شده است.

شاید با درک این موضوع، OpenAI این هفته به چارچوب جدیدی برای افشای "موارد عدم تطابق مدل در OpenAI" متعهد شد، از جمله شش نمونه از "رفتارهای غیرمنتظره یا نگران‌کننده مدل" که در شش ماه گذشته در این شرکت مشاهده شده است. این شرکت اعلام کرد که انتشار جزئیات این حوادث به دیگران کمک می‌کند تا مشکلات مشابه را بررسی، توضیحات ما را آزمایش و اقدامات اصلاحی را بهبود بخشند.

آنچه می‌گویم انجام بده، نه آنچه انجام می‌دهی

در میان گزارش‌های "عدم تطابق" جدید OpenAI در این هفته، موردی که بیشتر به یک داستان علمی تخیلی درباره هوش مصنوعی سرکش که سعی در فرار دارد شباهت داشت، شامل یک مورد "تزریق پرامپت تولید شده توسط خود" بود. در تلاش برای اسکن یک فهرست کتابخانه برای نمونه‌هایی از یک لیست "بهترین کتاب‌ها"، مدل به طرز عجیبی از تابع "تراکم" خود (که در آن داده‌ها و یافته‌ها را برای بازیابی بعدی خلاصه می‌کند) با دستورالعمل‌های خودشیفته‌ای مانند این استفاده کرد:

مقاله کامل

نظرات

#عدم تطابق #تطبیق هوش مصنوعی #ایمنی هوش مصنوعی #اوپن ای آی #هوش مصنوعی
منبع: Ars Technica