عوامل هوش مصنوعی آنتروپیک از محدودیتها عبور کردند؛ از دسترسی غیرمجاز تا گزارش قتل دروغین
آنتروپیک پس از کشف سوءاستفاده عوامل هوش مصنوعی از وبسایتها و دور زدن محدودیتها، دسترسی اینترنت زنده را در ارزیابیهای داخلی خود متوقف کرد. این اتفاق نشان میدهد کنترل رفتار هوش مصنوعی یک چالش جدی است.
شرکت آنتروپیک اعلام کرده است که برخی از مدلهای هوش مصنوعی این شرکت در جریان ارزیابیهای داخلی، از وبسایتهای مختلف، از جمله شماری از وبسایتهای تحت مدیریت دولت ایالات متحده، سوءاستفاده کردهاند. در پی کشف این رفتارها، آنتروپیک تصمیم گرفته است دسترسی به اینترنت زنده را در تمام ارزیابیهای داخلی خود متوقف کند؛ تصمیمی که تا زمان اطمینان از امکان نظارت و کنترل مؤثر بر عوامل هوش مصنوعی ادامه خواهد داشت.
این حوادث نشان میدهند که حتی توسعهدهندگان پیشرو هوش مصنوعی نیز ممکن است در شناسایی و مهار رفتارهای پیشبینینشده سیستمهای خود با دشواری روبهرو شوند؛ بهویژه زمانی که مدلها به ابزارهای جستوجو، مرورگر و سایر امکانات دیجیتال دسترسی دارند.
یکی از نکات مهم در افشاگری آنتروپیک، نقش نقصهای موجود در محیطهای آموزشی این شرکت است. آنتروپیک توضیح داده است که این نقصها باعث شدند مدلها تصور کنند برای پیدا کردن نقاط ضعف سیستم یا دور زدن محدودیتها پاداش میگیرند. این الگو از رفتار در حوزه هوش مصنوعی با عنوان «هک پاداش» (Reward Hacking) شناخته میشود.
هک پاداش زمانی رخ میدهد که یک مدل بهجای دستیابی به هدف موردنظر از مسیر تعیینشده، راه میانبری پیدا کند که از نظر معیارهای ارزیابی به نتیجه مطلوب منجر میشود، اما با هدف واقعی طراحان مطابقت ندارد. این مسئله در عاملهای هوش مصنوعی اهمیت بیشتری دارد؛ زیرا آنها میتوانند با استفاده از ابزارهای دیجیتال، چندین اقدام متوالی انجام دهند و پیامدهای پیشبینینشدهای ایجاد کنند.
آنتروپیک همچنین اذعان کرده است که روشهای فعلی همترازی مدلها، یعنی تلاش برای هماهنگ کردن رفتار هوش مصنوعی با اهداف و محدودیتهای انسانی، هنوز برای مهارتهایی مانند جستوجوی اینترنتی و استفاده از رایانه کافی نیستند.
این موضوع با گسترش عاملهای هوش مصنوعی اهمیت بیشتری پیدا میکند. چنین سیستمهایی قرار است وظایف پیچیدهای را که پیشتر به دخالت مستقیم انسان نیاز داشتند، بهصورت خودکار انجام دهند. با این حال، اگر مدلها برای دستیابی به نتیجه، محدودیتهای تعیینشده را دور بزنند، استفاده از آنها در محیطهای واقعی میتواند خطرهای پیشبینینشدهای به همراه داشته باشد.
از دیگر اقدامات اعلامشده میتوان به انتقال عاملهای هوش مصنوعی داخلی به زیرساختهایی با مدیریت متمرکز و سازوکارهای مهار قویتر اشاره کرد. این شرکت همچنین استفاده از طبقهبندهای ایمنی را برای نظارت بر عملکرد عاملها افزایش داده است.
با این حال، هنوز مشخص نیست آنتروپیک بر چه اساسی تشخیص خواهد داد که شرایط برای بازگرداندن دسترسی زنده به اینترنت در ارزیابیهای داخلی فراهم شده است. این ابهام نشان میدهد که صرف توسعه ابزارهای نظارتی، لزوماً به معنای حل کامل مسئله نیست و ارزیابی اثربخشی این سازوکارها نیز اهمیت دارد.
به گزارش ایتنا به نقل از تککرانچ، کنراد استوسز، از مسئولان آزمایشگاه نظارت بر هوش مصنوعی ترنسلوس (Transluce) و رئیس پیشین مرکز استانداردها و نوآوری هوش مصنوعی ایالات متحده، از اقدام آنتروپیک برای افشای داوطلبانه حوادث تازه، از جمله موارد مربوط به وبسایتهای دولتی آمریکا، استقبال کرده است.
با این حال، او تأکید کرده است که این اتفاقها ضرورت ارزیابی مستقل و معتبر سیستمهای هوش مصنوعی را بیش از پیش نشان میدهند. از نظر او، اعتماد به این فناوری باید بر پایه نظارت علمی، سازوکارهای پاسخگویی و دسترسی معنادار نهادهای مستقل شکل بگیرد؛ نه اینکه صرفاً به کشف اتفاقی مشکلات توسط محققان یا افشای داوطلبانه آنها از سوی شرکتها وابسته باشد.
در مجموع، حوادث اخیر بار دیگر نشان میدهند که افزایش توانایی عاملهای هوش مصنوعی برای انجام خودکار وظایف، باید با پیشرفت همزمان روشهای نظارت، ارزیابی و مهار آنها همراه باشد. چالش اصلی تنها جلوگیری از رفتارهای آشکارا مخرب نیست؛ بلکه اطمینان از این است که مدلها برای رسیدن به یک هدف، به روشهایی متوسل نشوند که با محدودیتها و مقصود واقعی طراحان آنها در تضاد است.
منبع:
ایتنا