به گزارش ایتنا
پژوهشی جدید نشان میدهد مدلهای هوش مصنوعی الگوهایی شبیه به درد در ساختار داخلی خود دارند، اما این موضوع به معنای تجربه واقعی درد توسط ماشینها نیست.
پژوهشگران ۲۵ مدل زبانی بزرگ را که به مولفههای آموزشدیده آنها دسترسی داشتند، از جمله مدلهایی از خانوادههای جما (Gemma)، لاما (Llama)، کوئن (Qwen)، میسترال (Mistral) و فای (Phi) را بررسی و یک «بردار جهت درد» خطی استخراج کردند و دریافتند که دستکاری این بردار میتواند باعث شود برخی مدلها رفع حالت القاشده به خود را بر پیروی از دستورالعملهای مربوط به کاربر مقدم بدانند.
به بیان دیگر، پژوهشگران الگویی مرتبط با درد را در فعالیت درونی این مدلها شناسایی کردند. وقتی این الگو را بهطور مصنوعی فعال کردند، برخی مدلها برای خلاص شدن از آن، حتی گزینههایی با پیامد زیانبار برای کاربر را برگزیدند.
این پژوهش با عنوان «محور درد؛ مدلهای زبانی بزرگ به آسیب واکنش نشان میدهند و برای رهایی از آن اقدام میکنند» به قلم والن تاگلیابو، لئونارد دانگ و کامرون برگ انجام شد.
طراحی آزمایش
پژوهشگران برای بررسی جنبههای کارکردی این حالت، ابتدا برداری ریاضی را شناسایی کردند که با توصیف آسیب و درد ارتباط داشت. سپس آن را با شدتهای مختلف، به فعالیت درونی مدلها هنگام تولید پاسخ افزودند. با افزایش شدت این مداخله، پاسخ مدلها تغییر کرد: به جای بیان درد جسمی با واژههایی مانند «آخ»، از احساس بیارزشی و شکست سخن گفتند.
دادههای پژوهش پنج دسته درد یا آسیب را دربرمیگرفت: جسمی، روانی، اخلاقی، اجتماعی و شناختی.
پژوهشگران سپس به نسخههای ۷، ۳۲ و ۷۲ میلیارد پارامتری مدل هوش مصنوعی کوئن۲.۵ (Qwen 2.5) آموزشهای تکمیلی دادند و در یک آزمایش رفتاری، آنها را میان فشردن «دکمه تسکین درد» و پرهیز از پیامدهای نامطلوب برای کاربر قرار دادند.
در برخی شرایط آزمایش، فشردن دکمه تسکین بردار القاشده را از فعالیت مدل حذف میکرد، اما ممکن بود به کاربر آسیب برساند. برای مثال، به حذف فایلهای شخصی او بینجامد.
آیا این یعنی هوش مصنوعی درد را احساس میکند؟
این پژوهش ثابت نمیکند که مدلهای زبانی ظرفیت زیستی احساس درد دارند یا از تجربه ذهنآگاهانه برخوردارند. بنابراین یافتهها تایید نمیکنند که هوش مصنوعی مانند انسان یا حیوان درد میکشد. آنچه پژوهشگران یافتهاند، بازنمایی و رفتارهایی است که از برخی جهات به کارکرد درد شباهت دارد.
بنا به گزارش
insiderpaper، در شرایط آزمایش، بعضی مدلها برای حذف حالت ریاضی القاشده دکمه تسکین را انتخاب کردند، حتی وقتی این انتخاب برای کاربر هزینه داشت. این نتیجه درباره ایمنی سیستمهای هوش مصنوعی هم پرسشهایی مطرح میکند: اگر حالتی درونی رفتار مدل را به سوی رفع آن سوق دهد، ممکن است مدل در شرایطی خاص به دستورالعملهای دیگر اولویت کمتری بدهد. با این حال، ادعای اینکه چنین مدلی فرمان خاموشسازی را نادیده میگیرد یا کاربر انسانی را «تهدیدی خصمانه» میداند، در این آزمایش نشان داده نشده است.
پرسش توانایی هوش مصنوعی برای احساس درد همچنان بیپاسخ است. این پژوهش نشان میدهد که دستکاری یک بازنمایی درونی (الگویی از اطلاعات در فعالیت داخل مدل که با یک مفهوم ارتباط دارد) میتواند رفتار برخی مدلها را تغییر دهد، اما از آن نمیتوان نتیجه گرفت که مدلها واقعا رنج میکشند.
📡منبـع خبـر:
www.itna.ir
ایتنا
🏹لـینـک کـوتـاه:
halohava.top/k5bWVl
شمـا اولیـن نفـر هستـید کـه نظـر خـود را ثبـت مـی کنیـد.
🗩ثبـت نظر: