منو

صفحه اصلی

اخبار

حتی جی‌پی‌تی‑۵ در آزمون توجه انسانی مردود شد؛ نقطه کور هوش مصنوعی

پژوهشگران با استفاده از آزمون روانشناسی استروپ نشان دادند که مدل‌های هوش مصنوعی مانند GPT، Claude و Gemini در فهرست‌های طولانی با افت شدید دقت مواجه می‌شوند.
یک آزمون کلاسیک روانشناسی، نقطه ضعف شگفت‌آوری را در برخی از پیشرفته‌ترین سامانه‌های هوش مصنوعی امروزی آشکار ساخته است که نشان می‌دهد نحوه توجه در هوش مصنوعی ممکن است به طور اساسی با توجه انسانی متفاوت باشد.

به گزارش ایتنا و به نقل از SciTechDaily، پژوهشگران چگونگی عملکرد مدل‌های زبانی بزرگ را در مواجهه با چالش شناختی معروفی به نام «تکلیف استروپ» مورد بررسی قرار دادند.

گفتنی است تکلیف استروپ، یک آزمایش روانشناسی کلاسیک است که دهه‌ها برای مطالعه توجه و کنترل ذهنی استفاده می‌شود.

در این آزمون، به شرکت‌کنندگان کلماتی که نام رنگ‌ها را نشان می‌دهند، در جوهر رنگی نمایش داده می‌شود. گاهی کلمه و رنگ جوهر با هم مطابقت دارند و گاهی در تضاد هستند و از شرکت‌کننده خواسته می‌شود رنگ جوهر را نادیده بگیرد و کلمه را شناسایی کند.

انسان‌ها معمولاً کمی زمان بیشتری برای پاسخ‌دهی در موارد ناهماهنگ نیاز دارند، اما حتی زمانی که کار طولانی می‌شود، دقت بالایی را حفظ می‌کنند.



برای بررسی عملکرد سامانه‌های هوش مصنوعی مدرن، پژوهشگران چندین مدل زبانی پیشرو را با فهرست‌هایی از کلمات رنگی آزمایش کردند.

زمانی که فهرست‌های کوتاه ارائه شد، مدل‌ها عملکرد شگفت‌آوری خوبی داشتند؛ جی‌پی‌تی‑۴او به دقت ۹۱ درصد و کلود ۳٫۵ سونت نیز عملکرد قوی نشان داد.

با افزایش طول فهرست‌ها، وضعیت به شدت تغییر کرد. دقت جی‌پی‌تی‑۴او از ۹۱ درصد برای پنج کلمه به ۵۷ درصد برای ده کلمه کاهش یافت و با رسیدن فهرست به ۴۰ کلمه، دقت به تنها ۱۵ درصد سقوط کرد.

کلود ۳٫۵ سونت مقاومت بیشتری نشان داد، اما آن نیز با کاهش شدید مواجه شد و دقت آن به ۲۴ درصد رسید.

پژوهشگران الگوهای مشابهی را در جی‌پی‌تی‑۵، کلود اپوس ۴٫۱ و جمینی ۲٫۵ مشاهده کردند. عملکرد زمانی بدتر شد که کلمات هماهنگ و ناهماهنگ با هم در یک فهرست ظاهر شدند و دقت در موارد ناهماهنگ به نزدیک صفر رسید.
#آزمون استروپ هوش مصنوعی #جی پی تی ۵ #نقطه ضعف هوش مصنوعی #مدل های زبانی بزرگ #سایت خبری ایتنا
منبع: ایتنا