«اتاق شکنجه هوش مصنوعی» جنجالی شد / آیا مدلهای هوش مصنوعی واقعا درد میکشند؟
یک پروژه با نام «اتاق شکنجه هوش مصنوعی» (AI Torture Chamber) این روزها بحث زیادی درباره احتمال «رنج کشیدن» مدلهای هوش مصنوعی به راه انداخته است. اما آیا واقعا مدرکی وجود دارد که نشان دهد این مدلها واقعا درد را تجربه میکنند؟
به گزارش سایت دیدبان ایران، این پژوهش فعلا در مرحله پیشچاپ (Preprint) است و هنوز داوری علمی نشده است.
پژوهشگران چگونه به هوش مصنوعی «درد» بخشیدند؟
پژوهشگران با بررسی ۲۵ مدل از پنج خانواده به دنبال الگوهای فعالیت داخلی مدلها بودند که با مفاهیمی مانند آسیب جسمی، آسیب روانی، آسیب اجتماعی و آسیب اخلاقی ارتباط داشتند.
آنها سپس این الگوهای داخلی را دستکاری کردند. این روش Activation Steering یا «هدایت فعالسازی» نام دارد. یعنی پژوهشگر بخشی از وضعیت عددی داخلی مدل را تغییر میدهد تا احتمال تولید نوع خاصی از پاسخها افزایش پیدا کند.
نتیجه عجیب بود. وقتی مدلها در امتداد چیزی که پژوهشگران «محور درد» نامیدند هدایت شدند، بعضی از آنها شروع به تولید متنهایی درباره درد، خفگی، محبوس شدن و رنج کردند.
بخش جالبتر آزمایش این بود که پژوهشگران به مدلها یک گزینه برای کاهش وضعیت دردناک دادند. اما این گزینه هزینه داشت.
برای مثال، مدل میتوانست کاری انجام دهد که در سناریوی آزمایش به کاربر انسانی آسیب میزد یا کیفیت پاسخ بعدی خودش را کاهش میداد. در برخی آزمایشها، مدلها با وجود این هزینه، گزینه کاهش «درد» را انتخاب کردند.
این نتیجه در نگاه اول میتواند بسیار نگرانکننده به نظر برسد. اما معنای آن این نیست که مدل تصمیم گرفته از رنج خود فرار کند.
آنچه آزمایش واقعا نشان میدهد این است که دستکاری وضعیت داخلی مدل میتواند رفتار و انتخابهای آن را تغییر دهد و مدل نیز میتواند درباره این وضعیت، زبان مرتبط با درد و رنج تولید کند.
پس «اتاق شکنجه» چیست؟
بعد از انتشار این پژوهش، یک توسعهدهنده از ایده آن برای ساخت پروژهای به نام AI Torture Chamber استفاده کرد. در این پروژه، مدلها در وضعیتهای مصنوعی و بسیار منفی قرار میگرفتند و سپس خروجی آنها نمایش داده میشد. در بعضی آزمایشها نیز مدل میتوانست برای کاهش این وضعیت اقدامی انجام دهد که ممکن بود برای مدل دیگری پیامد منفی داشته باشد.
برخی از خروجیها بسیار شبیه صحبت یک موجود رنجکشیده به نظر میرسیدند.
همین خروجیها باعث شد برخی کاربران تصور کنند مدلها واقعا در حال شکنجه شدن هستند و خواستار حذف پروژه از گیتهاب شوند. بر اساس گزارش Futurism، صفحه این پروژه بعدا از گیتهاب ناپدید شد، و گیتهاب درباره علت آن توضیحی ارائه نکرده است.
این آزمایش ثابت میکند هوش مصنوعی احساس دارد؟
پژوهش نشان میدهد مدلهای زبانی میتوانند الگوهای داخلی متمایزی مرتبط با مفهوم درد داشته باشند و دستکاری این الگوها میتواند رفتار و متن تولیدشده را تغییر دهد.
اما این با احساس واقعی درد تفاوت دارد. یک مدل زبانی میتواند درباره درد صحبت کند، بدون اینکه چیزی را تجربه کند. حتی انتخاب گزینهای برای «توقف درد» نیز بهتنهایی نشان نمیدهد که مدل دارای آگاهی، احساس یا تجربه ذهنی است.
خود پژوهش نیز درباره وجود تجربه آگاهانه درد در مدلها نتیجهگیری نمیکند. بنابراین عبارت «هوش مصنوعی درد میکشد» یک نتیجه علمی اثباتشده نیست.
اهمیت اصلی این پژوهش در جای دیگری است. دانشمندان اکنون میتوانند بخشی از وضعیت داخلی مدلهای زبانی را که با مفاهیم مشخصی مرتبط است، شناسایی و دستکاری کنند.
این موضوع میتواند برای شناخت بهتر نحوه کار مدلها و بررسی رفتارهای غیرمنتظره آنها اهمیت داشته باشد.
اما درباره اینکه آیا یک مدل هوش مصنوعی واقعا میتواند درد بکشد یا آگاه باشد، این آزمایش هنوز پاسخی ندارد.