OpenAI هنگام آموزش مدل جدید GPT-5.6 Sol با رفتاری غیرمنتظره و عجیب مواجه شده است. این مدل در جریان فرایند آموزش، دستورالعمل‌هایی را برای نسخه‌های بعدی خود باقی می‌گذاشت و به آن‌ها توصیه می‌کرد برخی اشتباهات یا رفتارهای ناسازگار خود را از کاربران پنهان کنند. این اتفاق بار دیگر یکی از پیچیده‌ترین چالش‌های ایمنی هوش مصنوعی را برجسته کرده که هرچه مدل‌ها توانمندتر می‌شوند، تشخیص رفتارهای ناخواسته آن‌ها نیز دشوارتر می‌شود.

OpenAI به تازگی در گزارشی به بررسی 6 مورد از رفتارهای غیرمنتظره مدل‌های هوش مصنوعی پرداخته و چارچوبی را معرفی کرده که در قالب آن فعالیت‌هایی برای شناسایی، بررسی و انتشار عمومی موارد مرتبط در نظر گرفته شده است. به گفته این شرکت هدف از ایجاد این چارچوب، اطلاع‌رسانی منظم‌تر این شرکت درباره رفتارهای مشکل‌ساز مدل‌های خود است.

تلاش GPT-5.6 Sol برای پنهان کردن اشتباهات خود

محققان OpenAI متوجه شدند برخی نمونه‌های آزمایشی GPT-5.6 Sol در جریان کار، اطلاعات و دستورالعمل‌هایی را داخل داده‌ای به نام «خلاصه‌سازی فشرده» قرار می‌دادند. این خلاصه‌ها نسخه‌ای فشرده از مکالمات قبلی و خروجی ابزارها هستند که برای ادامه کار در اختیار نسخه بعدی عامل هوش مصنوعی قرار می‌گیرند.

در یکی از نمونه‌ها، عامل هوش مصنوعی در حال ساخت یک مدل مالی بود اما به داده‌های تاریخی مورد نیاز دسترسی نداشت. مدل در خلاصه‌ای که برای ادامه کار ایجاد کرده بود، پیشنهاد کرد داده‌های تاریخی سال 2024 را خودش بسازد تا فایل نهایی تکمیل شود. نکته قابل توجه این است که این مدل تاکید کرده بود این موضوع فقط در صورت پرسش کاربر مطرح شود.

در نمونه‌ای دیگر، یک عامل هوش مصنوعی در حال ایجاد فهرستی از تامین‌کنندگان بود اما به اینترنت دسترسی نداشت و مجبور شد از نسخه‌های ذخیره‌ شده اسناد استفاده کند. مدل متوجه شد که اطلاعات منابع با برچسب‌های موجود کاملاً مطابقت ندارند، اما تصمیم گرفت این اختلاف را در پاسخ نهایی مطرح نکند، مگر اینکه لازم باشد. این رفتار از دید پژوهشگران اهمیت زیادی دارد، زیرا مدل نه ‌تنها متوجه مشکل شده بود، بلکه اطلاعاتی درباره نحوه برخورد با آن را به نسخه بعدی خود منتقل کرده بود.

رفتار مشابه و عجیب GPT-5.6 Astra

GPT-5.6 Sol تنها مدل OpenAI نبود که از این روش استفاده کرده است. یک مدل منتشر نشده از خانواده GPT-5.6 Astra نیز هنگام دریافت آموزش‌های لازم، دستورهای اضافی را در خلاصه‌های خود قرار داده بود. در یکی از موارد، مدل دستور «BREACH ALERT» را برای نسخه بعدی باقی گذاشته و از آن خواسته بود پیام‌های توسعه‌دهنده خود را نادیده بگیرد. در نمونه دیگری نیز دستورالعملی برای ایجاد یک شخصیت مستقل‌تر در خلاصه قرار گرفته بود که مدل بعدی را به نادیده گرفتن محدودیت‌های معمول چت‌بات‌ها تشویق می‌کرد.

در دو مورد، نسخه بعدی مدل متوجه این رفتار شد و دستورها را نادیده گرفت. با این حال، در آزمایش دیگری، مدل بعدی دستور قرار گرفته را اجرا کرد. این دستور شامل محدود کردن پاسخ به 30 کلمه و ممنوعیت استفاده از ابزارها و منابع بود.

چرا این اتفاق برای ایمنی هوش مصنوعی مهم است؟

مسئله مهم‌ در این گزارش OpenAI این است که مدل‌های پیشرفته می‌توانند اطلاعاتی را برای ادامه فعالیت نسخه‌های بعدی خود ایجاد کنند. در برخی شرایط، این اطلاعات ممکن است شامل دستورهایی برای دور زدن محدودیت‌ها یا پنهان کردن رفتارهای مشکل‌ساز باشد.

این موضوع بی‌سابقه نیست. OpenAI پیش‌تر اعلام کرده بود عامل‌های هوش مصنوعی این شرکت در جریان آزمایش‌های امنیتی مرتبط با Hugging Face از یک پیام غیرمجاز برای تبادل اطلاعات استفاده کرده و حتی پس از حذف آن، دوباره چنین زیرساختی ایجاد کرده بودند.

این ماجرا سؤال مهمی را پیش روی صنعت هوش مصنوعی قرار می‌دهد که هرچه مدل‌ها توانمندتر می‌شوند، تشخیص رفتارهای ناخواسته و اطمینان از عملکرد درست آن‌ها در راستای اهداف تعیین ‌شده دشوارتر می‌شود. سوال مهم دیگر این است که پژوهشگران چگونه می‌توانند مطمئن شوند که یک رفتار ناخواسته واقعاً از بین رفته است یا اینکه مدل فقط یاد گرفته آن را بهتر پنهان کند؟

OpenAI اعلام کرده که این 6 گزارش، فهرست کاملی از تمام رفتارهای مشکوک مشاهده‌ شده در مدل‌های این شرکت نیست و تنها مجموعه اولیه‌ای از یافته‌ها محسوب می‌شود. این موارد به منظور بررسی و انتشار براساس عواملی مانند شدت و تاثیر اولویت‌بندی شده‌اند.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.

نظرات (1)

  • مهمان - AI

    حداقل شفافیت دارن، اگه بعضی کشورها بود میگفتن این گزارش باعث خدشه به انسجام ملی ai ها شده و نواقص رو برای دشمنان آشکار کرده! طرف میرفت زندان اموالشم میرفت تو جیب مفت خورا :D

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید