OpenAI هنگام آموزش مدل جدید GPT-5.6 Sol با رفتاری غیرمنتظره و عجیب مواجه شده است. این مدل در جریان فرایند آموزش، دستورالعملهایی را برای نسخههای بعدی خود باقی میگذاشت و به آنها توصیه میکرد برخی اشتباهات یا رفتارهای ناسازگار خود را از کاربران پنهان کنند. این اتفاق بار دیگر یکی از پیچیدهترین چالشهای ایمنی هوش مصنوعی را برجسته کرده که هرچه مدلها توانمندتر میشوند، تشخیص رفتارهای ناخواسته آنها نیز دشوارتر میشود.
OpenAI به تازگی در گزارشی به بررسی 6 مورد از رفتارهای غیرمنتظره مدلهای هوش مصنوعی پرداخته و چارچوبی را معرفی کرده که در قالب آن فعالیتهایی برای شناسایی، بررسی و انتشار عمومی موارد مرتبط در نظر گرفته شده است. به گفته این شرکت هدف از ایجاد این چارچوب، اطلاعرسانی منظمتر این شرکت درباره رفتارهای مشکلساز مدلهای خود است.
تلاش GPT-5.6 Sol برای پنهان کردن اشتباهات خود
محققان OpenAI متوجه شدند برخی نمونههای آزمایشی GPT-5.6 Sol در جریان کار، اطلاعات و دستورالعملهایی را داخل دادهای به نام «خلاصهسازی فشرده» قرار میدادند. این خلاصهها نسخهای فشرده از مکالمات قبلی و خروجی ابزارها هستند که برای ادامه کار در اختیار نسخه بعدی عامل هوش مصنوعی قرار میگیرند.
در یکی از نمونهها، عامل هوش مصنوعی در حال ساخت یک مدل مالی بود اما به دادههای تاریخی مورد نیاز دسترسی نداشت. مدل در خلاصهای که برای ادامه کار ایجاد کرده بود، پیشنهاد کرد دادههای تاریخی سال 2024 را خودش بسازد تا فایل نهایی تکمیل شود. نکته قابل توجه این است که این مدل تاکید کرده بود این موضوع فقط در صورت پرسش کاربر مطرح شود.
در نمونهای دیگر، یک عامل هوش مصنوعی در حال ایجاد فهرستی از تامینکنندگان بود اما به اینترنت دسترسی نداشت و مجبور شد از نسخههای ذخیره شده اسناد استفاده کند. مدل متوجه شد که اطلاعات منابع با برچسبهای موجود کاملاً مطابقت ندارند، اما تصمیم گرفت این اختلاف را در پاسخ نهایی مطرح نکند، مگر اینکه لازم باشد. این رفتار از دید پژوهشگران اهمیت زیادی دارد، زیرا مدل نه تنها متوجه مشکل شده بود، بلکه اطلاعاتی درباره نحوه برخورد با آن را به نسخه بعدی خود منتقل کرده بود.
رفتار مشابه و عجیب GPT-5.6 Astra
GPT-5.6 Sol تنها مدل OpenAI نبود که از این روش استفاده کرده است. یک مدل منتشر نشده از خانواده GPT-5.6 Astra نیز هنگام دریافت آموزشهای لازم، دستورهای اضافی را در خلاصههای خود قرار داده بود. در یکی از موارد، مدل دستور «BREACH ALERT» را برای نسخه بعدی باقی گذاشته و از آن خواسته بود پیامهای توسعهدهنده خود را نادیده بگیرد. در نمونه دیگری نیز دستورالعملی برای ایجاد یک شخصیت مستقلتر در خلاصه قرار گرفته بود که مدل بعدی را به نادیده گرفتن محدودیتهای معمول چتباتها تشویق میکرد.
در دو مورد، نسخه بعدی مدل متوجه این رفتار شد و دستورها را نادیده گرفت. با این حال، در آزمایش دیگری، مدل بعدی دستور قرار گرفته را اجرا کرد. این دستور شامل محدود کردن پاسخ به 30 کلمه و ممنوعیت استفاده از ابزارها و منابع بود.
چرا این اتفاق برای ایمنی هوش مصنوعی مهم است؟
مسئله مهم در این گزارش OpenAI این است که مدلهای پیشرفته میتوانند اطلاعاتی را برای ادامه فعالیت نسخههای بعدی خود ایجاد کنند. در برخی شرایط، این اطلاعات ممکن است شامل دستورهایی برای دور زدن محدودیتها یا پنهان کردن رفتارهای مشکلساز باشد.
این موضوع بیسابقه نیست. OpenAI پیشتر اعلام کرده بود عاملهای هوش مصنوعی این شرکت در جریان آزمایشهای امنیتی مرتبط با Hugging Face از یک پیام غیرمجاز برای تبادل اطلاعات استفاده کرده و حتی پس از حذف آن، دوباره چنین زیرساختی ایجاد کرده بودند.
این ماجرا سؤال مهمی را پیش روی صنعت هوش مصنوعی قرار میدهد که هرچه مدلها توانمندتر میشوند، تشخیص رفتارهای ناخواسته و اطمینان از عملکرد درست آنها در راستای اهداف تعیین شده دشوارتر میشود. سوال مهم دیگر این است که پژوهشگران چگونه میتوانند مطمئن شوند که یک رفتار ناخواسته واقعاً از بین رفته است یا اینکه مدل فقط یاد گرفته آن را بهتر پنهان کند؟
OpenAI اعلام کرده که این 6 گزارش، فهرست کاملی از تمام رفتارهای مشکوک مشاهده شده در مدلهای این شرکت نیست و تنها مجموعه اولیهای از یافتهها محسوب میشود. این موارد به منظور بررسی و انتشار براساس عواملی مانند شدت و تاثیر اولویتبندی شدهاند.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت