ترفند جدید OpenAI چهره واقعی مدلهای هوش مصنوعی را پیش از عرضه برملا میکند
به گفته OpenAI، مدلهای هوش مصنوعی در ۹۹ درصد مواقع متوجه میشوند که درحال گذراندن یک آزمون هستند. این موضوع پرسشی نگرانکننده را مطرح میکند؛ اگر یک مدل صرفاً به این دلیل رفتار درستی دارد که میداند تحت نظارت است، چگونه میتوانیم اطمینان حاصل کنیم که پس از عرضه عمومینیز ایمن باقی میماند؟ راهکار OpenAI برای حل این مشکل، روشی به نام «شبیهسازی استقرار» است. در این روش جالب، محققان با ارائه نمونههایی از پیامهای واقعی کاربران، مدلها را فریب میدهند تا تصور کنند از قبل در دسترس عموم قرار گرفتهاند. اوپنایآی این دادهها را از کاربرانی جمعآوری میکند که اجازه استفاده از مکالماتشان را برای آموزش سیستم دادهاند. پژوهشگران پاسخ مدل قبلی را از این مکالمات پاک میکنند و از مدل جدید میخواهند تا به کاربر پاسخ دهد. درنهایت برای ارزیابی نتایج، سیستم تمام دادهها را به یک مدل ارزیاب به نام GPT-۵-Thinking ارسال میکند تا پاسخها را براساس ۲۰ دسته از رفتارهای مخرب، مانند ارائه محتوای غیرمجاز یا اقدامات فریبنده، بررسی و رتبهبندی کند.