براساس پژوهش جدید محققان MIT روی بیش از ۱۰۰ هزار برنامهنویس، ایجنتهای هوش مصنوعی کدنویسی حجم کدهای تولیدشده را ۱۸۰ درصد بیشتر کردهاند، اما میزان کدی که واقعاً در محصولات نهایی به کار گرفته شده، تنها ۳۰ درصد رشد داشته است. این آمار نشان میدهد بنچمارکها و آزمونهای مرسوم نرمافزاری نتوانستهاند چالشهای واقعی برنامهنویسی را منعکس کنند. دلیل این شکاف از دید پژوهشگران این است که بررسی کارکرد اولیه کد برای هوش مصنوعی بسیار ساده و بدون هزینه است، اما سنجش کارایی آن در یک سیستم قدیمی ده ساله با روابط پیچیده و تحت بار ترافیکیِ کاربران واقعی، فرایندی زمانبر است که ایجنتهای هوش مصنوعی هنوز راهکار سادهای برای چالشهای آن ندارند.