مایکروسافت از دو عضو جدید خانواده هوش مصنوعی خود با نامهای MAI-Image-۲.۵ Pro و MAI-Voice-۲ Flash رونمایی کرد. مدل تصویرساز برای ارائه بالاترین سطح وفاداری بصری و کنترل خلاقانه در پروژههای حرفهای طراحی شده است و مدل صوتی، پاسخی به نیاز روزافزون برنامههای صوتی با کمترین میزان تاخیر است. مدل MAI-Image-۲.۵ Pro درک بصری و دانش جهانی را بهبود بخشیده و برای مصارفی مانند تولید کمپینهای تبلیغاتی، عکاسی محصول و طراحی استوریبورد در صنایع فیلم و بازی به کار میآید. هزینه استفاده از این مدل برای ورودی متنی، ۵ دلار به ازای هر یک میلیون توکن و برای خروجی تصویر، ۱۰۶ دلار به ازای هر یک میلیون توکن تعیین شده است. در مقابل، MAI-Voice-۲ Flash یک مدل تبدیل متن به گفتار با تاخیر بسیار کم است که از بیش از ۱۵ زبان پشتیبانی میکند و قیمت آن از ۱۵ دلار به ازای هر یک میلیون کاراکتر آغاز میشود. مدل تصویری از طریق مایکروسافت فاندری و مدل صوتی از طریق سرویس Azure Speech در دسترس توسعهدهندگان قرار گرفته است.