مایکروسافت دو هوش مصنوعی تصویرساز جدید با عملکرد تحسینبرانگیز معرفی کرد
مایکروسافت دو هوش مصنوعی جدید را با هدف ارتقای کیفیت تولید تصاویر حرفهای و کاهش تأخیر در مکالمات صوتی به پلتفرم فاندری خود افزود.
به گزارش سایت دیدبان ایران، مایکروسافت از دو عضو جدید خانوادهی هوش مصنوعی خود با نام MAI-Image-2.5 Pro و MAI-Voice-2 Flash رونمایی کرد. مدل نخست برای ارائهی بالاترین سطح از وفاداری بصری و کنترل خلاقانه در پروژههای حرفهای طراحی شده و مدل دوم، پاسخی به نیاز روزافزون به برنامههای صوتی با کمترین میزان تاخیر است.
بر اساس نیازهای خاص هر پروژه عنوان شده است. مایکروسافت تأکید کرد که بازخورد توسعهدهندگان و شرکتها نشان میدهد برخی به دنبال بالاترین کیفیت ممکن برای تولیدات حرفهای هستند و گروهی دیگر سرعت واکنش و مقرونبهصرفهبودن را در اولویت قرار میدهند.
MAI-Image-2.5 Pro به طور خاص برای سناریوهایی ساخته شده که دقت بصری، یکپارچگی اشیا و همسویی دقیق با هدف در آنها اهمیت حیاتی دارد. مدل یاددشده درک بصری و دانش جهانی را بهبود بخشیده تا برای مصارفی مانند تولید کمپینهای تبلیغاتی بزرگ، عکاسی محصول برای کاتالوگهای تجارت الکترونیک و طراحی استوریبورد در صنایع فیلم و بازی به کار آید.
MAI-Image-2.5 Pro برای تولید محتوا در صنایع تحت نظارت مانند خدمات درمانی و مالی که به دقت بالایی در بازنمایی واقعیت نیاز دارند، گزینهای ایدئال محسوب میشود.
در مقابل، MAI-Voice-2 Flash یک مدل تبدیل متن به گفتار با تأخیر بسیار کم است که از بیش از ۱۵ زبان پشتیبانی میکند. کاربرد اصلی این مدل در مراکز تماس، دستیارهای صوتی مکالمهای و سیستمهای پاسخگویی صوتی تعاملی (IVR) تعریف شده است؛ جاهایی که هر میلیثانیه تأخیر میتواند تجربهی کاربر را از مکالمهی طبیعی دور کند. مایکروسافت میگوید این مدل با کاهش مکثهای طولانی، تعاملات را روانتر و طبیعیتر میکند.
مایکروسافت برای راهنمایی مشتریان خود، مرز انتخاب میان این مدلها و نمونههای پیشین را مشخص کرد. زمانی باید به سراغ MAI-Image-2.5 Pro رفت که وفاداری حداکثری تصویر، یکپارچگی اشیا در چندین تصویر و پایبندی دقیق به دستورالعملهای خلاقانه در اولویت باشد. در حوزهی صدا اگر کاهش تأخیر و مقرونبهصرفهبودن نسبتبه هویت صوتی اولویت دارد، MAI-Voice-2 Flash انتخاب بهتری خواهد بود.
هزینهی استفاده از MAI-Image-2.5 Pro برای ورودی متنی، ۵ دلار به ازای هر یک میلیون توکن و برای خروجی تصویر، ۱۰۶ دلار به ازای هر یک میلیون توکن است.
قیمت MAI-Voice-2 Flash از ۱۵ دلار به ازای هر یک میلیون کاراکتر آغاز میشود. مدل تصویری از طریق مایکروسافت فاندری و مدل صوتی از طریق سرویس Azure Speech در دسترس توسعهدهندگان قرار گرفته است.