微软AI(MAI)近日在官方博客宣布,其全新自研图像生成模型MAI-Image-2.6正式在Microsoft Foundry平台开放公开预览,同时推出面向高吞吐、低延迟场景的MAI-Image-2.6–Flash模型。这一发布标志着微软在图像生成赛道上进一步缩小与OpenAI的差距,并在性价比维度发起强力攻势。

性能表现:Arena榜单紧追GPT Image 2
MAI-Image-2.6在LMSYS Arena盲测榜单上表现抢眼。截至9月4日,该模型在文生图(Text-to-Image)排行榜上以1336分位居第二,仅次于OpenAI的GPT Image 2(1381分),差距约45分。在图像编辑(Image Editing)排行榜上同样排名第二,在Artificial Analysis的独立评测中更是登顶图像编辑榜第一。
对比上一代MAI-Image-2.5,新版本在综合Elo评分上提升了约79分,其中文本渲染(在图像中准确绘制文字)能力提升最为显著,Elo提高91分,在Arena文字渲染专项榜以1374分排名第一。人像面部细节、光影质感以及3D场景的空间结构和材质表现均有明显进步。

两大核心能力升级
MAI-Image-2.6引入了两项重要的新功能。首先是多参考图编辑(Multi-Reference Editing),单次请求最多支持5张参考图,能够将不同图片中的产品、角色、品牌标识等元素融合到同一场景中,并保持视觉一致性。这对于品牌物料制作、电商产品展示等需要保持视觉统一性的商业场景尤为重要。
其次是Web Grounding能力,模型可以从互联网实时获取真实世界的上下文信息,使生成的图像能够反映准确的地点、物体和主题细节,而非仅依赖训练数据中的知识。此外,模型还支持动态宽高比调整和最高1.5K分辨率输出。
Flash版:速度翻倍,成本减半
MAI-Image-2.6-Flash定位为旗舰版的”高速轻量化”版本。微软官方数据显示,Flash版的生成速度是GPT-Image-2-Medium的2.8倍,GPU效率提升72%,同时保持与旗舰版相近的图像质量。在Arena图像编辑榜单上,Flash版直接跻身前三。
定价方面,两个模型均按Token计费。MAI-Image-2.6的价格为文本输入5美元/百万Token、图像输入8美元、图像输出38美元;Flash版则大幅降至1.75美元、2.50美元和19美元,输出价格恰好减半。第三方平台Arena估算,MAI-Image-2.6生成1000张图像的成本约38.90美元,折合每张约3.9美分(约人民币0.28元),被Arena置于价格-性能的帕累托前沿——即没有其他模型能在更低价格下提供更高质量。
微软的自研模型战略
MAI-Image-2.6的发布是微软AI负责人Mustafa Suleyman推动自研模型战略的重要一步。Suleyman此前曾联合创立DeepMind和Inflection AI,2024年加入微软后主导组建Microsoft AI团队。他在今年3月的公司重组中明确表示,AI行业将由”前沿模型及其产品体验”来定义。
MAI-Image-2.6实现了微软在图像生成领域的两个关键目标:一是拥有自主知识产权的顶级模型,减少对OpenAI等外部供应商的依赖;二是通过Foundry平台将模型直接提供给企业开发者,结合Azure的云基础设施实现数据合规和成本可控。

目前MAI-Image-2.6和MAI-Image-2.6-Flash均可在MAI Playground(playground.microsoft.ai)免费试用,开发者也可通过Microsoft Foundry(ai.azure.com)的公开预览接入API。Copilot和Windows内置集成暂未在本次发布中提及。
对于开发者和创作团队而言,MAI-Image-2.6家族的意义在于:文生图与图像编辑能力正在从”实验室演示”走向”生产线就绪”,企业可以在自己的产品中嵌入与顶级榜单接轨的视觉生成体验,而Flash模型在速度和费用上的优势,将加速AIGC在广告、电商、游戏等高频用图行业的规模化落地。

