【事件】【事件】微软7月23日发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash,进入Microsoft Foundry公开预览。图像模型每100万文本输入token为5美元、图像输入8美元、图像输出106美元;语音模型每100万字符15美元,官方称速度为前代2倍、价格低32%。图像模型已用于Bing、PowerPoint和OneDrive;语音模型用于Dynamics 365 Contact Center与Azure Voice Live。性能与降本比例均为公司口径,尚无独立客户审计。
【背景】【背景】微软过去在Copilot产品中大量调用合作伙伴模型,本轮披露提供了自研模型替代的同口径坐标:PowerPoint图像到图像场景的GPU成本较GPT-Image-2最多降低84%;OneDrive上线后保存率提高26%、P95延迟约降25%、中等利用率下效率为原来的2.5倍;联络中心语音场景GPU成本最多降低89%。与只公布通用benchmark的模型发布不同,这些指标直接绑定生产表面和负载。公开预览并不等于全面GA,配额、区域、内容过滤和真实客户工作负载仍会改变结果;媒体报道只能确认发布和成本主线,具体百分比仍以官方试验口径为准。
【信号】【信号】微软正在把“模型自研”变成Office与Dynamics的毛利工程。Copilot定价不变时,固定场景的推理节省会先转成毛利和调用频率。外部开发者应以固定任务同时测试文本渲染错误率、编辑遵循度、首包延迟、每分钟语音成本与审核拒答率。反向风险是内部流量偏向微软产品,84%和89%不能外推到广告、医疗或多语言客服;Image-Pro价格也要换算为单张成品成本。若客户复测显示质量回退抵消成本优势,判断失效。后续核对Foundry GA、区域配额、OneDrive保存率和Dynamics每通电话GPU成本。