2026-10-03 · 模型发布 · 重要性 ★★★★
微软AI发布MAI系列低延迟语音转录与文本转语音模型
Microsoft AI releases new transcription and text-to-speech models for voice agents 微软AI发布了MAI-Transcribe-2-Streaming实时转录模型,覆盖60种语言,首批识别结果输出延迟略超100毫秒,可支持打断式对话。同步推出的MAI-Voice-2.1系列文本转语音模型支持以同一音色呈现23种语言的原生口音,其Flash版本延迟仅150毫秒。这组轻量高效模型显著降低了构建实时语音交互智能体的工程门槛与调用成本。
一手来源:The Decoder ↗
← 返回资讯列表本站仅做聚合整理与来源标注,版权归原作者所有。

