首页 / 资讯 / AI智讯 / Meta首个实时音频感知模型来了,20多人同时说话也能分轨转写

Meta首个实时音频感知模型来了,20多人同时说话也能分轨转写

时间:2026-09-05 10:02:04 来源:51DNS.COM
分享:

近期Meta正式推出旗下首款实时音频感知模型MuseVoiceTranscribe,在语音AI行业掀起不小波澜。该模型最大亮点便是支持20多人同时发言场景下实时分轨转写,并且API定价低至每千分钟3美元,兼顾高性能与亲民成本,为会议直播、线上访谈、远程研讨等多人音频场景带来全新解决方案。

Meta

一、多人实时语音转写长期存在技术痛点

在以往多人会议语音转写工作中,大多数语音工具只能做到音频结束之后再进行说话人区分,无法实现边录音边分轨输出。一旦出现多人同时插话、重叠发言的情况,转写文稿极易出现说话人身份混乱、文本错位,后期人工校对工作量巨大。

同时传统方案往往需要把语音识别、说话人分离、语音端点检测拆分为三套独立系统串联运行,多模块转接会带来额外延迟,很难胜任实时字幕、线上会议实时纪要等低延迟场景。市场上高性能多人实时转写服务定价偏高,中小团队长期使用成本压力较大。正是在技术痛点与成本难题双重驱动之下,Meta全新的实时音频感知模型应运而生。

 

二、模型核心能力:实时流式转写,轻松应对20+人对话

本次上线的MuseVoiceTranscribe,将流式语音识别、说话人分轨、语音端点检测三大功能整合进单一AI模型,无需后期二次处理即可输出带有发言人标记的文字文稿,真正做到边说话边转写。

在多人对话场景中,就算会议室里二十余人同时交流、声音重叠,模型依旧可以精准区分不同发言人,自动划分每一段发言归属。音频单次处理切片仅80毫秒,依托自适应延迟技术,简单词汇快速输出结果,复杂词汇会多收集一点音频信息再给出判断,平衡转写速度和识别准确率。

语言能力方面,模型完成70余种语言训练,首发阶段25种语言经过验证可用,支持对话中途无缝切换语种,中英文夹杂交谈也能够稳定识别。并且它可直接处理时长超过一小时的长音频会议,无需中途分段处理,非常适合大型研讨会、圆桌论坛等长时间多人音频场景。

价格层面,对外开放的API接口定价为每1000分钟音频仅收取3美元,折算下来每小时成本约0.18美元,低廉的收费标准大幅降低企业接入高性能多人转写服务的门槛。目前该模型已经在Mac端MetaAI应用以及MuseCode产品当中落地使用,开发者可调用MetaModelAPI快速接入这项能力。

 

三、对语音转写行业带来的深远影响

Meta本次新品发布,进一步加剧实时语音AI赛道的竞争。过去,高并发多人实时分轨转写属于成本高昂的高端能力,如今平价高性能方案落地,会倒逼同类语音产品优化定价策略,加速多人实时转写技术普惠。

对于线上办公、直播访谈、播客制作、在线教育等行业从业者而言,这项技术能够大幅减少会议纪要、音频文稿整理的人力消耗,提升音频内容生产效率。开发者基于低成本API,就可以快速搭建自带多人实时字幕、自动纪要功能的会议软件,降低音频类应用的开发门槛。

从技术方向来看,“识别‑分轨‑断句一体化”将会成为下一代实时音频模型重要的研发方向,语音AI产品也将从单人听写场景,全面转向复杂多人实时对话场景。

 

四、开发者与企业落地使用建议

企业和开发者计划接入该音频模型前,首先需要结合自身业务场景评估并发人数上限。如果日常会议人数远超20人,需要提前做好音频分流方案。其次,实时转写结果建议配置人工复核环节,遇到嘈杂背景音、口音较重发言者,进一步保障文稿准确度。

在成本管控上,可以按照月度音频时长预估费用,设置用量告警,避免API调用时长超出预算。同时也可以多对比多款语音转写模型,结合延迟、准确率、语种适配度综合选型。随着实时音频感知技术持续迭代升级,多人语音转写的体验还会迎来更大突破。

推荐产品:
关键词:

联系我们