媒体界
行业纵横 资讯速递 科技前沿 峰会论坛 企业快讯 商业快讯

Meta推出Muse Voice Transcribe:实时转写支持超20人发言,70余种语言覆盖

2026-09-02来源:快讯编辑:瑞雪

meta公司近日正式推出其首个实时音频感知模型——Muse Voice Transcribe,这一创新技术为语音转写领域带来了新的突破。开发者可通过meta Model API调用该模型,其定价为每1000分钟音频3美元(约合人民币20.2元),即每小时0.18美元(约合人民币1.2元),这一价格策略为开发者提供了高性价比的选择。

Muse Voice Transcribe的核心优势在于其流式自动语音识别能力,实现了边说边转写的功能。与传统的语音转写技术不同,该模型无需等待完整录音结束后再进行处理,而是能够实时、持续地输出文字结果。这种特性使得它在实时听写、会议记录、通话字幕等场景中具有显著优势,大大降低了延迟,提高了工作效率。

在技术实现上,Muse Voice Transcribe整合了说话人分离与端点检测功能。它能够在包含20余名说话者的录音中准确分离不同发言者,并识别说话的结束点,从而自动确定一段输入的边界。这一功能对于多人会议或访谈等场景尤为重要,能够确保转写结果的准确性和条理性。

该模型还具备强大的语言支持能力。其训练覆盖了70余种语言,其中25种语言在发布时已完成验证。无论是长音频还是短音频,无论是单一语言还是句内或句间的自然语言切换,Muse Voice Transcribe都能轻松应对。开发者还可以通过语言、关键词和上下文偏置来优化模型,提高特定语言、术语或场景下的识别效果。

为了兼顾实时响应和识别准确度,meta引入了自适应延迟的动态决策机制。该机制不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。对于较容易识别的语音,系统会更快提交转写结果;而对于发音不清、术语较多或语境复杂的词语,系统则会调用更多前后文音频信息进行分析。这种机制确保了模型在各种场景下都能保持高效的性能。

根据Artificial Analysis的流式语音转文本排行榜显示,截至2026年9月1日,Muse Voice Transcribe位列榜首。这一成绩充分证明了该模型在语音转写领域的领先地位和卓越性能。随着技术的不断发展和完善,Muse Voice Transcribe有望为更多行业和场景带来便捷和高效的语音转写解决方案。

OpenAI将推下一代AI模型Astra 达“关键”门槛但功能访问受限
此外,OpenAI 还警告称,Astra的安全防护措施可能会错误地将合法的防御性网络安全活动标记为滥用行为,从而导致任务被减慢、暂停甚至终止(IT之家注:OpenAI 根据网络安全工作的性质分为“蓝队”防…

2026-09-02

Meta约七万员工转用Slack办公,适配AI智能体成核心迁移动因
【环球网科技综合报道】9月2日消息,据外媒BusinessInsider报道,Meta通过内部备忘录宣布,公司将把全体员工的内部通信工具,从Google Chat迁移至Salesforce旗下的Slack…

2026-09-02

搜狐财报亮眼背后:以活动为引,构建独特内容社交新生态
算法擅长提高内容消费效率,却也容易让用户停留在“刷到—看完—离开”的弱连接中;关注关系的建立则需要更长时间,但一旦形成,创作者与用户、用户与用户之间就可能产生持续互动。更重要的是,一条持续多年的业务路径正变得…

2026-09-02