Mistral AI 发布 Voxtral Transcribe 2 系列语音转文字模型,其一延迟不足 0.2s

2026-02-05 15:38 IT之家 - 溯波(实习)

IT之家 2 月 5 日消息,Mistral AI 当地时间昨日发布两款 Voxtral Transcribe 2 系列模型,包括面向批量处理的 Voxtral Mini Transcribe V2 和用于实时转录的 Voxtral Realtime,其中后者以 Apache 2.0 许可开放权重形式公开。

Voxtral Realtime 参数规模为 4B,专为对延迟要求严格的应用场景而设计,其采用了一种全新的流式架构,可在音频到达时立即进行转录,能将转录延迟压缩至 200ms 以下

另一方面,Voxtral Mini Transcribe V2 拥有目前性价比最高的转录 API,准确率表现优于 GPT-4o mini Transcribe、Gemini 2.5 Flash,单次请求可处理长达 3 小时的录音。

这两款模型均支持包含中文在内的 13 种语言。定价上,Voxtral Mini Transcribe V2 的 API 价格为每分钟 0.003 美元,Voxtral Realtime 则为每分钟 0.006 美元。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

文章价值:
人打分
有价值 还可以 无价值
置顶评论
    热门评论
      文章发布时间太久,仅显示热门评论
      全部评论
      一大波评论正在路上
        取消 发送
        分享成功

        长按关注IT之家公众号
        阅读更多精彩文章

        查看更多原创好文
        软媒旗下人气应用

        如点击保存海报无效,请长按图片进行保存分享