OpenAI 升级 Whisper 语音转录 AI 模型,不牺牲质量速度快 8 倍
最新 10 月 3 日消息,OpenAI 在 10 月 1 日举办的 DevDay 活动日中,宣布推出了 Whisper large-v3-turbo 语音转录模型,共有 8.09 亿参数,在质量几乎没有下降的情况下,速度比 large-v3 快 8 倍。
Whisper large-v3-turbo 语音转录模型是 large-v3 的优化版本,并且只有 4 层解码器层(Decoder Layers),作为对比 large-v3 共有 32 层。
Whisper large-v3-turbo 语音转录模型共有 8.09 亿参数,比 7.69 亿参数的 medium 模型稍大,不过比 15.5 亿参数的 large 模型小很多。
OpenAI 表示 Whisper large-v3-turbo 的速度比 large 模型快 8 倍,并且所需的 VRAM 为 6GB,而 large 模型需要 10GB。
Whisper large-v3-turbo 语音转录模型大小为 1.6GB,OpenAI 继续根据 MIT 许可证提供 Whisper(包括代码和模型权重)。
最新援引 Awni Hannun 测试结果,在 M2 Ultra 上,将 12 分钟的内容转录为 14 秒。
GitHub:https://github.com/openai/whisper/discussions/2363
模型下载:https://huggingface.co/openai/whisper-large-v3-turbo
在线体验:https://huggingface.co/spaces/hf-audio/whisper-large-v3-turbo
相关文章
- 安卓平台吃上 AI,谷歌 Gemini Nano 轻量模型面向开发者
- 谷歌追赶 OpenAI,加速推进会“思考”的 AI 通用推理模
- OpenAI 雄心:2026 年销售额 256 亿美元,2029 年破 1000
- 谷歌 DeepMind 携手 BioNTech 打造 AI 科学助手:规划实
- 英特尔新版 AI Playground 上线:酷睿 Ultra 200V 笔记
- OpenAI 升级 Whisper 语音转录 AI 模型,不牺牲质量速度
- 谷歌 Lens 开启 AI 新篇章:视频、语音多维度拓展,搜索、
- 快手可灵 AI 新增“对口型”功能:生成人物口型与上传音
- 非 Transformer 架构 AI 模型 Liquid 问世,号称性能“
- 安卓版谷歌 Gemini Live 上线,助力 AI 开启全民语音聊