英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题
最新 7 月 8 日消息,英伟达于今年 6 月发表论文,推出 Audex(Nemotron-Labs-Audex-30B-A3B)统一音频-文本大语言模型,总参数量 30B,激活参数 3B,在保留核心文本智能情况下,能理解和生成音频(audio)和语音(speech)。
该模型骨干为文本模型 Nemotron-Cascade-2-30B-A3B,后者为 52 层混合 Mamba-Transformer 结构,包含 128 个可路由专家、每次激活 6 个专家。

该模型的设计目标是避免多模态扩展后文本能力下滑问题。论文显示,Audex 将音频输入编码后映射到文本嵌入空间,并把量化后的音频输出标记与文本标记统一处理。
在音频组件上,Audex 使用 AF-Whisper(音频编码器)处理 16kHz 输入,配合两层 MLP 适配器映射特征,输出词表从原始 131072 个 Token 扩展至 205312 个 Tokens。

语音输出采用 X-Codec2(语音编解码器),速率为每秒 50 个标记,使用单层 finite scalar quantization(有限标量量化),码本大小为 65536。非语音音频采用 X-Codec(音频编解码器),速率为每秒 200 个标记,使用 4 层展平残差向量量化。
文本评测方面,Audex 在 MMLU-Redux 上得分 86.4,高于骨干模型的 86.3;在 IMO AnswerBench 上为 81.1,高于骨干的 79.3,但在 MMLU-Pro 与 GPQA-Diamond 上出现小幅下降。
最新附上参考地址
Unified Audio Intelligence Without Regressing on Text Intelligence
《英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
华为昇腾 950 超节点荣获 2026 世界人工智能大会最高荣誉 SAIL 奖
@华为中国 昨日(7 月 18 日)发布博文,宣布昇腾 950 超节点(Atlas 950 SuperPoD)荣获 2026 世界人工智能大会(WAIC)最高荣誉 SAIL 奖。... -
“反 AI”情绪愈演愈烈,多家头部 AI 公司加强高管安保
《华尔街日报》报道称,针对 AI 行业的敌意不断上升,开发先进 AI 模型的人员和企业正面临越来越多的威胁与袭击企图。多家头部 AI 公司已经加强安保,部分高管出行时甚至由武装保镖随行,另一些人则选择降低曝光度,减少公开活动。... -
OpenAI 回应 GPT-5.6 Sol AI 意外删除用户文件:已采取措施降低风险
OpenAI 核心产品负责人蒂博 · 索蒂奥(Tibo Sottiaux)于 7 月 16 日在 X 平台发布推文,回应 GPT-5.6 Sol 会擅自删除用户文件问题。... -
面向手机的 AI 游戏创作工具,《Roblox》移动版将更新“Build”功能
Roblox 为移动版客户端推出“Build”功能,用户通过简单提示词即可生成基础游戏,无需编程技能。该功能由多种 AI 模型驱动,支持生成玩法、环境、角色等。将于 7 月 28 日开启 Alpha 测试,首先面向新西兰用户开放。#Roblox #AI 游戏创作 #移动游戏开发#... -
歌曲生成平台 Suno 部分源码泄露,被发现全网爬取数百万歌曲训练 AI
科技媒体 404Media 昨日(7 月 16 日)发布博文,报道称基于黑客披露的 Suno 内部源代码,该 AI 歌曲生成平台从 YouTube Music、Deezer 和 Genius 等平台抓取数百万首歌曲来构建其核心模型。...












