字节发布 Seed Audio 1.0 音频创作模型:支持精细时间控制,音色风格可控、长时稳定
最新 7 月 20 日消息,字节跳动 Seed 官方今日发布了音频创作模型 Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。

官方宣称,声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”,其核心能力主要体现在以下方面:
多要素统一编排,支持精细的时间控制:一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。
音色风格可控,长时稳定:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。
多语种自然生成:支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。
据介绍,在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

在多场景音频生成能力上,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,多数场景中的音频可用率已达到 90% 以上。

针对多语言音频生成能力,在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;在复杂音频生成的指令遵循上,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

目前,Seed Audio 1.0 已在火山方舟体验中心上线,最新附相关链接:
https://seed.bytedance.com/seedaudio1_0
《字节发布 Seed Audio 1.0 音频创作模型:支持精细时间控制,音色风格可控、长时稳定》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
爱芯元智揭晓元曦系列大算力产品,A 系列 AI 推理卡算力超 1000TOPS
该产品线品专攻高并发高负载场景,基于其自研爱芯通元混合精度 NPU 架构。... -
(更新:马斯克否认)鸿海首度夺下 SpaceX AI 服务器代工订单,总价高达 520 亿美元
鸿海首次获得 SpaceX 的 AI 服务器代工订单,价值高达 520 亿美元,将打破戴尔、超微的长期垄断。订单涉及超 1.3 万个英伟达 GB300 服务器机柜,预计今年四季度开始交付。#鸿海# #SpaceX# #AI服务器#... -
把 256 张 GPU 变成一台计算机:摩尔线程 MTT C256 超节点亮相 WAIC 2026
2026 世界人工智能大会已于 7 月 17 日在上海揭幕,摩尔线程在本次大会上首次公开展示了 MTT C256 超节点。据介绍,摩尔线程通过创新架构首创了一层 Scale-up 网络,将 256 张 GPU 有效聚合为一台数据中心级超级计算机。#WAIC2026# #摩尔线程#... -
再来两周:腾讯混元大模型 Hy3 限免活动延长至 8 月 5 日
腾讯混元大模型 Hy3 的两周限免活动即将结束之际,因用户反响热烈,腾讯决定为 WorkBuddy 和 CodeBuddy 用户将活动延长至 8 月 5 日。Hy3 作为快慢思考融合的 MoE 模型,在推理、智能体等任务上表现出色,性价比高。#腾讯混元# #AI模型#... -
我国人形机器人整机产品超全球半数
工业和信息化部 7 月 20 日发布数据显示,上半年,我国一批具有国际竞争优势的产业加快壮大。智能机器人领域,我国研发的四足机器人占全球销量份额接近 70%,人形机器人整机产品达 400 余款、超全球半数。#我国人形机器人整机产品超全球半数#...












