从“会说”走向“会创作”| Seed Audio 1.0 音频创作模型发布

从“会说”走向“会创作”| Seed Audio 1.0 音频创作模型发布

日期

2026-07-20

分类

模型发布

对音频创作者而言,生成单一音频要素并不困难,真正困难的是让台词、音效等各类声音在同一场景中自然配合,服务于叙事和情绪表达。长期以来,这类创作往往依赖多个模型分别生成,再通过人工拼接、对齐和混音完成,不仅流程冗长,也难以兼顾整体完成度与控制精度。

今天,我们很高兴向你介绍音频创作模型 Seed Audio 1.0,它面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到 “听见” 即 “看见”。

其核心能力主要体现在以下方面:

  • 多要素统一编排,支持精细的时间控制:一条 prompt 即可统一编排带有特定情绪的对白、关键音效和环境声,并可按时间线精准控制声音进场。

  • 音色风格可控,长时稳定:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。

  • 多语种自然生成:支持 20+ 语种的音频生成,同一角色声音可依据不同语种的特点,呈现更自然的发音、节奏与表达方式。

目前,Seed Audio 1.0 已在火山方舟体验中心上线,欢迎大家体验,用声音表达创意。

项目主页:

https://seed.bytedance.com/zh/seedaudio1_0

体验入口:

https://ark.volcengine.com/region:cn-beijing/experience/voice?_vtm_=a441938.b28928.0_0.0_0.0.242_7661095862207497779&model=doubao-seed-audio-1-0

从拼接生成到完整声音场景生成

过去,完整音频内容的生产通常依赖多环节拼接。要打破这种级联方式,实现完整声音场景的生成,模型至少需要跨越三个门槛:

  1. 兼顾多类声音的细节保留。不同类型音频对表征的要求并不相同:语音看重清晰度和韵律,环境声则要求空间氛围持续稳定。模型需具备足够强的声学细节建模能力。

  2. 理解并生成完整声音场景。一段完整音频里,各音频要素间存在时间关系、情绪关系和声学互动,彼此关联、相互影响,模型要理解的是整个声音场景。

  3. 遵循多种指令控制。模型不仅要有生成质量,还要能够服从文本、参考音频、时间轴和角色设定等多种条件,使声音在合适的时间、以合适的方式出现。

Seed Audio 1.0 的核心思路,是将不同的音频要素放在统一框架下理解与生成,学习更复杂的联合分布。为此,我们训练了一个通用声学编码器,将各类音频要素视为同一声音场景中的组成部分,映射到统一的声学表征中,而非将多类音频作为独立任务编码。

基于这种统一建模方式,模型能够更自然地组织角色语气、背景氛围和声音节奏,让输出更接近一段完整作品,而不是一组拼接起来的素材。这也是我们更愿意将 Seed Audio 1.0 称为 “音频创作模型” 的原因。

Seed Audio 1.0 可生成兼具角色互动、情绪推进和氛围营造的复杂音频作品,支持专题叙事、剧情对话、主播互动等典型场景。

在真实创作环境中,声音出现的时机同样关键。它会直接影响节奏推进、情绪表达,以及一段内容能否真正成立。

Seed Audio 1.0 能先将创作意图拆解成结构化时间线,明确角色、台词、情绪和音效的进入时机,从而控制不同声音何时出现、如何衔接,以及怎样更自然地服务剧情。

基于此,Seed Audio 1.0 支持精准时间控制生成,创作者可以在 prompt 中指定角色台词的时间安排,当前时间控制支持 100ms 间隔精度。对于视频配音、视频翻配、广告片等场景,这项能力尤其关键。

音色立得住、接得上、演得开

Seed Audio 1.0 支持零样本音频生成。创作者既可以直接用文字描述目标声音,也可以结合参考音频进一步控制生成结果,而无需为每一种声音单独训练模型。

对真实创作来说,这意味着在前期尚未明确最终声音方案时,创作者可以先快速试出方向,再围绕更合适的音色与表达继续细化,从而减少反复试音和后期返工的成本。

与此同时,在长音频创作场景中,有声书、播客、长剧集和多人对话都要求角色声音前后一致,一旦出现明显音色变化,听众很快就会出戏。传统制作中,这通常需要配音演员长时间连续录制,或者依赖后期反复比对和修正。

针对这一问题,Seed Audio 1.0 支持基于参考音频进行延展生成,当前单次可生成约 2 分钟音频,并可在此基础上继续延长,同时保持角色音色与表达方式一致。

不过,稳定并不意味着表达单一。Seed Audio 1.0 在保持角色辨识度的同时,也支持同一音色自然呈现不同情绪、场景和表达方式。它支持“单音色、多角色”能力,同一音色可以通过差异化演绎塑造不同人物,从而拓展配音、叙事类内容和创意音频的创作空间。

多语种生成,声音表达更地道

多语种创作,不只是内容翻译,而是让声音的节奏、重音、停顿与情绪都更符合目标语言的表达方式。

Seed Audio 1.0 支持同一音色在多种语言中的自然迁移,并已覆盖 20+ 语种,包括中文、英文、日语、韩语、西班牙语、印尼语、德语、法语、泰语、越南语等。

对于出海内容、游戏本地化、品牌广告、多语种播客和短视频创作来说,这意味着一个创意不必在每个语言市场重新制作,而可以基于同一角色或音色设定,高效地扩展出多语言版本。

评测结果

为了更全面地验证 Seed Audio 1.0 在真实创作任务中的表现,我们从文本生成音色、多场景创作和多语种生成三个维度进行了评估。

在文本生成音色能力上,Seed Audio 1.0 在 AB 主观评测中表现出显著优势,可用率和优良率也明显提升。

Seed Audio 1.0 在文本到音色任务上与其他模型的主观评测结果

在多场景音频生成能力上,我们进一步评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景。结果显示,多数场景中的音频可用率已达到 90% 以上。

Seed Audio 1.0 按场景拆分的条件音频到音频生成评测

Seed Audio 1.0 按场景拆分的条件音频到音频生成评测

针对多语言音频生成能力,我们从指令遵循和音频自然度两个维度进行了人工评测。结果显示,在音频自然度上,大部分语言的 MOS 超过 4 分,音质已达到优秀水准;复杂音频生成的指令遵循能力,除越南语外,其余语言的 MOS 均高于 3.5 分,表明 Seed Audio 1.0 已具备较强的多语言指令遵循能力。

Seed Audio 1.0 在 “文本生成音频” 和 “音频生成音频” 两类任务上的效果

Seed Audio 1.0 在 “文本生成音频” 任务上的效果

写在最后

从“会说”到“会创作”,Seed Audio 1.0 迈出了重要一步。

以 Seed Audio 1.0 为起点,我们希望进一步拓展模型在真实创作流程中的能力边界,通过模型框架创新支持视频参考等更多模态输入,并满足长音频、分轨等更复杂的音频生成需求。同时,我们也将探索把 Seed Audio 与可控翻译结合起来,提升模型在多语种场景下对内容表达和时长约束的控制能力。

未来,我们希望音频生成朝着更自然、更可控、更贴近创作流程的方向继续演进,让创作者轻松将脑海中的声音变成可听见的作品。