字节跳动发布 Seed Audio 1.0,一条提示词可以同时安排多角色对白、背景音乐、音效和环境氛围。它支持文本、参考音频或参考图片输入,单次最长生成 2 分钟音频。
一条提示词完成一段声音场景
普通 TTS(文字转语音)的主要任务是把文字读出来。Seed Audio 1.0 处理的对象是完整声音场景:同一次生成里可以包含多角色对白、笑声和叹息等非语言声音、背景音乐、拟音与环境声。
提示词需要像一份简短的声音脚本。可以写清场景、角色、台词、语言、语气、背景声和音效出现的时机。例如,想做一段雨夜咖啡店对话,可以把两个角色的声线与台词、窗外雨声、室内杯碟碰撞声和音乐风格写在同一条指令里。
模型返回的是混合后的音频文件,不是分开的人声、音乐和音效轨道。需要对单独声部做精细调整时,仍要进入音频编辑工具处理。
可用参考音频或图片控制结果
除了纯文本生成,Seed Audio 1.0 还可以接收参考音频或参考图片。音频模式最多支持 3 段参考片段,每段最长 30 秒,在提示词中用 @Audio1、@Audio2和 @Audio3 指定不同参考。图片与音频参考不能在同一次请求中混用。
参考音频可用于在不同片段中复用角色声音,也可以把已生成的片段继续延长。上传真人声音时,需要事先获得本人授权,不要把未获授权的声音用于生成或公开发布。
单次最长生成 2 分钟
Seed Audio 1.0 单次最长生成 2 分钟音频,可输出 MP3、WAV、PCM 或 OGG Opus 格式。这个时长适合短广播剧、广告样片、游戏声音草图和视频配音等单个片段。播客、有声书或连续剧情需要分段生成,再继续延长或拼接。
开发者调用时还可设置采样率、语速、音量和音高。这些参数调整的是输出规格和语音表现,场景内的角色、动作与氛围仍由提示词描述。
普通用户和开发者怎么用
普通用户可以打开火山方舟体验中心的 Seed Audio 1.0 入口,选择文本生音频,填写声音脚本后生成。想复用特定角色声音时,再添加已授权的参考音频。
开发者可以通过 fal.ai 的 bytedance/seed-audio-1.0 接口调用模型。该页面提供在线试用和 API,可直接提交提示词、参考音频或图片,生成完成后获取音频文件。


