豆包音频生成模型 1. 0 发布,开启「音频导演」时代
6 月 24 日
豆包音频生成模型 1.0 正式发布,具备多模态参考生成与长时音色一致性两大核心技术,可通过输入包含角色台词、情绪语气、背景音乐及环境氛围的 Prompt 直接产出完整音频成片,能在长音频创作中稳定保持角色声音特性,还拥有 0 样本多模态音频创造能力,支持文本描述或参考音频输入,无需额外训练即可生成高质量目标音频,实现音色与风格深度解耦及一声多角演绎,降低专业音频制作门槛。
体验专业版特色功能,拓展更丰富、更全面的相关内容。