关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro3716人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

阅读全文
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

王菲女儿李嫣疑恋爱!与帅气男生现身机场

二妹扯娱 浏览 5552

老外在中国的最酷打开方式

时尚COSMO 浏览 9109

富勒姆球队大巴在英联杯赛前和一辆货车剐蹭,车体出现大划痕

懂球帝 浏览 5715

德约科维奇仅训练12分钟便显露痛苦状态,澳网前景引发担忧

网球之家 浏览 5441

默茨送特朗普德国队球衣作为生日礼物 特朗普敷衍对待

极目新闻 浏览 180152

来搞笑的?超级杯花名册漏洞百出:照片古早且粗糙,译名叠词

懂球帝 浏览 4770

北美夺冠,中国票房从7.8亿跌到6400万,这块金字招牌算砸了?

靠谱电影君 浏览 6082

深圳松岗街道:以“开放性场景”创享技术可感、产品可触、产业互联“新模式”

中国商报 浏览 5600

玲花时隔4个月单人复出,曾毅近照憔悴暴瘦,凤凰传奇合体艰难

萌神木木 浏览 5355

果壳直击CES:具身智能下班时刻

果壳 浏览 5454

OptiScaler发测试版:抢跑AMD为Vulkan游戏开启FSR 4

IT之家 浏览 4952

中国人自己的敞篷跑车来了!腾势Z敞篷版曝光

优视汽车 浏览 5614

太好看了!!!「镖人」把我看激动了!

吐槽电影院 浏览 4801

2026年世界互联网大会亚太峰会下月在香港召开

财闻 浏览 4487

NBA球员工会:我们与明州人民站在一起,必须捍卫言论自由的权利

懂球帝 浏览 5929

前央视主持人水均益直播 额头顶"中国人"纸条否认移民

极目新闻 浏览 11917

马杜罗在出庭期间在纸上做笔记 对旁听席说"新年快乐"

环球网资讯 浏览 9095

家居巨头杀入汽车圈,为渠道跨界找到新解法

汽车公社 浏览 5450

TA:世界杯赛场是姆巴佩的福地,他将成为世界杯史上最佳球员

懂球帝 浏览 2351

买手机前必看!安兔兔1月性能排行更新:第一名甩开垫底近40万分

快科技 浏览 5340

美媒称马杜罗请求普京提供导弹等援助 佩斯科夫回应

环球时报国际 浏览 12206
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1