关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro2766人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

阅读全文
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

辽宁一小米SU7起火 疑似车内易燃物点燃

网易汽车 浏览 4095

岚图冲刺港股0融资:车型“偏科”,年销目标前9月完成48.5%

尺度商业 浏览 5734

收视破1,全员狠人,我断言:央视这部剧,又要火向全国了

娱乐圈笔娱君 浏览 4514

安乃达等在南京成立智能机器人公司

财闻 浏览 2359

华境S登场在即 手捧华为智能全家桶走入寻常百姓家

网易汽车 浏览 4035

上市三周交付3603台!华境S跻身旗舰大六座第一梯队

车界江湖car 浏览 1789

TCL科技110亿元收购LG Display中国业务

三言科技 浏览 5589

4年“伺候”4位总经理,水井坊公关一号位挂印封金

财经众议院 浏览 4890

女网红名下公司涉嫌逃税逾千万被查处 仍在高频次直播

红星新闻 浏览 9849

美军突袭马杜罗的秘密武器 遭特朗普披露

环球时报国际 浏览 4339

贝斯美实控人涉要约收购违规遭立案

中国经营报 浏览 5537

60年首次4200万美国人"断粮" 特朗普:快打民主党电话

红星新闻 浏览 11315

福建舰常驻地为三亚军港

人民网-人民日报 浏览 5254

前球员:湖人时期的奥尼尔无法统治当今NBA;约基奇会是90年代的独角兽

懂球帝 浏览 4831

中国社会科学院发布14项冷门绝学

经济观察报 浏览 6211

让大模型能自己想出安全方案——KAIST团队的突破性研究

科技行者 浏览 4319

隔空互撂狠话后白宫相见,佩特罗给特朗普提了一个建议

国是直通车 浏览 4268

马绩效:尤文对皇马机会多但把握差,很难说这就是积极的表现

懂球帝 浏览 5465

关系藏不住了?小S二女儿被曝恋情

小梊搞笑解说 浏览 5631

赛力斯联手字节打造"赛豆" 首款跨界车年内推出

网易汽车 浏览 1805

何炅51岁无妻无子,且不再隐瞒身体状况了?

艳儿说电影 浏览 5381
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1