关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro2768人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

阅读全文
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

闪电快讯|海信发布影游旗舰E8S,RGB-Mini LED价格下探

电厂 浏览 4390

舒淇,东亚女孩的恨海情天

时尚COSMO 浏览 4335

萨顿力挺凯恩:英格兰从未有过几个比他更好的球员

懂球帝 浏览 5525

阿里腾讯一起投!理想前高管组团做机器人,半年融了20亿

财通社 浏览 3639

黎巴嫩总统谴责以军空袭贝鲁特

上观新闻 浏览 5059

满配华为全家桶 岚图追光L将上市

网易汽车 浏览 4980

许绍雄葬礼设公祭时段,开放公众致意,曝他去年查出肾脏有肿瘤

扒虾侃娱 浏览 5198

内维尔:B费的表现就像坎通纳;曼联的表现体现了球队的DNA

懂球帝 浏览 4513

德国15人“大军”突然撤离格陵兰 原因公布

澎湃新闻 浏览 8637

邱泽妈妈没想到 这个女人竟把她儿子狠狠“拿捏”

黄小仙的搞笑视频 浏览 4844

扎哈罗娃:俄罗斯保留对日本采取强硬回应的权利

环球网资讯 浏览 5029

再创历史新高!2025年粮食产量达14298亿斤

央视财经 浏览 4462

窦靖童帮帮唱,亲妈亲爸继父四选一你选谁?

TVB的四小花 浏览 1682

洪秀柱警告日本别惹事:小日本不要太嚣张

北京日报 浏览 3544

以2.5吨白银建造的湖南“永兴银楼”被拍卖,其中1.75吨纯银折算1204.7万元,每克仅6.88元“白菜价”,委托方回应

极目新闻 浏览 4364

贵=好用?这个刚需我们试了一堆才选到合适的

黎贝卡的异想世界 浏览 5644

格拉斯纳:看起来伊斯梅拉-萨尔喜欢踢利物浦,他总是能进球

懂球帝 浏览 5350

聂卫平告别仪式:兰莉娅变化大

古希腊掌管松饼的神 浏览 4459

闫学晶首现身再传噩耗,这回真洗不白了

草莓解说体育 浏览 4509

杭州龙井山偶遇周杰伦,一身休闲难掩酷劲

乡野小珥 浏览 3075

特斯拉两员大将,被小米挖走了!马斯克花5000万留人

象视汽车 浏览 2944
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1