关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro2646人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

阅读全文
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

神舟二十号飞船以无人状态安全顺利返回,面对新挑战,更多任务细节公布

上观新闻 浏览 4401

闫学晶风波再次升级,娱乐圈多位明星躺着中枪,唯独一人成为赢家

徐帮阳 浏览 4378

网红坠机起火身亡 村民:我们赶到时人还绑在飞机上

封面新闻 浏览 39669

高市早苗当选日本首相 成为日本历史上首名女首相

环球网 浏览 10361

乐道推7年超低息金融方案 年化费率低至0.49%

网易汽车 浏览 4395

交锋升级,贝弗利再diss特雷-杨:你是擅长得分助攻,但你是数据刷子

懂球帝 浏览 6219

毒枭留下的80头河马被捕杀前获救 亚洲富豪:我全要了

中国新闻周刊 浏览 96587

中国机器人组团出征CES,加速进化首日售出数十台,魔法原子海外收入占比过半

红星资本局 浏览 4390

特朗普访日 高市早苗将罕见与其共同搭乘美国总统专机

新京报 浏览 11100

奥斯瓦尔多:我想看到迪巴拉加盟博卡,但他不大可能去

懂球帝 浏览 4790

史上头次只有6人拍总决赛合照,ATP骚操作引球迷众怒:德约呢?

网球之家 浏览 5228

从“元宝”到“龙虾”,腾讯能否在AI领域复制微信的生态神话?

征探财经 浏览 3652

中金公司出席第19届亚洲金融论坛,以国际化投行实力融通世界

时代周报 浏览 4350

波音圣路易斯地区罢工持续近三月,谈判陷入僵局

国际金融报 浏览 5267

E句话|李雨桐又来锤薛之谦了?

仙女事件簿 浏览 3758

一年蛰伏,亮剑CES:吉利智驾业务深度整合后,交出怎样一份全球化答卷?

封面新闻 浏览 4524

50+女人快跳出“扮嫩”误区,学会4个技巧,就能穿出高级

静儿时尚达人 浏览 5290

消息称三星Galaxy S26系列手机将首次提供2400万像素切换开关

IT之家 浏览 4400

全新旗舰SUV 蔚来ES9将于第二季度正式上市

车质网 浏览 4392

王勤伯:美感足球给AI足球上一课!巴黎拜仁谱传奇

体坛周报 浏览 2407

3年半亏损289亿,华侨城A换帅,人均薪酬15.5万元

华美财经 浏览 6231
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1