关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro3850人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

阅读全文
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

卡位AI算力基建狂潮,鸿辉光通加快实现向光器件隐形龙头的蜕变

第一财经资讯 浏览 7250

徐帆带徐朵参加活动,徐朵发文回应质疑

无处不风景love 浏览 5485

你觉得美,可能是大脑在偷偷节能|光锥读论文

未来光锥 浏览 5980

AI如何助力空调“降温”过程中更节能,珠海这场论坛揭秘

南方都市报 浏览 6669

荣梓杉出轨约妹照曝光!与李禹熹控诉时间吻合,还曾要求对方删照

萌神木木 浏览 5411

中国排名前五的储能企业未来三年有望占据全球50%以上市场份额

澎湃新闻 浏览 6563

国米vs凯拉特首发预测:巴雷拉踢后腰,劳塔罗继续首发搭皮奥

懂球帝 浏览 6513

或为黄色特别版 斯巴鲁BRZ新车型预告图发布

车质网 浏览 6769

统治力!罗诗芳卫冕全运会女子举重59公斤级金牌!

体坛周报 浏览 6431

美军参联会主席警告:对伊朗动武可能带来重大风险

央视新闻客户端 浏览 5034

我国建成全球最大可再生能源体系,十年来风光发电新增装机占六成

IT之家 浏览 6516

周星驰新片被传空降春节档,制作成本3.8亿,票房能否冲击40亿

娱乐圈笔娱君 浏览 5462

曝窦骁婚变原因!何超莲曾怀孕又流产,相关照片被扒女方变化明显

萌神木木 浏览 6609

在罗塞尼尔执教的13场比赛中,切尔西因定位球丢了7球

懂球帝 浏览 4909

高通踩线,中国出手:车载芯片并购进入高压区

钛媒体APP 浏览 6842

杀进世乒赛四强!国乒男团3-0复仇韩国,林诗栋+梁靖崑同时立大功

侃球熊弟 浏览 3507

精读季报丨好气!姜诚管理规模掉到115亿元,相较巅峰缩水1/4

一地基毛 浏览 5389

亚马逊跻身3万亿美元俱乐部

北京商报 浏览 1225

乌克兰一地遭俄军无人机密集袭击 基辅实施紧急停电

每日经济新闻 浏览 5590

父亲脑血栓瘫痪儿子正叛逆 母亲又气又痛告知儿子身世

红星新闻 浏览 99212

美联储,重磅来袭!降息传出大消息

券商中国 浏览 7158
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
沪ICP备20017958号-1