Skip to content
Artwork for 每日AI
每日AI · Yesterday · 26 min

Tencent AuK技术报告:开源语音生成与编辑基座模型 像改文档一样改录音

AuK是由上海交通大学与腾讯等机构联合开发的开源语音生成与编辑基座模型。该模型通过统一的自然语言指令界面,实现了语音合成、声学属性调整、副语言变换、内容编辑以及音频增强与分离五大功能。研发团队构建了包含30亿条指令音频实例的大规模数据集,并结合多模态大语言模型与混合流变换器架构进行训练。通过人类反馈偏好优化与强化学习,AuK在生成质量和指令遵循方面均达到领先水平。此外,经过蒸馏加速的AuK-Flash版本显著提升了推理效率,支持更快速的实际应用。这一成果已全面开源,旨在促进语音技术领域的复现与后续研究。

0:00-26:38

transcript

No transcript — this publisher did not publish one.

show notes

AuK是由上海交通大学与腾讯等机构联合开发的开源语音生成与编辑基座模型。该模型通过统一的自然语言指令界面,实现了语音合成、声学属性调整、副语言变换、内容编辑以及音频增强与分离五大功能。研发团队构建了包含30亿条指令音频实例的大规模数据集,并结合多模态大语言模型与混合流变换器架构进行训练。通过人类反馈偏好优化与强化学习,AuK在生成质量和指令遵循方面均达到领先水平。此外,经过蒸馏加速的AuK-Flash版本显著提升了推理效率,支持更快速的实际应用。这一成果已全面开源,旨在促进语音技术领域的复现与后续研究。