AuK:腾讯混元开源的语音生成与编辑统一基础模型深度解读
论文:《AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing》(arXiv:2609.08936,2026-09-08) 开源地址:https://github.com/Tencent-Hunyuan/AuK 核心作者:Ziyang Ma、Zhikang Niu、Xie Chen(通讯作者)等——正是 F5-TTS 原班人马,联合腾讯混元、上海交大、南洋理工完成。
一、为什么需要"统一"的语音模型
当前的语音生成领域,能力被拆散在一堆专用模型里:想做零样本声音克隆要用一个模型,想改一句话里的某个词要用另一个,想给语音换个情绪、去个口音、分离出某个说话人、修复一段带噪录音,各自又需要不同的系统。对用户体验和工程维护来说,这种碎片化代价很高。
而把这些能力"塞进"一个模型又有三重困难:
- 输出约束本质不同:生成是凭空创造;内容编辑只能改动指定区域;副语言/声学编辑必须保留语言内容;增强与分离则要按指令保留场景中的特定成分。
- 条件接口不统一:有的任务只吃文本,有的需要对指令 + 源音频/参考音频做联合推理。
- 监督与评估高度异构:生成任务有 WER、说话人相似度这类可规模化的自动指标;开放式编辑则依赖自然度、编辑强度、上下文恰当性等主观判断。
AuK 给出的答案是一个统一接口:一条自然语言指令 + 可选的音频上下文 → 目标波形。五大任务族全部收敛到这个形式:
| 任务族 | 典型能力 |
|---|---|
| 语音生成 | 零样本 TTS(免参考文本)、指令 TTS(用文字"描述"一个声音) |
| 声学编辑 | 语速(0.5x~2.0x)、音高(±3 半音)、响度(±15 dB) |
| 副语言编辑 | 情绪、音色、去口音、非语言声音(笑声/咳嗽等 39 类)增删、耳语转换 |
| 内容编辑 | 口语词的插入/删除/替换、歌词编辑 |
| 增强与分离 | 语音增强、多说话人分离、人声/伴奏分离、语音超分 |
二、数据工程:30.3 亿条指令-音频实例
AuK 构建了约 30.3 亿条指令-音频实例、195 万小时有效监督,全部采用统一的"指令 + 输入音频 + 目标波形"三元组格式。几个值得一提的数据构造思路:
零样本 TTS:免转写的跨句内上下文学习。 传统方案要求参考音频 + 参考文本,部署时还得挂一个 ASR。AuK 对同一说话人的 n 条不同语句枚举所有配对(n×(n−1) 个双向实例),每条实例只给提示语音和目标文本,从不提供提示音频的转写。这迫使模型把"说话人不变特征"和"语句级因素"解耦,推理时给一段完整参考或随机裁剪的片段都能克隆。
指令 TTS:用 Qwen3-Omni 给每条语音打自由文本描述,覆盖性别、年龄、语速、清晰度、流利度、嗓音状态、语调、响度、音色、音高、口音、情绪、性格等结构化属性,教会模型"按描述设计声音"而非"按参考模仿声音"。
编辑类数据大量采用"确定性变换 + 定向合成"的成对构造: - 声学编辑直接用信号处理生成配对(保持音高的时间伸缩、保持时长的变调、波形增益),并做削波保护; - 情绪编辑用 Qwen3-TTS-CustomVoice 合成情绪参考,再用 IndexTTS2 在固定转写下迁移情绪; - 去口音数据覆盖 13 类中文方言/地域口音,用 CosyVoice2 + OmniVoice 合成"同音色标准普通话"目标; - 内容编辑用 Qwen3-ForcedAligner 做词级对齐,只掩码编辑区间,再用 F5-TTS 做局部掩码填充,保证未编辑区域原样保留。
增强与分离的关键设计是"选择性目标":训练目标不一定是完全干净的语音——去噪目标可以保留混响,去混响目标可以保留环境声。模型由此学到"增强是指令依赖的":同一个成分,这条指令要删,那条指令要留。多说话人分离也构造了带轮换、停顿、打断、重叠的"真实对话式"混音,指令可以用说话内容、顺序、相对响度或时间戳来指认目标说话人。
三、模型架构:MLLM + VAE + 混合流 Transformer
AuK 由三个互补组件构成:
指令文本 ──┐
├─→ Qwen2.5-Omni(冻结)─→ 逐层隐状态加权求和 ─→ 语义条件 c_sem ─┐
参考音频 ──┘ │
├─→ M×双流 MMDiT ─→ 拼接 ─→ N×单流 DiT ─→ 速度场 v̂ ─→ VAE 解码 ─→ 波形
参考音频 ──→ AuK-VAE 编码器(冻结)─→ 参考潜变量 z_ref ─┐ │
高斯噪声 ──→ 带噪目标潜变量 z_t ────────────────────────┴─→ 声学条件流 ──────┘
1)MLLM 语义条件:Qwen2.5-Omni 的"层级融合"。 单一输出层未必是各类任务的最优条件——不同深度的表示分别捕获语言、声学与跨模态线索。AuK 把 Qwen2.5-Omni 所有 L 层的隐状态各自 LayerNorm 后做可学习标量加权求和:c_sem = Σ w_ℓ · LayerNorm(h^(ℓ))。有参考音频时指令与音频联合编码,纯文本任务只编码指令。
2)AuK-VAE:语音、通用音频、音乐三域联合训练的连续潜空间。 工作于 24 kHz,编码器把波形压到 64 维、50 Hz 的潜变量(总下采样 480 倍);训练时用 4 层残差耦合 normalizing flow 正则化潜分布,推理时在原始潜空间操作。解码器是 BigVGAN 风格的因果结构(SnakeBeta 激活 + 抗混叠多周期模块),编码器非因果。训练数据约 300 万小时,语音:音乐:通用音频 = 6:3:1,共 124 万步;损失为多尺度 log-mel L1 + 多周期/多尺度 CQT 判别器的 LSGAN 对抗损失 + 特征匹配 + KL(权重 15/1/2/5)。
3)Transformer 主干:FLUX 风格混合整流流(rectified flow)Transformer。 共 30 层:10 层双流 MMDiT + 20 层单流 DiT,隐层 1536、24 头(head dim 64)、SwiGLU FFN 中间维 3072,约 15 亿参数。双流块里语义流与声学流各自持有 Q/K/V 和残差通路,只在注意力处拼接做联合交互;随后两流拼接进入单流块精炼,预测流匹配速度场。位置编码沿用 F5-TTS 的 RoPE + 卷积位置嵌入设计,配合 RMSNorm QK-Norm 和零初始化的时间条件 AdaLN。
四、训练流水线:预训练 → 偏好优化 → 强化学习
统一预训练(两阶段课程):先纯生成任务热身 5 万步,建立稳定的文本-语音对齐;再联合生成 + 编辑训练 60 万步。全程 MLLM 和 VAE 冻结,只训 Transformer 主干。
- 流匹配目标:z_t = (1−t)z₀ + t·z₁,预测 v = z₁ − z₀,掩码 MSE;t 通过 sigmoid(N(−0.8, 0.8²)) 采样,偏向噪声更大的低 t 区间。
- 层级条件丢弃支撑 CFG:先以 0.3 概率丢声学条件,再以 0.2 概率无条件(同时丢语义+声学)。
- 任务混合比例:生成 28.1%、内容编辑 23.0%、增强分离 23.2%、副语言编辑 21.8%、声学编辑 4.0%。
- 基础设施:256 卡 GPU,DeepSpeed ZeRO-2 + bf16,AdamW 峰值学习率 1e-4,EMA(0.9999) 权重用于评估和发布。
后训练采用"编辑走偏好优化、生成走 RL"的互补双轨——这是 AuK 很有意思的一个设计决策:
- 编辑偏好优化:开放式编辑没有现成的奖励模型和偏好数据集,团队直接收集人类反馈——每条指令采样 10~20 个候选,标注员按 {失败/部分完成/成功} 三级评分,过滤后得到 818 组、9080 个候选。训练上用 Diffusion-DPO 式的流匹配误差改进量作为隐式偏好分数(同组候选共享噪声与时间步重新评估,隔离出目标潜变量的差异),再套 LiPO 的序数列表级目标做两级归约。只训了 104 步。
- 生成强化学习(Flow-GRPO):1 万条零样本提示(中英各 5 千,按参考时长分层,含重复词/重复句等困难文本)+ 5 千条按薄弱维度定向过采样的指令 TTS 提示。采样改为 SDE 以获得探索性,按 MixGRPO 只在轨迹前半段低信噪比区域的 6 步窗口内做随机采样和梯度计算。奖励设计有三层:
- 内容正确性:区分宽容错误率(同音字替换不算发音失败)与严格错误率,后者与目标文本 NLL 融合成细粒度排序信号;
- 说话人相似度:候选与参考的声纹余弦相似度,且只在内容全对的候选内部标准化——堵死了"用高相似度补偿错误内容"这一经典 reward hacking 路径;
- 风格一致性:基于 Qwen2.5-Omni-7B 训练专用奖励模型(3 万条 1:1 正负样本),推理时多次询问取多数投票。
五、AuK-Flash:4 步推理、4.5 倍加速的蒸馏版
完整模型需要 32 次函数评估(NFE)+ CFG=2.0,推理昂贵。AuK-Flash 通过两阶段蒸馏实现 4 步、免 CFG 推理,同硬件同输出时长下墙钟加速 4.5 倍:
- 一致性初始化(500 步):从教师初始化学生,做轨迹级一致性蒸馏,让学生把任意噪声状态直接映射到采样轨迹终点。论文对比了 Self-Forcing、MeanFlow 等替代方案,一致性蒸馏在匹配更新数下最稳。
- 任务路由的 Decoupled DMD + APG(学生 2500 步,每步配 5 次 fake-score 更新):Decoupled DMD 把学生更新拆成"CFG 增强(CA)"和"分布匹配(DM)"两个在独立重加噪预测上评估的分支。两个实战修正很关键: - CA 分支直接用教师 CFG 目标会让少步学生产生过饱和预测(过冲、可闻削波),换成 APG(自适应投影引导) 抑制过度引导分量; - 对分离任务统一套 DMD 会导致输出退化回未处理的混合音频(错误的分离输出重加噪后落在教师训练分布之外,教师场偏好"全局合理但分离不足"的结果)。解决方案是按任务路由:分离样本走有监督的干净潜变量回归损失,并从 DMD 两侧更新中剔除。
推理侧还有一个 Prompt Enhancer(PE):用 LLM 对自由请求做任务路由、指令改写、参数合法性校验(口语化的语速/响度/音高描述映射到训练覆盖的离散档位),并按任务用不同启发式估计输出时长(如零样本 TTS 按 UTF-8 字节长度比例缩放、变速编辑按倍率倒数、指令 TTS 由 LLM 结合风格修正)。论文坦承:没有 PE 的原生自由指令跟随还不够鲁棒——这是"拥有能力"和"可靠唤起能力"之间的普遍鸿沟。
六、实验结果:生成与编辑全面领先,修复类任务有竞争力
VAE 重建:在语音(Seed-TTS-Eval)、通用音频(AudioSet)、音乐(MUSDB18-HQ)三个域上,AuK-VAE 的 PESQ/STOI/Mel 距离/STFT 距离全部第一,语音域 PESQ 达 4.143(次优 MiniMax-H3-AudioVAE 为 3.633)。
零样本 TTS(Seed-TTS-Eval):
| 模型 | WER↓ (en/zh/zh-hard/avg) | SIM↑ (avg) |
|---|---|---|
| Seed-TTS | 2.25 / 1.12 / 7.59 / 3.65 | 0.778 |
| Qwen3-TTS | 1.23 / 1.22 / 6.76 / 3.07 | 0.745 |
| VoxCPM2 | 1.84 / 0.97 / 8.13 / 3.65 | 0.767 |
| AuK | 1.02 / 1.02 / 5.91 / 2.65 | 0.795 |
| AuK-Flash | 1.03 / 1.10 / 6.43 / 2.85 | 0.790 |
平均 WER 从最强基线 Qwen3-TTS 的 3.07% 降到 2.65%,SIM 从 Seed-TTS 的 0.778 提到 0.795,两项指标同时登顶。
指令 TTS(InstructTTSEval DSD):AuK 中文 ACC 83.37%,超过 Qwen3-TTS-VD 2.27 个百分点;AuK-Flash 英文 82.40% 并列最佳。
通用语音编辑: - MMAE-Speech:IFR 48.23%、CR 88.11% 均为最高(此前最强 Step-Audio-EditX 为 43.52%/77.27%);Flash 的 EMR 13.85% 近乎翻倍于 Ming-UniAudio 的 7.04%。 - SpeechEditBench:内容编辑 91.83% vs Ming-UniAudio 76.46%,韵律编辑 71.33% vs 26.50%。 - Ming-Freeform-Audio-Edit:Full-ZH 平均 WER 从 10.46% 压到 3.09%,Full-EN 从 14.28% 压到 3.96%。
增强与分离(对比 SAM-Audio-Large、AnyEnhance、RE-USE、MossFormer2-SS 等专用/通用系统):DNS Challenge dWER 2.66%、SIM 0.99 均为最佳;CHiME-4 Flash WER 7.84% 大幅领先 RE-USE 的 10.71%;Libri2Mix 分离 WER 9.12%;VCTK-SR 超分上 Flash 拿下 7 项指标中的 6 项。整体在信号级修复任务上"有竞争力",部分指标(如 DNSMOS-OVRL)略逊于专用增强系统,但一个模型能同时打平这么多专用赛道已属罕见。
两个有趣的涌现发现: 1. 跨任务迁移:训练数据只有"正常语音↔耳语"的编辑对,模型却学会了直接从文本 + 风格指令合成耳语——编辑学到的变换迁移到了生成。 2. 跨语言迁移:去口音监督只覆盖中文方言,模型却能减轻英语中的印度口音、日本口音,且基本保留说话人身份。统一训练似乎把某些声学变换从"监督它的语言和任务"中解耦了出来。
七、总结与思考
AuK 的价值可以从三个层面看:
- 路线层面:它验证了"指令 + 音频上下文 → 波形"这一极简统一接口足以承载生成、编辑、修复三大类十几族任务,且性能不输甚至超越各赛道专用模型。这与图像领域 FLUX/SD3 用 MMDiT 统一文生图与图像编辑的演化路径高度同构——AuK 本身就是把 FLUX 式混合架构 + 流匹配搬进音频域的产物。
- 工程层面:数据构造是这篇报告最厚重的部分。30.3 亿实例里大量采用"确定性信号处理 + 现有模型定向合成 + 严格质量回收"的流水线,用 F5-TTS、CosyVoice2、IndexTTS2、Qwen3-TTS 等开源/可用模型互为数据引擎,这套方法论对任何想构建多任务音频模型的团队都有直接参考价值。
- 对齐层面:"编辑走人类偏好优化、生成走自动奖励 RL"的双轨后训练,以及"内容全对才纳入相似度标准化"这类防 reward hacking 的细节,体现了对语音任务奖励结构差异的深刻理解。而任务路由蒸馏(分离任务绕开 DMD)则说明少步蒸馏不是通用配方,必须尊重任务间的分布特性。
局限也很明确:原生自由指令跟随仍依赖 Prompt Enhancer 做任务路由和指令规范化;信号级修复与最顶尖专用系统尚有差距。论文把"提升原生指令接地与组合泛化、降低对显式任务路由的依赖"列为未来方向。
代码与权重均已开源(GitHub: Tencent-Hunyuan/AuK),对于语音方向的开发者,这可能是目前能力覆盖面最广、可直接落地的开源语音基础模型之一。
参考资料 - AuK Technical Report, arXiv:2609.08936, 2026-09-08 - GitHub: https://github.com/Tencent-Hunyuan/AuK - 相关工作:F5-TTS (arXiv:2410.06885)、FLUX/SD3 (arXiv:2403.03206)、Flow-GRPO、MixGRPO、Decoupled DMD、LiPO、Diffusion-DPO
posted on 2026-09-10 11:22 fox_charon 阅读(68) 评论(0) 收藏 举报
浙公网安备 33010602011771号