ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

同一个模型的两个版本:AuK 与 AuK-Flash 该下哪个?4.5 倍提速背后到底牺牲了什么

同一个模型的两个版本:AuK 与 AuK-Flash 该下哪个?4.5 倍提速背后到底牺牲了什么 同一个模型的两个版本AuK 与 AuK-Flash 该下哪个4.5 倍提速背后到底牺牲了什么【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK2026 年 9 月腾讯混元开源了 AuK——一个以自然语言指令统一语音生成与编辑的 1.5B 基础模型同时放出两个权重版本追求质量的 AuK 与主打 4 步推理、提速 4.5 倍的 AuK-Flash。对想要本地部署的开发者来说这几乎是立刻要做的第一个决策省下 4.5 倍的算力代价到底是什么是换了个几乎无损的轻量版还是把模型的核心能力悄悄砍掉了本文基于 AuK 技术报告arXiv:2609.08936的完整基准数据与仓库源码把蒸馏路径、推理成本账和质量损失逐一拆开最后给出按显存与场景的选型建议。两个版本同一套 1.5B 主干先明确一个容易误判的事实AuK 与 AuK-Flash 的参数量完全一致共享同一套架构——由 Qwen2.5-Omni-3B 多模态编码器提供语义条件、BigVGANFlowVAE 提供声学条件、以及一个 10 层双流 MMDiT 20 层单流 DiT 的混合整流流 Transformer 主干负责生成。仓库中的 config.yaml 把这一切写得清清楚楚backbone: Flux2Edit、dim: 1536、heads: 24、vae_name: BigVGANFlowVAE、downsample_rate: 480、latent_dim: 64、target_sample_rate: 24000。也就是说Flash 并不是参数更小的蒸馏版而是步数更少的蒸馏版。按 README.md 的说明仓库内发布的是AuK base 模型权重auk_base.safetensorsvae.safetensorsFlash 版本需要按同样方式从 Hugging Face / ModelScope 单独拉取两个变体的运行骨架完全相同——同一个 MLLM 编码器、同一个 VAE、同一份推理管线差异只发生在扩散采样的迭代次数与是否使用无分类器引导CFG上。这也是同一个模型的两个版本这句话的准确含义。AuK-Flash 的蒸馏路径与推理成本账完整模型的成本有多高按技术报告给出的推理配置表AuK 使用 EMA 后训练 checkpointEuler ODE 求解器需要32 次函数评估NFECFG 强度 2.0sweay 系数 -1.0。而 AuK-Flash 使用任务路由蒸馏 checkpoint只需4 次 NFE、完全关闭 CFG输出采样率、VAE 潜空间64 维 50Hz均不变。4.5× 的壁钟加速正是在相同硬件、相同输出时长、相同 batch size的对照条件下测得的——也就是说它不是 GPU 型号差异带来的红利而是蒸馏本身实打实的收益。Flash 是怎么少走 28 步的蒸馏不是一步到位的而是两阶段接力一致性初始化Consistency Initialization先用冻结教师模型即完整后训练模型CFG 2.0做轨迹级一致性蒸馏训练学生把任意噪声状态直接映射到采样轨迹端点让学生先具备 4 步采样的基础能力。报告明确提到在相同更新步数下一致性蒸馏比 ODE 回归CausVid 路线和 MeanFlow 都更稳。任务路由解耦 DMDTask-Routed Decoupled DMD第二阶段引入 Decoupled DMD把学生更新拆成 CFG 增强CA与分布匹配DM两个解耦分支。其中 CA 分支没有直接沿用教师的 CFG 目标而是换成自适应投影引导APG——因为直接迁移教师 CFG 会让少步学生产生过饱和预测导致过冲和可闻削波。这版蒸馏最值得注意的工程细节是任务路由分离类任务被整体从 DMD 更新中剔除。原因是作者观测到对多说话人分离和人声分离均匀施加 DMD 时学生的输出会退化、甚至回归到未处理的混合音频——重新加噪的错误分离输出落在教师训练分布之外教师场自然倾向于全球听起来合理但没真正分开的结果。于是对分离样本改用干净的潜空间回归损失只在非分离任务上跑 DMD。换句话说Flash 的 4 步能力本身就是靠按任务挑训练目标这种精细的取舍换来的。质量损失在哪些任务上最明显把两个版本在所有基准上的差异摊开见 性能基准对比图可以清晰地看到三类不同的代价曲线。第一类生成任务损失很小。零样本 TTSSeed-TTS-Eval 平均上AuK 的 WER 为 2.65%、音色相似度 SIM 0.795Flash 为 2.85%、SIM 0.790——差距微乎其微且在 test-zh-hard 这种最难的中文子集上 Flash 的 SIM0.784反而最高。指令 TTSInstructTTSEval DSD上则出现有趣的分化中文 DSD 从 83.37% 掉到 78.80%-4.6 个百分点英文 DSD 却从 81.60% 升到 82.40%、追平最强基线。如果你主要做 TTS 生成Flash 几乎无损英文场景甚至可能更好。第二类内容与声学编辑损失最明显。这是 Flash 代价最集中的领域。SpeechEditBench 五个编辑维度上内容编辑成功率从 91.83% 掉到 87.50%声学编辑从 37.07% 掉到 30.26%-6.8 个百分点相对损失约 18%情绪编辑从 9.94% 掉到 6.29%。Ming-Freeform-Audio-Edit 的语义编辑替换/插入/删除在 Full 设置下中文平均 WER 从 3.09% 涨到 3.34%英文从 3.96% 涨到 4.84%。注意情绪编辑本就是 AuK 全家最弱的一环——社区实测中也反复提到情绪编辑成功率仅约 9.94%这一数字——Flash 在这条本就脆弱的线上又砍了一刀说明对自由形式编辑指令的精确执行正是少步采样最容易丢失的能力。第三类增强与分离各有胜负。在 DNS Challenge、CHiME-4、Libri2Mix、VCTK-SR 四个信号级任务上Flash 的感知质量指标UTMOS全面反超完整模型4.05 vs 3.86、3.91 vs 3.72、4.03 vs 3.87、4.05 vs 3.93但完整模型在语言内容保持上更稳DNS 上 dWER 2.66% vs 2.93%Libri2Mix 上 WER 9.12% vs 10.07%VCTK-SR 上 SIM 0.97 vs 0.96。一个反直觉的结论是更快的蒸馏版在增强/分离这类任务上听起来反而更好但在降噪场景里更容易损伤字面内容。这与蒸馏阶段专门为分离任务做的路由保护形成了对照——路由保护保住了分得开但没有完全保住字认得清。按显存与场景给出选型建议先算清显存账Flash 并不省显存。两个版本共享同一 1.5B 主干且都必须挂载 Qwen2.5-Omni-3B 编码器与 VAE 运行权重体积几乎相同Flash 省下的是算力与延迟而不是内存占用。社区反馈与仓库线索一致这套模型对显存要求偏高config.yaml中甚至注明梯度检查点训练峰值约 91G→75G推理端同样建议预留充足显存且当前存在约 30 秒音频长度限制。若你的瓶颈是卡上放不下换 Flash 无济于事若瓶颈是出片太慢Flash 才是解药。下载与目录结构按 README.md 执行即可# AuK-Base hf download tencent/AuK --local-dir ./ckpts/AuK # AuK-Flash (4-step distilled) hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash # MLLM Encoder hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B最终选型可以收敛成一张决策表场景推荐版本理由零样本/指令 TTS、音色克隆AuK-Flash生成类几乎无损英文指令 TTS 甚至更强4.5× 提速白拿内容编辑改词、歌词改写、pitch/音量等精细声学编辑AuK编辑成功率与 WER 全面占优这类任务对采样质量最敏感降噪、超分、人声分离等信号级处理AuK-FlashUTMOS 全面更高感知质量更好对字面精度要求极高时再换 AuK情绪编辑暂时都别指望两版成功率都极低约 6%–10%属于能力边界而非版本差异实时交互、批量离线、ComfyUI/SGLang-Omni 演示AuK-Flash无 CFG 意味着少一个超参数、少一批采样开销部署更省心最后补充一个容易被忽略的工程事实技术报告指出两个变体对自由形式用户请求的鲁棒执行都依赖 Prompt Enhancer任务路由 指令改写 时长估计将请求拉回训练分布直接喂口语化、缺参数的原始指令模型能力会明显打折。也就是说无论选哪个版本提示词工程都是质量曲线里不可省略的一环——这一点对两个版本一视同仁。4.5 倍提速从来不是免费的但 AuK 把这张账单写得非常透明生成能力近乎无损信号处理甚至因祸得福真正买单的是内容编辑的精确度。对于多数语音生成与批处理场景Flash 是性价比更高的默认选项只有当你要对语音内容做外科手术式的精确修改时才值得为完整模型多付那 4.5 倍的等待时间。【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进