)
论文IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion TransferarXiv: 2511.22167ACM MM 2025作者Bo Chen, Tao Liu, Qi Chen, Xie Chen, Zilong Zheng上海交通大学 X-LANCE Lab × 北京通用人工智能研究院 BIGAI代码与权重https://github.com/bigai-nlco/IMTalker图 1IMTalker 官方 Teaser。一张肖像 一段音频或驱动视频即可在 RTX 4090 上以 512×512 分辨率、40~42 FPS 生成说话人脸并支持头部姿态与视线方向的独立控制。一、引言数字人赛道的不可能三角给一张静态照片开口说话是生成式 AI 落地最迅猛的方向之一虚拟主播、视频会议替身、影视配音、在线教育……但这条赛道一直被困在一个不可能三角里——高保真、强身份保持、实时性三者最多取其二扩散模型路线EMO、Hallo 系列、Sonic把音频、运动参考、外观参考注入预训练视频扩散模型画面生动但计算昂贵动辄分钟级生成一秒视频且运动参考的外观信息会泄露进结果造成伪影显式形变路线Face-vid2vid、LivePortrait、LIA 一系先解耦运动与外观再用光流 局部仿射形变warping搬运像素速度极快但局部形变本质上假设运动是小幅度、局部平滑的一旦遇到大角度转头、遮挡、夸张表情就会拉伸、撕裂甚至把驱动者的脸贴到源人物身上——这就是臭名昭著的身份漂移identity drift。IMTalker 的切入点非常明确不再搬运像素而是在统一潜空间里隐式地生成新外观。这一思路继承了 IMFImplicit Motion Function的隐式运动函数思想但把它系统性升级为一套完整的、可实时运行的说话人脸框架并用一个精巧的身份自适应模块补上隐式表示最致命的短板——身份泄露。要理解 IMTalker 的真正贡献需要先把它放回 2025-2026 年实时数字人赛道的演进脉络中它不是第一个实时的方法也不是最快的方法它的独特性在于一个特定的组合——这个组合是什么正是本文要论证的第四节会给出完整的横向坐标。二、方法拆解三个模块各解一个死结图 2IMTalker 总体架构。(a) 身份自适应运动迁移渲染器(b) 流匹配运动生成器。整个框架分为两阶段运动潜码生成视频驱动时由运动编码器直接提取音频驱动时由流匹配生成器合成以及运动迁移与渲染。三个核心模块分别对应三个被前人忽视或未能根治的问题。2.1 隐式运动迁移IMT用注意力代替光流传统 warping 的数学本质是用一组局部仿射变换去逼近人脸这个高度非刚体的运动流形——逼近不了的部分就成了伪影。IMTalker 的做法是把源帧的身份特征 f_dense、驱动与源的运动潜码经 Motion Decoder 解码出的多尺度 2D 运动图 M_D、M_S 放到同一潜空间用交叉注意力完成对齐Query 来自驱动运动图Key 来自源运动图Value 来自身份特征。注意力天然具有全局感受野且输出是重新生成的外观特征而非重排的像素因此大姿态、遮挡、非刚性形变都能被整体重渲染。但标准注意力的 O(N^2) 复杂度在高分辨率特征图上是不可接受的。论文的关键工程创新是分层粗到细的引导注意力策略低分辨率64²老老实实算完整交叉注意力得到全局注意力图 A_coarse高分辨率128² / 256²不再计算 QK 注意力而是把 A_coarse 上采样后按行取top-k生成稀疏掩码与高分身份特征做 Hadamard 乘积——作者称之为引导稀疏重采样器Guided Sparse Resampler。它为什么能保留全局感受野因为全局对应关系已经在 64² 的粗注意力图里被完整编码过一次后续每个细尺度位置只需查询这张全局图的 top-k 强对应而无需再与全图做交互——全局信息以压缩形式被传递下去而非被丢弃。它的理论代价也应说清楚细尺度特征是重采样而非重建出来的对应关系的精度被粗尺度图卡了脖子亚像素级对应无法凭空产生top-k 的 k 则是保真度与算力之间的显式折中——在粗粒度上没有支撑的全新细节细尺度同样得不到。这是一笔用对应精度上限换线性复杂度的交易但对人脸这类结构强先验的对象交易是划算的。2.2 身份自适应模块IA为跨身份重演而解耦隐式运动迁移在本框架内有一个隐蔽的缺陷运动潜码与身份特征在潜空间里反复交互会不可避免地给运动潜码引入身份相关的归纳偏置inductive bias。训练是自监督重构源帧与驱动帧来自同一段视频、同一个人模型学到的是半成品解耦一旦进入跨身份重演cross-identity reenactment——用张三的运动驱动李四的脸——驱动者身份就会从运动通道里渗进结果。需要说明的是这是潜空间耦合 同人自训练这一组合在跨身份场景下的具体病症而非一切隐式表示的普遍定律。IMTalker 的解法是一个轻量 MLPΦ输入全局运动潜码与目标身份特征输出个性化的运动潜码——同一段运动被投影到不同受试者各自的运动空间里相当于给每个人的表情方言做了翻译。更妙的是运动距离一致性损失L_dist论文 Eq.8。它的构造是显式的取同一个运动潜码 z 和两个不同身份 A、B分别经 Φ 投影得到个性化潜码 z_A Φ(z, f_A)、z_B Φ(z, f_B)然后计算原潜码到各自投影的距离 d(z, z_A) 与 d(z, z_B)强制这两个距离相等之差为零。几何含义是所有个性化潜码必须落在以原潜码为球心的同一超球面上——Φ 对每个身份施加的是同等强度的风格化而不是对某些身份大改、对另一些不改。这一步还回答了一个容易被忽略的疑问保真度IMT 负责与身份保持IA 负责会不会在潜空间里互相打架关键在于流水线次序与扰动有界性IA 在上游把运动潜码个性化L_dist把这次个性化约束为等强度的有界形变IMT 在下游只消费已经翻译好的运动图身份信息则以 Value 形式走另一条独立通路。身份对运动通道的注入被 Φ 的扰动幅度显式封顶因此两条通路各管一段、互不越界——这才是同时赢下两个目标的机制而不是简单的各加一个模块。消融实验论文 Fig.5显示去掉 IA 后跨身份重演中源身份外观严重劣化印证了该模块是身份一致性的直接来源。2.3 流匹配运动生成器在 39M 参数里塞下三路控制音频驱动的第二段是一个改进 DiT 流匹配Flow Matching的小生成器Wav2Vec2 音频特征、SMIRK 的 6D 姿态、L2CS-Net 的视线方向分别线性投影后逐元素相加作为条件通过帧级 AdaLN 注入 DiT 块训练时每个条件以 10% 概率独立置空以支持无分类器引导CFG。由于只在低维运动潜码空间做生成而非像素空间采样步数很少时唇同步反而更好——论文消融表明流匹配在此类 seq2seq 任务上比扩散更高效、更稳定。三个模块合起来只有124M渲染器 39M生成器≈ 1.6 亿参数。准确地说它的主干不含像素空间的视频扩散模型流匹配本身与扩散同源只是训练目标与采样路径更直接它的效率根本来源不是模型小而是任务分解——生成器只在低维运动潜码空间采样渲染器逐帧单次前向全程没有多步像素级去噪。这是理解后文效率论断的前提。三、实验质量、身份、效率三线同时压过 SOTA在 HDTF 与 CelebV 上IMTalker 对 LIA、MCNet、EDTalk、X-Portrait、LivePortrait视频驱动和 EchoMimic、Hallo、AniTalker、Ditto、FLOAT音频驱动进行了全面比较视频驱动跨身份重演CSIM 0.824身份保持、AED 7.553表情距离越低越好全面领先FID 与 LivePortrait 持平音频驱动多数指标最优CSIM 略低于 Ditto——这个失利值得深挖CSIM 基于 ArcFace 人脸嵌入的余弦相似度而 ArcFace 特征天然对姿态敏感Ditto 几乎不生成头部运动姿态几乎不变的输出自然占便宜。CSIM 作为身份保持指标本身有偏——它惩罚动得多的方法且是逐帧静态指标完全测不出时序上的身份抖动flicker。论文用它来解释差距是合理的但读者应意识到在身份保持与运动丰富度存在指标层面的零和关系时单一 CSIM 不足以裁决优劣需要配合时序一致性指标如逐帧 CSIM 方差一起看效率RTX 4090 上 512×512 分辨率视频驱动40 FPS、音频驱动42 FPS。论文 Teaser 中标注 LivePortrait 为 20 FPS 作为对照但需要指出LivePortrait 官方报告的 4090 速度约为 12.8ms/帧≈78 FPSTeaser 中的 20 FPS 很可能来自特定配置或不同分辨率设置。因此比 LivePortrait 快一倍这一效率论据引用自论文但存疑更稳妥的说法是 IMTalker 达到了同类方法中的实时第一梯队定性结果论文 Fig.3在视线控制、大角度姿态、跨性别重演、丰富表情等硬场景下基线方法普遍出现身份退化与运动失真IMTalker 全部稳定通过——甚至能把一段驱动视频的表情迁移到大理石雕像上。四、横向坐标2025-2026 实时数字人生成的演进脉络在讨论影响之前把 IMTalker 放进它真实所处的时间线里。看表之前先交代两条边界。第一条是输出模态下表中的工作按输出分为两类——输出像素级视频的FLOAT、SyncAnimation、Teller、IMTalker、FlowTalk、SoulX 系、InfiniteTalk与输出3D 运动参数的AsynFusionSMPLX 表情与姿态系数两类工作的基准与指标完全不同HDTF/CelebVCSIM/FID vs BEAT/SHOWFMD/FGD并列仅为呈现赛道全貌不可直接比较优劣。第二条是速度协议帧率数字来自各家论文与实测测试条件互不统一是否 torch.compile、分辨率、是否含特征提取开销只宜分档比较不宜精确比较。层级工作时间 / 出处速度驱动范围身份模式输出模态技术路线实时·人脸像素FLOAT2024.12 / ICCV 202541.4 FPS10 NFE人脸单图通用像素视频正交运动潜码 OT 流匹配范式先驱实时·人脸像素Teller2025.03 / CVPR 202525 FPS 流式人脸颈部/配饰单图通用像素视频隐式关键点 RVQ 离散 token AR 自回归实时·人脸像素IMTalker2025.11 / ACM MM 202540-42 FPS人脸单图通用像素视频潜空间注意力迁移 流匹配实时·人脸像素FlowTalk2025.12 / ACM MM Asia 2025100 FPS人脸单图通用像素视频运动空间 OT 流匹配实时·人脸像素SoulX-FlashHead2026.0296 FPS单卡 4090人脸单图通用像素视频1.3B 蒸馏轻量化实时·上半身像素SyncAnimation2025.01 / IJCAI 202541 FPS头上半身按人训练每人约 4h论文原文单张 4090像素视频身份特定 NeRF流式·上半身像素SoulX-FlashTalk2025.12 报告 / 2026.01 开源32 FPS首帧 0.87s头上半身手势单图通用像素视频14B 双向蒸馏流式实时·全身参数AsynFusion2025.05 / PRCV 2025异步 LCM 少步采样自称为实时全身表情手势单身份音频驱动SMPLX 3D 参数双分支 DiT CoSync 交叉注意力非实时·全身像素InfiniteTalk2025.08 / arXiv消费级实测1s 视频需数十秒3090 Ti 约 550s/8s全身 无限时长单图 / 视频像素视频Wan2.1-I2V-14B 稀疏帧配音速度栏加粗者为 40 FPS 档分档只是为了阅读档位内部的精确比较请参见本节末的方法论提醒。附注任务层级再往下细分还有 MuseTalk2024.10腾讯音乐 Lyra LabarXiv 2410.10122——V100 上 30 FPS、256×256比表中所有工作都更轻更快但它只做唇形同步在已有视频上修改嘴部区域不生成头部姿态与表情更不处理跨身份重演。它回答的问题小得多——不是生成一张会说话的脸而是让一张已经在动的脸的嘴对上音频。故不入对比表仅作为任务分层的最底层锚点唇同步 ≠ 人脸动画。图 3TellerCVPR 2025官方 Teaser。同为单图通用 实时设定Teller 用 RVQ 离散运动 token 路线把流式数字人做到 25 FPS且保留了颈部与配饰的自然运动——它是 IMTalker 在单图通用 实时设定下最直接的同类竞品之一。这张表修正三个可能产生的误区也暴露一条常被忽视的赛道分界线其一实时不是 IMTalker 的首创。早在 2025 年 1 月SyncAnimation 就已在 RTX 4090 上跑到 41 FPS且驱动范围覆盖上半身Teller 则在 CVPR 2025 实现了 25 FPS 的流式生成。但要注意可比性SyncAnimation 的 41 FPS 是身份特定 NeRF的推理吞吐——换个新身份要重新训练约 4 小时论文原文单张 4090其实时代价是前置的、按人收费的Teller 虽然单图通用且流式但帧率明显更低、训练资源消耗显著更高论文原文表述为8×8 Nvidia A800理解为 8 台 8 卡节点即共 64 卡。IMTalker 的独特位置是在单张图零样本驱动任意身份这一最通用、最难的设定下同时给出 40 FPS 与跨身份 SOTA 质量——它不是第一个实时的但它是第一个让通用性、实时性、质量三者同时成立的工作。其二运动空间生成范式不是 IMTalker 开创的。真正的先驱是 FLOAT2024 年 12 月它首次用 OT 流匹配在正交分解的运动潜码空间生成10 步采样即达 41.4 FPSIMTalker 的生成器本质是其继承者FlowTalk 随后把同一路线推到 100 FPS。IMTalker 的独立贡献在渲染端——用隐式交叉注意力迁移替代显式 warping并配上身份自适应模块解决跨身份泄露。换句话说FLOAT/FlowTalk 回答了运动怎么高效生成IMTalker 回答了运动怎么高质量、保身份地落到像素的脸上。这两半问题正交共同拼出了运动空间生成范式的完整版图。其三效率的上限还在被刷新且按模态分配算力成为共同智慧。FlowTalk 的 100 FPS 和 SoulX-FlashHead 单卡 96 FPS 说明 40 FPS 在 2026 年只是合格线值得注意的是不同工作以不同形式收敛到同一个思想——不该对所有模态、所有分辨率付出同等算力。IMTalker 把全局注意力压在 64² 粗尺度、细尺度只做稀疏重采样AsynFusion 让表情分支用 4-6 步、手势分支用 6-8 步异步采样SoulX-FlashTalk 用双向蒸馏把 14B 教师的能力压进流式小模型。IMTalker 的效率叙事应当降级为证明了潜空间渲染路线可以在消费级显卡上达到实时为后续更快的工作铺平了工程地基。还有一条分界线值得明说表中的工作分属几个相邻但不同的赛道。AsynFusion 生成的是 SMPLX 3D 运动参数表情 blendshape 身体关节旋转BEAT/SHOW 基准指标是 FMD/FGD/BA不渲染人脸而 IMTalker/Teller/FLOAT 生成的是像素级人脸视频HDTF/CelebV 基准指标是 CSIM/FID/LSE-C不管身体。而 2025 年 8 月的 InfiniteTalkMeiGen-AIarXiv 2508.14033把这条界线推向了更精确的位置它基于 Wan2.1-I2V-14B 做稀疏帧视频配音输出像素级全身视频且支持无限时长——证明全身 像素并非不可行只是代价极高消费级显卡实测生成 1 秒视频需数十秒RTX 3090 Ti 实测 8 秒片段约 550 秒与 IMTalker 的约 0.024 秒/秒相差三个数量级。因此准确的分界线不是模态而是实时约束下的模态选择在实时约束内全身只能走参数化路线AsynFusion一旦放弃实时像素级全身生成InfiniteTalk、SoulX-FlashTalk立刻可行。把 InfiniteTalk 当作任务分解论点的对照组时需要克制结论的力度两者的效率差距是任务分解端到端像素扩散 vs 低维运动潜码 单帧渲染、模型规模14B vs 1.6 亿参数、输出模态全身像素 vs 人脸像素三重差异叠加的结果任何单一归因都缺乏严格对照实验的支撑。能下的结论只有两条其一任务分解是其中一个关键因素其二InfiniteTalk 证明了当放弃实时约束时端到端像素生成可以覆盖全身与无限时长——这是任务分解路线目前无法企及的范围。两条路线服务两类需求这不是优劣是分工。图 4AsynFusionPRCV 2025框架。上面是双分支 DiT表情分支 4-6 步、手势分支 6-8 步中间黄色的 CoSync 模块用交叉注意力做双向特征同步——它代表全身参数化路线与 IMTalker 的人脸像素化路线相邻而暂未合流。最后补一个方法论提醒跨论文的 FPS 对比本身就是有缺陷的操作——是否启用 torch.compile、输入分辨率、是否包含特征提取与 IO 开销、批大小各家协议各不相同前文 LivePortrait 的 78 FPS 与 IMTalker 论文 Teaser 中标注的 20 FPS 之争即为一例。因此本文所有效率结论只应读作实时第一梯队的定性判断而非精确倍数。4.1 附离散运动 token 与连续潜码——表格背后的一条技术分野细心的读者会在表格中注意到Teller 与 IMTalker 同属实时·人脸像素层技术路线却截然不同。这不是偶然而是两种运动表示的权衡值得单独一段——对 IMTalker 本身不感兴趣的读者可以跳过本节。Teller 选择 RVQ 离散 tokenIMTalker 选择连续潜码 交叉注意力这决定了两者截然不同的失效模式。Teller 的路线承自 LivePortrait 一系的隐式关键点把运动编成 RVQ 码本中的离散 token再用 AR Transformer 逐 token 自回归——离散表示的失效模式是量化失真codebook 容量有限极端表情、大幅度非典型运动会被四舍五入到码本中的最近邻表情丰富度存在硬性天花板且自回归存在误差累积但它的收益同样明确codebook 先验天然抑制时序抖动流式延迟低长序列稳定。IMTalker 的路线是连续运动潜码 交叉注意力渲染没有量化损失运动丰富度上限更高渲染端的全局注意力保证了跨身份时的整体一致性对应的代价是时序一致性必须显式维护所以它需要 SMIRK 姿态条件、视线条件来锚定全局运动且跨身份身份泄露必须靠 IA 模块这类额外机制来堵——而这恰恰暴露了连续表示的弱点解耦不会凭空发生必须付费购买。一句话总结分野离散表示用表达上限换时序稳定连续表示用时序负担换表达上限失效模式从表情塌缩变成身份漂移后者正是 IMTalker 论文花一整节去解决的问题。选哪条路本质是选你愿意与哪种失效模式共处。五、对视频生成的影响精确定位后的三个判断有了第四节的坐标系关于影响的论断才能下得准确效率叙事的正确版本是任务分解而非小模型击败扩散。IMTalker 的效率优势来自把音画映射拆成低维运动潜码生成 单帧潜空间渲染两个各自高效的小问题扩散与否只是表象表示设计才是里子。而如第四节所示这个分解本身由 FLOAT 开创、被 FlowTalk 推进到 100 FPS——IMTalker 的角色是把这个分解与高质量渲染端结合证明该范式能支撑 SOTA 级保真度而不只是够用。从搬运到生成的价值在渲染端且有明确的适用边界。分层稀疏注意力把全局建模成本摊薄到不同分辨率层级对全身驱动、手势迁移、lip-sync 等需要全局一致性的局部重渲染任务有直接迁移价值但它依赖人脸这一强结构先验粗尺度对应关系足以预测细尺度外观换成结构自由度大的全身运动粗到细对应关系的精度瓶颈可能更早暴露——这也是隐式轻量路线目前停留在人脸的原因——上半身有按人收费的 SyncAnimation全身在实时约束内只能参数化AsynFusion、放弃实时才有 14B 像素方案InfiniteTalk、SoulX-FlashTalk。赛道不是按驱动范围分层而是按实时约束 × 驱动范围分层约束越紧能覆盖的范围越小。可控性与开源工程是它最确定的遗产。音频、姿态、视线三路独立控制 CFG意味着说什么、看哪里、怎么动完全解耦加上官方开放的推理代码与权重Hugging Face 一键拉取它事实上成了潜空间渲染路线的公共基座——2026 年大量数字人工作乃至商业产品仍在与 LivePortrait/IMTalker 这一级的轻量模型对表而不是直接与 14B 的 SoulX-FlashTalk 对表。局限依然要直视只支持人脸、固定 512×512、训练数据以英语为主中文口型效果存疑、推荐纯色/虚化背景——其背后共同的根因是自监督重构训练的分布边界660 小时的说话人脸视频既定义了它的能力也定义了它的天花板。六、部署与资源需求推理模型权重从 Hugging Face 自动下载renderer.ckpt、generator.ckpt、wav2vec2-base-960h一行python app.py即可拉起 Gradio 界面。官方在 RTX 409024GB上测得 40~42 FPS考虑到 1.6 亿参数的体量fp16 权重约 350MB外加 Wav2Vec2/SMIRK/L2CS 等特征提取模型实际显存占用估计在6–12GB量级主流消费级显卡12GB 以上应可流畅运行官方未公布最低显存。系统内存建议16–32GB。训练渲染器在 4×A100 80GB 上、batch size 4 时单卡显存占用不超过 50GB约 4 天收敛生成器 batch size 16 时单卡不超过 20GB、约 2 天收敛各迭代约 1 秒 / 10 次迭代每秒。数据需求渲染阶段约 660 小时VFHQ VoxCeleb2 MultiTalk生成器阶段约 350 小时VoxCeleb2。七、实测效果用自己的可视化界面进行测试添加图片和克隆的音频选择IMTalker模型生成视频选择裁剪部分运行过程生成结果演示视频采用imtalker默认裁剪模式下脸、嘴巴和颈部能动讲话能模仿小撒的语调虽然其中念“叠满”时不流畅猜测是克隆时输入文本的“叠满”后面连接空格造成的可惜表情有点夸张用力过度了小撒讲话此外作者也尝试了不裁剪身体但效果不佳容易变形还出现了有声音但嘴巴不动的情况八、结语IMTalker 值得写的不是又一个 SOTA而是它在数字人赛道一次精确的卡位当 FLOAT 证明了运动可以在低维空间高效生成、当 SyncAnimation 证明了上半身可以实时渲染之后IMTalker 证明了通用单图设定下的跨身份质量也能做到实时——质量-身份-效率三角的同时占据在 2025 年 11 月、40 FPS 这一档的面部动画子赛道上是唯一一份答卷——Teller 同属单图通用但帧率为 25 FPSSyncAnimation 同属实时但按人收费FLOAT 同属范式但不管跨身份渲染。这里需要公允地说一句25 FPS 已是视频流畅帧率电影标准 24 FPSTeller 在实时意义上与 IMTalker 同属一档40 FPS只是更宽的余量而非另一个物种IMTalker 的边际贡献是在把帧率推到 40 的同时保持了跨身份质量的优势。这个精确的卡位而非任何单项指标的冠军是理解它为何能在 ACM MM 上占有一席之地的关键。而 2026 年的后续故事FlowTalk 的 100 FPS、SoulX 系列的流式大模型化提醒我们在运动空间生成这条主线上IMTalker 更像一块承前启后的基石而非终点。真正的启示依旧朴素先把问题分解对再谈模型大小。创作不易禁止抄袭转载请附上原文及其链接参考链接IMTalker 论文https://arxiv.org/abs/2511.22167IMTalker GitHubhttps://github.com/bigai-nlco/IMTalkerTellerCVPR 2025https://arxiv.org/abs/2503.18429Teller 项目https://teller-avatar.github.io/SyncAnimationIJCAI 2025https://arxiv.org/abs/2501.14646SyncAnimation 项目https://syncanimation.github.io/FLOATICCV 2025https://arxiv.org/abs/2412.01064FLOAT GitHubhttps://github.com/deepbrainai-research/floatFlowTalk(ACM MM Asia 2025)https://dl.acm.org/doi/10.1145/3769748.3773363InfiniteTalk(2025.08,MeiGen-AI)https://arxiv.org/abs/2508.14033InfiniteTalk GitHubhttps://github.com/MeiGen-AI/InfiniteTalkMuseTalk2024.10腾讯音乐 Lyra Labhttps://arxiv.org/abs/2410.10122MuseTalk GitHubhttps://github.com/TMElyralab/MuseTalkAsynFusionPRCV 2025https://arxiv.org/abs/2505.15058SoulX-FlashTalkhttps://github.com/Soul-AILab/SoulX-FlashTalkSoulX-FlashHead项目https://github.com/Soul-AILab/SoulX-FlashHeadSoulX-FlashHead论文https://arxiv.org/abs/2602.07449