详情

首页手游攻略 TMAP平台图生视频推理加速实践

TMAP平台图生视频推理加速实践

佚名 2026-07-22 17:26:57

TMAP平台通过多卡并行、Attention加速、量化与缓存优化,在保证质量无损的前提下实现4.87倍推理加速,单次成本降至0.15元/秒以下。
核心内容:
1. 针对图生视频模型推理瓶颈的四大优化领域
2. 关键加速技术:序列并行、SageAttention算子与混合量化
3. 自研DPCache缓存方案带来的全局最优调度效果

加速后


  多卡并行选型


我们服务的视频生成业务特点: 

  • 流量多为在线流量, 对堆积的容忍度较低; 

  • 同等质量下, 生成越快给用户的体感越好, 就越具有竞争力.

  • 会结合多种加速策略

因此需要选择可以降低单条视频产出耗时的、易于和其他加速技术结合(量化, 缓存等)的多卡并行策略, 最终使用了 Deepspeed Ulysses 序列并行, 将线性层和注意力层的计算量均分到所有设备上. 下图展示了序列切分的过程: 

的输出的输出差异很小,则可直接复用。但在推理过程中,只有完成了当前步的计算,才能进行这个比较,这就导致了“不计算就无法知道差异”的矛盾。为了解决这个矛盾,TeaCache 提出:模型输入与输出存在强相关性,且可以通过一个多项式对其进行拟合。


计算并缓存输出。

  • 对于后续时间步并累加。

  • 若累加和(设定的阈值),则复用缓存;若,则进行完整计算并更新缓存。


  • taylorseer论文原图(https://arxiv.org/pdf/2503.06923)

    taylorseer论文原图(https://arxiv.org/pdf/2503.06923)


    最优调度选择阶段:用动态规划完成关键时间步序列计算

    该阶段于线上初始化时进行,在给定只能完整计算 K 次的情况下,以 PACT 为成本,动态规划为最优路径算法,计算最优采样序列。该阶段的优化目标如下:



    动态规划递推公式如下:

    其中 D[m, k] 为用 m 个关键步到达时间步 k 的最小累积成本,P[m, k] 则记录了达成该最小成本时的上一个关键步(用于回溯最优路径)。

    该阶段得到的关键时间步序列与采样配置绑定,一旦生成,可在生产环境长期复用,直到配置变化才需要重新计算。


    推理阶段:按关键时间步序列执行推理

    在线推理时,对于每一个时间步执行如下策略:

    • 关键步:执行完整模型前向计算,得到该时间步输出,并把指定特征写入缓存;

    • 非关键步:调用与校准时完全相同的预测器,根据缓存快速生成该时间步所需特征。


    落地效果

    • 生成质量:生成结果退化比例明显低于 TeaCache 及 TaylorSeer。

    • 加速性能:由于 DPCache 能够通过校准找到最优的采样序列,因此可以进一步减少完整计算步数,加速效果约为 140%-160%


      已落地方案对比


    对于我们在探索过程中已落地的三种缓存策略。下表从多个维度进行了综合对比:

    通过对三种缓存方案的实践与对比,可以得出以下结论:

    1. TeaCache 是视频生成缓存加速领域的经典方法,但在高质量生成场景下,其启发式阈值难以平衡质量与速度。

    2. TaylorSeer 证明了“预测范式”的有效性,大幅提升了加速比,但固定间隔限制了其进一步优化空间,且额外的显存占用对实际落地影响较大。

    3. DPCache 在大多数情况下是更好的选择。它通过路径感知成本动态规划的结合,从而找到全局最优的计算路径。在线上AB测试中,DPCache 不仅继承且进一步提升了 TaylorSeer 的高加速比,且在灵活性及生成质量稳定性上实现了突破。


    团队介绍


    本文作者蓝愿、行宣、不竭,来自淘天集团-用户&内容技术团队。团队聚焦视频、直播、图文、音乐等集团内容资源,建设兼具技术先进性与成本竞争力的内容能力矩阵,统一内容库并贯穿内容生产、处理与分发全链路,服务淘宝各场域。
    其中围绕直播与内容理解、音视频转码与增强、视频AIGC、直播数字人等AI方向,团队打造了统一内容算力平台 TMAP,提供 AI 时代下的大规模服务部署、算力调度优化、推理加速等能力,以先进、高效的技术底座支撑内容能力的规模化落地,持续提升内容生态的运行效率与服务体验。


    ¤ 拓展阅读 ¤
    3DXR技术 | 终端技术 | 音视频技术

    服务端技术 | 技术质量 | 数据算法



    登录查看剩余 70% 内容

    点击查看更多
    推荐专题
    热门阅读