详情

首页手游攻略 安谋科技发布武当VPU:视频压缩转向机器友好

安谋科技发布武当VPU:视频压缩转向机器友好

佚名 2026-07-21 17:39:10

在 2026 世界人工智能大会(WAIC 2026)上,安谋科技(Arm China)VPU研发总监黄鑫博士发表了题为《AI VPU:开启视频压缩新篇章》的演讲,并披露了下一代“玲珑”视频处理器(VPU)IP“武当”

图 | 安谋科技(Arm China)VPU研发总监黄鑫博士;来源:与非网摄制

从该演讲中,我们看到视频的“消费者”正在从人类转变为AI,而视频压缩的逻辑也必须从“人眼友好”彻底转向“机器友好”

从“给人看”到“给机器看”

黄鑫提到,过去二十年间,视频编解码技术(如H.264、H.265等)的演进始终围绕着一个核心:服务于人眼的主观视觉体验。其目标是在有限的带宽和存储空间内,尽可能消除人眼可察觉的瑕疵。

然而,随着人形机器人、自动驾驶、智慧安防等技术的爆发,AI已逐步成为视频数据最大的消费者。数据显示,AI获取的数据超过80%来自视频,视频成为连接物理世界与虚拟世界的关键桥梁。

这带来了全新的挑战:人眼与机器对视频质量的容忍度完全不同

首先是传统压缩的问题,某些为了节省带宽而对人眼“无感”的微小图像受损,在机器眼里却可能是致命的。这会直接导致AI推理与训练精度的崩塌(例如:自动驾驶系统可能因此将行人误判为背景)。

与此同时,为了降本增效,VPU(视频处理单元)的设计理念必须颠覆,从单纯满足主观视觉,转变为全面提升机器视觉的辨识精度。

从“被动执行”到“内容感知”

面对此产业变局,安谋科技的自研“玲珑”VPU IP给出了清晰的技术演进路线图:

图 | “玲珑”编码技术演进路线图;来源:与非网摄制

  1. 内嵌AI算子的CAE技术

 在过往产品中,VPU是被动的,完全由CPU主控。而在现阶段的“峨眉”与下一代“武当”VPU中,内部都集成了轻量化的AI算子,具备了内容感知视频编码(CAE)技术

黄鑫指出,CAE处于视频编码单元的第一级,在搬移数据的同时,可以平行处理两个核心动作:

  • 第一层(浅层):像素级的图像预处理。
  • 第二层(深层):深度的图像语义解析。

这两层数据融合后共同引导下一级的编码决策,从而在不同场景下实现极高的带宽节省:航拍场景可省20%、监控场景可省10%、游戏场景可省5%以上

  1. “武当”VPU的三维跨越

 作为继“峨眉”之后的最新力作,即将于明年年初发布的“武当”VPU,在继承CAE技术的基础上,将实现三大性能跨越:

  • PPA(性能/功耗/面积)层面:单核性能突破8K30fps+@1GHz,且芯片面积比上一代大幅节省40%。在不规则运动等AI典型场景中,编码质量额外提升5%~10%。
  • 规格扩展:支持YUV422编码以满足专业拍摄需求;特别支持Raw Data直接压缩,省去色域转换的精度丢失,直接为AI训练输送高精度数据。
  • 具身智能适配:支持高达1Gbps+的超高码率,全力服务人形机器人等Physical AI(具身智能)的复杂感知场景。

图 | 玲珑”VPU“武当”揭秘;来源:与非网

端到端联合优化与“任务感知”

为了打破“局部优化”的瓶颈,安谋科技正在落地“AI端到端视频编码技术”。黄鑫透露,该框架的核心在于“端到端联合优化”“AI 任务感知压缩”

首先是反向传播打通全链路,在训练时,将前置网络、编码器与下游的特定 AI 应用串联,通过反向传播(Backpropagation)进行联合训练。

其次是灵活配置码率,让压缩过程主动去“感知”下游AI任务的需求,把珍贵的码率智能分配给关键信息,在显著提升压缩率的同时,最大程度保证机器AI的任务精度。

图 | AI VPU在具体视频任务上的实践;来源:与非网摄制

在具体的视频任务实践中,这套框架已展现出惊人的数据回报:在Ostrack目标追踪任务中可节省18.3%的码率;在SlowFast动作识别任务中可节省12.0%的码率,且两者的编码质量皆提升高达10%以上

所以说,虽然这种优化在人眼看来与传统算法差异不大,但对机器而言,其可辨识度与友好度发生了质的提升。

写在最后

“让 AI 看懂视界”, 安谋科技正在通过将AI算子下沉到VPU硬件层,将自研IP的触角从传统的多媒体编解码,延伸到边缘端AI的部署和训练环节,以此巩固其在端侧异构计算生态中的话语权。

对于下游芯片设计工程师而言,如何在受限的功耗预算下做好系统级优化(System-level Optimization),才是这款VPU能否用起来的关键。

点击查看更多
推荐专题
热门阅读