详情

首页手游攻略 ICML 2026 | SVL:驱动脉冲神经网络实现高效3D开放世界理解

ICML 2026 | SVL:驱动脉冲神经网络实现高效3D开放世界理解

佚名 2026-07-23 09:00:54

论文题目: SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

论文:https://arxiv.org/abs/2505.17674

代码:https://github.com/bollossom/SVL

(中国科学院自动化所李国齐课题组,转载需注明出处)

https://zhuanlan.zhihu.com/p/2041482895919927718

脉冲神经网络(SNN)因其高能效和时空处理能力,在3D感知中具有巨大潜力。然而,现有的SNN在预训练和推理阶段面临挑战,限制了其在3D开放世界理解(如零样本3D分类和开放世界问答)中的泛化能力和多模态推理能力。为此,我们提出了一种通用的基于脉冲的视觉-语言预训练框架(SVL),在保持端到端脉冲高能效的同时,赋予SNN开放世界3D理解能力。SVL包含两个核心组件:多尺度三元对齐(MTA)和可重参数化视觉-语言集成(Rep-VLI)。此外,我们还开发了首个全脉冲驱动的点云Transformer(Spike-driven PointFormer),其3D脉冲驱动自注意力(3D-SDSA)将交互简化为稀疏加法,实现了更高效的训练和推理。在多个基准测试中,我们的模型在零样本3D分类上取得了85.4%的Top-1准确率,并在下游任务(如3D分类、检测、分割和动作识别)中全面超越了现有的SNN,同时在开放世界3D问答中展现出媲美人工神经网络(ANN)的性能。这项工作有效弥合了SNN与ANN在复杂开放世界理解任务中的差距,标志着SNN向通用3D多模态主干网络迈出了重要一步。

图1

一、背景

受大脑启发的脉冲神经网络(SNNs)由于其独特的脉冲驱动特性和时空处理能力,为处理稀疏的3D几何数据(如事件流和点云)提供了一种高能效的途径。例如,在神经形态芯片(如Speck)上,事件驱动的稀疏处理可以将功耗降低至毫瓦级别。

然而,现有的SNN在性能上与人工神经网络(ANN)仍存在显著差距,并且大多是任务特定的,缺乏泛化表示能力和在3D开放世界场景中进行多模态理解的能力。在实际应用中,SNN往往难以泛化到训练集之外的未知类别数据。现有的SNN预训练方法(如基于STDP的初始化、知识蒸馏、掩码图像建模等)要么在复杂数据集上效果不佳,要么需要大量计算资源,或者缺乏多模态(特别是语言)的引导。

另一方面,虽然视觉-语言模型(VLMs,如CLIP)通过将2D图像知识迁移到3D领域实现了开放世界理解,但它们在推理时严重依赖庞大的文本编码器,这极大地限制了其在资源受限的神经形态硬件上的部署。为了解决这些问题,我们提出了SVL(Spike-based Vision-Language pretraining framework),旨在提升SNN的开放世界多模态3D理解能力,同时保持高效的脉冲驱动推理。

二、本文主要贡献

1. 多尺度三元对齐(MTA) 为了捕捉3D数据的几何特性并实现开放世界理解,我们提出了多尺度三元对齐(MTA)机制。MTA通过无标签的三元组对比学习,联合优化文本、图像和3D输入之间的相关性对齐。具体而言,MTA不仅包含语义级别的脉冲-文本对齐(Semantic Spike-Text Alignment),将3D实例的特征与CLIP提取的文本提示特征在嵌入空间中拉近;还引入了细粒度的脉冲-图像对齐(Fine-grained Spike-Image Alignment),通过InfoNCE和MSE损失的结合,进一步捕捉图像和3D数据之间紧密耦合的细粒度语义信息。

2. 可重参数化视觉-语言集成(Rep-VLI) 传统的视觉-语言模型在推理时需要庞大的文本编码器,这成为了SNN高效部署的瓶颈。为此,我们设计了可重参数化视觉-语言集成(Rep-VLI)模块。Rep-VLI的核心创新在于,将离线文本嵌入直接转换为轻量级分类层的权重。在推理阶段,完全丢弃文本编码器,采用硬件友好的脉冲计数决策规则(Spike-count decision rule)替代传统的Softmax操作。这使得模型在保持全脉冲驱动和硬件兼容的同时,实现了无文本编码器的轻量级推理。

3. 首个全脉冲驱动点云Transformer(Spike-driven PointFormer) 除了SVL框架,我们还提出了首个全脉冲驱动的点云Transformer架构——Spike-driven PointFormer。它采用3D脉冲驱动自注意力机制(3D-SDSA),将传统的矩阵乘法交互简化为纯加法操作(Sparse additions)。这种设计不仅保留了端到端的脉冲计算特性,还大幅降低了训练和推理的内存与时间消耗,使其能够支持大规模预训练,并在各类3D任务中展现出广泛的泛化能力。

三、实验结果

1. 3D零样本分类(Zero-shot Classification) 在ModelNet40和更具挑战性的大规模Objaverse-LVIS数据集上,SVL展现了卓越的零样本分类性能。例如,基于SVL预训练的E-3DSNN在ModelNet40上取得了85.4%的准确率,超越了众多ANN(如OpenShape、ULIP)和SNN基线模型,同时仅消耗0.79 mJ的能量,参数量仅为17.7M。在Objaverse-LVIS上,我们的模型性能媲美ULIP-2,但能效提升了204倍。这充分证明了Rep-VLI模块在实现高效零样本推理方面的巨大优势。

表1

2. 3D对象字幕生成与开放世界问答(Generative 3D Object Captioning and QA) 我们将SVL训练的Spike-driven PointFormer与大语言模型(LLM)结合,构建了SVL-13B模型。在3D对象字幕生成任务中,SVL-13B达到了与最先进的ANN方法(如PointLLM)相媲美的性能,这也是SNN首次应用于3D字幕生成任务。在开放世界3D问答中,模型能够准确理解物体的形状、材质、功能和上下文,展现出强大的常识推理和多模态对齐能力。

表2

3. 3D下游任务(分类、分割、检测与动作识别) 我们将SVL预训练的脉冲编码器在多个下游任务上进行微调:

3D分类:在ModelNet40和ScanObjectNN上,SVL预训练显著提升了准确率。例如,Spike PointNet在ScanObjectNN上的准确率从70.0%大幅提升至76.1%(提升6.1%)。3D分割与检测:在Semantic KITTI和KITTI数据集上,SVL预训练也带来了1.2%和1.1%的性能提升。神经形态动作识别:在DVS Action和DVS128 Gesture数据集上,模型准确率分别提升了2.1%和1.6%,证明了SVL在时空特征提取上的强大能力。

表3

表4

4. 架构效率对比 与现有的脉冲点云Transformer相比,我们的Spike-driven PointFormer-S在训练速度上提升了高达4.3倍,训练内存降低了4.1倍,同时在ModelNet40上取得了92.6%的高准确率,推理能耗仅为5.1 mJ,完美平衡了ANN级别的识别性能与SNN的能效优势。

图2

四、讨论与总结

本文提出了SVL,一种新颖的基于脉冲的视觉-语言预训练框架,为脉冲神经网络(SNN)赋予了强大的开放世界3D理解能力,同时保持了其固有的高能效优势。通过多尺度三元对齐(MTA)和可重参数化视觉-语言集成(Rep-VLI),SVL成功弥合了SNN低功耗与先进视觉-语言模型强泛化能力之间的鸿沟。

此外,我们提出的Spike-driven PointFormer作为首个全脉冲驱动的点云Transformer,进一步推动了SNN在复杂3D任务中的应用。SVL不仅在多项基准测试中刷新了SNN的SOTA成绩,更首次实现了SNN的开放世界3D问答,标志着脉冲系统在多模态表示学习领域迈出了重要一步。

本文系学术转载,如有侵权,请联系CVer小助手删文

本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2026-06-29,如有侵权请联系[email protected] 删除
点击查看更多
推荐专题
热门阅读