← 返回首页
读书笔记

论文精读:《SlowFast Networks for Video Recognition》——快慢网络提取视频特征

Link:https://arxiv.org/pdf/1812.03982.pdf

Introduction

Architecture

优势

  1. 高效性:快通道设计轻量级,较少,仅占用约20%的计算资源,提高了整体计算效率。
  2. 时间分辨率保持:快通道省略了时间池化,保持了时间分辨率,适用于对时序信息敏感的任务。
  3. 融合多种信息:通过慢通道和快通道的侧向连接,能够融合提取到的空间和时域信息。
  4. 端到端操作:从原始数据端到端操作,简化了视频处理流程,提高了整体处理效率。
  5. 轻量级设计:快通道采用较少的通道和较弱的卷积核,使得模型更加轻量化,适用于资源受限的场景。

结构

💡
SlowFast 网络包括低帧率、低时间分辨率的 Slow 路径和高帧率、高时间分辨率(Slow 路径时间分辨率的 α 倍)的 Fast 路径。使用通道数的一部分(β,如 β = 1/8)来轻量化 Fast 路径。Slow 路径和 Fast 路径通过侧连接来连接
  1. 双流结构:SlowFast采用了双流(slow和fast)的卷积结构,但和双流结构有所不同
  2. 慢通道(Slow Pathway):一条专注于处理可以在低帧速率下观看的类别语义(如:颜色、纹理和目标),它以低帧率运行,刷新速度缓慢,旨在捕获图像或几个稀疏帧提供的语义信息
  3. 快通道(Fast Pathway):另一条路径则寻找在以较高帧速率显示的视频中更容易识别的快速变化的运动(如:鼓掌、挥手、摇头、走路或跳跃),它的刷新速度快、时间分辨率高,用于捕获快速变化的动作
  4. 侧向连接:慢通道和快通道通过侧向连接进行信息融合

思考:

How the Model Works —— 实例化

SlowFast 网络的实例化示例

网络结构数据

特征融合

如何融合?

三种方案:

本文由 GJJ 创作,内容来源于 Notion 数据库,随时可在 Notion 中编辑更新。 本站由 DeepSeek-v4-flash 辅助构建,项目参考 NotionNext

← 返回首页
61
文章
6
标签
3
分类
962
运行天数