1 方法
1.1 关键帧选择机制
1.2 自适应通道模型
2 实验设置
表1 实验参数表Tab.1 Experimental parameter table |
| 数据集 | 数据类型 | 图像分辨率 | 训练细节 | 交叉试验 |
|---|---|---|---|---|
| StateFarm | 图片 | 224×224×3 (10帧,重复) | 批次大小:32,优化器:随机梯度下降, 学习率:5×10-4,训练轮数:50 | / |
| DMD | 图片 视频 | 224×224×3 (10帧,重复) | 批次大小:32,优化器:随机梯度下降, 学习率:5×10-4,训练轮数:50 | DMD->StateFarm |
| SAM-DD | 图片 视频 | 224×224×3 (10帧,重复) | 批次大小:32,优化器:随机梯度下降, 学习率:5×10-4,训练轮数:50 | SAM-DD->StateFarm |
| SynDD1 | 图片 视频 | 224×224×3 (10帧,重复) | 批次大小:32,优化器:随机梯度下降, 学习率:5×10-4,训练轮数:50 | SynDD1->StateFarm |
3 结果与讨论
表2 消融实验结果统计表Tab.2 Statistical Table of Ablation Experiment Results |
| 模型 | StateFarm 准确率/% | DMD 准确率/% | SAM-DD 准确率/% | SynDD1 准确率/% |
|---|---|---|---|---|
| CNN主干网 | 0.56 | 0.47 | 0.66 | 0.57 |
| 普通帧增强模块(w) | 0.71 | 0.62 | 0.72 | 0.63 |
| 多帧时序输入机制(w) | 0.80 | 0.69 | 0.69 | 0.68 |
| 关键帧引导策略(w) | 0.76 | 0.70 | 0.70 | 0.70 |
| 特征增强模块(w/o) | 0.89 | 0.85 | 0.85 | 0.77 |
| 多帧时序输入机制(w/o) | 0.92 | 0.86 | 0.91 | 0.81 |
| 关键帧引导策略(w/o) | 0.93 | 0.90 | 0.96 | 0.80 |
| 本文方法 | 0.97 | 0.99 | 0.98 | 0.83 |
注:w表示包含该模块;w/o表示不包含该模块。 |
表3 与其他方法的结果统计对比表Tab.3 Statistical comparison of results with other methods |
| 方法 | StateFarm | DMD | SAM-DD | SynDD1 | ||||
|---|---|---|---|---|---|---|---|---|
| 准确率/% | FPS | 准确率/% | FPS | 准确率/% | FPS | 准确率/% | FPS | |
| VGG16[11] | 0.91 | 11.01 | 0.56 | 10.31 | 0.87 | 10.50 | 0.13 | 11.13 |
| ResNet18[12] | 0.93 | 15.36 | 0.86 | 13.16 | 0.88 | 12.77 | 0.48 | 12.97 |
| ShuffleNet-v2[13] | 0.95 | 16.17 | 0.85 | 15.19 | 0.96 | 13.69 | 0.63 | 15.07 |
| MobileNet-v2[14] | 0.94 | 15.34 | 0.90 | 13.07 | 0.95 | 13.01 | 0.65 | 12.79 |
| ViT[15] | 0.95 | 9.89 | 0.93 | 7.16 | 0.97 | 8.10 | 0.79 | 8.16 |
| VideoCLIP[16] | / | / | 0.98 | 8.70 | 0.98 | 7.90 | 0.82 | 8.93 |
| Multi-frameCLIP | / | / | 0.93 | 9.35 | 0.89 | 8.46 | 0.70 | 8.52 |
| 本文方法 | 0.97 | 16.07 | 0.99 | 14.35 | 0.98 | 13.09 | 0.83 | 13.97 |
表4 不同数据集的性能表现Tab.4 Performance of different datasets |
| 方法 | DMD->StateFarm | SAM-DD->StateFarm | SynDD1->StateFarm |
|---|---|---|---|
| Top-1系数 准确率/% | Top-1系数 准确率/% | Top-1系数 准确率/% | |
| VGG16 | 0.55 | 0.75 | 0.37 |
| ResNet18 | 0.83 | 0.76 | 0.64 |
| ShuffleNet-v2 | 0.81 | 0.83 | 0.75 |
| MobileNet-v2 | 0.92 | 0.89 | 0.80 |
| ViT | 0.90 | 0.92 | 0.68 |
| VideoCLIP | 0.95 | 0.91 | 0.79 |
| Multi-frameCLIP | 0.83 | 0.85 | 0.73 |
| 本文方法 | 0.96 | 0.91 | 0.86 |
表5 在SynDD1数据集上不同采样率下的视频片段Tab.5 Video clips at different sampling rates on the SynDD1 dataset |
| 采样率/ (FPS) | SynDD1 | SynDD1->StateFarm |
|---|---|---|
| Top-1系数准确率/% | Top-1系数准确率/% | |
| 0.5 | 0.63 | 0.61 |
| 1 | 0.76 | 0.75 |
| 2 | 0.66 | 0.63 |
| 5 | 0.75 | 0.79 |
| 10 | 0.83 | 0.86 |
| 20 | 0.82 | 0.85 |
表6 本文方法(单帧)在DMD数据集上的性能统计表Tab.6 Performance statistics table of the proposed method (single frame) on the DMD dataset |
| 序号 | 动作分类 | 得分 |
|---|---|---|
| A1 | 喝水 | 0.97 |
| A2 | 梳头和化妆 | 0.92 |
| A3 | 打电话 | 0.97 |
| A4 | 调节音响 | 0.86 |
| A5 | 伸向后座 | 0.73 |
| A6 | 伸向侧边 | 0.59 |
| A7 | 打哈欠 | 0.80 |
| A8 | 与乘客说话 | 0.91 |
| A9 | 手机打字 | 0.92 |
| A10 | 安全驾驶 | 0.70 |

