Intelligent Transportation

Distracted driving recognition based on key frame guidance and adaptive MAMBA

  • Liu Guihua ,
  • Ren Peng ,
  • Liu Chengbin
Expand
  • Non-commissioned Officer Acadeny of PAP, Zhejiang Hangzhou 311400

Received date: 2026-01-13

  Revised date: 2026-03-09

  Online published: 2026-07-30

Abstract

With the continuous development of deep learning in driving behavior analysis, traditional methods have shown limitations in processing massive video and image data.To address the problem of driver distraction recognition, a distracted driving recognition method based on keyframe guidance and adaptive channel MAMBA is proposed.It includes:(1) guiding the model to focus on discriminative information through a keyframe guidance mechanism;(2) enhancing spatial feature representation by integrating edge feature enhancement and channel attention mechanism;(3) capturing the dynamic evolution of driving actions via multi-frame temporal modeling. Experimental results demonstrate that the proposed method achieves 99% accuracy on the SAM-DD dataset,and improves the accuracy by 7 percentage points compared with VideoCLIP in the cross-dataset transfer task (SynDD1->StateFarm). This study provides a high-precision and robust solution for distracted driving recognition,and offers a reference for the optimization of temporal modeling and modular design.

Cite this article

Liu Guihua , Ren Peng , Liu Chengbin . Distracted driving recognition based on key frame guidance and adaptive MAMBA[J]. Command Control and Simulation, 2026 , 48(4) : 130 -137 . DOI: 10.3969/j.issn.1673-3819.2026.04.017

我国机动车保有量持续快速增长,截至2023年已达3.35亿辆[1],车内娱乐功能的不断丰富极易导致驾驶员注意力分散,由此引发的交通安全问题日益突出,对道路安全治理形成严峻挑战。相关研究数据表明[2],65%的临界碰撞事件和80%的交通事故均由分心驾驶直接导致。研究人员若能实时识别并预警驾驶员分心行为,可有效降低交通事故发生率。因此,研究人员开展分心驾驶检测识别方法研究,对实现驾驶员行为智能监控、提升道路交通安全水平具有重要现实意义。
分心驾驶[3],指任何将驾驶员的注意力从驾驶任务上转移开的行为。数据显示,以每小时90千米的速度行驶,看手机3秒钟,就相当于盲开了75米。近年来,人工智能技术为分心驾驶行为的动态检测提供了高效解决方案,该技术通过智能算法对车内摄像头采集驾驶员行为的自然视频进行精准识别与分类。
闫洪枚等[4]采用U-net架构,提出了MAMBA(具有选择性状态空间的线性时间序列建模)的全局时空注意力机制,能有效捕获图像的全局特征,但存在算力需求高、推理速度不足等问题;Manessi F等[5]采用卷积神经网络自动提取特征实现分心驾驶识别,受限于局部感受野,难以捕捉全局上下文信息;Li Y等人[6]探索多尺度、多粒度特征表示,但仅聚焦单一尺度特征提取,无法同时捕捉到细微局部关节运动和长时行为模式变化,未能从根本上解决视频时空特征的协同建模问题。针对上述不足,本文提出一种基于关键帧引导和自适应通道MAMBA的自然视频分心驾驶识别方法。该方法通过融合外观特征、骨架结构先验与时序上下文信息,可有效提升复杂场景下驾驶行为分心识别的准确性与泛化能力。

1 方法

本文方法整体框架如图1所示,首先对输入的自然视频序列进行预处理:通过关键帧选择机制(Key frame Selection Mechanism,KSM)[7]提取代表性图像帧,利用Canny边缘检测算法[8]生成边缘图像,同步保留外观细节与结构特征;其次,通过关键帧引导-对比文本-图像预训练模型(Key frame Guidance Contrastive Language-Image Pre-training,KG-CLIP)实现多通道特征向单通道特征的转换,完成对图像特征与边缘特征进行深度融合,其中关键帧增强模型(Key frame Enhance Model,KFEM)对图像序列{I1,I2,…,In}和边缘序列{E1,E2,…,En}进行对齐与增强,并通过跨模态交互机制挖掘外观与结构信息;最后经特征融合后,输入自适应通道MAMBA(Adaptive Channel-MAMBA,CA-MAMBA)模块[9]完成时序建模,捕获驾驶行为动态演化过程,由分类层输出具体行为(如说话、进食、喝水等)的预测分数。
图1 本文方法框架图

Fig.1 Framework diagram of the proposed method

1.1 关键帧选择机制

本文提出的关键帧自适应选择机制是一种基于边缘特征变化的动态检测方法,核心为响应视频局部统计特性的动态阈值决策器,如图2所示。该机制以视频首帧f1作为初始参考帧,依次对后续fi经Canny算法提取边缘响应值Edgei,并量化其灰度均值μi与方差 ${\mathit{\delta }}_{\mathit{i}}^{2}$
图2 关键帧选择流程图

Fig.2 Key frame selection flowchart

滑动时间窗口V统计历史帧特征变化统计量,以实现动态阈值Thri的自适应调整,数学表达式为
Thri=α $\overline{\mathit{\Delta }\mathit{E}\mathit{d}\mathit{g}{\mathit{e}}_{\mathit{V}}}$+βδV
其中, $\overline{\mathit{\Delta }\mathit{E}\mathit{d}\mathit{g}{\mathit{e}}_{\mathit{V}}}$为滑动窗口V内相邻帧边缘特征差值均值,表征近期平均变化强度;δV为窗口内标准差,表征变化波动性;αβ为超参数,平衡均值与方差的权重。
在帧判定过程中,本文计算当前帧与前一关键帧的边缘特征变化强度Ti= $\left|{\mathit{\mu }}_{\mathit{i}}-{\mathit{\mu }}_{\mathit{k}\mathit{e}\mathit{y}}\right|$,判定逻辑如下:
(1)若Ti>Thri:本文判定当前帧fi包含显著运动变化或结构信息(如手部大幅移动、头部姿态突变),将其设为关键帧并更新参考状态(keyframefi);
(2)若TiThri:本文判定当前帧为冗余帧(如静止状态、微小抖动),予以剔除。
关键帧特征提取模型采用层次化卷积架构与自定义特征增强模块相结合,如图3所示。本文以关键帧图像为输入,经多层3×3卷积层实现多层次空间特征提取,每层卷积接入KFEBlock模块;通过1×1卷积完成通道降维与特征压缩(c1c2),再经3×3卷积实现局部上下文感知的特征重构,最后通过 1×1 卷积恢复通道维度并完成特征融合,输出可表示为:c1+n×cm(n为增强系数,cm为中间特征维度);经多层迭代处理后,通过全连接层将空间特征映射为高维向量,由分类器输出驾驶行为类别。该模型实现了特征选择、增强与残差学习的一体化,显著提升关键帧中判别性特征提取能力,为后续时序建模与行为分类奠定基础。
图3 关键帧特征提取模型

Fig.3 Key frame feature extraction model

图4为基于CLIP的关键帧和普通帧多层次特征提取网络结构。该网络包含5个阶段,各阶段由3×3卷积层、特征增强模块(Feature Enhancement Block;FEBlock)和最大池化层(Max-Pool)构成,实现从低级纹理到高级语义的时空特征提取,最终由全连接层和分类器输出分心驾驶行为类别。特征学习过程中,CLIP[10]的对比学习范式嵌入多尺度特征提取深层阶段,构建图像-文本对联合嵌入空间,具体实现机制如下:
图4 基于CLIP的关键帧引导模型

Fig.4 Key frame guidance model based on CLIP

本文选取关键帧图像 $\left\{{\mathit{I}}_{\mathit{i}}\right\}$与对应细粒度文本描述 $\left\{{\mathit{T}}_{\mathit{i}}\right\}$(如“驾驶员低头玩手机”),通过预训练图像编码器提取视觉特征嵌入ϑi,通过文本编码器将Ti转为文本特征ti;采用对称交叉熵损失函数优化正负样本对的相似度分布,最大化匹配对(Ii,Ti)互信息,抑制非匹配对(Ii,Tj)冗余响应,实现跨模态特征对齐与增强。对比学习损失函数可形式化表达为
Lcontrast=- $\frac{1}{2}\sum _{\mathit{i}=1}^{\mathit{N}}\left[\mathit{l}\mathit{o}\mathit{g}\frac{{\mathit{e}}^{\frac{\mathit{s}\mathit{i}\mathit{n}({\mathit{\vartheta }}_{\mathit{i}},{\mathit{t}}_{\mathit{i}})}{\mathit{\tau }}}}{\sum _{\mathit{j}=1}^{\mathit{N}}{\mathit{e}}^{\frac{\mathit{s}\mathit{i}\mathit{n}({\mathit{\vartheta }}_{\mathit{i}},{\mathit{t}}_{\mathit{j}})}{\mathit{\tau }}}}+\mathit{l}\mathit{o}\mathit{g}\frac{{\mathit{e}}^{\frac{\mathit{s}\mathit{i}\mathit{n}({\mathit{t}}_{\mathit{i}},{\mathit{\vartheta }}_{\mathit{i}})}{\mathit{\tau }}}}{\sum _{\mathit{j}=1}^{\mathit{N}}{\mathit{e}}^{\frac{\mathit{s}\mathit{i}\mathit{n}({\mathit{t}}_{\mathit{i}},{\mathit{\vartheta }}_{\mathit{j}})}{\mathit{\tau }}}}\right]$
式中,sin(·,·)为余弦相似度,τ为可学习的温度系数。
该模型将CLIP的视觉编码器、对比学习先验知识与关键帧的时序引导机制相融合,通过对比学习实现视觉特征与语言语义对齐,显著提升动态驾驶行为的表征能力与识别精度。

1.2 自适应通道模型

自适应通道MAMBA方法以多通道特征为输入,通过并行堆叠的通道注意力模块(Channel Attention Mamba Block,CAMBlock)实现特征自适应增强与结构重构,如图5所示。每个CAMBlock通过1×1卷积对输入特征进行通道降维,借助池化操作聚合空间信息生成通道统计量;通过全连接层与σ激活函数构建非线性映射,生成通道注意力权重W∈[0,1]C,对原始特征图各通道响应强度进行重加权,选择性增强判别性通道、抑制冗余或噪声通道。
图5 自适应通道MAMBA方法

Fig.5 Adaptive channel MAMBA method

图6为通道注意力模块的结构设计,核心融合多分支注意力机制与状态空间模型(State Space Model,SSM[10])以构建时空联合感知注意力范式。SSM通过线性微分/差分方程来定义系统内部状态演变规律,方程定义如下:
(1)状态方程描述系统内部状态h(t)∈RN随时间t的演化规律,可有效表征驾驶员姿态等关键动作的连续时空变化趋势,表示如下:
h(t)=Qh(t)+Px(t)
式中:Q∈RN×N为状态转移矩阵,决定状态变量h(t)各维度间相互作用与时变规律;P∈RN×1为输入矩阵,将外部输入x(t)∈R映射至状态空间;N为隐藏状态维度。
(2)观测方程描述从内部状态h(t)生成可观测输出y(t)∈R的映射关系,表示如下:
y(t)=Gh(t)
式中:G∈RN为输出矩阵,将高维内部状态投影至低维观测空间。
本文输入序列 $\left\{{\mathit{x}}_{1},{\mathit{x}}_{2},\dots,{\mathit{x}}_{\mathit{T}}\right\}$为视频帧提取的目标动作相关特征向量。状态转移矩阵Q用于学习动作演变的多尺度时间模式,输入矩阵P实现新观测特征对记忆状态的更新,输出矩阵G从连续内部状态中解码各时刻驾驶员行为的最优估计与分类结果。
图6左侧主干分支经1×1卷积层后,引入带跳跃连接的特征选择单元Fsc(·)与参数化特征激励单元Fex(·,W),保留高阶语义信息并缓解梯度弥散;右侧两路分支先经线性变换层完成特征压缩与通道对齐,一路经1×1卷积与σ激活函数生成静态通道注意力权重,另一路将压缩特征输入SSM实现动态时序建模,捕捉驾驶动作关键通道响应的演化趋势。两路分支输出经拼接操作c聚合为综合注意力表征,与左侧分支在特征缩放单元Fscale(·,·)完成逐通道仿射变换与加权融合,最终输出增强后的多尺度特征图。该并行多分支结构可有效捕获多尺度通道依赖关系,结合状态空间模型强化时序建模,提升关键通道特征的筛选与增强能力。
图6 通道注意力模块结构图

Fig.6 Structure Diagram of Channel Attention Module

2 实验设置

实验设置如表1所示。本文选取StateFarm、DMD、SAM-DD和SynDD1四个主流驾驶行为识别数据集,采用统一输入尺度与标准化训练协议,确保跨数据集对比的公平性与可复现性。所有实验均以10帧图像序列为网络输入,其中StateFarm原始数据为单帧图像,采用帧复制策略完成时序扩展以满足序列输入要求,其余视频数据集则按时间连续性均匀采样,保留原始动态上下文信息。训练阶段,批次大小设为32,优化器采用随机梯度下降方法,初始学习率设为5×10-4,训练轮数为50。为评估模型在分布偏移下的泛化能力与迁移性能,除标准域内训练与测试外,本文设计在DMD->StateFarm、SAM-DD->StateFarm、SynDD1->StateFarm 3组跨域迁移实验,验证模型从源域到目标域(StateFarm)的适应能力,其余实验均遵循标准数据集内划分规则,避免数据泄露。
表1 实验参数表

Tab.1 Experimental parameter table

数据集 数据类型 图像分辨率 训练细节 交叉试验
StateFarm 图片 224×224×3
(10帧,重复)
批次大小:32,优化器:随机梯度下降,
学习率:5×10-4,训练轮数:50
/
DMD 图片
视频
224×224×3
(10帧,重复)
批次大小:32,优化器:随机梯度下降,
学习率:5×10-4,训练轮数:50
DMD->StateFarm
SAM-DD 图片
视频
224×224×3
(10帧,重复)
批次大小:32,优化器:随机梯度下降,
学习率:5×10-4,训练轮数:50
SAM-DD->StateFarm
SynDD1 图片
视频
224×224×3
(10帧,重复)
批次大小:32,优化器:随机梯度下降,
学习率:5×10-4,训练轮数:50
SynDD1->StateFarm

3 结果与讨论

为验证模型各关键组件的有效性与泛化能力,本文在4个公开驾驶数据集上开展消融实验。研究人员分析特征增强模块、多帧时序输入机制、关键帧引导策略的单独作用与协同效果如表2所示。各模块均能有效提升模型性能,其中特征增强模块通过通道注意力强化判别特征表达,多帧输入机制捕获时序动作动态,关键帧引导策略实现高响应帧的语义聚焦,三者协同作用时性能增益最显著,验证了各组件的互补性与集成有效性。本文方法在StateFarm、DMD、SAM-DD数据集上分别达到97%、99%、98%;在SynDD1数据集上准确率达83%,显著优于所有消融变体,证明本文方法在多尺度特征增强与时序建模融合方面的优越性。
表2 消融实验结果统计表

Tab.2 Statistical Table of Ablation Experiment Results

模型 StateFarm
准确率/%
DMD
准确率/%
SAM-DD
准确率/%
SynDD1
准确率/%
CNN主干网 0.56 0.47 0.66 0.57
普通帧增强模块(w) 0.71 0.62 0.72 0.63
多帧时序输入机制(w) 0.80 0.69 0.69 0.68
关键帧引导策略(w) 0.76 0.70 0.70 0.70
特征增强模块(w/o) 0.89 0.85 0.85 0.77
多帧时序输入机制(w/o) 0.92 0.86 0.91 0.81
关键帧引导策略(w/o) 0.93 0.90 0.96 0.80
本文方法 0.97 0.99 0.98 0.83

注:w表示包含该模块;w/o表示不包含该模块。

本研究在4个数据集上开展现有算法与本文模型的性能对比,结果如表3所示。VGG16受结构冗余与归纳偏置限制,在SynDD1与DMD上表现较差,准确率仅13%、56%;ShuffleNet-v2、MobileNet-v2实现精度与效率的平衡,准确率达85%~96%,推理速度为12~16FPS,但时序建模能力不足。ViT、VideoCLIP在各数据集上准确率较高,VideoCLIP在DMD与SAM-DD数据集上准确率达98%,但计算复杂度高、推理速度仅7~9FPS,且对数据规模依赖较强。本文方法在所有数据集上均取得最优准确率,在DMD数据集上达99%,推理速度接近轻量级CNN模型,实现了性能与计算成本的最优权衡,展现出更强的实用性与泛化能力。
表3 与其他方法的结果统计对比表

Tab.3 Statistical comparison of results with other methods

方法 StateFarm DMD SAM-DD SynDD1
准确率/% FPS 准确率/% FPS 准确率/% FPS 准确率/% FPS
VGG16[11] 0.91 11.01 0.56 10.31 0.87 10.50 0.13 11.13
ResNet18[12] 0.93 15.36 0.86 13.16 0.88 12.77 0.48 12.97
ShuffleNet-v2[13] 0.95 16.17 0.85 15.19 0.96 13.69 0.63 15.07
MobileNet-v2[14] 0.94 15.34 0.90 13.07 0.95 13.01 0.65 12.79
ViT[15] 0.95 9.89 0.93 7.16 0.97 8.10 0.79 8.16
VideoCLIP[16] / / 0.98 8.70 0.98 7.90 0.82 8.93
Multi-frameCLIP / / 0.93 9.35 0.89 8.46 0.70 8.52
本文方法 0.97 16.07 0.99 14.35 0.98 13.09 0.83 13.97
表4为跨域迁移性能的定量对比结果,揭示不同模型在分布偏移场景下的泛化能力差异。VGG16依赖手工浅层特征且缺乏自适应归一化机制,跨域表现最差;ShuffleNet-v2、MobileNet-v2通过通道重排与深度可分离卷积提升特征解耦能力,域适应性有所增强;ViT、VideoCLIP凭借自注意力机制捕捉泛化语义特征,跨域任务表现稳健。本文方法在3项跨域测试中均取得最优性能,在SynDD1->StateFarm任务上准确率达86%,较最优对比模型VideoCLIP提升7个百分点。结果表明,本文方法通过特征增强、时序动态建模与关键帧引导的融合,构建了高判别性、强鲁棒性的特征空间,有效缓解域偏移带来的分布差异,显著提升跨域适应能力,为真实复杂场景下的驾驶行为识别提供实用解决方案。
表4 不同数据集的性能表现

Tab.4 Performance of different datasets

方法 DMD->StateFarm SAM-DD->StateFarm SynDD1->StateFarm
Top-1系数
准确率/%
Top-1系数
准确率/%
Top-1系数
准确率/%
VGG16 0.55 0.75 0.37
ResNet18 0.83 0.76 0.64
ShuffleNet-v2 0.81 0.83 0.75
MobileNet-v2 0.92 0.89 0.80
ViT 0.90 0.92 0.68
VideoCLIP 0.95 0.91 0.79
Multi-frameCLIP 0.83 0.85 0.73
本文方法 0.96 0.91 0.86
本文在SynDD1数据集上开展采样频率消融实验,分析采样频率对时序动作识别性能的影响,结果如表5所示。当采样频率低于0.5 FPS时,模型最优准确率仅61%,过低采样率破坏时序连续性,无法有效建模动作演化过程;采样频率提升至1FPS,准确率达76%,可捕获部分关键姿态变化与动作起止点,具备初步动作判别能力;采样频率增至10 FPS,模型性能趋于收敛至最优,密集时间采样增强动作片段的完整性与上下文连贯性,利于网络学习高判别性时序表征;采样频率提升至20 FPS,帧间高度相关性导致信息冗余、计算开销增加,同时降低训练样本有效多样性,加剧过拟合,泛化能力下降。因此,采样频率为10 FPS时,模型在动作信息完整性、时序建模有效性与计算效率间实现最优平衡。此外,SynDD1->StateFarm跨域测试结果与本地评估趋势一致,且目标域表现更优,证明合理采样策略习得的时序表征具备良好可迁移性,验证了采样频率对时序模型性能的关键影响。
表5 在SynDD1数据集上不同采样率下的视频片段

Tab.5 Video clips at different sampling rates on the SynDD1 dataset

采样率/
(FPS)
SynDD1 SynDD1->StateFarm
Top-1系数准确率/% Top-1系数准确率/%
0.5 0.63 0.61
1 0.76 0.75
2 0.66 0.63
5 0.75 0.79
10 0.83 0.86
20 0.82 0.85
为评估方法鲁棒性,本文在StateFarm数据集上统计多次实验最优准确率,绘制均值与方差分布图,如图7所示。本文方法平均准确率达99%,显著优于对比模型,同时方差更小,表明方法在不同运行条件下保持性能稳定,对数据分布波动与实验随机性具备强适应能力,验证了其优异鲁棒性。
图7 StateFarm数据集上的准确率平均值及方差图

Fig.7 Average and variance of accuracy rate on the StateFarm dataset

本文在DMD数据集上开展细粒度分心驾驶行为识别实验,结果如表6所示。A1、A2、A3、A8、A9五类动作识别得分超0.9,表明模型对特征显著行为具备优异判别能力;A4、A7等动作得分0.8~0.9,表明模型对细微动作、手部中距离移动具备较强局部运动感知能力。结果表明,单帧输入下本文方法可有效捕捉关键人体姿态线索,适用于多数分心行为的细粒度分类。部分动作类别识别性能偏低,主要受实际场景视觉遮挡、肢体移出检测框、类别定义模糊(如“安全驾驶”无显著动作特征)、视角偏差(侧向伸展动作二维投影位移微弱)等因素影响,揭示单帧输入模型在高遮挡、低动态对比度、视角敏感场景下的固有局限,为后续引入时序建模与多视角融合优化提供方向。
表6 本文方法(单帧)在DMD数据集上的性能统计表

Tab.6 Performance statistics table of the proposed method (single frame) on the DMD dataset

序号 动作分类 得分
A1 喝水 0.97
A2 梳头和化妆 0.92
A3 打电话 0.97
A4 调节音响 0.86
A5 伸向后座 0.73
A6 伸向侧边 0.59
A7 打哈欠 0.80
A8 与乘客说话 0.91
A9 手机打字 0.92
A10 安全驾驶 0.70
为验证表6结果可靠性,本文在DMD数据集上构建单帧输入下模型预测结果与真实标签的混淆矩阵,实现分类性能细粒度可视化分析,如图8所示。A1、A2、A3、A8、A9等类别分类准确率高、类别混淆率低,与表6定量结果一致,验证模型对特征显著、姿态稳定动作的强判别能力。性能较低类别的分析结果进一步印证单帧输入范式的固有局限。
图8 本文模型(单帧)在 DMD 数据集上的混淆矩阵

Fig.8 Confusion matrix of the proposed model (single frame) on the DMD dataset

为验证该问题的普适性,本文在StateFarm与SAM-DD数据集上统计典型错误案例,如图9所示。即使高性能模型下,“打电话”与“与乘客交谈”“发短信”与“低头”等动作在单帧姿态高度重叠易发生误判,仅依靠空间特征无法精准区分。因此,本文引入时序建模、分析连续帧间的运动轨迹是突破单帧模型性能瓶颈的有效技术路径,多帧输入结合时序建模与注意力机制可强化对细微动态特征的捕捉能力。
图9 本文方法(单帧)在StateFarm和SAM-DD数据集上的典型错误分类案例

Fig.9 Illustrates typical erroneous classification cases of the proposed method (single frame) on the StateFarm and SAM-DD datasets

4 结束语

本文提出一种基于关键帧引导与自适应通道MAMBA的视频分心驾驶识别方法,通过融合外观特征、骨架结构先验与时序上下文信息,构建复杂驾驶场景下的多模态时序建模框架,显著提升了行为识别的准确性与鲁棒性。该方法首次将MAMBA模型应用于视频行为识别与多模态时序融合任务,依托其隐藏状态空间建模能力,结合关键帧驱动特征选择机制与通道自适应增强模块,实现判别性特征的动态聚焦与加权融合,具备技术创新性与前瞻性。消融实验验证了各组件对性能提升的显著作用,揭示了单帧输入在动作混淆、遮挡、细微动作识别中的固有局限;经多维度分析确定10 FPS为最优采样频率,实现时序完整性与计算开销的最优平衡。综合实验结果表明,该方法在多个数据集上均取得优异性能,具备良好泛化能力与实际部署潜力,为复杂场景下分心驾驶实时监测提供理论支撑与技术路径。
未来研究可引入可解释性注意力与因果推理模块,增强模型决策过程的透明性与可信性,满足自动驾驶安全合规要求;同时开展连续驾驶行为理解与预测任务,实现从被动识别到主动预警的技术演进。
[1]
王青治, 吴有龙, 赵雨欣, 等. 面向疲劳驾驶的车辆安全预警监测系统[J]. 物联网技术, 2025, 15(11): 26-28, 32.

Wang Q Z, Wu Y L, Zhao Y X, et al. Vehicle safety early warning and monitoring system for fatigue driving[J]. Internet of Things Technologies, 2025, 15(11): 26-28, 32.

[2]
Singh S. Critical reasons for crashes investigated in the national.Motor vehicle crash causation survey[R]. 2015.

[3]
Ge H, Bo Y. Literature review of driving risk identification research based on bibliometric analysis[J]. Journal of Traffic and Transportation Engineering(English Edition), 2023, 10(4):560-577.

[4]
闫洪枚, 王春军. 基于Mamba的无监督汽车衡异常行为识别系统[J]. 信息与电脑, 2025, 37(15): 7-9.

Yan H M, Wang C J. Unsupervised abnormal behavior recognition system for truck scales based on mamba[J]. Information & Computer, 2025, 37(15): 7-9.

[5]
Manessi F, Rozza A, Manzo M. Dynamic graph convolutional networks[J]. Pattern Recognition, 2020(97):10.

[6]
Li Y, Wang Y, Qin C, et al. USDRL: Unified Skeleton-Based dense Representation Learning with Multi-Grained Feature Decorrelation[C]// Proceedings of the AAAI Conference on Artificial Intelligence: Vancouver, 2024:13 506-13 514.

[7]
胡一康. 基于关键帧增强与多标签语义学习的视频描述研究及应用[D]. 黄石: 湖北师范大学, 2025.

Hu Y K. Research and application of video description based on key frame enhancement and multi-label semantic learning[D]. Huangshi: Hubei Normal University, 2025.

[8]
杨秋菊, 肖雪梅. 基于改进Canny特征点的SIFT算法[J]. 计算机工程与设计, 2011, 32(7): 2 428-2 431,2 458.

Yang Q J, Xiao X M. Improved SIFT algorithm based on Canny feature points[J]. Computer Engineering and Design, 2011, 32(7): 2 428-2 431,2 458.

[9]
Zhang X P, Wu X J, et al. A light-weight mamba for low-light image enhancement[J]. Circuits, Systems, and Signal Processing, 2025, 45(11):1-21.

DOI

[10]
袁康, 王旭智, 万旺根, 等. 一种基于CLIP和动态语义优化的文本到3D形状生成方法[J]. 工业控制计算机, 2026, 39(1): 47-48, 54.

Yuan K, Wang X Z, Wan W G, et al. A text to 3D shape generation method based on CLIP and dynamic semantic optimization[J]. Industrial Control Computer, 2026, 39(1): 47-48, 54.

[11]
张亚军, 王聪聪, 贾广成, 等. 改进VGG-16的轻量级手势识别研究[J]. 现代电子技术, 2025, 48(23): 137-143.

Zhang Y J, Wang C C, Jia G C, et al. Research on lightweight gesture recognition based on improved VGG-16 model[J]. Modern Electronics Technique, 2025, 48(23): 137-143.

[12]
李霖, 车刚. 基于无人机图像和改进ResNet18的水稻成熟度轻量化检测方法研究[J/OL]. 南京农业大学学报, 2026:1- 13[2026-01-1].

Li L, Che G. Research on lightweight detection method for rice maturity based on UAV images and improved ResNet18[J/OL]. Journal of Nanjing Agricultural University, 2026:1- 13[2026-01-1].

[13]
张靖晗. 基于ShuffleNet V2的垃圾图像分类方法研究[D]. 西安: 西安电子科技大学, 2023.

Zhang J H. Research on garbage image classification method based on ShuffleNet V2[D]. Xi’an: Xidian University, 2023.

[14]
张明, 孙晓丽. 基于MobileNet V2模型迁移学习的垃圾图像分类算法[J]. 湖北工业职业技术学院学报, 2024, 37(5): 67-72.

Zhang M, Sun X L. Garbage image classification algorithm based on MobileNet V2 model transfer learning[J]. Journal of Hubei Industrial Polytechnic, 2024, 37(5): 67-72.

[15]
张津, 冯凡, 戴晨光, 等. 基于CNN-ViT混合特征优化的小样本高光谱图像分类[J]. 测绘学报, 2025, 54(12): 2 233-2 246.

Zhang J, Feng F, Dai C G, et al. Small-sample classification of hyperspectral images based on mixed CNN ViT feature optimization[J]. Acta Geodaetica et Cartographica Sinica, 2025, 54(12): 2 233-2 246.

[16]
杨颖, 宋元冰, 张一峰, 等. 基于Mamba与注意力机制的三阴性乳腺癌超声图像分类方法[J]. 海军军医大学学报, 2026, 47(1):37-45.

Yang Y, Song Y B, Zhang Y F, et al. Classification of triple-negative breast cancer ultrasound images based on Mamba and attention mechanisms[J]. Academic Journal of Naval Medical University, 2026, 47(1): 37-45.

Outlines

/