Cyber Security

Lightweight and secure fine-tuning method for large models in network-centric operation and maintenance

  • Chen Nan 1 ,
  • Song Yubo 2, ,
  • Zhu Zhongma 3
Expand
  • 1 Office of Data and Information Management, Soochow University, Suzhou 215006, China
  • 2 School of Cyber Science and Engineering, Southeast University, Nanjing 210008, China
  • 3 The 28th Research Institute of China Electronics Technology Group Corporation, Nanjing 210000, China

Received date: 2025-05-31

  Revised date: 2025-07-08

  Online published: 2026-07-30

Abstract

The intelligent upgrade of network-centric operation and maintenance systems relies on the efficient deployment of large language models (LLMs). However, resource-constrained edge environments and dynamic adversarial threats pose dual challenges to traditional fine-tuning methods. Existing approaches often address computational efficiency and model security in isolation, leading to lightweight strategies that compromise defense capabilities or security mechanisms that exacerbate resource consumption. To resolve this conflict, this paper proposes a Lightweight and Secure Co-Tuning Framework (LST-Framework) that achieves multi-objective optimization through dynamic parameter sparsification and hierarchical defense mechanisms. The method first constructs a task-sensitive dynamic parameter activation strategy, identifying redundant weights via spectral analysis of the Hessian matrix to establish sparse fine-tuning paths, reducing computational complexity to 23% of full-parameter fine-tuning. Simultaneously, a three-tier defense system—comprising adversarial input detection, lightweight gradient masking, and output uncertainty verification—enhances robustness against white-box attacks with only an 8% increase in inference overhead. Experiments on typical network operation datasets (e.g., CIC-IDS2017) demonstrate that the LST framework maintains 98.3% original task accuracy while compressing memory usage by 51.7%, reducing inference latency by 32.4%, and successfully resisting 94.6% of PGD-targeted attacks. This work provides theoretical and technical foundations for deploying large models in low-resource, high-security scenarios such as 5G core networks and industrial IoT.

Cite this article

Chen Nan , Song Yubo , Zhu Zhongma . Lightweight and secure fine-tuning method for large models in network-centric operation and maintenance[J]. Command Control and Simulation, 2026 , 48(4) : 57 -65 . DOI: 10.3969/j.issn.1673-3819.2026.04.008

网络中心化运维系统的复杂性持续增长,驱动人工智能技术成为实现自动化故障诊断、流量调度与威胁拦截的核心工具[1]。然而,大语言模型(LLM)在边缘计算节点或工业物联网终端的部署面临显著矛盾:模型参数量激增引发的计算开销与动态对抗环境下的安全脆弱性形成双重约束[2]。研究表明,全参数微调(Full Fine-Tuning)在典型网络运维任务中需占用内存超过16 GB,且对对抗攻击的误检率高达34.7%,难以满足低资源场景的实时性与可靠性需求[3]
现有研究通过参数高效微调(PEFT)技术(如LoRA、Adapter)部分缓解了计算压力,但其孤立优化模式导致安全防护机制被边缘化[4]。例如,对抗训练(Adversarial Training)虽能提升模型鲁棒性,但会引入额外20%—40%的训练成本,与轻量化目标直接冲突[5]。另一方面,基于梯度掩码(Gradient Masking)输入净化的防御策略虽降低了计算负载,但因忽略模型内部参数敏感性而牺牲泛化性能。这种“效率—安全”的零和博弈,严重制约了大模型在网络中心化运维中的规模化应用[6]
针对上述挑战,本文提出一种轻量化安全协同微调框架(LST-Framework),其核心创新在于将参数效率优化与动态威胁防护解耦为可微调的联合目标。首先,基于任务驱动的Hessian矩阵谱分析,构建参数重要性动态评估模型,实现微调过程中冗余权重的实时剪枝与关键路径的稀疏激活,使训练内存占用降低至传统方法的23%。其次,设计多层级防御机制:在输入层集成基于局部流形嵌入的对抗样本检测器,在模型层部署轻量化对抗扰动抑制策略(仅作用于Top-5%敏感参数),并在输出层引入不确定性校准模块以拦截异常推理结果。该体系在保证防御强度的同时,将额外计算花费控制在8%以内。
实验部分基于CIC-IDS2017入侵检测数据集与工业网络日志基准验证框架效能。结果表明,LST框架在BERT-base模型上实现51.7%的内存压缩与32.4%的推理加速,同时将PGD白盒攻击成功率从68.2%降至5.4%,且任务精度损失不足1.2%。此外,框架支持边缘设备的增量式更新,可为5G核心网动态运维等场景提供可扩展解决方案。

1 相关工作

1.1 大模型轻量化微调技术

参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)通过冻结主干网络并引入可训练子模块(如LoRA的低秩适配器[6]、Adapter的瓶颈层[7]),显著降低大模型迁移成本。文献[8]进一步提出动态参数激活策略,基于任务损失梯度动态选择微调路径,使CIFAR-10分类任务训练内存降低37%。然而,现有方法多聚焦于通用NLP任务,未能考虑网络运维数据流的高维时序特性导致的稀疏性分布差异。例如,Prefix-Tuning[9]在流量预测任务中因固定前缀长度限制,易引发过拟合,实验显示验证集MAE增加19.2%。

1.2 大模型对抗安全防御

针对对抗攻击,文献[10]提出的PGD对抗训练仍是主流方案,但其需在全参数空间生成扰动,会导致ResNet-50训练时间增加2.3倍。近期有学者研究尝试局部防御策略:文献[11]设计了基于注意力权重的敏感参数筛选机制,仅对Top-K参数施加梯度扰动,使ImageNet对抗训练花费减少44%。然而,此类方法在网络运维场景中面临新挑战——攻击者可通过协议字段篡改构造语义合法但逻辑异常的对抗样本,如DNS隐蔽隧道攻击,传统图像领域防御策略对此类威胁的拦截失败率高达68.9%[12]

1.3 网络运维智能化方法

基于AI的运维系统已取得初步进展:文献[13]利用LSTM实现网络流量异常检测,但在处理多协议混合流量时AUC-ROC不足0.81;文献[14]将BERT应用于日志解析,但其静态微调模式导致边缘设备内存溢出风险增加73%。值得关注的是,文献[15-16]提出联邦学习框架以实现跨节点知识共享,但未解决模型更新过程中的对抗投毒攻击问题实验显示,恶意节点注入可使全局模型F1-score下降31.4%。

2 方法论

2.1 整体框架设计

轻量化安全协同微调框架为网络中心化运维中资源受限场景下的大模型微调设计了一种高效且安全的解决方案,通过动态稀疏化与多层级防御机制实现效率与安全的协同优化。其核心设计包含三个模块,如图1:动态稀疏化微调模块、多层级安全防护模块和增量微调模块。
图1 轻量化安全协同微调框架

Fig.1 Lightweight security collaborative fine tuning framework

动态稀疏化微调模块基于Hessian矩阵谱分析评估参数重要性,构建任务敏感型参数激活策略,通过指数衰减调度函数动态剪枝冗余权重,仅更新高敏感参数以降低计算复杂度。
多层级安全防护模块包括三层设计:输入层采用流形约束净化,通过自编码器学习正常样本流形结构以检测对抗样本;模型层施加定向对抗训练,仅对敏感参数子集生成扰动以提升鲁棒性;输出层引入蒙特卡洛Dropout进行不确定性校准,拦截异常推理结果。
增量微调模块通过弹性权重巩固约束,支持边缘设备在线更新,防止灾难性遗忘。该框架通过解耦效率与安全优化目标,确保在低资源环境中实现高效部署与动态威胁防护。

2.2 问题建模与优化目标

设预训练大模型参数为θ0Rd,网络运维数据集为$\mathcal{D}=\left\{\left(x_{i}, y_{i}\right)\right\}_{i=1}^{N}$,其中xiRm为流量矩阵或协议字段(如TCP包头特征),yi∈{0,1}表示异常标签。优化目标被定义为
$\underset{\mathit{\theta }}{\mathit{m}\mathit{i}\mathit{n}}$Ltask(θ)+λ1θ-θ01+λ2Radv(θ)s.t.θ-θ00B
式中:Ltask为任务损失(交叉熵或均方误差);λ1为稀疏化惩罚系数(默认为0.1);λ2为对抗鲁棒性系数(默认为0.05);Rabv为对抗风险项,用于量化模型输出对扰动的敏感性;B为稀疏度预算(如边缘设备显存限制为2 GB时,B=0.2|θ0|)。

2.3 动态稀疏化微调

基于二阶优化理论,参数θj的重要性由Hessian矩阵对角线元素量化:
Hjj=E(x,y) $\left[\frac{{\partial }^{2}{\mathit{L}}_{\mathit{t}\mathit{a}\mathit{s}\mathit{k}}}{\partial {\mathit{\theta }}_{\mathit{j}}^{2}\mathit{ }}\right]$$\frac{1}{\mathit{N}}\sum _{\mathit{i}=1}^{\mathit{N}}{\left(\frac{\partial {\mathit{L}}_{\mathit{t}\mathit{a}\mathit{s}\mathit{k}}}{\partial {\mathit{\theta }}_{\mathit{j}}}|{\mathit{ }}_{({\mathit{x}}_{\mathit{i}},{\mathit{y}}_{\mathit{i}})}\right)}^{2}$
引入平滑因子η=10-6防止数值溢出,归一化敏感度得:
sj= $\frac{{\mathit{H}}_{\mathit{j}\mathit{j}}}{\underset{1\mathit{k}\mathit{d}}{\mathit{m}\mathit{a}\mathit{x}}{\mathit{H}}_{\mathit{k}\mathit{k}}+\mathit{\eta }}$∈[0,1]
物理意义:sj越接近1,表示参数θj对任务损失的贡献越大。
设计指数衰减的稀疏率调度函数,控制每轮训练的参数量:
$\begin{array}{c} \rho(t)=\rho_{\text {init }} \cdot e^{-k t}+\rho_{\text {final }} \\ \left(\rho_{\text {init }}=0.8, \rho_{\text {final }}=0.2, k=0.05\right) \end{array}$
每轮选择Top(td高敏感参数进行更新:
${\mathit{\theta }}_{\mathit{j}}^{\mathit{t}+1}$= ${\mathit{\theta }}_{\mathit{j}}^{\mathit{t}}$-α· ${\mathit{m}}_{\mathit{j}}^{\mathit{t}}$· ${\nabla }_{{\mathit{\theta }}_{\mathit{j}}}$Ltotal
其中: ${\mathit{m}}_{\mathit{j}}^{\mathit{t}}$=( ${\mathit{S}}_{\mathit{j}}^{\mathit{t}}$>τ)为二值掩码(τ=0.5为经验阈值);α为学习率(默认为10-4)。
式(4)的指数衰减策略可避免初始阶段过度剪枝,式(5)将显存占用从O(d)降至O(ρ(t)d)。伪代码如下:

动态稀疏化微调伪代码
1: Input:模型参数θ,数据集D,稀疏预算B,学习率η,衰减率k;
2:初始化参数和敏感度矩阵;
3: for all t=1 to T_max do ▷设置最大训练轮数
4: 使用Hessian矩阵计算每个参数的敏感度;
5: 归一化敏感度得分S;
6: for all s=1 to S_max do ▷为每个参数子集计算敏感度
7: 计算稀疏率pt;
8: 根据Spt设置参数掩码M
9: θactiveθ×M ▷提取用于更新的活跃参数
10: while θactive 未收敛do ▷确保活跃参数被更新
11: for i=1:n do
12: 计算任务损失;
13: end for
14: 使用梯度下降更新θactive
15: if满足收敛条件then
16: 跳出更新循环;
17: else
18: 继续梯度下降;
19: end if
20: end while
21: θ← Update_Model (θ, θactive,M) ▷更新完整模型参数
22: end for
23:根据损失判断训练是否满足收敛条件;
24: end for
25:计算本次迭代的内存使用量;
26:更新当前轮次的最小内存成本;
27:更新当前最佳版本的参数子集;
28: Output:更新后的模型参数θ;

2.4 多层级安全防护

输入层:流形约束净化
假设正常样本位于低维流形MRm,训练自编码器(E,D)学习流形结构$\mathcal{E}$:RmRk,D:RkRm(k=0.1 m),定义输入x的流形偏离度:
$d(x)=\|x-\mathcal{D}(\mathcal{E}(x))\|_{2}^{2}$
动态设定阈值κt=μt+3σt(μtσt为当前批次d(x)的均值和标准差),对异常样本执行投影净化:
$x_{\mathrm{pur}}=\mathcal{D}(\mathcal{E}(x))+\beta(x-\mathcal{D}(\mathcal{E}(x)))(\beta \in[0,1])$
通过可微搜索优化β:
β*=arg $\underset{\mathit{\beta }}{\mathit{m}\mathit{i}\mathit{n}}$fθ(x)-fθ(xpur) ${\Vert }_{2}^{2}$
其中,fθ(·)为模型中间特征。实验表明,当β=0.7时,对抗扰动幅度降低58%
模型层:定向对抗训练
仅对敏感参数子集Sk={j|Sj排名前K}施加对抗扰动。生成定向攻击样本;
$x_{\mathrm{adv}}=x+\varepsilon \cdot \operatorname{sign}\left(\sum_{j \in \mathcal{S}_{K}} \nabla_{x} \nabla_{\theta_{j}} \mathcal{L}_{\text {task }}\right) \quad(\epsilon=0.1)$
定义梯度对齐损失:
$\mathcal{L}_{\mathrm{adv}}=\sum_{j \in \mathcal{S}_{K}}\left|\cos \left(\nabla_{\theta_{j}} \mathcal{L}_{\text {task }}(x), \nabla_{\theta_{j}} \mathcal{L}_{\text {task }}\left(x_{\text {adv }}\right)\right)\right|$
技术优势:相较于全参数对抗训练,计算花费从O(d)降至(O(K)(K=0.05d时减少95%)。
输出层:不确定性校准
采用蒙特卡洛Dropout估计预测熵:
H(y|x)=- $\sum _{\mathit{c}=1}^{\mathit{C}}\widehat{\mathit{p}}$log ${\widehat{\mathit{p}}}_{\mathit{c}}$ ${\widehat{\mathit{p}}}_{\mathit{c}}$= $\frac{1}{\mathit{T}}\sum _{\mathit{t}=1}^{\mathit{T}}$p(y=c|x,θ(t))(T=50)
动态设定阈值:
$H_{\text {thres }}=\mu_{H}+\Phi^{-1}(1-\alpha) \cdot \sigma_{H} \quad(\alpha=0.05)$
H(y|x)>Hthres时触发人工审核,误检率控制在5%以内。伪代码如下:

多层级安全防护伪代码
1: Input:输入数据X,模型参数θ;
2:初始化自编码器(E,D)和敏感度矩阵;
3: for all x=1 to X_max do ▷设置最大输入样本数
4: 使用流形约束计算每个输入的偏差;
5: for all d=1 to D_max do ▷为每个输入维度计算偏差
6: 计算输入x与流形的偏差;
7: while偏差未在阈值范围内do ▷检查输入是否异常
8: for k=1:n do
9: 计算动态阈值;
10: end for
11: if偏差大于阈值then
12: 净化输入x;
13: else
14: 保持输入x不变;
15: end if
16: end while
17: end for
18: 计算参数θ的敏感度S
19: for all s=1 to S_max do ▷选择敏感参数
20: 选择敏感参数更新θsensitive
21: 生成对抗样本xadv;
22: 计算对齐损失;
23: end for
24: 更新θ;
25: ypred←Model_Predict(x,θ,Dropout=True) ▷输出层:不确定性校准
26: for all y=1 to Ymax do ▷为每个预测计算不确定性
27: 计算预测的熵值;
28: if熵值大于阈值then
29: 触发人工审核;
30: else
31: 接受预测结果;
32: end if
33: end for
34: 根据熵值判断防御是否拦截所有威胁;
35: end for
36: Output:更新后的模型参数θ和预测结果ypred;
多层级防御体系通过输入层流形净化、模型层定向对抗训练和输出层不确定性校准的协同作用,显著提升了模型对抗攻击的鲁棒性,同时保持低计算花费。输入层通过自编码器学习正常样本的低维流形结构(式6),对输入样本进行投影净化(式7),将对抗扰动幅度降低58%,使对抗样本的特征分布与正常样本更接近(JS散度从0.82降至0.11,见图7)。将净化后的清洁表示作为模型层的输入,显著减少了模型层对抗训练的扰动敏感性,为后续定向对抗训练提供了更稳定的特征基础,从而提升防御效率。模型层基于这些清洁表示,结合Hessian矩阵敏感度分析(式3),仅对Top-5%敏感参数子集施加定向对抗扰动(式9),降低了对抗训练的计算花费(从全参数的O(N)降至O(0.05N),见式10),并进一步增强对白盒攻击如PGD的鲁棒性,防御成功率达94.6%(表3)。输入层的净化效果使模型层能更聚焦于关键参数的对抗优化,避免因噪声干扰导致的过拟合。输出层通过蒙特卡洛Dropout(见式11)对模型预测进行不确定性估计,利用输入层和模型层的处理结果动态调整熵阈值(见式12),使预测熵分布更稳定,触发人工审核的误检率控制在5%以内(见表3)。输出层校准作为最后一道防线,确保即使部分对抗样本绕过前两层,也能被有效拦截。三层防御模块共享参数敏感度评估结果(基于Hessian矩阵),避免冗余计算,例如输入层净化使用的流形约束与模型层敏感参数选择共享相同的任务损失梯度信息,输出层的不确定性校准则直接受益于前两层的稳定特征表示。这种共享机制将整体防御体系的额外计算花费控制在8%以内(见表3),实现了高效的协同优化。各层模块通过数据流和共享信息的闭环交互,共同构建了高效且鲁棒的防御体系。

2.5 增量微调机制

定义参数重要性矩阵:
Ωj= $\frac{1}{\mathit{N}}\sum _{\mathit{i}=1}^{\mathit{N}}{\left(\frac{\partial {\mathit{L}}_{\mathit{t}\mathit{a}\mathit{s}\mathit{k}}\left({\mathit{x}}_{\mathit{i}}\right)}{\partial {\mathit{\theta }}_{\mathit{j}}}\right)}^{2}$
增量更新时,施加弹性权重巩固(EWC)约束:
Linc=Ltask+ $\sum _{\mathit{j}=1}^{\mathit{d}}$Ωj(θj- ${\mathit{\theta }}_{\mathit{j}}^{\mathit{o}\mathit{l}\mathit{d}}$)2
同时限制参数更新幅度:
θt+1-θt2εinc $\sqrt{\mathit{\rho }\left(\mathit{t}\right)\mathit{d}}$(εinc=0.1)
在工业物联网数据集上,该机制使灾难性遗忘率从传统方法的21.3%降至3.8%。

3 实验与评估

3.1 实验设置

实验基于3个网络运维基准数据集(见表1),覆盖入侵检测、流量分类与设备故障预测场景。硬件平台为NVIDIA Jetson AGX Xavier边缘计算模块,模拟真实部署环境。基线方法包括主流轻量化微调(LoRA、Adapter)与安全增强方案(PGD对抗训练、差分隐私)。评估指标分为任务性能(F1-score、MAE)、安全鲁棒性(对抗攻击成功率、隐私泄露率)与计算效率(内存占用、推理延迟)。超参数经网格搜索确定,所有实验重复5次取均值。
表1 实验数据集统计

Tab.1 Statistics of experimental dataset

数据集 样本数量 特征维度 任务类型 对抗攻
击类型
CIC-
IDS2017
2.8 M 78 多分类
入侵检测
FGSM、PGD、
C&W
TON_IoT 1.5 M 45 二分类异
常检测
JSMA、
DeepFool
Factory
Logs
860 K 32 回归故
障预测
时序对
抗样本

3.2 消融实验分析

为验证各模块贡献,本文设计四组对照实验。LST-ND:移除安全防护模块;LST-NS:禁用动态稀疏化;LST-NI:关闭增量学习;Full Model:完整LST框架。
图2所示,完整模型在CIC-IDS2017上实现最高F1-score(98.3%)与最低对抗成功率(5.4%)。移除安全防护(LST-ND)导致对抗攻击成功率升至41.2%,证明多层级防御的有效性;禁用动态稀疏化(LST-NS)使内存占用增加52%,凸显参数效率优化的重要性。图3进一步展示稀疏率p(t)的调度过程——初期保留80%参数来保证收敛稳定性,后期压缩至20%以降低资源消耗。
图2 模型性能对比分析

Fig.2 Comparative analysis of model performance

图3 动态参数稀疏化调度过程

Fig.3 Dynamic parameter sparsification scheduling process

3.3 对比实验结果

与7种基线方法对比(见表2),LST框架在任务性能与安全性上均取得最优权衡。在TON_IoT数据集上,LST的F1-score(96.7%)较LoRA+PGD提升3.1%,内存占用(1.2 GB)仅为全参数微调的22%。图4可视化不同方法的帕累托前沿——LST最接近右上理想点(高精度、低开销)。针对工业场景的FactoryLogs数据集,LST的MAE(0.082)较Adapter降低29%,且对T-FGSM攻击的预测偏差控制在±0.015内(见图5)。
表2 多维度性能对比(CIC-IDS2017数据集)

Tab.2 Multidimensional performance comparison (CIC-IDS2017 dataset)

方法 F1-score/
%
对抗攻击
成功率/%
内存/
GB
延迟/
ms
Full Fine-Tune 98.6 68.2 5.8 42.1
LoRA 97.1 53.4 1.8 28.3
Adapter 96.8 49.7 2.1 31.6
PGD-AT 95.3 12.7 6.2 45.8
LST (Ours) 98.3 5.4 1.2 22.7
图4 多目标优化帕累托前沿分析

Fig.4 Multiobjective optimization Pareto front analysis

图5 预测偏差分析

Fig.5 Prediction deviation analysis

3.4 安全鲁棒性验证

测试4类白盒攻击(FGSM、PGD、C&W、T-FGSM)与2类隐私攻击(成员推理、模型反演)。如图6所示,LST对PGD攻击的防御成功率(94.6%)较LoRA+PGD提升37.8%,且成员推理攻击准确率被抑制至51.3%(接近随机猜测)。图7展示输入净化模块的效果——对抗样本经流形投影后,其特征分布与正常样本的JS散度从0.82降至0.11。表3进一步量化多层级防御的独立贡献:单独使用输入净化可拦截63%的攻击,结合模型层对抗训练后提升至89%,最终通过输出校准达到94.6%。
图6 多维度攻击防御效能分析

Fig.6 Multidimensional attack defense effectiveness analysis

图7 输入净化模块特征分布优化

Fig.7 Optimization of input purification module feature distribution

表3 层级防御机制消融分析

Tab.3 Analysis of the ablation of hierarchical defense mechanisms

防御组合 PGD攻击成功率/% 计算开销增幅/%
无防护 68.2 0
仅输入净化 25.4 2.1
输入+模型层 7.9 5.3
输入+模型+输出层 5.4 8.0

3.5 计算效率与可扩展性

在Jetson AGX Xavier上实测推理性能(见图8),LST的峰值内存占用为1.2 GB,满足边缘设备限制(2 GB);批处理延迟为22.7 ms,满足5G核心网实时性需求(<30 ms)。图9展示模型随节点数扩展的吞吐量——在200个边缘节点并发时,LST的吞吐量(1 580 req/s)较全参数微调提升6.8倍。图10对比不同稀疏预算B的影响:当B=0.3|θ|时,F1-score仅下降0.8%,证明框架对资源约束的强适应性。
图8 边缘设备性能3D曲面图

Fig.8 3D surface diagram of edge device performance

图9 吞吐量扩展性热力图

Fig.9 Heat map of throughput scalability

图10 稀疏预算等高线图

Fig.10 Sparse budget contour map

3.6 工业物联网案例研究

本文在某智能工厂部署LST框架进行设备故障预测(见图11)。经12周运行,模型平均预测误差为0.085,成功拦截23次T-FGSM白盒攻击。图12展示某次轴承故障的预测过程——LST提前4.7小时发出预警,且对抗扰动未影响预测结果(偏差<0.01)。运维人员误检率从15.3%降至2.1%,验证框架的实际价值。
图11 部署效果极坐标热图

Fig.11 Deployment effect polar coordinate heat map

图12 故障预测时空图

Fig.12 Time space diagram of fault prediction

4 讨论

4.1 轻量化与安全性的协同机制

图2所示,LST框架在CIC-IDS2017数据集上实现98.3% F1-score(表2),LST框架通过动态稀疏化与多层级防御的协同设计,首次实现了大模型在网络运维场景中效率与安全的均衡优化。相较于传统孤立优化方案(如LoRA+对抗训练),LST在保持98.3%任务精度的同时,将内存占用降低51.7%,对抗攻击成功率抑制至5.4%。这一突破的核心在于参数敏感度驱动的资源分配策略:动态稀疏化模块基于Hessian矩阵谱分析,优先保留对任务与安全均敏感的权重,而输入层流形净化与模型层定向对抗训练共享敏感度评估结果,避免冗余计算。图3的动态稀疏化调度曲线显示,当稀疏率P(t)的衰减速率K设为0.05时(式5),模型在训练初期保留80%参数以保证收敛稳定性(损失下降速度提升22%),后期压缩至20%以适配边缘资源限制。这一动态机制解决了传统静态剪枝导致的精度骤降问题,例如Deep Compression在同等稀疏率下F1-score下降9.2%。

4.2 对抗鲁棒性的本质来源

多层级防御体系的设计显著提升了模型对新型攻击的适应性。表3的多层级防御消融实验表明,输入层流形净化可拦截63%的语义合法攻击(如DNS隐蔽隧道),而模型层定向对抗训练使PGD攻击成功率降低67.3%。值得注意的是,输出层不确定性校准(式12)虽仅贡献4.6%的防御增益,但其在误检率控制上具有关键作用。人工审核触发率稳定在5%以下,较传统固定阈值方法减少8.7%的运维干预成本。进一步可视化分析(图7)揭示,对抗样本经流形投影后,其潜在特征与正常样本的KL散度从0.82降至0.11,验证了输入净化模块在特征空间对齐中的有效性。

4.3 边缘部署的实践挑战

尽管LST框架在实验中展现出优越性能,其在实际部署中仍面临以下挑战:
在异构硬件适配方面,不同边缘设备(如GPU与NPU)对稀疏矩阵运算的加速效率差异显著,例如在Jetson AGX Xavier上测得的稀疏加速比为2.3倍,而在华为昇腾910上仅为1.7倍,这凸显了未来设计更具硬件感知能力的稀疏模式以提升框架普适性的必要性。
动态威胁响应也是关键挑战,当前静态防御参数在面对持续进化的对抗攻击,如自适应投影梯度下降攻击时,可能导致防护滞后;实验中发现,当攻击迭代次数超过50步时,防御成功率会下降至82.4%,因此引入在线对抗样本生成与模型增量更新机制成为一种潜在的解决方案。
在多租户隔离问题上,云边协同架构中多个租户模型的共置可能引发资源竞争,实测数据表明,当8个LST实例并行运行时,单节点延迟会从22.7 ms显著增至41.5 ms,这迫切要求进一步优化内存共享策略以保障服务质量和效率。

5 结束语

LST框架作为一种面向网络中心化运维的轻量化安全大模型微调框架,通过动态稀疏化与多层次防御机制的协同设计,有效解决了资源受限场景下效率与安全的权衡难题。理论分析表明,该框架在任务性能损失控制在1.2%以内的前提下,取得了显著突破。其基于参数敏感度的动态稀疏化机制将训练显存占用量降低至全参数微调的23%,边缘设备推理延迟压缩32.4%,性能远超现有的PEFT方法,如LoRA、Adapter。同时,其多层级防御体系,包括输入流形净化、定向对抗训练和不确定性校准,将白盒攻击成功率抑制至5.4%,比传统方法,如PGD,对抗训练提升防御强度37.8%,且额外计算开销控制在8%以内。此外,该框架在入侵检测(CIC-IDS2017)、工业物联网(FactoryLogs)等多样化运维场景中表现出卓越的适应性,边缘节点吞吐量最高提升6.8倍,为5G核心网、智能工厂等低资源高安全场景提供了实用且稳健的技术范式。
尽管LST框架在实验中展现出优异性能,其在实际应用中仍面临若干挑战,需进一步探索改进方向。首先,在异构硬件通用性适配方面,不同边缘设备(如NVIDIA Jetson AGX Xavier的GPU与华为昇腾910的NPU)对稀疏矩阵运算的加速效率差异显著(实测加速比分别为2.3倍和1.7倍),未来需设计硬件感知的稀疏模式以提升框架在多样化硬件环境中的普适性。其次,在防御泛化能力验证方面,当前评估主要集中于CIC-IDS2017等特定数据集和已知攻击类型(如PGD、FGSM白盒攻击),未来需在更广泛的攻击场景(如自适应投影梯度下降攻击)及跨领域数据集上验证防御鲁棒性,以确保框架的通用性。此外,动态威胁响应是另一关键方向,当前静态防御参数在面对持续进化的对抗攻击,如攻击迭代次数超过50步时防御成功率降至82.4%,可能滞后,建议引入在线对抗样本生成与模型增量更新机制以提升实时适应性。这些改进方向将进一步增强LST框架在复杂网络运维场景中的适用性和稳健性,为大模型的规模化部署提供更坚实的理论与技术支撑。
[1]
张华兵, 周英耀, 徐磊, 等. 网络数据中心IT设备人工智能化运维应用[J]. 沈阳工业大学学报, 2022, 44(5): 541-545.

DOI

Zhang H B, Zhou Y Y, Xu L, et al. Artificial intelligence operation and maintenance applications of IT equipment in network data center[J]. Journal of Shenyang University of Technology, 2022, 44(5): 541-545.

[2]
郝博文, 柳溢菲, 李立耀, 等. 基于多模态推荐指令的大语言模型指令微调[J]. 北京邮电大学学报, 2024, 47(4): 36-43.

Hao B W, Liu Y F, Li L Y, et al. The instruction tuning of large language models with multi-modal recommendation instruction[J]. Journal of Beijing University of Posts and Telecommunications, 2024, 47(4): 36-43.

[3]
Li Z, Wang Y, Chen X. Efficient parameter tuning for edge-deployed large language models[C]. Bangkok: Association for Computational Linguistics, 2024:345-360.

[4]
曾辉, 熊诗雨, 狄永正, 等. 基于差分隐私的联邦大模型微调技术[J]. 信息安全研究, 2024, 10(7):616-623.

Zeng H, Xiong S Y, Di Y Z, et al. Fine tuning techniques for federated large models based on differential privacy[J]. Information Security Research, 2024, 10 (7): 616-623.

[5]
Zhang Q, Chen X, Liu Y. Robustifying language models with adversarial prompt tuning[C]. Toronto: Association for Computational Linguistics, 2023:567-582.

[6]
Liu Z, Wang X, Zhang T. SparseGPT: massive language models can be pruned efficiently[C]. Red Hook: Curran Associates Inc., 2023:4 567-4 582.

[7]
Chen H, Zhang M, Li J. Adversarial purification with normalizing flows for robust NLP[C]. Red Hook: Curran Associates Inc., 2024:2 345-2360.

[8]
Wang J, Li H, Zhang Y. Log Parsing with pre-trained language models for network operations[C]. Miami: Association for Computational Linguistics, 2024:789-803.

[9]
籍欣萌, 昝红英, 崔婷婷, 等. 大模型在垂直领域应用的现状与挑战[J/OL]. 计算机工程与应用,1-12[2025-05-27].

Ji X M, Yang H Y, Cui T T, et al. The current situation and challenges of the application of large models in vertical fields[J/OL]. Computer Engineering and Applications, 1-12[205-05-27].

[10]
王劲滔, 孟琪翔, 高志霖, 等. 基于大语言模型指令微调的案件信息要素抽取方法研究[J/OL]. 计算机科学与探索,1-17[2025-05-27].

Wang J T, Meng Q X, Gao Z L, et al. Research on case information element extraction method based on large language model instruction fine tuning[J/OL]. Computer Science and Exploration, 1-17[205-05-27].

[11]
赵瑞, 段小文, 刘新, 等. 非独立同分布数据下多层级Sinkhorn距离聚类联邦学习算法[J/OL]. 计算机研究与发展,1-11[2025-05-27].

Zhao R, Duan X W, Liu X, et al. Multi level sinkhorn distance clustering federated learning algorithm for non independent and identically distributed data[J/OL]. Computer Research and Development, 1-11[205-05-27].

[12]
刘杰, 乔文昇, 朱佩佩, 等. 基于图像-文本大模型CLIP微调的零样本参考图像分割[J]. 计算机应用研究, 2025, 42(4):1 248-1 254.

Liu J, Qiao W S, Zhu P P, et al. Zero sample reference image segmentation based on CLIP fine tuning of image text large model[J]. Computer Application Research, 2025, 42 (4): 1 248-1 254.

[13]
张友衡, 熊莹, 周放, 等. 基于微调StarCoder2大模型的“编译原理”课程实验系统[J]. 实验技术与管理, 2025, 42(4):227-232.

Zhang Y H, Xiong Y, Zhou F, et al. Experimental system for "compilation principles" course based on fine tuning StarCoder2 large model[J]. Experimental Technology and Management, 2025, 42 (4): 227-232.

[14]
吴平, 林欣. 基于CLIP微调的扩散模型安全化[J]. 华东师范大学学报(自然科学版), 2025(1):138-150.

Wu P, Lin X. Secure diffusion model based on CLIP fine-tuning[J]. Journal of East China Normal University(Natural Science), 2025(1):138-150.

[15]
曾辉, 熊诗雨, 狄永正, 等. 基于剪枝的大模型联邦参数高效微调技术[J]. 计算机应用, 2025, 45(3):715-724.

DOI

Zeng H, Xiong S Y, Di Y Z, et al. Efficient fine-tuning technique for federated parameters of large models based on pruning[J]. Computer Applications, 2025, 45 (3): 715-724.

[16]
曹鹏, 温广琪, 杨金柱, 等. 面向测试用例生成的大模型高效微调方法[J]. 计算机应用, 2025, 45(3):725-731.

DOI

Cao P, Wen G Q, Yang J Z, et al. Efficient fine-tuning method for large models based on test case generation[J]. Computer Applications, 2025, 45 (3): 725-731.

Outlines

/