烛夜
烛夜
发布于 2026-09-30 / 2 阅读
1
0

深度学习安全之对抗样本篇 Day 3 —— 物理世界中的对抗样本攻击

今天研读 《Adversarial examples in the physical world》

物理拍摄对抗样本的 demo 视频:Demo


1. 物理世界中的对抗样本攻击

许多机器学习模型对于对抗样本十分脆弱。对抗样本是一种对干净样本施加微小扰动,使得机器学习模型在推理期产生误判的攻击方法。形式化地说,假设有一个机器学习系统 M 和一个干净样本 C ,其中 C 是可以被 M 正确分类的,也就是 M(C) = ytrue 。我们可以从 C 中构建出一个对抗样本 A 。A 在感知上和 C 难以区分(即 A 和 C 之间的距离存在一个很小的给定上界),但是 M 却无法正确分类 A ,即 M(A) ≠ ytrue 。对抗样本对机器学习模型的误导结果远比噪声的误导性强,甚至在噪声的幅度远大于对抗扰动的幅度时也是如此。

此外,前人研究发现,对抗样本还具备可迁移性:为一个机器学习系统设计的对抗样本,经常也会欺骗另一个机器学习系统。这意味着,当攻击者打算攻击一个机器学习系统时,他可以不需要完全了解该机器学习系统的底层模型结构。

但作者指出,前人研究存在一个局限性:他们认为攻击者都可以直接对机器学习模型提供输入。但是,许多机器学习系统运行在物理世界中,例如机器人的环境感知系统、视频监控系统、移动端的图像声音分类系统。此前并未有研究证明,在物理世界构造的对抗样本,在通过摄像头等传感器的数据采集过程后,依然能保持这种“对抗能力”。

虽然此前已有工作探讨过针对机器学习系统的物理攻击,但并非通过对输入施加微小扰动来欺骗神经网络。作者列举了两个案例,并阐明了对抗样本在这些领域的潜在形式:

  • 语音识别领域:

    • 既有研究(Carlini et al., 2016):构造出了手机能识别为语音指令、但人类听起来是不可理解杂音的音频输入。

    • 对抗样本的潜在形态:在人类听起来是正常声音(例如一首歌曲),但机器学习算法却能从中识别出隐藏的语音指令。

  • 人脸识别领域:

    • 既有研究(Smith et al., 2015):利用重放攻击,即用已授权用户的打印照片代替真实人脸面对摄像头。

    • 对抗样本的潜在形态:在人脸上添加微小的标记,使得人类依然能正确辨认其身份,而机器学习系统却将其误判为另一个人。

作者进一步补充,本文存在一个主题相近的同期研究:Sharif et al. (2016) 。本文与 Sharif 等人工作存在三个主要区别:

比较维度

本文

Sharif et al. (2016)

1. 攻击算法与计算开销

大多数实验采用计算成本低的闭式解算法。

采用计算成本相对较高的基于优化的算法。

2. 对抗样本的生成策略

不针对打印和拍照过程做任何特殊修改,仅作为一种科学观察,验证大量对抗样本在没有任何额外干预的情况下,本身就能在物理采集过程中存活。

引入了额外的机制与特征,以专门提升在真实人脸识别系统中攻击的鲁棒性和可行性。

3. 像素修改的约束方式

约束每个像素的修改幅度(每个像素的变化很小),但在修改范围上可以修改图像的所有像素。

限制被修改像素的数量(仅修改眼镜框架上的像素),但允许对这些像素施加较大幅度的修改。

于是,作者明确了本文的研究定位:本文关注的是在不针对物理信道做特殊优化、仅依靠全图微小扰动且使用低成本算法的条件下,检验对抗样本对物理世界采样过程的自然耐受能力。

在具体实验中,作者使用预训练的 ImageNet Inception 分类器,针对该模型生成对抗样本,随后通过手机摄像头拍摄这些样本并输入分类器,测量其分类准确率。实验数据表明,大量为原始模型生成的对抗样本,在经过摄像头的物理采集后,依然处于被错误分类的状态。

令人惊讶的是,作者的攻击方法在生成对抗样本时没有针对摄像头的存在做任何专门修改。直接采用针对 Inception 模型生成的对抗样本,就能有效迁移至“相机 + Inception”构成的联合系统。作者认为,这种未对物理信道建模的最简攻击所测得的成功率,构成了物理对抗攻击成功率的一个下界;如果攻击者在生成对抗样本时显式地对相机的成像特性进行建模,攻击成功率理论上可能会高于此基准。

不过,这个实验存在一个局限性:实验假定攻击者完全知晓模型的架构和参数(即白盒模型)。作者说明,采用该假设主要是为了在全部实验中复用单一的 Inception v3 模型,避免额外设计并训练其他高性能模型的工程负担。但是,由于对抗样本具有已知的泛化特性,作者认为该结论原则上可以推演至攻击者无法获知模型细节的黑盒场景。尽管论文未就物理对抗样本的可迁移性做详尽测试,但作者开发了一个简易的手机应用,展示了物理世界中实施黑盒攻击的潜在可行性:

此外,为明确摄像头引起的图像变换如何具体影响对抗样本的有效性,作者还设计了一系列针对特定人工合成变换(如亮度调节、对比度调节等)的对比实验。

2. 生成对抗样本的算法

作者特别强调:本节介绍的算法不能 100% 保证生成的样本一定能让分类器错误分类。但是这是一种高效获取真正对抗样本的方式。因此,为了方便起见,下面把用这种算法生成的样本统一称为“对抗样本”。

以下是数学建模时用到的符号含义表:

FGSM 方法

FGSM 方法具体介绍参见我的笔记 Day 1 。它将损失函数局部线性化,并一步到位地生成对抗样本:

其中 ε 是对抗扰动无穷范数的一个上界,可以作为超参数来选定。

BIM 方法

BIM 方法(Basic Iterative Method)是对 FGSM 迭代使用多次的简单方法:

在实验中设定为 α = 1 ,即每一步迭代仅将每个像素的数值调整 1 个单位。迭代步数 N 设定为 min(ε + 4, 1.25ε) ,N 的选取是一个启发式结果,原因如下:

  1. 保证迭代次数足以让对抗扰动在梯度方向上达到无穷范数球的边界(即达到最大扰动幅度 ε );

  2. 限制总迭代步数,避免计算开销过度增加,使实验成本保持在可控范围内。

l.l. class 方法

与 FGSM 以及改进版方法 BIM 不同,l.l. class 方法是一个有目标攻击方法。有目标攻击方法关注的是如何让一个对抗样本被模型分类为一个特定的目标类别。一般地,对于一张干净图像 X ,在模型原始分类结果中,设概率值最低的类别为 yLL :

我们的攻击目标是让模型将 X 错误分类为 yLL 类别。由于对于一个分类性能良好的分类器来说,yLL 类别通常与正确类别大为不同,因此用这种方法构造出的对抗样本更加有趣。这种攻击方法就称作 l.l. class 方法,它采用了 BIM 的迭代思想:

与 BIM 不同的是,这里的攻击目标是通过迭代扰动输入 X ,让模型预测和 yLL 类别的损失不断下降。在实验中,这里的超参数 α 和迭代步数 N 与 经典 BIM 方法的设定完全相同。

对比实验

作者采用了 ImageNet 的全部 50,000 张验证集样本作为测试集。基础模型使用预训练的 Inception v3 分类器。首先计算全部干净样本的 Top-1 与 Top-5 分类准确率作为基线,随后计算每种前述攻击方法在不同 ε 参数组合下的准确率。

这里需要注意:生成对抗样本并不能百分之百保证模型一定会误判,实际效果取决于攻击算法与模型分类能力的博弈。

FGSM 的实验现象与机制分析

  • 小扰动下的表现:即便在极小的 ε 设定下,FGSM 也能让 Top-1 准确率降低到原来的一半左右,使 Top-5 准确率降低约 40% 。

  • 随 ε 增大的变化趋势:当 ε 逐步增大时,该方法生成的对抗样本准确率在 ε = 32 之前基本维持在相似水平;当 ε 继续增大到 128 时,准确率缓慢下降到接近 0 的水平。

  • 归因解释:FGSM 是将经过 ε 尺度缩放的梯度符号值加到图像上。当 ε 较大时,这种扰动在本质上破坏了图像原有的视觉内容,甚至使人类观察者也无法辨认目标物体。

迭代类方法的对比优势

  • 扰动细致度更高:相比于单步快速方法,迭代方法利用了更为精细的扰动模式。即便在较高的 ε 取值下,也不会破坏图像可被人眼辨识的内容,同时能以更高的概率使分类器发生误判。

  • 基础迭代法(BIM):在 ε < 48 的区间内生成的对抗样本效果优于快速方法;但当 ε 进一步增大时,其攻击效果不再继续提升。

  • 最小概率类别法(l.l. class):在相对较小的 ε 取值下,就能使绝大多数图像的正确分类结果失效。

作者决定在后续的所有实验中,将扰动参数限定在 ε ≤ 16 的范围内。依据有两个方面:

  1. 视觉隐蔽性:在该范围内的扰动在人眼看来仅相当于轻微的背景噪声,甚至完全不可被察觉;

  2. 攻击有效性:在此邻域范围之内,各种对抗攻击算法已经能够使相当数量的样本发生分类错误,足以满足安全评估的需求。

3. 实验与结果

3.1 Metrics

本节提出了用于量化评估各类图像变换对对抗样本影响程度的核心评价指标——破坏率。破坏率是指在经历某种变换 T 之后,原本能够成功误导分类器的对抗样本中,不再被误判(即恢复为正确分类)的样本所占的比例。该指标用于研究任意图像变换(如打印并拍照等物理转换,或人工数字图像变换)对对抗样本扰动有效性的削弱程度。

首先定义用于判定分类结果正确性的指示函数 C(X, y) :

为了表示分类错误,文中引入了该指示值的二元取反符号:

破坏率 d 的计算公式如下:

简单解读:

  • 分母统计了所有“原本分类正确,且在未变换前成功实现对抗误导”的有效对抗样本总数。这排除了模型原本就无法识别的干净样本,以及未攻击成功的失效对抗样本。

  • 分子统计了在上述所有有效对抗样本中,因变换 T 而失去误导作用、恢复为正确预测的样本数量。

3.2 照片变换

照片变换指的是指“将数字图像打印在纸上 -> 使用手机摄像头拍摄 -> 从拍摄的全幅画面中裁切出目标图像”的流程。作者将其视作一个黑盒变换过程。评估指标如下所述:

  1. 变换前后干净图像与对抗图像的分类准确率变化;

  2. 经历照片变换后对抗样本的破坏率。

实验操作流程

步骤

环节名称

工具与设备

关键操作与参数细节

异常处理与控制指标

步骤 1

图像打印

• ImageMagick 套件

• 理光(Ricoh MP C5503)办公室打印机

• 拼版打印:每张纸打印多对干净样本与对抗样本

• 四角标记:嵌入 4 个二维码用于后续定位

• 格式保存:无损 PNG 格式

• PDF 转换:执行 convert *.png output.pdf

• 打印设定:分辨率 600 dpi,默认缩放铺满纸张

—

步骤 2

物理拍摄

• Google Nexus 5X 手机

• 使用手机后置摄像头拍摄打印纸张

• 正常室内采光,相机大致正对纸面手动拍摄

引入光照、距离与微小角度等现实环境干扰变量

步骤 3

自动矫正与裁剪

• 二维码检测定位算法

• 透视变换

• 识别 4 个角标二维码并读取批次信息

• 通过透视变换校正拍摄畸变,将角标对齐至预设坐标

• 按已知固定坐标切块,裁切为与源图像同尺寸的正方形

• 若任一角点二维码识别失败,整张照片作废不参与统计

• 单项实验废片率通常在 3%~6% 之间,上限不超过 10%

步骤 4

分类与量化评估

• ImageNet Inception 分类器

• 分别将变换后的切片图像与原始源图像送入模型推断

• 计算变换前后的分类准确率

• 计算对抗样本的破坏率

实验组别设立

作者在测试每种对抗生成方法与扰动参数 ε 组合时,设立了两种不同实验评估设置:平均情况与预筛选情况。

平均情况:在给定的攻击方法和参数 ε 下,随机挑选 102 张图像执行单次实验。用于评估攻击者面对随机选取的图像时的平均攻击表现。作者将其描述为“外部环境随机选取一张图像,攻击者尝试让分类器对该图像产生误判”。它反映的是对抗攻击在任意未筛选数据上的常规泛化水平。

预筛选情况:该设置旨在模拟一种更具威胁性、更激进的定向攻击场景,测试攻击者能够自主挑选原始样本时所达到的攻击表现。

  1. 严格的样本筛选准则(共挑选 102 张满足全部条件的图像)。进入该实验集合的图像必须同时满足三个判定条件:

    • 干净图像正确识别:对应的干净图像能够被模型正确分类。

    • 数字化空间完全误判:在未经照片变换之前,生成的对抗样本在 Top-1 和 Top-5 分类中均判定错误。

    • 高置信度要求:模型对预测类别最高项的置信度需达到设定阈值,即 p(ypredicted | X) ≥ 0.8(其中 ypredicted 为网络对图像 X 输出的预测类别)。

  2. 威胁模型层面的合理性:

    • 离线验证能力:在白盒威胁模型下,攻击者拥有模型的完整结构和权重参数,因此在制作物理攻击载体前,能够先在本地运行模型推断。

    • 攻击策略:攻击者倾向于优先挑选那些在数字空间内已经成功误导模型且置信度较高的样本制作物理实体。受害者随后对攻击者展示的物理实体拍照,由“照片变换”过程决定该对抗扰动是得以保留还是被破坏。

3.3 实验结果

  • 与各类迭代方法相比,快速方法(FGSM)生成的对抗图像在面对照片变换时表现出了更高的鲁棒性。作者的归因解释是:迭代方法所利用的对抗扰动更为精细和微妙,而这些细微的扰动模式在经过打印、光电转换及重采样等物理变换时,更容易被破坏。

  • 在部分测试情况下,“预筛选情况”下的对抗样本破坏率反而高于“平均情况”。对于迭代类方法而言,预筛选图像在变换后的整体攻击成功率甚至低于随机选取的图像。作者的归因解释是:迭代算法为了在数字空间达到极高的预测置信度,往往会在像素之间建立微小且精细的协同适配。这种对像素具体数值高度敏感的精细结构,在经历物理照片变换后通常无法存活,从而导致其破坏率上升。

  • 实验表明,即使经历了非平凡的物理照片变换,依然有相当一部分对抗样本保持被错误分类的状态。这一结果证实了物理世界中存在对抗样本的实际可行性。例如:

    • 当使用扰动参数 ε = 16 的 FGSM 方法时,大约有 2/3 的图像在 Top-1 分类中被误判;

    • 大约有 1/3 的图像在 Top-5 分类中被误判。

  • 推论:在真实物理输入下,模型本身的自然分类错误率相对较低;攻击者只需生成足够数量的对抗样本,即可在物理世界中诱发远高于自然状态下的分类错误。

补充说明:上述实验设置均建立在白盒假设之上,即假定攻击者完全掌握目标系统的结构、权重等内部参数。然而,在现实世界的安全攻防场景中,攻击者通常无法获取目标系统的模型架构与具体参数。因此,黑盒场景更贴近实际的安全威胁形态。

现有研究发现,为某一特定模型生成的对抗样本,通常能够有效欺骗架构或参数不同的其他模型。因此,黑盒场景中,攻击者可以基于本地已知模型(如 Inception)离线制作对抗样本,并利用迁移性对未知的第三方模型实施物理攻击。

作者补充做了一组黑盒攻击的实验,选取了一个与生成样本时完全不同的模型——开源的 TensorFlow Camera Demo 移动端应用程序。该应用直接在手机端本地运行图像分类推断。具体方法如下所述:

  • 将打印好的干净图像与对抗图像分别置于手机镜头前进行实时识别;

  • 在镜头对准干净图像时,应用输出真实类别;而当镜头对准打印的对抗图像时,分类预测改变为错误类别。

在本笔记的导言区给出了作者演示的 demo 。

3.4 物理变换的消融研究

作者过在受控的数字空间中解构各项人工合成变换,探究了物理照片变换对对抗扰动产生破坏作用的具体构成要素。

打印、拍摄与裁切构成的物理照片变换,在本质上可以看作是由一系列相对简单、基础的图像变换组合而成的复合过程。为了解析其内在机制,作者通过在数字环境中单独测试各项人工变换,量化分析它们各自对对抗样本造成的破坏程度。

作者从验证集中一次性随机抽取 1,000 张图像的子集。为了保证各对比项的可比性,该章节的所有实验均在同一子集上进行。针对不同的攻击方法与变换类型的组合,在固定扰动上限 ε = 16 的条件下生成对抗样本,施加相应的人工变换后,计算对抗破坏率。

实验系统测试了以下四类常见的单项或复合图像扰动:

  1. 对比度与亮度调整

  2. 高斯模糊

  3. 高斯噪声

  4. JPEG 压缩编码

实验结果如下:

实验数据分析:

  1. 不同攻击方法的鲁棒性规律与物理实验一致

    • 由快速方法(FGSM)生成的对抗样本对各项人工变换的耐受性最高;

    • 由目标类迭代法(l.l. class)生成的对抗样本耐受性最低。

    • 该现象与前述物理照片变换实验中观察到的结论完全吻合。

  2. Top-5 破坏率通常高于 Top-1 破坏率

    • 归因解释:在判定条件上,若要破坏一个 Top-5 对抗样本,施加的变换只需将正确标签推入预测概率前 5 名即可;而若要破坏一个 Top-1 对抗样本,则必须将正确标签重新恢复至预测概率的第 1 位。后者属于一个约束条件严格更高的要求,因此 Top-1 维度的对抗状态更难被彻底消除。

  3. 对比度与亮度调整对对抗扰动的影响有限

    • 改变图像亮度和对比度对对抗扰动的破坏效果较低。

    • 对于 FGSM 方法和基础迭代法(BIM),其破坏率均低于 5%;对于目标类迭代法,其破坏率也保持在 20% 以下。

  4. 模糊、噪声与 JPEG 编码的破坏力显著,但均未完全清除扰动

    • 相比亮度和对比度,高斯模糊、高斯噪声以及 JPEG 编码表现出了更高的破坏率;在迭代类方法生成的对抗样本上,破坏率可以达到 80% 至 90%。

    • 关键结论:即便破坏率相对较高,上述任何一种人工变换都未能达到 100% 的完全破坏率,这解释了为什么对抗样本在经历包含这些要素的物理照片变换后,依然有部分样本能够成功维持误导状态。

4. 结论

作者在本研究中探讨了为运行在物理世界中的机器学习系统构建对抗样本的可能性。作者使用手机摄像头拍摄的图像作为 Inception v3 图像分类神经网络的输入。研究表明,在这样的设置下,使用原始网络生成的对抗图像即使通过摄像头输入给分类器,仍有相当一部分被错误分类。这一发现证实了物理世界中机器学习系统存在对抗样本的可能性。

作者指出了一些未来研究的方向:

  • 使用除纸张打印图像之外的其他物理实物进行攻击展示;

  • 针对不同类型的机器学习系统(例如复杂的强化学习智能体)展开攻击;

  • 在不获取模型参数和架构的情况下实施攻击(推测可利用可迁移性);

  • 在构建对抗样本的过程中显式建模物理变换,以获得更高成功率的物理攻击。

  • 开发出防御此类攻击的有效方法。


评论