今天研读《Explaining and Harnessing Adversarial Examples》,对抗样本领域的奠基性著作。
1. 对抗样本的发现与归因分析
前人研究发现,包含神经网络在内的多种机器学习模型均对于“对抗样本”展现出脆弱性。而对抗样本仅与来自数据分布的正确分类样本存在微小差异。很多时候,不同架构、使用不同训练数据子集训练出的多种模型,会对同一个对抗样本产生相同的误判。这种跨模型的泛化误判,表明对抗样本暴露了当前训练算法中存在的根本性盲点。
此前学术界倾向于将其归因于深层神经网络的高度非线性,以及模型平均不足和纯监督学习正则化不足的结合。但作者指出,这些推测性假设都是不必要的。高维空间中的线性行为本身就足以引发对抗样本。
基于线性视角,作者设计出了一种快速生成对抗样本的方法,使对抗训练在实际中成为可行。而对抗训练带来的正则化增益,超出了单独使用 Dropout 所能提供的效果。此外,Dropout、预训练和模型平均等通用正则化策略,并不能显著降低模型对于对抗样本的脆弱性。而转向径向基函数网络(RBF networks)等非线性模型家族,能够起到降低脆弱性的作用。
作者指出:模型的线性特性使其便于优化训练,而抵御对抗扰动则需要利用非线性效应,这两者之间构成了根本性的张力。长远来看,若能研发出更强大的优化方法来成功训练更具非线性特征的模型,或许有可能打破这种在“易训练性”与“抗扰动性”之间的权衡。
2. 对抗样本的线性解释
本节阐述的核心观点是:单纯在高维空间中的线性模型,就足以产生对抗样本。
现实世界中输入特征的精度是有限的。例如 8 位图像每个像素只能区分 256 级,丢弃了所有动态范围低于 1/255 的信息。因此,如果扰动 η 中的每一个元素都小于特征本身的精度,分类器理应对扰动前后的输入给出一致的判断。形式化地来说,对于类别分离明确的问题,只要扰动的无穷范数满足

(其中 ε 足够小,可被设备忽略),模型就应当对原始样本 x 与扰动样本 x˜ = x + η 输出完全相同的类别。
注:上述约束条件翻译为自然语言就是,扰动 η 的各分量中绝对值的最大值应当比上界 ε 小。
考虑权重向量 w 与对抗样本 x˜ 的内积计算:

不难发现,扰动使线性组合的激活值增加了 wTη 。现在我们想让 wTη 最大,在 η 的约束条件下,只需满足:

如果权重向量 w 是 n 维的,且其元素的平均绝对大小为 m ,则激活值的变化量为:

扰动本身的幅度限制并不会随着问题维度 n 的增加而增大,但激活值的变化量 εmn 却会随维度 n 线性增长。因此,在高维空间中,对输入施加的大量微小改动(每个微小改动都处于测量误差范围之内),在累加后会转化为输出端的大幅度变化。换言之,线性模型会被迫只关注那些与其权重高度对齐的微弱信号,哪怕场景中同时存在幅度远大于该扰动的其他正常信号。
只要输入的维度足够高,简单的线性模型就必然会出现对抗样本,因而此前归因于深层网络非线性的假说不再必要。此外,线性假说结构简单,并解释了为何同属于广义线性模型的 Softmax 回归同样对于对抗样本具有脆弱性。
3. 对非线性模型的线性扰动
作者提出假说:神经网络由于设计上过于偏向线性,因而不具备抵抗线性对抗扰动的能力。
架构选择的初衷:诸如 LSTM、ReLU 以及 Maxout 网络,在设计时都被有意赋予了高度线性的运算行为,目的是降低优化求解的难度。
饱和型网络的状态:即使是理论上具备更强非线性特征的网络(如 Sigmoid 网络),在实际工程调优中,也会被尽量调整至非饱和区间运行,而该区间同样表现出较为明显的线性特征。
推论:对线性模型有效的低成本、解析式扰动,同样能够对这些复杂的神经网络造成干扰。
基于对损失函数的局部线性化,作者给出了在最大范数约束下的最优扰动计算方式:
设模型的参数为 θ ,输入为 x ,真实目标为 y ,训练损失函数为 J(θ, x, y) 。围绕当前参数对损失函数进行局部线性化,可得扰动向量:

核心机理:计算损失函数关于输入 x 的梯度,并提取其符号方向(sign),再乘以扰动上限 ε 。该扰动沿着损失增加最快的方向移动。
计算效率:所需的输入梯度可以通过反向传播算法快速求得,无需进行耗时的循环迭代。
这就是快速梯度符号法(Fast Gradient Sign Method, FGSM)。
作者在不同模型与数据集上验证了 FGSM 的有效性,模型在受到微小扰动后均表现出高比例的误判以及偏高的置信度:
MNIST 数据集(设定 ε = 0.25 ):
浅层 Softmax 分类器:错误率达到 99.9%,平均预测置信度为 79.3% 。
Maxout 网络:对抗样本的误判率为 89.4%,平均预测置信度为 97.6% 。
CIFAR-10 数据集(设定 ε = 0.1 ):
卷积 Maxout 网络:预处理测试集上的错误率达到 87.15%,且分配给错误标签的平均概率为 96.6% 。
其他生成方式:除了符号梯度外,作者还指出将输入 x 沿梯度方向旋转一个微小角度,同样能稳定生成对抗样本。
下图就展示了一个经典的例子:

作者以应用于 ImageNet 数据集上的 GoogLeNet 为例展示了扰动效果:
原始图像 x :输入熊猫图像,GoogLeNet 正确判定为“panda”(熊猫),置信度为 57.7% 。
施加的扰动量:
计算扰动项 + 0.007 * sign(∇xJ(θ, x, y)) 。
扰动幅值 ε = 0.007 对应于 8 位图像编码转换为实数后最小有效位的量级,人眼无法察觉明显改变。
扰动噪声本身若单独送入网络,会被判定为“nematode”(线虫),置信度仅为 8.2% 。
扰动后的对抗样本:组合后的图像在视觉上与原图保持一致,但 GoogLeNet 将其判定为“gibbon”(长臂猿),且置信度为 99.3% 。
通过如此简易、低计算开销的算法便能制造出误判样本,这为“对抗样本主要源于线性特性”这一假说提供了证据。不过,该算法计算高效,不仅可用于分析已训练网络的性质,还大幅提升了后续进行对抗训练的计算可行性。
4. 以逻辑回归为例介绍对抗训练的解析形式

上图展示了在一个逻辑回归模型上应用 FGSM 方法产生的对抗样本的效果。
对于逻辑回归这类单层线性模型,损失函数中外层的 Softplus 函数严格单调递增,最大化损失等价于最大化它内部的仿射表达式。因此 FGSM 在此处不存在局部近似误差,是严格精确的最优扰动。
考虑我们要训练一个模型,标签 y ∈ {−1, 1} ,模型预测概率为:

其中 σ() 是 Sigmoid 函数。标准训练通过梯度下降最小化以下损失:

其中,

为 Softplus 函数。
现在我们想要得到 x 的一个最具破坏性的对抗样本。为使损失最大化,梯度的符号方向为 -ysign(w) 。我们将输入替换为最坏情况扰动后的样本:

可得对抗逻辑回归的最小化目标为:

上面的详细推导参见 “我的补充思考” 一节。
P.S. 这里我的推导结果和论文结果略有出入,不过我仔细复查了我的推导,没有发现明显的问题;且我的推导结果貌似更加合理一些,因此这里暂时保留我的推导结果。
可以发现,上面的优化目标看上去很类似加入 L1 正则化后的结构风险最小化准则。不过,具体存在几点不同:
对抗训练中的 L1 惩罚项是直接从模型的激活值内部减去,而不是作为独立附加项直接加在最终训练损失上。
当模型学习到足够置信的预测时,Softplus 函数进入饱和区间(梯度趋近于 0),该惩罚项的影响会随之减弱甚至消失。不过,如果模型处在欠拟合状态下,对抗训练会进一步加剧欠拟合。
传统的 L1 权重衰减更加 “悲观” ,在模型已经具有充足分类间隔时依然持续施加惩罚,不会自动解除。
事实上,L1 正则化机制对可能存在的攻击的“过度悲观”效应在多分类场景(即 Softmax 回归)中更加突出:
对于类别 k 的权重向量 wk ,当攻击者给予输入特征 x 一个扰动 η = ε · sign(wk) 时,恰好能给予类别 k 的 Logits 最大可能扰动值,这个扰动值是 ε · ||w||1 。
L1 正则化在损失函数中加入的惩罚项是所有类别权重的 L1 范数之和,这等价于是认为,所有类别的 Logits 会受到对应的最大可能扰动值。
但这是几乎不可能的。因为攻击者只能给予输入一个全局统一的扰动 η ,而同时让 η = ε · sign(w1) = ε · sign(w2) = ... = ε · sign(wk) 是几乎不可能做到的。
也就是说,L1 正则化机制相当于在防御一种“多位攻击者各自挑选最优扰动分别攻击不同神经元”的虚拟场景,而不是现实中“一位攻击者只能用同一个扰动同时影响所有神经元”的真实场景。这种假设在现实中过于严苛(过于悲观),使得 L1 惩罚项给模型施加了超出实际对抗需求的过大约束,因而在实际应用中,必须大幅调小正则化系数才能维持正常的训练优化。
作者做了一个对比实验:
在 MNIST 上训练 Maxout 网络时,对抗训练采用 ε = 0.25 取得了良好效果。
若在网络首层施加 L1 权重衰减,仅 0.0025 的系数就已过大,导致模型在训练集上的错误率停滞在 5% 以上;而使用更小的衰减系数虽然能完成训练,却无法带来正则化收益。
5. 深度网络的对抗训练
概述
根据通用近似定理,只要允许隐藏层拥有足够多的神经元,包含至少一个隐藏层的神经网络就能够以任意精度表示任意函数。因此,与浅层线性模型不同,深度网络在理论上完全有能力表示出能够抵抗对抗扰动的函数。然而,通用近似定理仅证明了鲁棒函数在函数空间中的存在性,并没有说明现有的训练算法是否能够真正搜索并收敛到满足这些期望特性的函数。
究其根本,标准的纯监督学习在优化目标中并没有设定“所选函数必须抵御对抗扰动”的约束条件。因此,若要让网络学到抗扰动的函数,必须将这种鲁棒性约束以某种方式显式编码到训练流程之中。
与常规的数据增强方式(如图像平移、旋转等变换)不同,对抗样本并不属于预期在真实测试集分布中实际会出现的自然扰动。其核心价值不在于模拟自然分布的变化,而在于暴露模型在构建决策函数时所存在的理解缺陷。前人研究已经表明,混合输入干净样本与对抗样本进行联合训练,能够使神经网络获得一定程度的正则化效果。
不过,对抗训练在当时的前沿基准测试上并没有展现出超越 Dropout 的性能优势。作者认为这是因为先前的研究依赖基于 L-BFGS 的最优化方法来生成对抗样本,该方法计算复杂度过高,难以支撑大规模、多轮次的对抗训练实验。事实上这也是作者在本文提出轻量级 FGSM 算法的重要应用动因。
深度网络的对抗训练设计
作者基于 FGSM 设计了用于深度网络的联合训练目标函数:

作者在所有实验中均设定权重超参数 α = 0.5 。由上述目标函数可知,该函数由干净样本上的标准损失与对抗样本上的损失按比例线性加权构成。此外,对抗样本并不是在训练前离线生成的,而是在训练过程中依据模型当前的参数版本实时计算并更新,以抵御当前状态下的梯度攻击。在原版结合了 Dropout 的 Maxout 网络上,加入该对抗目标训练后,测试集错误率由无对抗训练时的 0.94% 下降至 0.84% 。
不过,作者观察到模型在训练集自身的对抗样本上并未达到零错误率。作者对此做出了两项具体调整:
增大模型容量:将每层隐藏单元数由原版网络的 240 扩展至 1600 。若仅扩大模型而不引入对抗训练,模型会出现轻微过拟合,在测试集上的错误率为 1.14% 。
调整早停判据:
原版 Maxout 的早停策略是当验证集错误率在 100 个 epoch 内不再下降时终止训练。
实验发现,对抗训练下常规验证集的错误率曲线十分平缓且进展缓慢,但对抗验证集上的错误率具有清晰的变化轨迹。
因而,作者改用对抗验证集错误率作为早停判定标准来确定训练的总 epoch 数。
基于对抗验证集确定的训练轮数,作者使用全部 60,000 个 MNIST 样本重新进行了训练。通过改变随机数种子(涉及批次划分、权重初始化与 Dropout 掩码生成)执行了 5 次独立实验:
其中 4 次实验在测试集上的错误率为 0.77% ,1 次实验为 0.83% 。
5 次实验的平均测试错误率为 0.782% 。
该指标为当时在置换不变 MNIST 基准上报道的最优成绩,在统计学上与通过 Dropout 微调深层玻尔兹曼机所得的 0.79% 相当。
此外,在针对 FGSM 做过对抗训练之后的模型,在面对 FGSM 生成的对抗样本时,错误率从 89.4% 下降至 17.9% 。而且对抗样本具备一定的迁移性:
使用原模型生成的对抗样本去测试对抗训练后的模型,错误率为 19.6% 。
使用对抗训练后的模型生成的对抗样本反过来测试原模型,错误率达到 40.9% 。
结果表明对抗样本可以在两者之间迁移,但对抗训练模型具备更高的抵抗能力。
然而,尽管防御性能有所改善,但在对抗训练模型发生误判的样本中,预测置信度依然偏高,平均预测置信度达到了 81.4% 。
下图展示了作者对 MNIST 训练所得的 Maxout 网络第一层权重进行的可视化对比:

朴素训练模型(Left):权重呈现出较为杂乱、分散的无规则噪声形态。
对抗训练模型(Right):权重表现出明显的局部化特征,笔画结构相对分明,呈现出更易于人类解释的视觉模式。
对抗训练的本质属性
作者指出,对抗训练不仅是针对最坏情况的防御手段,还可以从不同的机器学习范式来理解:
博弈论视角:模型在与一个扰动生成者进行对抗博弈,目标是最小化数据受到对手攻击扰动时的最坏情况误差。
期望损失的上界优化视角:在输入中添加均匀分布噪声 U(-ε, ε) 时,对抗训练等价于在最小化该加噪数据分布下期望损失的一个数学上界。
主动学习视角:传统主动学习由模型主动挑选难以判别的输入样本并请求人工标注;对抗训练则挑选模型脆弱方向上的新点,并将人工标注者替换为一个启发式标注器 —— 直接复制临近原始样本的标签。
一种直观的防御思路是:既然特征变化小于精度 ε 时分类应保持一致,直接在 ε 最大范数立方体内密集采样或添加随机噪声是否即可实现鲁棒性?作者指出了这种方法的低效性:
正交性与内积期望为零:零均值、零协方差的随机噪声,其与任意固定的模型参考向量(如权重向量 w 或梯度向量)做点积时,期望值严格为零。
缺乏针对性破坏:由于各维度的微小随机扰动相互抵消,在高维空间中,随机噪声多数情况下对模型的线性激活值几乎不产生净影响,无法构成更具难度的输入;甚至在许多情况下,随机微扰还会偶然让目标函数值变得更低。
基于对随机噪声特性的分析,作者将对抗训练定性为:
噪声集合中的难例挖掘:对抗训练并不是漫无目的地在扰动立方体内采样,而是在所有可能的带噪输入候选集中,定向筛选出能够抵抗模型正确分类的样本点。
高效性来源:通过解析梯度直接求解破坏力最大的方向,模型只需要在最严苛的边界样本上进行优化,避免了在无害的随机噪声样本上浪费算力。
为了验证上述理论,作者在 Maxout 网络上设计了对照实验,对比了加入纯随机噪声训练与对抗训练的效果差异:
实验一:加入离散二值噪声(每个像素随机加上 ±ε):
训练后的模型在面对 FGSM 对抗样本时,错误率仍高达 86.2%(平均置信度为 97.3%)。
实验二:加入均匀连续噪声(每个像素添加 U(-ε, ε) 噪声):
训练后的模型在面对 FGSM 对抗样本时,错误率高达 90.4%(平均置信度为 97.8%)。
结论印证:未经任何噪声或对抗处理的模型错误率为 89.4%,而对抗训练能将错误率压低至 17.9% 。这证明了简单的随机 ±ε 或均匀噪声数据增强,无法使模型获得抵御线性对抗扰动的鲁棒性。
扰动生成过程的可微性
由于 sign 函数的导数几乎处处为零或未定义,导致在以 FGSM 为基础的对抗目标函数上执行梯度下降时,模型无法预先感知对抗者对模型参数变化的反应。作者于是尝试了一些可微的扰动方案:
若改用小幅度旋转或按比例缩放梯度的加法,扰动生成过程本身是可微的,学习算法便能将对抗者的反作用纳入考量。
实验效果对比:此类可微方案并未取得与 FGSM 相当的强正则化效果,作者推测原因可能是这类扰动所构成的对抗样本对模型而言相对更容易求解。
有关什么是“预先感知对抗者对模型参数变化的反应”,请见我的补充思考一节,
最优扰动位置
学术界对于扰动位置的最优选择存在不一致的结论:
先前研究的结论:Szegedy 等人在 Sigmoid 网络上观察到,将扰动施加在隐藏层能取得最佳的正则化效果。
无界激活函数的自适应机制:在本文使用 FGSM 的实验中,对于激活值无界的隐藏单元(如 ReLU、Maxout),网络面对隐藏层的加性扰动时,会倾向于将隐藏单元的激活值整体放大。因为一旦基数变得很大,固定的加性扰动在相对比例上就会被显著稀释。因此,对于这类网络,通常直接扰动原始输入层效果更好。
饱和型模型的表现:在包含饱和特性的模型(例如 Rust 模型)上,扰动输入层与扰动隐藏层取得了相近的性能表现。
针对无界激活网络通过单纯增大激活值来应对加性扰动的问题,作者尝试在隐藏层采用旋转变换扰动,使扰动的相对破坏力不随激活值绝对幅度的增大而失效。结果是:虽然成功利用该方法训练了 Maxout 网络,但其带来的正则化增益依然明显逊色于对输入层直接施加加性扰动。
此外,作者认为,一般不对最后一层隐藏层施加对抗扰动:
对抗训练生效的前提假设:作者认为,对抗训练明确发挥作用的前提,是模型本身必须具备表示出对抗扰动函数的容量,即依赖于通用近似定理的适用场景。
最后一层的本质缺陷:神经网络的最后一层(线性-Sigmoid 或线性-Softmax 层)对于最终隐藏层的特征映射而言,并不是一个通用函数近似器,它在数学上退化为一个浅层线性分类器。
欠拟合风险与实验结论:若对最后一层隐藏层施加对抗扰动,受限于该层有限的非线性表达能力,模型容易陷入欠拟合状态。作者在实验中证实了这一现象:在所有针对隐藏层扰动取得的最优训练结果中,均未包含对最终隐藏层的扰动。
6. 不同类型的模型容量
人们觉得对抗样本很反直觉,因为人类生活在三维空间中,难以直观理解数百个特征维度上微小扰动相互累加后引发的显著效应。此外,许多人直观上认为“低容量模型无法在多个不同区域做出高置信度预测”,但作者指出这一认知并不普遍成立。例如逻辑回归这种线性模型就可能在远离数据分布的广阔半空间中都给出很高的预测置信度。不过,也的确有一些低容量模型是满足这一认知的,例如浅层径向基函数(RBF)网络。
浅层 RBF 网络的条件概率建模形式是:

其中模型仅在中心点 μ 的临近区域赋予正类高置信度;在空间的其他区域,则默认判定该类别不存在,或者输出偏低的预测置信度。
这就是为什么 RBF 网络对于对抗样本存在天然免疫性:当其被对抗样本欺骗时,所输出的置信度处于偏低水平。
作者在 MNIST 数据集上做了一个实验:
无隐藏层的浅层 RBF 网络在 FGSM(ε = 0.25)对抗样本下的错误率为 55.4% 。
但在该模型误判的对抗样本上,平均置信度仅为 1.2%(作为对比,在干净测试样本上的平均置信度为 60.6%)。
实验表明,该模型在自身无法“理解”的输入空间点上,会通过显著压缩置信度来表达不确定性。
作者借用分类评估指标,将两种架构类比为权衡曲线上的两个端点:
RBF 单元的泛化局限:RBF 单元对任何显著的变换都不具备不变性,无法很好地建立跨空间模式的泛化能力。
线性单元(偏向高召回率):
机制:对特征空间中特定半空间/方向上的所有输入均产生持续响应。
优缺点:拥有高召回率,但由于在不熟悉的输入区域往往过度响应,导致其精确率偏低。
RBF 单元(偏向高精确率):
机制:仅对空间中某一个中心点周围的特定邻域做出响应。
优缺点:拥有高精确率,但代价是牺牲了召回率。
受到上述权衡的启发,作者尝试探索引入二次单元的模型家族,包括构建更深层的 RBF 网络。然而,在使用随机梯度下降(SGD)进行训练时,任何包含充足“二次抑制效应”以抵抗对抗扰动的模型,在训练集上均停留在较高的训练误差状态。这表明,具有抵御对抗扰动潜力的强非线性模型,在当时的优化算法下极难完成有效训练,印证了引言中提到的“模型可训练性与抗扰动鲁棒性之间的基本权衡”。
7. 为什么对抗样本具备泛化性?
对抗样本存在一个很有意思的现象:为一个模型生成的对抗样本,能够使其他不同架构、或在互斥训练集上训练的模型同样发生误判。而且,当这些不同模型发生误判时,它们通常倾向于将样本判别为完全相同的错误类别。早期的归因假说都存在问题:
若将其归因于过拟合与高度非线性,很难解释为什么多个具有多余容量的模型,会对处于训练分布之外的样本给出完全一致的判别结果。
早期有一种观点认为对抗样本就像“实数轴上的有理数”一样紧密铺满空间,即对抗样本虽然常见,但只存在于极其狭窄、孤立的微小区域中。但是若此假说成立,不同模型在各自空间中碰巧落入同一微小缝隙并输出相同结果的概率极低。
从线性视角来看,对抗样本并不存在于狭窄的缝隙中,而是存在于广阔的连续子空间中。这是因为,要构成有效的对抗扰动,扰动向量 η 并不需要极其精确,只需要与损失函数的梯度保持正内积,且幅度 ε 足够大即可。下图展示了这一现象:

在上图中,沿着 FGSM 定义的一维方向改变 ε 的取值,对抗样本在特征空间中呈现出连续的带状区域。这解释了为什么对抗样本数量丰富,并且一个分类器判错的样本天然在先验上具有被另一个分类器误判的较高概率。
基于此,作者提出了如下假说:
向基准线性分类器看齐:采用现有方法训练出的各类神经网络,其最终行为模式都类似于在同一数据集上训练出的线性分类器。
泛化能力保证权重稳定:由于机器学习算法本身具备跨样本子集的泛化能力,当线性分类器在同一任务的不同数据子集上训练时,所学习到的分类权重向量在空间方向上大致相同。
权重稳定性导致对抗样本一致性:底层线性分类权重的稳定对齐,使得由该权重导出的对抗扰动在不同网络间具备共享性,进而使不同模型在受扰动后被推向相同的决策区域。
作者利用深层 Maxout 网络生成对抗样本,并分别输入浅层 Softmax 网络(纯线性模型)与浅层 RBF 网络(非线性局部响应模型)进行预测对比:
原始一致率统计:
在 Maxout 网络误分类的样本中,Softmax 分类器给出与 Maxout 相同类别预测的比例为 54.6%;
而 RBF 网络给出与 Maxout 相同类别预测的比例仅为 16.0%。
排除单一出错样本后的条件一致率: 由于不同模型的基础错误率存在差异,作者进一步排除了两者未同时出错的案例(即仅考察两个模型同时发生误判的交集样本):
Softmax 与 Maxout 的类别一致率达到了 84.6%。
RBF 与 Maxout 的类别一致率仅为 54.3%。
作为对比,RBF 网络预测 Softmax 预测类别的概率为 53.6%(说明 RBF 自身的行为中也存在一定的线性成分)。
实验结论: 尽管该假说无法解释 Maxout 的所有错误,但纯线性 Softmax 与深层 Maxout 在错误类别上的高度重合(84.6%),表明高维线性行为是驱动对抗样本跨模型泛化的主要因素。
8. 结论
本文得出的核心结论如下列出:
对抗样本可以被解释为高维点积的一种特性。它们是模型过于线性而非过于非线性的结果。
对抗样本在不同模型间的泛化性,可以解释为对抗扰动与模型的权重向量高度对齐,且不同模型在针对同一任务进行训练时学到了相似的函数。
扰动的方向至关重要,而非空间中的特定点。空间中并未充满像有理数细密铺满实数那样、构成微小孤立空穴的对抗样本。
正是由于方向最为关键,对抗扰动能够跨越不同的干净样本产生泛化。
作者提出了一系列快速生成对抗样本的方法(FGSM)。
作者证明了对抗训练能够带来正则化效果,甚至能带来超越 Dropout 的正则化增益。
作者进行了对照实验,在使用更简单但效率较低的正则化方法(包括 L1 权重衰减和添加噪声)时,未能复现这种效果。
便于优化的模型更容易受到扰动。
线性模型缺乏抵抗对抗扰动的容量;只有具备隐藏层的结构(即适用通用近似定理的结构),才应当通过训练来抵御对抗扰动。
RBF 网络对对抗样本具备抵抗能力。
旨在对输入分布进行建模而训练的模型,对对抗样本不具备抵抗能力。
模型集成对对抗样本不具备抵抗能力。
后两点结论来源于作者进行了生成式训练与集成学习两种实验,发现它们都无法增强模型系统对于对抗样本的抵抗能力(鲁棒性)。
基于梯度的优化算法是现代人工智能的主力工具。通过使用被设计为充分线性的网络——无论是 ReLU 网络、Maxout 网络、LSTM,还是经过精心配置以避免过度饱和的 Sigmoid 网络——我们至少能够在训练集上拟合所关注的绝大多数问题。对抗样本的存在表明,能够解释训练数据甚至能够正确标注测试数据,并不意味着模型真正理解了我们要求其执行的任务。相反,它们的线性响应在数据分布之外的点上表现出过度的置信度,而这些置信预测往往存在显著错误。本文表明,我们可以通过显式识别存在问题的点并在每个此类点上修正模型,从而在一定程度上改善这一问题。然而,人们也可能会得出这样的结论:我们当前使用的模型家族本身存在内在缺陷。优化的便利性是以模型容易被误导为代价的。这促使人们去开发能够训练出在局部行为上更加稳定的模型的优化方法。
我的补充思考
补充思考 1 :有关逻辑回归的标准优化目标的推导
在二分类逻辑回归中,设定样本标签 y ∈ {−1, 1} 。于是正类预测概率可以建模为:

负类预测概率可以建模为:

将两式统一,对于任意 y ∈ {−1, 1} ,条件概率可紧凑写为:

训练目标是最大化对数似然,等价于最小化负对数似然损失 J :

引入 Softplus 函数:

在整个数据分布上的期望损失即为:

补充思考 2 :为什么 FGSM 在逻辑回归中是 “精确的” ?
对抗攻击的目标是在满足最大范数约束

的前提下,使训练损失最大化:

考虑 Softplus 函数的导数:

因此,Softplus 函数是严格单调递增的,因此,训练损失最大化,等价于最大化括号内的值。
进一步地,

前一项与 η 无关,因此可以将这个最优化问题简化为:

这个目标函数关于扰动向量 η 是严格线性的。因此 FGSM 在逻辑回归中是 “精确的” 。我们还能给出 η 的最优闭式解:

补充思考 3 :有关对抗逻辑回归的最小化目标推导
考虑施加最坏扰动后的对抗样本:

代入原始损失函数中,则括号内部变为:

利用性质:

于是可以化简得到:

y2 = 1 恒成立。因此我们得到了对抗逻辑回归的最小化目标:

补充思考 4 :在对抗训练中,什么是“对抗者对模型参数变化的反应”?
在对抗训练中,联合损失函数为:

这里的对抗样本事实上也是当前参数 θ 的函数:

第二项对 θ 求梯度得:

直接效应:假设输入的对抗样本特征不变,仅评估参数 θ 的改变对损失产生的影响。
间接效应:评估当参数 θ 发生变化时,对抗者根据新参数重新计算最坏扰动,进而引发的损失变化。这正是所谓的“对抗者对模型参数变化的反应”。
补充思考 5 :为什么 FGSM 对抗训练会导致模型“无法预先感知对抗者对模型参数变化的反应”?
在 FGSM 中,扰动向量满足:

于是有:

根据链式法则,

但是,符号函数 sign(u) 是一个阶跃函数:
当 u ≠ 0 时,它是局部平坦的常数函数,其导数严格为零。
当 u = 0 时,它存在跳跃不连续点,导数未定义。
因此,在定义域内几乎处处满足:

代入 θ 的梯度解析式,可得:

第二项归零,反映在优化机制上带来了如下结果:
静态视角(当前 FGSM 的行为):
优化算法在计算梯度更新 θ 时,把 x~ 当成了一个已经固定不变的普通样本。模型只负责在这一轮拟合当前的 x~ ,无法通过一阶优化预先得知:“如果我把参数往这个方向挪动一小步,对手会如何随之调整其攻击策略”。
动态/交互视角(理想情况):
如果扰动生成机制是平滑可微的,求导过程就会包含 Hessian 矩阵项。模型在更新 θ 的同时,能够根据二阶交互信息预先推演对手下一步的攻击转向,从而选取一个能使对手后续进攻收益受限的参数点。