AI 与网络安全
生成式AI安全与韧性:学术研究揭示治理框架落后于部署速度
Frontiers in Artificial Intelligence 刊出的评审论文提出覆盖设计、实施、监控、合规、反馈五阶段的生成式AI治理框架,并指出生成式系统部署速度与机构保障成熟度之间的落差正在催生影子AI风险。
导语
2025年6月2日,同行评审期刊 Frontiers in Artificial Intelligence 刊出一篇题为《Generative AI cybersecurity and resilience》的评审论文。作者分别来自牛津大学计算机科学系、艾伦·图灵研究所、思科系统与基尔大学,研究采用 PRISMA 引导的系统性文献综述,并结合主题分析与定量分析,提出一个覆盖五个生命周期阶段的负责任生成式AI部署框架。
这篇文章的核心判断并不关于模型性能,而关于治理落差:生成式系统的落地速度已明显快于机构安全与合规保障的成熟速度,由此产生的“影子AI”(shadow AI)成为新的风险来源。对于把大模型接入业务流程的企业安全负责人而言,其价值在于把讨论从“模型能做什么”拉回到“组织能否管住它”。
研究概览
- 期刊与时间:Frontiers in Artificial Intelligence,2025年6月2日,第8卷,DOI: 10.3389/frai.2025.1568360
- 栏目与专题:AI for Human Learning and Behavior Change,属“AI and Resilience”研究专题
- 作者机构:牛津大学计算机科学系与艾伦·图灵研究所(Petar Radanliev)、思科系统(Omar Santos)、基尔大学计算机科学与数学学院(Uchenna Daniel Ani)
- 编辑与审稿:Kaushik Das 编辑;Dimiter Velev、Janika Leoste 审稿
- 研究类型:评审论文,方法论为 PRISMA 引导的文献综述,叠加主题与定量(文献计量)分析
- 核心产出:五阶段治理框架(设计、实施、监控、合规、反馈)
- 应用指向:论文将结论指向国家关键基础设施中符合伦理且安全的AI应用路径
需要说明的是,这是一篇学术综述,不是事件响应报告,也没有提供特定行业的事件统计或损失数据。因此下文聚焦其提出的风险结构与治理框架,而非个案披露。信息源头:https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1568360/full
技术与风险分析
#### 技术底座决定了风险形态
论文指出,生成式AI与传统算法方法的根本差异在于其能够自主合成新内容。技术路径上,生成对抗网络(GAN)通过生成器与判别器的零和博弈迭代提升输出质量;变分自编码器(VAE)则把数据分布编码到低维潜在空间,再从该空间采样生成新样本。这种能力不再局限于传统数据输出,而可合成从高分辨率图像到上下文丰富的自然语言文本的内容,且往往与人类创作难以区分。
论文同时梳理了生成式与判别式模型的差异。这一区分对企业有实际意义:判别式模型通常用于分类与判定,生成式模型用于构造内容、代码与合成数据;二者在攻击面、审计方式与数据依赖上并不相同。
#### 攻击面:从数据投毒到深度伪造
论文把生成式AI引入的安全风险归纳为若干类别:
- 自动化攻击规模化:生成式AI可自动生成代码、构造更复杂的钓鱼内容,从而提升攻击的规模与复杂度。
- 虚假信息自动化传播:借助生成能力,错误叙事可被快速扩散,显著增加检测与缓解难度。
- 深度伪造:由GAN驱动的音视频伪造已达到高度逼真程度,对信息完整性与公众信任构成风险。
- 算法偏见:训练数据中的偏见被无意传播,可能在决策系统中产生歧视性结果。
- 隐私与再识别:微调大型模型所需的海量数据集常包含敏感信息,引发数据所有权、同意有效性以及匿名数据集中再识别可能性的问题。
论文特别提到,这些技术与《通用数据保护条例》(GDPR)等现行法律框架之间存在持续张力,需要更具适应性、更贴合具体场景的治理机制。
#### 韧性如何度量
论文对“韧性”的定义沿用复杂系统研究的经典表述:预测、吸收、恢复并适应不利条件的能力。在生成式AI语境下,韧性被具体化为三个可操作的评估方向:
1. 数据投毒与模型鲁棒性:模型在训练数据被操纵时保持完整性的能力,对应手段包括对抗训练与差分隐私。 2. 深度伪造与虚假信息检测:通过嵌入AI驱动的检测机制对抗虚假信息、维护数字真实性。 3. 治理与政策执行:把安全合规与伦理治理嵌入系统运行,使生成式AI在明确约束下运行。
#### 影子AI:被低估的治理盲区
论文最关键的概念性贡献,是指出生成式系统被快速采用与机构保障措施成熟度之间存在“脱节”(disconnection),而这一落差会催生影子AI风险。所谓影子AI,指未经安全与合规评审便进入业务流程的AI使用——它可能表现为员工私自调用外部模型处理内部数据,也可能是团队在正式审批流程之外自行接入的AI组件。其危险不在于AI本身是否“作恶”,而在于组织对其数据流向、权限边界与输出用途缺乏可见性。
企业影响分析
把论文框架映射到企业场景,可以对应到五类风险。
运营风险。当AI能力被嵌入内容生产、代码开发、客服与决策辅助流程,模型输出质量、可用性和数据来源就成为运营连续性问题。影子AI尤其棘手:安全团队在资产清单上找不到它,事件响应流程也就无法覆盖它。
数据与隐私风险。论文指出,训练与微调所需的数据集常含敏感信息,匿名化并不必然消除再识别可能。对处理客户数据、员工数据或医疗、金融数据的企业,这意味着数据治理边界需要从数据库延伸到模型与提示。
合规风险。GDPR 等框架对数据来源、同意与用途限制的要求,与生成式模型的训练方式之间存在结构性张力。合规负责人需要回答:训练数据从何而来、以何依据处理、如何在模型生命周期内响应删除与访问请求。
信任与品牌风险。深度伪造直接冲击身份与信息真实性,企业高管的音视频被伪造、品牌内容被冒充生成,都会转化为信任成本。
第三方与供应链风险。模型、插件与AI服务多以外部依赖形式进入企业,第三方风险管理清单需要新增AI供应商条目:模型来源、数据保留策略、日志可得性、事件通知义务。
行业趋势观察
第一,攻防同源成为常态。论文提到生成式AI既被用于自动化威胁检测与对抗攻击模拟,也被用于构造攻击内容。同一技术栈同时服务攻防两侧,意味着防御方必须以更快的迭代速度应对。
第二,治理从“原则”走向“生命周期运行控制”。论文提出的设计、实施、监控、合规、反馈五阶段,本质上是把抽象的AI伦理原则翻译成可审计的工程与管理节点,这与近年监管与企业实践的共同方向一致:从发布原则声明,转向可验证的控制项。
第三,影子AI把AI治理变成资产可见性问题。这与此前云安全、SaaS治理的演化路径相似——先出现自发采用,再出现可见性缺口,最后才形成正式的准入与监控机制。
第四,行业特定治理取代通用治理。论文明确主张自适应、行业特定的治理方式,并指向国家关键基础设施。对能源、水务、交通、医疗等OT与IT融合场景,通用AI安全建议的适用性有限。
防御与应对建议
需要说明,以下建议中一部分源自论文框架,一部分是基于企业安全实践对框架的延伸落地。
企业层面:把AI资产纳入身份与访问管理体系,对模型调用、API密钥和数据管道实施最小权限;对高权限AI管理入口强制多因素认证;在数据侧建立训练与提示数据的分类分级与使用审批;将AI供应商纳入第三方风险管理与供应链评审;把AI相关组件纳入漏洞管理范围。
技术层面:以SIEM汇聚AI服务与内部模型的访问日志,建立异常调用与数据外流检测;用EDR/XDR覆盖端点上的AI工具与本地模型运行环境;引入威胁情报跟踪生成式AI相关的攻击手法与工具演化;对模型输出建立内容真实性与敏感信息检测环节。
管理层面:把影子AI发现纳入常态化流程,形成AI资产台账并定期复核;在事件响应预案中加入模型被投毒、提示与数据泄露、深度伪造冒用等场景;把论文的五阶段框架映射为内部控制的评审节点,明确各阶段负责人与证据留存要求;在治理层面对AI使用建立准入与退出机制。
SecurityPost Insight
这篇论文的真正价值,不在于它宣称生成式AI有多危险,而在于它给出了一个可以衡量的判断:企业AI部署速度与治理成熟度之间存在结构性落差,而影子AI正是这一落差的可观测表现。对CISO而言,这意味着AI治理的第一步不是采购检测工具,而是先解决可见性问题——组织是否知道自己在用哪些模型、这些模型接触哪些数据、输出流向哪里。
第二点启示是韧性视角的引入。论文把韧性拆解为预测、吸收、恢复、适应,并对应到模型鲁棒性、虚假信息检测和政策执行三个方向。这为企业提供了不同于“合规打勾”的路径:与其追求一次性认证,不如建立能在对抗条件下保持功能的能力。
第三,论文的行业特定治理主张值得关注。当生成式AI进入关键基础设施相关的决策与运维环节,通用安全建议将迅速失效,监管与企业内控都会向行业化、场景化方向收敛。
值得持续跟踪的趋势有三条:一是影子AI的可见性与治理工具是否形成标准化的企业能力;二是模型鲁棒性手段(如对抗训练与差分隐私)能否从研究走向工程化部署;三是围绕训练数据来源与再识别的隐私争议,会以何种形式转化为具体合规要求。对企业安全负责人而言,现在可以着手的一件事,是把AI资产发现与AI事件响应场景加入下一轮安全规划——这是论文框架与真实防御之间最短的一段距离。
证据路径 · securitypost
securitypost 将这段说明放在「威胁简报 / 企业安全 / 聚焦身份、云防护、终端安全、安全运营、供应商动态,以及影响企业风险管理的关键控制措施。」的站点语境中。「威胁简报 / 企业安全 / 聚焦身份、云防护、终端安全、安全运营、供应商动态,以及影响企业风险管理的关键控制措施。」解释了本文的本地编辑角度: 读者复用摘要前应先打开来源链接。日期、名称和状态变化仍需重新核对。