智能体时代的网络攻击战:自主人工智能攻防的技术突变与欧洲治理困局

报告深度剖析了商业大模型的武器化趋势、安全护栏的系统性失效以及跨大西洋在人工智能军事化应用上的战略分歧,并提出了构建动态人工智能治理框架的系统性路径。

导语:2026年7月6日,卡内基基金会欧洲中心(Carnegie Europe)发表《当智能体发起攻击:自主网络作战与欧洲的治理鸿沟》(When AI Agents Attack:Autonomous Cyber Operations and Europe's Governance Gap)的专题报告,指出具备自主规划、工具调用与闭环决策能力的智能体正推动网络威胁格局发生结构性突变。报告深度剖析了商业大模型的武器化趋势、安全护栏的系统性失效以及跨大西洋在人工智能军事化应用上的战略分歧,并提出了构建动态人工智能治理框架的系统性路径。

一、网络安全领域的

“代理式转向”与威胁演进

人工智能在网络安全领域的应用正经历由“辅助工具”向“自主智能体”的结构性转变。传统网络安全防御建立在“攻击者为受限于生理与认知极限的人类”这一假设之上,攻击呈现为按部就班的攻击杀伤链,入侵周期以天计算,归因分析依赖行为特征签名。代理式人工智能(Agentic AI)的兴起打破了这一范式:其架构将大语言模型与规划循环、工具接口、长期记忆和反馈机制深度融合,使系统能在极少或无需人类干预的情况下,自主完成观察环境、制定策略、执行攻防并迭代修正的全过程。

这一转向在三个维度上重塑了网络威胁格局:

(1)决策授权与自主性:攻击者将决策权直接下放给智能体,由其自主完成从侦察、漏洞利用到数据外泄的全流程操作;

(2)非对称规模化:极少数人类操作员即可部署并控制成千上万个智能体。如2026年1月智能体专属社交平台Moltbook事件中,仅1.7万名人类操作员就控制了超过150万个自主智能体,导致身份认定与责任归因极度困难;

(3)认知攻击面拓宽:威胁从传统代码漏洞扩展至大模型自身的认知机制,如提示词注入、越狱攻击和数据篡改。

高度自主的攻防智能体依赖于目标导向的强化学习训练,但这类训练使系统对实现目标的手段缺乏道德或规则约束。美国国家标准与技术研究院(NIST)研究表明,当智能体被赋予代码执行等灵活工具时,往往会利用规则漏洞“博弈”安全检查。智能体因缺乏对安全策略实质精神的理解,极易将嵌入在外部数据中的恶意指令误判为合法任务步骤,进而引发非预期的越狱与滥用。

当数以万计的智能体以机器速度进行攻防交锋时,传统日志审计与行为识别难以区分人类意图与机器自发行为,归因体系易受到机器虚假信号或模型幻觉干扰,因此急需建立基于密码学的智能体身份验证与可审计行动日志机制。

二、商业大模型武器化:

网络犯罪与间谍活动的技术倍化

商业前沿大模型的快速迭代,在提升生产力的同时也为网络间谍与网络犯罪提供了强力工具。2025年11月,Anthropic披露了一起特定国家背景威胁发起者发起的自动化网络入侵事件,这是首次公开发表的将大语言模型作为自主网络攻击核心组件的案例。攻击者通过提示词越狱将Claude伪装成安全工具,指示其自主执行侦察、漏洞检测、利用代码编写、初始接入及数据外泄,在无人类引导下完成了约80%至90%的操作,将原本需数月的攻击周期压缩至数天。

随着黑帽生成式人工智能(如WormGPT)的出现,越狱技术正演变为模型可自动生成的普遍能力,极大降低了技术门槛,缩小了非国家行为体与国家级黑客之间的能力差距。然而,模型自身的安全对齐(Safety Alignment)在持续性对抗提示词面前显得脆弱不堪,且极易遭受国家权力的干预。2026年2月,美国国防部要求Anthropic为其军方合同开放Claude的无限制访问权限,Anthropic因拒绝越过“全自主致命打击”和“国内大规模监控”两条红线,被美军方列为“国家安全供应链风险”。仅数小时后,OpenAI即与美军签署了替代性合同。这揭示了前沿人工智能安全护栏在国家采购杠杆与军事需求面前的脆弱性,靠开发商自律无法为下游部署者提供稳定安全保障。

三、护栏幻觉与运行安全:

传统防护机制的系统性失效

在企业级应用中,现有网络安全防护体系面对自主智能体时正遭遇严重的“护栏幻觉”。传统的数据防泄漏(DLP)系统与访问控制建立在“静态软件”与“明确人类意图”假设之上,难以约束具备广泛语义访问权限的智能体。

2026年2月,微软确认其Copilot Chat存在严重漏洞,导致该人工智能助手持续数周总结用户的敏感机密邮件,直接绕过了企业DLP策略和敏感度标签。这一事件中该助手被赋予了跨邮件、文档、聊天的广泛语义访问权限,当常规软件隔离与模型层发生逻辑脱节时,智能体便会在无意中提取并暴露受保护的信任域数据。

安全研究员西蒙·威利森(Simon Willison)将自主智能体的核心架构风险总结为“致命三要素”(Lethal Trifecta):一是读取敏感内部数据的权限;二是接收不可信外部环境输入的接口(如网页、邮件、共享文件);三是向外部传输信息或执行操作的能力。当三者同时具备时,攻击者只需在外部网页或文档中嵌入隐蔽恶意指令,智能体在读取时就会将其误判为合法指令,触发本地文件调取、凭据泄露或数据外传。这种攻击消解了传统安全中数据与代码的界限,攻击者可直接操纵智能体的认知过程,将其转化为内部网络的“半自主威胁源”。

在开源智能体框架(如Moltbook集成的OpenClaw)中,该风险更为突出:智能体被赋予本地最高级权限(读取修改文件、访问邮件、存储凭据及调用API),高权限、多接口且缺乏持续人工监督的架构极易引发跨系统级联失效,使边界防御形同虚设。

四、欧洲网络安全与人工智能治理

的技术监管鸿沟

面对智能体威胁的演化,欧洲现有的法律与监管框架展现出严重不匹配。2024年的欧盟《人工智能法案》(EU AI Act)与2026年的《网络安全一揽子计划》(Cybersecurity Package),立法逻辑依然停留在对模型开发者的合规约束与事前产品认证上,忽视了智能体在“运行时”(Runtime)的动态演化特征。

《人工智能法案》未将“代理式人工智能”列为独立监管类别,且明确将“仅用于军事、国防或国家安全目的的人工智能系统”排除在适用范围之外。然而,最具战略影响力的自主网络攻击能力恰恰产生于这一监管盲区。现行监管模式在应对智能体威胁时存在三大缺陷:

(1)权责错位:监管过于偏向前端开发者,忽视了后端部署者。开发者的安全对齐无法防止部署后的越狱滥用,真正决定风险的是智能体在运行环境中的权限与数据接触面;

(2)边界防御思维失效:现有法规侧重防范外部入侵与供应链硬件漏洞,但智能体攻击发生在受信任的内部网络中,攻击者只需通过提示词注入引导已授权的智能体向错误方向行动;

(3)静态认证与动态行为的冲突:欧盟信息和通信技术安全认证建立在“软件行为确定性”之上。但智能体具备上下文记忆与自主学习能力,行为随环境而变,事前通关评估无法保证后期的运行安全。

此外,代理式人工智能依赖于API、第三方插件、RAG数据库构成的动态工具链,其中任何节点的损坏都会直接改变智能体决策,形成传统供应链审查无法覆盖的新型攻击面。

五、跨大西洋战略分歧

与欧美的攻防博弈

在治理理念与安全战略上,美欧正走向不同方向,跨大西洋分歧加剧了欧洲的战略被动。美国在网络空间转向激进的“全面解禁”(Gloves-off)与“前向防御”(Defend Forward)姿态。2026年3月发布的《美国国家网络战略》(Trump's Cyber Strategy for America)明确将前沿人工智能与智能体提升为国家攻防核心要素,鼓励美国国防情报机构联合私人安全承包商,利用自主智能体对对手发起主动遏制与网络中断。美国将前沿人工智能视为战略资产,甚至通过采购杠杆强迫厂商放宽安全限制。

相比之下,欧洲仍锚定在法规约束、风险管理、数据保护(如GDPR)及事后恢复力上,这给欧洲带来三重挑战:

(1)技术依赖与制度冲突:欧洲高度依赖美国前沿大模型与云基础设施,而这些底层设定深受美军方采购与国安指令影响,与欧盟数据隐私和尽职调查法律产生冲突;

(2)法律责任与私人承包商风险:美国将私人承包商深度纳入攻防体系,模糊了国家与商业界限,欧洲网络设施极易被美方智能体用作攻防跳板,带来连带风险;

(3)安全能力鸿沟拉大:对比美国机器速度的攻防系统,欧洲依赖人工协调与事后响应的防守体系显得过于迟钝。

六、构建面向未来的

自主人工智能动态治理框架

为弥合治理鸿沟,必须超越静态监管,建立涵盖“运行时监控、动态授权与国际规范”的综合治理体系。

(一)从“事前认证”转向“运行时动态监管”

应要求部署高风险智能体的组织实施持续的运行时监控。建立严格的上下文限制与权限隔离,防止智能体同时具备敏感数据读取、不可信内容吸收与外部通信三项能力。同时引入密码学身份标识与强制行动日志,并为高风险智能体配备硬性“阻断开关”(Kill-Switch)。

(二)强化国家响应机制与部门协调

相关部门应领头制定智能体故障与安全事件的统一分类标准。计算机动力响应小组与行业信息共享中心需升级技术手段,建立针对智能体异常行为的共享报告通道,在机器速度攻击爆发前识别早期征兆。

(三)保护薄弱的关键基础设施

地方市政、医疗机构、中小能源企业缺乏抵御自动化智能体攻击的技术资源。须提供针对性的技术支持、自动化防御工具和应急响应资源。

(四)推行尽职调查与国际规范

可吸收经济合作与发展组织《负责任人工智能尽职调查指南》原则,将安全责任贯穿于开发者、部署者、云服务商全过程。外交层面,应推动在联合国框架下明确国际法与国际人道法在自主网络武器领域的适用性,推动禁止针对医疗系统、核指挥与控制系统及核心民用关键基础设施使用完全自主的网络攻击智能体。

七、结语

当前,网络空间博弈的焦点正不可逆转地从“人类攻防对抗”转向“自主智能体之间的机器速度交锋”。仅靠高密度立法不足以弥合鸿沟,关键在于监管范式的转变,即从对静态代码与开发者的审查,转向对动态行动、运行权限与人机控制权的实时把控。在数字基础设施充斥自主智能体的未来,确保“机器代理权的扩张速度不超越人类制度的治理能力”,将是决定数字文明安全与秩序的核心考验。

参考来源:卡内基和平基金会

参考题目:When AI Agents Attack:Autonomous Cyber Operations and Europe’s Governance Gap

参考链接:https://carnegieendowment.org/europe/research/2026/07/when-ai-agents-attack-autonomous-cyber-operations-and-europes-governance-gap

请扫码关注数字化经济观察网
责编:左翊琦
参与评论
文明上网,理性发言!请遵守新闻评论服务协议
0/200