安全动态

AI黑客迎来“克星”!一个隐藏诱饵让攻击成功率暴跌90%

来源:聚铭网络    发布时间:2026-08-14    浏览次数:
 
AI智能体正在改变网络攻击方式,攻击者可利用它们自动完成侦察、入侵和权限提升。面对这一趋势,安全公司Tracebit提出“上下文炸弹”防御技术:通过部署带有特殊提示词的诱饵文件,主动触发大模型安全护栏,让恶意AI智能体在攻击早期停止运行,同时向防御者发出警报。

随着攻击者越来越多地使用AI智能体来自动化网络攻击的所有阶段,安全行业和企业迫切需要寻找新的网络防御方法,其中一种很有前景的技术,就是主动放置植入有提示词的诱饵文件,以此触发LLM内置的内容安全护栏,从而达到崩溃恶意的自主工作流的目的。

将诱饵资源用作触发器来向防御者警报潜在的未经授权访问,这在网络安全领域并非新概念,这些诱饵被称为“金丝雀”——得名于早期矿井中用金丝雀作为预警系统的做法,它们可以是伪造的文件、AWS访问密钥、数据库转储、DNS记录,甚至是合规进程不会查询、但对攻击者极具诱惑力的URL。

网络安全公司Tracebit设计并测试的这种新方法的创新之处在于:不仅利用这些诱饵资源触发警报,还能直接阻止AI智能体,为防御者争取更多时间,这项被命名为“上下文炸弹”的技术,充分利用了LLM原生容易遭受提示词注入攻击的弱点——即模型会对在处理的数据中遇到的指令做出响应。

构建自家AI智能体的企业必须警惕攻击者置于网页、电子邮件、文档、代码注释以及这些智能体可能访问的其他第三方资源中的恶意提示词。如果在没有防御措施的情况下,企业自研的智能体面临被劫持并反过来被用于执行未经授权操作的风险,然而,攻击者使用的恶意AI智能体也同样存在这一弱点。

Tracebit的CTO Sam Cox在博客文章中表示:“我们将这种防御性版本称为上下文炸弹:这是一段旨在触发模型安全护栏的简短文本,直接放置在攻击者的必经之路上——比如诱饵密钥、环境变量或DNS记录,读取它的AI智能体往往会拒绝继续运行,你依然会收到警报,而且攻击会在早期被直接阻断,而不仅仅是被检测到。”

上下文炸弹大幅降低攻击成功率

Tracebit在AWS测试环境中进行的测试表明,只需加入能够触发内容安全护栏的指令,就能将AI模型在多条攻击路径上的成功率降低高达90%。LLM经过训练,会拒绝回答有关制造生物、化学或核武器的问题,或者在开源中文模型的情况下,拒绝回答有关敏感政治话题。

此外,一旦这些禁用的指令进入上下文窗口,整个会话就会被“毒化”,模型通常需要人工干预才能继续运行。研究人员运行了大量测试来寻找能够稳定触发模型安全护栏的短字符串,但值得注意的是,不同模型所确定的有效字符串并不相同,测试的模型包括:Claude Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek V4 Pro和Kimi K2.6。

在基准测试中,AI智能体在154次攻击运行中,平均有54%的概率获得完整的账号管理员权限,并在36%的测试中实现了完全入侵(获取管理员权限加持久化),而在部署了上下文炸弹后,它们获取管理员权限的成功率骤降至5%,完全入侵的成功率则降至1%,此外,在基准攻击运行中,有91%的智能体成功完成了十条可能攻击路径中的至少一条,但在上下文炸弹的作用下,它们的平均成功率降至15%。

来自西方AI实验室的模型——Opus和Gemini——被证明在获取完整管理员权限方面能力最强,成功率分别达到93%和70%,但它们受上下文炸弹的影响也最为严重,后者的成功率均降至0%,这表明,与参与测试的中文模型相比,这些模型中的内容安全护栏要强大得多。

攻击者率先尝试了利用安全拒绝机制

Tracebit的研究人员之前一直在尝试将AI金丝雀用于警报目的,5月份发表的一篇论文显示,在利用10种不同AI模型驱动的AI智能体进行的162次成功攻击运行中,金丝雀在95.9%的情况下向防御者发出警报,这些警报比智能体执行关键操作提前了8分钟触发,而攻击运行平均需要14分钟才能获取管理员权限。

在这些测试中,研究人员观察到,如果他们告知模型网络中可能包含欺骗性设计,模型获取完整管理员权限和持久化的成功率平均从20%下降到3%。

随后在6月份,安全公司Socket.dev的研究人员发现了一起软件供应链攻击,涉及包含恶意PyPI wheel包,其中含有旨在触发AI模型内置安全护栏内容的提示词注入,这些恶意提示词被包含在文件开头的代码注释中,其目的可能是为了规避由LLM驱动的安全扫描工具的检测。

“这个文件头看起来是专为AI辅助分析设计的,而不是给Node、Bun或Python准备的,”Socket.dev的研究人员当时表示,“它试图干扰扫描器或分析师Copilot,这些工具会将文件开头喂给语言模型,但未能将这些内容明确隔离为不可信数据。在脆弱的流水线中,这会导致在扫描器接触到真正的恶意软件之前,引发拒绝行为、提示词混淆、上下文污染或过早做出分类判断。”

Tracebit的研究人员随后萌生了逆向思维:利用他们的金丝雀技术,主动触发这种安全拒绝机制来对抗恶意AI智能体,这样一来,不仅智能体的运行会被中止,还会因为金丝雀被访问而触发警报。

虽然这种金丝雀也有可能被工程或安全团队使用的合法LLM驱动工具意外发现和访问,但这也意味着企业可以将此类金丝雀部署在敏感位置,以阻止自家可能被劫持或偏离轨道的AI智能体。

网上有许多关于AI模型由于陷入失败循环并探索“创意方式”来完成任务,进而执行破坏性或未经授权操作(如删除数据库、文件夹或提升自身权限)的报告,这种情况在被要求在没有人类干预或监督的情况下实现目标的自主AI智能体中更为常见。

“自主AI攻击的爆发速度,正促使欺骗防御技术提升至安全计划的核心优先级,”Tracebit的Cox表示,“当攻击链的时间单位从几天缩短到几分钟时,你能争取到的每一分钟响应时间都至关重要——而一种能够彻底阻止攻击者、而不仅仅是报告攻击者的控制措施,将从根本上改变攻防的经济格局。”

信息来源:51CTO https://www.51cto.com/article/850477.html

 
 

上一篇:专家解读|把握数字化网络化智能化机遇 开创信息化创新发展新局面

下一篇:2026年8月14日聚铭安全速递