威胁情报
全球威胁情报、攻击态势与应急提示。
-
认知防火墙:一种面向LLM安全的主动式、零信任、多门控框架
作者: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz 原文链接:https://arxiv.org/pdf/2607.01277v1 摘要—大型语言模型(LLM)可能通过多轮策略被诱导生成...
作者: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz 原文链接:https://arxiv.org/pdf/2607.01277v1 摘要—大型语言模型(LLM)可能通过多轮策略被诱导生成...作者: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz 原文链接:https://arxiv.org/pdf/2607.01277v1 摘要—大型语言模型(LLM)可能通过多轮策略被诱导生成...扩展字段
{ "guid": "https://paper.seebug.org/3499" } -
超越提示词:通过模拟审核痕迹越狱函数调用型LLM
作者:Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia 原文链接:https://arxiv.org/pdf/2607.00481v1 摘要 越狱攻击仍然是对大型语言模型(LLM)安全部署的关键威胁。虽然先前的工作主要研究提示词层面的攻击和防御,但我们表明,这种以提示词为中心的范式忽视了有状态、函数调用环境中的结构性漏洞。在此类应用中,开发者定义的架构...
作者:Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia 原文链接:https://arxiv.org/pdf/2607.00481v1 摘要 越狱攻击仍然是对大型语言模型(LLM)安全部署的关键威胁。虽然先前的工作主要研究提示词层面的攻击和防御,但我们表明,这种以提示词为中心的范式忽视了有状态、函数调用环境中的结构性漏洞。在此类应用中,开发者定义的架构...作者:Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia 原文链接:https://arxiv.org/pdf/2607.00481v1 摘要 越狱攻击仍然是对大型语言模型(LLM)安全部署的关键威胁。虽然先前的工作主要研究提示词层面的攻击和防御,但我们表明,这种以提示词为中心的范式忽视了有状态、函数调用环境中的结构性漏洞。在此类应用中,开发者定义的架构...扩展字段
{ "guid": "https://paper.seebug.org/3497" } -
拒绝背后:通过行为监控确定护栏激活
作者:William Hackett, Peter Garraghan 原文链接:https://arxiv.org/pdf/2607.02121v1 摘要 随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和保障性变得至关重要。用于检测并拦截发送至LLM及从LLM发出的恶意指令的护栏系统,是AI安全的关键组成部分。然而,针对生产级AI系统进行黑盒对抗模拟的研究人员,常常难以判断是护...
作者:William Hackett, Peter Garraghan 原文链接:https://arxiv.org/pdf/2607.02121v1 摘要 随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和保障性变得至关重要。用于检测并拦截发送至LLM及从LLM发出的恶意指令的护栏系统,是AI安全的关键组成部分。然而,针对生产级AI系统进行黑盒对抗模拟的研究人员,常常难以判断是护...作者:William Hackett, Peter Garraghan 原文链接:https://arxiv.org/pdf/2607.02121v1 摘要 随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和保障性变得至关重要。用于检测并拦截发送至LLM及从LLM发出的恶意指令的护栏系统,是AI安全的关键组成部分。然而,针对生产级AI系统进行黑盒对抗模拟的研究人员,常常难以判断是护...扩展字段
{ "guid": "https://paper.seebug.org/3496" } -
Hephaestus:迈向网络安全AI科学家
作者:Jiaqi Li, Yang Zhao, Wen Lu, Lvyang Zhang, and Lidong Zhai 原文链接:https://arxiv.org/pdf/2606.29981v1 摘要 网络攻击正在以机器速度推进;但网络安全研究本身却并非如此。现有的AI科学家系统使得端到端的研究自动化越来越可行,但它们针对的是相对稳定的科学领域。我们认为,AI原生的网络安全是一种不同类型的...
作者:Jiaqi Li, Yang Zhao, Wen Lu, Lvyang Zhang, and Lidong Zhai 原文链接:https://arxiv.org/pdf/2606.29981v1 摘要 网络攻击正在以机器速度推进;但网络安全研究本身却并非如此。现有的AI科学家系统使得端到端的研究自动化越来越可行,但它们针对的是相对稳定的科学领域。我们认为,AI原生的网络安全是一种不同类型的...作者:Jiaqi Li, Yang Zhao, Wen Lu, Lvyang Zhang, and Lidong Zhai 原文链接:https://arxiv.org/pdf/2606.29981v1 摘要 网络攻击正在以机器速度推进;但网络安全研究本身却并非如此。现有的AI科学家系统使得端到端的研究自动化越来越可行,但它们针对的是相对稳定的科学领域。我们认为,AI原生的网络安全是一种不同类型的...扩展字段
{ "guid": "https://paper.seebug.org/3494" } -
从效率到泄露——联邦语言模型微调中的隐私后门
作者:Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou 原文链接:https://arxiv.org/pdf/2606.20553 摘要 联邦学习(FL)使多方能够在不共享原始数据的情况下,协作微调面向...
作者:Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou 原文链接:https://arxiv.org/pdf/2606.20553 摘要 联邦学习(FL)使多方能够在不共享原始数据的情况下,协作微调面向...作者:Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou 原文链接:https://arxiv.org/pdf/2606.20553 摘要 联邦学习(FL)使多方能够在不共享原始数据的情况下,协作微调面向...扩展字段
{ "guid": "https://paper.seebug.org/3493" } -
NRT-Bench:面向安全关键控制室中 LLM 智能体的多轮红队测试基准
作者:Hanwool Lee, Dasol Choi, Bokyeong Kim等 原文链接:https://arxiv.org/pdf/2606.20408 摘要 大型语言模型(LLM)智能体越来越多地被提议作为安全关键系统的监督组件,但它们在持续、自适应对抗压力下的鲁棒性仍然缺乏充分表征。本文提出NRT-Bench,一个用于对担任安全关键系统操作员的LLM智能体进行多轮红队测试的基准,具体实例...
作者:Hanwool Lee, Dasol Choi, Bokyeong Kim等 原文链接:https://arxiv.org/pdf/2606.20408 摘要 大型语言模型(LLM)智能体越来越多地被提议作为安全关键系统的监督组件,但它们在持续、自适应对抗压力下的鲁棒性仍然缺乏充分表征。本文提出NRT-Bench,一个用于对担任安全关键系统操作员的LLM智能体进行多轮红队测试的基准,具体实例...作者:Hanwool Lee, Dasol Choi, Bokyeong Kim等 原文链接:https://arxiv.org/pdf/2606.20408 摘要 大型语言模型(LLM)智能体越来越多地被提议作为安全关键系统的监督组件,但它们在持续、自适应对抗压力下的鲁棒性仍然缺乏充分表征。本文提出NRT-Bench,一个用于对担任安全关键系统操作员的LLM智能体进行多轮红队测试的基准,具体实例...扩展字段
{ "guid": "https://paper.seebug.org/3492" } -
面向多种防御策略的自动化越狱攻击
作者:Qi Wang, Chengcheng Wan等 原文链接:https://arxiv.org/pdf/2606.16751 摘要 大型语言模型(LLM)在广泛的任务中展现出了卓越的能力。然而,由于其易受对抗性提示攻击的影响,其安全性仍然是一个关键问题。在本文中,我们提出了UniAttack,这是一个从防御视角设计的对抗性测试框架,用于系统性地构建有效的黑盒攻击提示。与以往依赖静态模板或迭代...
作者:Qi Wang, Chengcheng Wan等 原文链接:https://arxiv.org/pdf/2606.16751 摘要 大型语言模型(LLM)在广泛的任务中展现出了卓越的能力。然而,由于其易受对抗性提示攻击的影响,其安全性仍然是一个关键问题。在本文中,我们提出了UniAttack,这是一个从防御视角设计的对抗性测试框架,用于系统性地构建有效的黑盒攻击提示。与以往依赖静态模板或迭代...作者:Qi Wang, Chengcheng Wan等 原文链接:https://arxiv.org/pdf/2606.16751 摘要 大型语言模型(LLM)在广泛的任务中展现出了卓越的能力。然而,由于其易受对抗性提示攻击的影响,其安全性仍然是一个关键问题。在本文中,我们提出了UniAttack,这是一个从防御视角设计的对抗性测试框架,用于系统性地构建有效的黑盒攻击提示。与以往依赖静态模板或迭代...扩展字段
{ "guid": "https://paper.seebug.org/3491" } -
ZERO-APT:面向智能防御下 LLM 驱动自动化渗透测试的闭环对抗框架
作者:Anlan Zheng, Tiantian Zhu 原文链接:https://arxiv.org/html/2606.05567v1 摘要 LLM驱动的自动化渗透测试智能体通常是在既不会检测也不会响应攻击的静态目标上进行评估的,因此它们在智能防御下的行为仍然未经测试。多步攻击链的因果一致性同样依赖于不稳定的LLM推理,而智能体的决策对人类分析人员来说仍然是不透明的。这三个缺陷——真实性、一致...
作者:Anlan Zheng, Tiantian Zhu 原文链接:https://arxiv.org/html/2606.05567v1 摘要 LLM驱动的自动化渗透测试智能体通常是在既不会检测也不会响应攻击的静态目标上进行评估的,因此它们在智能防御下的行为仍然未经测试。多步攻击链的因果一致性同样依赖于不稳定的LLM推理,而智能体的决策对人类分析人员来说仍然是不透明的。这三个缺陷——真实性、一致...作者:Anlan Zheng, Tiantian Zhu 原文链接:https://arxiv.org/html/2606.05567v1 摘要 LLM驱动的自动化渗透测试智能体通常是在既不会检测也不会响应攻击的静态目标上进行评估的,因此它们在智能防御下的行为仍然未经测试。多步攻击链的因果一致性同样依赖于不稳定的LLM推理,而智能体的决策对人类分析人员来说仍然是不透明的。这三个缺陷——真实性、一致...扩展字段
{ "guid": "https://paper.seebug.org/3490" }