超越提示词:通过模拟审核痕迹越狱函数调用型LLM
摘要
作者:Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia 原文链接:https://arxiv.org/pdf/2607.00481v1 摘要 越狱攻击仍然是对大型语言模型(LLM)安全部署的关键威胁。虽然先前的工作主要研究提示词层面的攻击和防御,但我们表明,这种以提示词为中心的范式忽视了有状态、函数调用环境中的结构性漏洞。在此类应用中,开发者定义的架构...
标签
- source:seebug
- type:paper
扩展字段
{
"guid": "https://paper.seebug.org/3497"
}