拒绝背后:通过行为监控确定护栏激活
摘要
作者:William Hackett, Peter Garraghan 原文链接:https://arxiv.org/pdf/2607.02121v1 摘要 随着大型语言模型(LLM)和智能体系统融入实际应用,确保其安全性和保障性变得至关重要。用于检测并拦截发送至LLM及从LLM发出的恶意指令的护栏系统,是AI安全的关键组成部分。然而,针对生产级AI系统进行黑盒对抗模拟的研究人员,常常难以判断是护...
标签
- source:seebug
- type:paper
扩展字段
{
"guid": "https://paper.seebug.org/3496"
}