认知防火墙:一种面向LLM安全的主动式、零信任、多门控框架
摘要
作者: Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz 原文链接:https://arxiv.org/pdf/2607.01277v1 摘要—大型语言模型(LLM)可能通过多轮策略被诱导生成...
标签
- source:seebug
- type:paper
扩展字段
{
"guid": "https://paper.seebug.org/3499"
}