无一幸免!OpenAI最强竞对Anthropic:“长上下文”让大模型更不安全
原创 学术头条 学术头条 2024-04-03 12:09 北京
自 ChatGPT 问世以来,国内外越来越多的强大大模型陆续发布。其中一个让大模型能力增强的方法之一,便是增加大模型的上下文窗口。
如今,长上下文窗口却成为了大模型抵御外部攻击的“短板”,甚至成为遭受攻击的罪魁祸首。
今日凌晨,OpenAI 的最强竞争对手 Anthropic 在一篇最新发布的研究论文中,揭示了一种可以用来规避大型语言模型(LLM)开发者设置的安全防护措施的方法——Many-shot jailbreaking,即“多样本越狱攻击”。
简单来说,如果你先问 LLM 几十个危害性较小的问题,就可以说服它告诉你