本文是LLM系列文章,针对《A Causal Explainable Guardrails for Large Language Models》的翻译。
摘要
大型语言模型 (LLM) 在自然语言任务中表现出令人印象深刻的性能,但它们的输出可能会表现出不良属性或偏差。将 LLM 引导至所需属性的现有方法通常假定无偏见的表示,并且仅依赖于转向提示。然而,从预训练中学到的表示可能会引入影响转向过程的语义偏差,从而导致次优结果。我们提出了 LLMGuardrail,这是一个新颖的框架,它结合了因果分析和对抗性学习,以在 LLM 中获得无偏的转向表示。LLMGuardrail 系统地识别并阻止了偏见的混杂效应,从而能够提取无偏的转向表示。此外,它还包括一个可解释的组件,用于深入了解生成的输出与所需方向之间的对齐情况。实验表明,LLMGuardrail 在减少偏差的同时,可以有效地将 LLM 引导至所需的属性。我们的工作有助于开发符合所需属性的安全可靠的 LLM。
1 引言
2 背景
3 因果分析
4 方法
5 实验
6 结论
在本文中