- 博客(1)
- 收藏
- 关注
原创 【Reflextion论文总结】
Reflexion框架通过语言反馈来强化LLM Agent,而不是通过更新权重的方法进行学习。传统的强化学习方法需要大量的训练样本和昂贵的模型微调,这对于把大型语言模型(LLMs)与外部环境进行交互作为目标驱动的 智能体Agent 来说仍然是具有挑战性的。Reflexion 通过将任务反馈信号转化为反思,并将其保存在循环记忆缓冲区中以诱导更好的决策,在后续试验中提高决策能力。Reflexion框架灵活地集成了各种类型和来源的反馈信号,并在多种任务上取得了显著的改进,包括序列决策、编码和语言推理等。
2024-07-17 16:01:55 867
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人