北笙乌衣-CSDN博客

原创【Reflextion论文总结】

Reflexion框架通过语言反馈来强化LLM Agent，而不是通过更新权重的方法进行学习。传统的强化学习方法需要大量的训练样本和昂贵的模型微调，这对于把大型语言模型（LLMs）与外部环境进行交互作为目标驱动的智能体Agent 来说仍然是具有挑战性的。Reflexion 通过将任务反馈信号转化为反思，并将其保存在循环记忆缓冲区中以诱导更好的决策，在后续试验中提高决策能力。Reflexion框架灵活地集成了各种类型和来源的反馈信号，并在多种任务上取得了显著的改进，包括序列决策、编码和语言推理等。

2024-07-17 16:01:55 867

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

原创 【Reflextion论文总结】

空空如也

空空如也

原创【Reflextion论文总结】