- 博客(7)
- 收藏
- 关注
原创 LLM强化学习的最优训练配置!不再盲目调参——跑出性能最好的模型[Meta 2025]
作者探究了各种训练配置对于大模型最终效果的影响,包括损失函数设计,归一化设计,训练时长等等。依照作者提出的最佳实践,可以让我们训练模型时候获得最佳结果。
2026-01-17 16:10:38
630
原创 用错误数据训练LLM——训练效率提升了8倍?[2024Neurips]
使用GPT4和Gemini1.5Pro,随机采样GSM8K和MATH中的数据,每条数据生成一个新问题和答案,并确保这些问题的分布和真实世界数学问题的分布相近。在这里,Actor对Dsyn中每个问题进行M=100次采样,只选择结果正确的采样(每个问题最多保留4个正确且多样化的解答),构建数据集Dπsft。另外,作者发现,如果在RFT数据集中引入更多虚假推理,会导致性能不如同样引入虚假推理的SFT。作者证明,按照特定的正负向成对构建的数据熵执行DPO,其目标函数等价于优势加权强化学习。能够提高模型的准确性。
2026-01-16 20:30:04
845
原创 旺财也能看懂的[大模型PPO算法详解]
在强化学习中,直接优化策略会导致不稳定的训练,模型可能因为过大的参数更新而崩溃。PPO通过限制策略更新幅度,使得每一步训练都不会偏离当前策略太多。
2026-01-12 17:23:29
634
原创 CNN完全指南
是一个非常有用的工具,它会打印出模型的每一层、其输出形状以及参数数量,帮助你检查网络结构是否符合预期。步骤四:编译模型模型构建完成后,需要通过方法来配置其学习过程。optimizer: 优化器,负责根据损失函数的梯度来更新网络的权重。'adam'是一种自适应学习率的优化算法,它在大多数情况下都表现良好,是初学者的稳健选择。loss: 损失函数,用于衡量模型预测值与真实标签之间的差距。对于多分类问题,并且标签已经过独热编码,应使用。metrics: 评估指标,用于在训练和测试期间监控模型的性能。
2025-10-19 22:31:42
460
原创 【完整源码】2048及其AI模式实现(底层逻辑及算法优化、GUI界面编程、Minimax算法实现AI)
2048底层逻辑、GUI、AI模式的实现。设计Python高级语法、GUI编程、Minimax算法和数据结构的相关知识。附源代码,恳请批评指正。
2022-05-14 21:20:20
7170
1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅