自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(7)
  • 收藏
  • 关注

原创 LLM强化学习的最优训练配置!不再盲目调参——跑出性能最好的模型[Meta 2025]

作者探究了各种训练配置对于大模型最终效果的影响,包括损失函数设计,归一化设计,训练时长等等。依照作者提出的最佳实践,可以让我们训练模型时候获得最佳结果。

2026-01-17 16:10:38 630

原创 用错误数据训练LLM——训练效率提升了8倍?[2024Neurips]

使用GPT4和Gemini1.5Pro,随机采样GSM8K和MATH中的数据,每条数据生成一个新问题和答案,并确保这些问题的分布和真实世界数学问题的分布相近。在这里,Actor对Dsyn中每个问题进行M=100次采样,只选择结果正确的采样(每个问题最多保留4个正确且多样化的解答),构建数据集Dπsft。另外,作者发现,如果在RFT数据集中引入更多虚假推理,会导致性能不如同样引入虚假推理的SFT。作者证明,按照特定的正负向成对构建的数据熵执行DPO,其目标函数等价于优势加权强化学习。能够提高模型的准确性。

2026-01-16 20:30:04 845

原创 旺财也能看懂的[大模型PPO算法详解]

在强化学习中,直接优化策略会导致不稳定的训练,模型可能因为过大的参数更新而崩溃。PPO通过限制策略更新幅度,使得每一步训练都不会偏离当前策略太多。

2026-01-12 17:23:29 634

原创 CNN完全指南

是一个非常有用的工具,它会打印出模型的每一层、其输出形状以及参数数量,帮助你检查网络结构是否符合预期。步骤四:编译模型模型构建完成后,需要通过方法来配置其学习过程。optimizer: 优化器,负责根据损失函数的梯度来更新网络的权重。'adam'是一种自适应学习率的优化算法,它在大多数情况下都表现良好,是初学者的稳健选择。loss: 损失函数,用于衡量模型预测值与真实标签之间的差距。对于多分类问题,并且标签已经过独热编码,应使用。metrics: 评估指标,用于在训练和测试期间监控模型的性能。

2025-10-19 22:31:42 460

原创 远程连接服务器+Pycharm远程开发

如果是文件夹,请使用-r所有的交互都基于端口-P xxxxx。

2025-10-19 17:27:37 236

原创 西工大数据结构实验NOJ参考代码和分析合集

西工大数据结构实验noj全部代码。自己码完AC的。

2022-05-22 23:30:12 13791 3

原创 【完整源码】2048及其AI模式实现(底层逻辑及算法优化、GUI界面编程、Minimax算法实现AI)

2048底层逻辑、GUI、AI模式的实现。设计Python高级语法、GUI编程、Minimax算法和数据结构的相关知识。附源代码,恳请批评指正。

2022-05-14 21:20:20 7170 1

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除