Paper
文章平均质量分 95
aJupyter
自然语言处理方向在读硕士生,CSDN人工智能领域优质创作者,语雀知识库构建者,欢迎大家交流~
https://github.com/aJupyter
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
《COLM 2025》Search-R1:Train your LLMs to reason and call a search engine with reinforcement learning
Search-R1:基于强化学习的自主搜索推理框架 Search-R1提出了一种创新框架,通过强化学习训练大模型自主决定搜索时机、查询构造和多轮推理。该研究解决了传统RAG被动接受搜索结果和Prompting泛化能力差的问题,将搜索引擎整合为RL环境的一部分。核心创新包括: 检索Token掩码技术,避免优化无关内容 结果导向的奖励机制,仅评估最终答案准确性 马尔可夫决策过程建模搜索交互 实验表明,经过训练的模型能主动增加有效搜索次数(从1.4次提升至2.0次),输出长度随训练动态调整,最终实现准确率显著提升原创 2026-03-13 21:05:07 · 641 阅读 · 0 评论 -
1.Chinese Tiny LLM_ Pretraining a Chinese-Centric Large Language Model
CT-LLM 是一个 2B 的 LLM,在 1200B 的 token 上预训练,包括 800B 的中文 token、300B 的英文 Token、100B 的代码 token,以提高模型理解和处理中文的能力。CT-LLM 不仅在中文基准 CHC-Bench 上表现出色,还可以通过 SFT 熟练处理英语任务。与以往的 LLM 不同(主要在英语语料上训练,然后改编为其他语言),该 LLM 以中文为主。2B的中文LLM:CT-LLM大规模的预训练中文语料(800B):MAP-CC。原创 2024-04-13 10:31:55 · 2330 阅读 · 0 评论
分享