一个全面、先进、公平且模块化的开源RAG框架

AI大模型学习不迷路

于 2024-09-09 10:03:11 发布

阅读量233

点赞数 1

文章标签：大模型人工智能大语言模型自然语言处理 RAG AI大模型语言模型

本文链接：https://blog.csdn.net/Z4400840/article/details/142051051

版权

两个关键问题限制了 RAG 的发展：

新型 RAG 算法之间缺乏全面和公平的比较。
像 LlamaIndex 和 LangChain 这样的开源工具使用了高级抽象，这导致了透明度的缺失，并限制了开****发新算法和评估指标的能力。

RAGLAB：是一个模块化的开源库。RAGLAB 复现了 6 种先进的算法，并为研究 RAG 算法提供了一个全面的生态系统。利用 RAGLAB，对 10 个基准上的 6 种 RAG 算法进行了公平比较。有了 RAGLAB，研究人员可以高效地比较各种算法的性能并开发新算法。

不同 RAG 库和框架的比较。公平比较指的是在评估过程中对所有基本组件进行对齐，包括随机种子、生成器、检索器和指令。数据收集器指的是能够收集或生成训练和测试数据的能力，无论是通过从现有的原始数据集中抽样，还是通过使用LLM构建标记数据。

RAGLAB提供了一个模块化的架构，允许用户轻松地替换和扩展算法的各个组成部分，包括检索器（retriever）、生成器（generator）和指令（instruction）。

RAGLAB 框架的架构和组件

检索器（Retriever）：集成了基于BERT的模型，如Contriever和ColBERT，提供了统一的查询接口和客户端-服务器架构，以及检索缓存机制。
语料库（Corpus）：提供预处理的Wikipedia语料库，包括2018年和2023年的版本，以及对应的索引和嵌入。
生成器（Generator）：集成了Huggingface Transformers和VLLM，支持量化和低秩适应（LoRA）技术，允许使用大型模型。
指令实验室（Instruction Lab）：包含系统指令、任务指令和算法指令，允许用户自定义和组合指令。
训练器（Trainer）：集成了Accelerate和DeepSpeed库，支持模型的微调，包括LoRA和量化LoRA技术。
数据集和度量（Dataset and Metric）：收集了10个广泛使用的基准数据集，覆盖五种不同的任务类型，并提供了灵活的数据适配机制和多种评估指标

RAGLAB进行了全面的实验，使用不同的基础模型作为生成器，同时保持其他基本组件的一致性，以促进不同高级RAG算法之间的公平比较。

一个使用 RAGLAB 来复现 Self-RAG 算法的脚本

分析了使用不同基础模型的RAG算法（Naive RAG、RRR 、ITER-RETGEN、Self-Ask、Active RAG、Self-RAG）在多个基准上的性能，发现Self-RAG算法在使用特定生成器时显著优于其他算法。

不同算法的指令

Naive RAG
# read process insruction
"### Instruction:\n {task_instrucion} \n## Input:\n\n{query}\n\n Now, based on the following passages
and your knowledge, please answer the question more succinctly and professionally. ### Background
Knowledge:\n {passages} \n\n### Response:\n" 

RRR
# rewrite process instruction
"Provide a better search query for Wikipedia to answer the given question, end the query with '**'. \n\n
Question: Ezzard Charles was a world champion in which sport? \n\n Query: Ezzard Charles
champion** \n\n Question: What is the correct name of laughing gas? \n\n Query: laughing gas
name** \n\n Question: {query} \n\n Query: " # read process insruction
"### Instruction:\n {task_instrucion} \n## Input:\n\n{query}\n\n Now, based on the following passages
and your knowledge, please answer the question more succinctly and professionally. ### Background
Knowledge:\n {passages} \n\n### Response:\n"

ITER-RETGEN
# read process insruction
"### Instruction:\n {task_instrucion} \n## Input:\n\n{query}\n\n Now, based on the following passages
and your knowledge, please answer the question more succinctly and professionally. ### Background
Knowledge:\n {passages} \n\n### Response:\n" 

Self ASK
# follow up question instruction
"Question: When does monsoon season end in the state the area code 575 is located? Are follow up
questions needed here: Yes. Follow up: Which state is the area code 575 located in? Intermediate
answer: The area code 575 is located in New Mexico. Follow up: When does monsoon season end in
New Mexico? Intermediate answer: Monsoon season in New Mexico typically ends in mid-September. So the final answer is: mid-September. \n{query} Are follow up questions needed here:" # read process insruction
"### Instruction:\n {task_instrucion} \n## Input:\n\n{query}\n\n Now, based on the following passages
and your knowledge, please answer the question more succinctly and professionally. ### Background
Knowledge:\n {passages} \n\n### Response:\n" 

Active RAG
# read process insruction
"### Instruction:\n {task_instrucion} \n## Input:\n\n{query}\n\n Now, based on the following passages
and your knowledge, please answer the question more succinctly and professionally. ### Background
Knowledge:\n {passages} \n\n### Response:\n" 

Self-RAG
# read process instruction
"### Instruction:\n{task_instruction}\n\n## Input:\n\n{query}\n\n### Response:\n"

RAGLAB 系统用户评估问卷

读者福利：如果大家对大模型感兴趣，这套大模型学习资料一定对你有用

对于0基础小白入门：

如果你是零基础小白，想快速入门大模型是可以考虑的。

一方面是学习时间相对较短，学习内容更全面更集中。
二方面是可以根据这些资料规划好学习计划和方向。

包括：大模型学习线路汇总、学习阶段，大模型实战案例，大模型学习视频，人工智能、机器学习、大模型书籍PDF。带你从零基础系统性的学好大模型！

😝有需要的小伙伴，可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓
在这里插入图片描述

👉AI大模型学习路线汇总👈

大模型学习路线图，整体分为7个大的阶段：（全套教程文末领取哈）

第一阶段： 从大模型系统设计入手，讲解大模型的主要方法；

第二阶段： 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用；

第三阶段： 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统；

第四阶段： 大模型知识库应用开发以LangChain框架为例，构建物流行业咨询智能问答系统；

第五阶段： 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型；

第六阶段： 以SD多模态大模型为主，搭建了文生图小程序案例；

第七阶段： 以大模型平台应用与开发为主，通过星火大模型，文心大模型等成熟大模型构建大模型行业应用。

👉大模型实战案例👈

光学理论是没用的，要学会跟着一起做，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

在这里插入图片描述

👉大模型视频和PDF合集👈

观看零基础学习书籍和视频，看书籍和视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。
在这里插入图片描述

👉学会后的收获：👈

• 基于大模型全栈工程实现（前端、后端、产品经理、设计、数据分析等），通过这门课可获得不同能力；

• 能够利用大模型解决相关实际项目需求： 大数据时代，越来越多的企业和机构需要处理海量数据，利用大模型技术可以更好地处理这些数据，提高数据分析和决策的准确性。因此，掌握大模型应用开发技能，可以让程序员更好地应对实际项目需求；

• 基于大模型和企业数据AI应用开发，实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能， 学会Fine-tuning垂直训练大模型（数据准备、数据蒸馏、大模型部署）一站式掌握；

• 能够完成时下热门大模型垂直领域模型训练能力，提高程序员的编码能力： 大模型应用开发需要掌握机器学习算法、深度学习框架等技术，这些技术的掌握可以提高程序员的编码能力和分析能力，让程序员更加熟练地编写高质量的代码。

👉获取方式：

😝有需要的小伙伴，可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓
在这里插入图片描述

AI大模型学习不迷路

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
一个全面、先进、公平且模块化的开源RAG框架

两个关键问题限制了 RAG 的发展：新型 RAG 算法之间缺乏的比较。像 LlamaIndex 和 LangChain 这样的开源工具使用了高级抽象，这导致了透明度的缺失，并限制了的能力。RAGLAB：是一个的开源库。RAGLAB 复现了 6 种算法，并为研究 RAG 算法提供了一个生态系统。利用 RAGLAB，对 10 个基准上的 6 种 RAG 算法进行了比较。有了 RAGLAB，研究人员可以高效地比较各种算法的性能并。。
复制链接

扫一扫