从0打造本地聊天机器人：如何实现大模型流式输出？OpenAI+Ollama 实战

AI大模型知识分享

于 2024-10-10 14:55:59 发布

阅读量356

点赞数 7

文章标签：机器人语音识别人工智能 agi ai 大模型 Ollama

本文链接：https://blog.csdn.net/AIDAMOXING/article/details/142821823

版权

尽管有了 GPU 加持，推理速度依然很慢，怎么搞？

流式输出！

相比全部生成后再输出，流式输出生成一句就播报一句，大大减少了用户的等待时间。

主流大模型推理 API 包括：

OpenAI 格式：沿袭 ChatGPT 的云端 API，多用于线上模型；
Ollama 格式：用于本地部署的大模型推理。

本次分享，将带大家实战：OpenAI 和 Ollma 下的大模型流式输出。

1. OpenAI 流式输出

当前大部分大模型的推理 API 都兼容了 OpenAI 格式。

如果没有，强烈推荐用 OneAPI 进行管理：一键封装成OpenAI协议，强推的一款神器！

和非流式输出相比，只需新增一个参数：stream=True。

不过，为了方便后续进行语音合成，我们需要对大模型的流式输出进行一番处理！

首先，定义一个标点符号列表：punct_list = [‘。’, ‘！’, ‘？’]，遇到这里的标点，则立即输出。

具体实现如下，供参考：

class LLM_API:
    def __init__(self, api_key, base_url, model):
        self.client =  OpenAI(
            api_key=api_key,
            base_url=base_url,
        )
        self.model = model
  def stream(self, messages):
      completion = self.client.chat.completions.create(
          model=self.model, messages=messages, stream=True
      )
      text2tts = ''
      for chunk in completion:
          text = chunk.choices[0].delta.content
          text2tts += text
          for punct in punct_list:
              if punct in text:
                  front, back = text2tts.replace('\n', '').rsplit(punct, 1)
                  yield front + punct
                  text2tts = back
                  break
      if text2tts:
          yield text2tts

上述代码用 yield 关键字定义一个生成器函数。

2. Ollama 流式输出

有关 Ollama 的使用，可参考：本地部署大模型？看这篇就够了，Ollama 部署和实战

Ollama 的 API 和 OpenAI 略有区别，但核心逻辑是一样的，直接上代码：

def stream(self, messages):
    data = {
        "model": self.model, "messages": messages, "stream": True
    }
    response = requests.post(self.base_url, json=data, stream=True)
    text2tts = ''
    for line in response.iter_lines():
        data = json.loads(line.decode('utf-8'))
        text = data['message']['content']
        text2tts += text
        for punct in punct_list:
            if punct in text:
                front, back = text2tts.replace('\n', '').rsplit(punct, 1)
                yield front + punct
                text2tts = back
                break
    if text2tts:
        yield text2tts

调用时，可以用 for 循环来迭代生成器对象，每次迭代，生成器会执行到下一个 yield 语句，并返回当前值：

ollama_api = OLLAMA_API(ollama_url, 'qwen2.5:7b')
messages = [{ "role": "user", "content": "天空为什么是蓝色的"}]
for text in ollama_api.stream(messages):
    print(text)

输出效果如下：

天空之所以呈现蓝色，主要是因为大气中的气体分子和其他细小颗粒对太阳光的散射作用。
这种现象被称为瑞利散射（Rayleigh scattering），由英国物理学家威廉·汉斯·瑞利爵士在19世纪末发现。
当阳光进入地球的大气层时，其中的各种颜色（不同波长）的光线都会受到气体分子、水蒸气和尘埃等微粒的影响。
然而，这些微粒对较短波长的光（如蓝色和紫色）散射得更为强烈。
由于人眼对蓝光比紫光敏感得多，所以我们看到的是天空呈蓝色。
实际上，太阳本身发出的白光包含了所有颜色的光。
当阳光进入大气层时，其中的蓝色光线因散射作用被分散到各个方向，在我们看来，天空就呈现出蓝色。
而太阳和天空在白天看起来呈现不同的颜色（例如：日出和日落时天边的橙红色或紫色），则是由于此时光线需要穿过更多的大气层，蓝光几乎都被散射掉了，只有红、橙等较长波长的光线能够直接到达我们的眼睛。
总之，正是这种自然现象造成了天空呈现出蓝色。

实测：在 Jetson Orin Nano 上使用本地部署的 qwen2.5:7b，流式输出 + 语音合成播报，体验基本无延迟！

那么，如何系统的去学习大模型LLM？

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

作为一名热心肠的互联网老兵，我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。

但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

所有资料 ⚡️ ，朋友们如果有需要全套《LLM大模型入门+进阶学习资源包》，扫码获取~
在这里插入图片描述

篇幅有限，部分资料如下：

👉LLM大模型学习指南+路线汇总👈

💥大模型入门要点，扫盲必看！
在这里插入图片描述
💥既然要系统的学习大模型，那么学习路线是必不可少的，这份路线能帮助你快速梳理知识，形成自己的体系。

👉大模型入门实战训练👈

💥光学理论是没用的，要学会跟着一起做，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。
在这里插入图片描述

👉国内企业大模型落地应用案例👈

💥《中国大模型落地应用案例集》 收录了52个优秀的大模型落地应用案例，这些案例覆盖了金融、医疗、教育、交通、制造等众多领域，无论是对于大模型技术的研究者，还是对于希望了解大模型技术在实际业务中如何应用的业内人士，都具有很高的参考价值。 （文末领取）
在这里插入图片描述
💥《2024大模型行业应用十大典范案例集》 汇集了文化、医药、IT、钢铁、航空、企业服务等行业在大模型应用领域的典范案例。