<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[我有满天星辰的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/beiluoL</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; beiluoL]]></copyright><item><title><![CDATA[一次性读取整个 Obsidian：自动把我的 Markdown 变成 AI 知识库]]></title><link>https://blog.csdn.net/beiluoL/article/details/165364976</link><guid>https://blog.csdn.net/beiluoL/article/details/165364976</guid><author>beiluoL</author><pubDate>Mon, 14 Sep 2026 23:34:16 +0800</pubDate><description><![CDATA[ObsidianMarkdownChunkEmbeddingMilvusRAG自动索引Python的感觉。但是冷静下来一看，我马上发现了一个问题。这根本不能叫知识库。篇 Markdown。]]></description><category></category></item><item><title><![CDATA[第一次完整 RAG：让本地大模型真正“读懂”我的知识库]]></title><link>https://blog.csdn.net/beiluoL/article/details/165126084</link><guid>https://blog.csdn.net/beiluoL/article/details/165126084</guid><author>beiluoL</author><pubDate>Sat, 12 Sep 2026 21:59:30 +0800</pubDate><description><![CDATA[Qwen3.5 9Bjson={],print()print("AI 最终回答")]]></description><category></category></item><item><title><![CDATA[第一次使用 Milvus：给我的 AI 知识库装上“记忆”]]></title><link>https://blog.csdn.net/beiluoL/article/details/164881206</link><guid>https://blog.csdn.net/beiluoL/article/details/164881206</guid><author>beiluoL</author><pubDate>Thu, 10 Sep 2026 20:40:45 +0800</pubDate><description><![CDATA[Milvus向量数据库CollectionPython但是新的问题来了。然后把向量放进去。甚至每篇文章又被切成几十个 Chunk。几十万个向量这时候，简单的 Python List 显然不够用了。的数据库。]]></description><category></category></item><item><title><![CDATA[我终于搞懂 Embedding：为什么一句话可以变成 1024 个数字？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164880578</link><guid>https://blog.csdn.net/beiluoL/article/details/164880578</guid><author>beiluoL</author><pubDate>Thu, 10 Sep 2026 20:26:01 +0800</pubDate><description><![CDATA[Obsidian↓Markdown↓Embedding↓向量这些向量放在哪里？1000篇 Markdown10000个 Chunk50000个向量我总不能把它们全部存在一个 Python List 里面。]]></description><category></category></item><item><title><![CDATA[【从 0 打造我的本地 AI 知识库】在 M1 Mac 上搭建 Ollama：我的本地 AI 模型到底应该怎么选？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164758265</link><guid>https://blog.csdn.net/beiluoL/article/details/164758265</guid><author>beiluoL</author><pubDate>Wed, 09 Sep 2026 23:45:39 +0800</pubDate><description><![CDATA[Ollama本地大模型Qwen3.5EmbeddingM1 Mac16GB。]]></description><category></category></item><item><title><![CDATA[《从 0 打造我的本地 AI 知识库：Obsidian + Ollama + Milvus + RAG + MCP + Agent》第 01 篇]]></title><link>https://blog.csdn.net/beiluoL/article/details/164757448</link><guid>https://blog.csdn.net/beiluoL/article/details/164757448</guid><author>beiluoL</author><pubDate>Wed, 09 Sep 2026 23:05:13 +0800</pubDate><description><![CDATA[听过，但是没有真正跑过。EmbeddingMilvusRAGChunkMCPAgent看文章的时候感觉都懂。“看懂”和“做出来”完全是两回事。这种问题。向量数据库到底是怎么工作的。所以我决定把这个项目完整记录下来。不追求一开始就做得多复杂。能跑↓理解↓优化↓扩展↓最终做成真正能用的系统如果最终成功，我希望得到的不只是一个 AI 工具。「本地 AI + 个人知识库 + RAG + MCP + Agent」系统。]]></description><category></category></item><item><title><![CDATA[RAG 到底是什么？我用一个 PDF 做出了自己的 AI 知识库]]></title><link>https://blog.csdn.net/beiluoL/article/details/164508131</link><guid>https://blog.csdn.net/beiluoL/article/details/164508131</guid><author>beiluoL</author><pubDate>Mon, 07 Sep 2026 23:16:16 +0800</pubDate><description><![CDATA[把一大段文本切成一个个小块。300000字Chunk 1Chunk 2Chunk 3Chunk 4...Chunk 500Chunk 101：G1 是一种面向服务端应用的垃圾收集器。它将堆划分成多个大小相等的 Region...Chunk 102：Mixed GC 会同时回收年轻代和部分老年代 Region...G1 Mixed GC什么时候发生？Chunk 102而不是整本 PDF。]]></description><category></category></item><item><title><![CDATA[我用 Python 做了一个文本相似度搜索：终于搞懂 Embedding 到底有什么用]]></title><link>https://blog.csdn.net/beiluoL/article/details/164341920</link><guid>https://blog.csdn.net/beiluoL/article/details/164341920</guid><author>beiluoL</author><pubDate>Fri, 04 Sep 2026 00:51:41 +0800</pubDate><description><![CDATA[先自己写一个只有几十行代码的东西。]]></description><category></category></item><item><title><![CDATA[我用 Python 做了一个 Token 计算器：一段文字到底消耗多少 Token？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164303805</link><guid>https://blog.csdn.net/beiluoL/article/details/164303805</guid><author>beiluoL</author><pubDate>Wed, 02 Sep 2026 20:04:32 +0800</pubDate><description><![CDATA[一段文字↓Tokenizer↓Token ID↓Token 数量请求内容↓API↓↓模型生成↓↓它还会继续影响后面的 Embedding、Transformer、Context、RAG 和 Agent。学习 AI 时，很多概念只看解释很容易忘记。真正写一次代码，看到文本被编码成 Token ID，再调用 API 查看真实的usage数据，理解会更扎实。]]></description><category></category></item><item><title><![CDATA[AI 为什么能预测你下一句话？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164269345</link><guid>https://blog.csdn.net/beiluoL/article/details/164269345</guid><author>beiluoL</author><pubDate>Tue, 01 Sep 2026 22:29:17 +0800</pubDate><description><![CDATA[大语言模型并不是直接“想出”一整句话，而是在当前上下文的基础上，通过 Transformer 计算下一个 Token 的概率分布，然后选择一个 Token，再把它加入上下文，继续预测下一个 Token。这个过程不断重复，最终形成完整回答。Token↓Context↓↓↓Next Token↓Context 更新↓Next Token↓……这就是大语言模型最核心的生成机制之一。]]></description><category></category></item><item><title><![CDATA[Attention 到底是什么？从“我喜欢苹果”理解大模型如何建模上下文]]></title><link>https://blog.csdn.net/beiluoL/article/details/164230137</link><guid>https://blog.csdn.net/beiluoL/article/details/164230137</guid><author>beiluoL</author><pubDate>Mon, 31 Aug 2026 22:04:55 +0800</pubDate><description><![CDATA[上一篇我们介绍了 Embedding。文本经过 Tokenizer 处理后，会被切分成 Token；但仅有向量还不够。模型还需要理解 Token 之间的关系。模型需要判断“它”更可能指代“苹果”，而不是“我”或“喜欢”。这里的“苹果”指的是公司，而不是水果。这说明，同一个 Token 的含义不能脱离上下文单独确定。模型需要根据当前句子中的其他 Token，动态调整每个 Token 的表示。]]></description><category></category></item><item><title><![CDATA[Embedding：从 Token 到向量表示]]></title><link>https://blog.csdn.net/beiluoL/article/details/164192924</link><guid>https://blog.csdn.net/beiluoL/article/details/164192924</guid><author>beiluoL</author><pubDate>Sun, 30 Aug 2026 21:00:53 +0800</pubDate><description><![CDATA[将离散的信息转换为连续向量，使计算机能够通过数学运算表示和比较它们之间的关系。文本↓Token↓Token ID↓Embedding↓向量空间↓相似度计算↓搜索 / 推荐 / RAG / 分类Token 解决的是“文本如何切分和编号”，Embedding 解决的是“这些 Token 如何以可计算的形式表示”。不过，单个 Token 的向量还不足以表达完整句子的含义。多个 Token 的向量进入 Transformer 后，模型还需要进一步建模它们之间的关系。]]></description><category></category></item><item><title><![CDATA[Token 到底是什么？为什么 AI 应用离不开 Token？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164172686</link><guid>https://blog.csdn.net/beiluoL/article/details/164172686</guid><author>beiluoL</author><pubDate>Sat, 29 Aug 2026 19:39:29 +0800</pubDate><description><![CDATA[文本↓Tokenizer↓Token ID↓Embedding↓位置编码↓↓Logits↓采样或选择下一个 Token↓解码↓文本Token 不是固定意义上的字，也不是固定意义上的词。Token 是具体模型 Tokenizer 产生的文本片段或控制符号。Tokenizer 通常将文本编码为 Token ID，Token ID 再映射为向量参与模型计算。LLM 的生成过程，本质上是根据上下文逐步预测下一个 Token。]]></description><category></category></item><item><title><![CDATA[LLM 到底是什么？从 GPT 到 Agent：一文看懂大语言模型的过去、现在与未来]]></title><link>https://blog.csdn.net/beiluoL/article/details/164153702</link><guid>https://blog.csdn.net/beiluoL/article/details/164153702</guid><author>beiluoL</author><pubDate>Fri, 28 Aug 2026 22:28:56 +0800</pubDate><description><![CDATA[从“生成文字”↓到“理解信息”↓到“进行推理”↓到“使用工具”↓到“执行任务”↓到“自主完成工作”GPT 又出了什么版本？LLM 能做什么？↓如何给它提供上下文？↓如何让它获取外部知识？↓如何让它调用工具？↓如何让它自主执行？↓如何让它可靠地完成真实任务？LLM 是 AI 时代的大脑。Context= 它看到的世界RAG= 它获取知识的方式Tool= 它与外部世界交互的手MCP= 连接外部能力的接口Skill= 它完成工作的专业方法Agent。]]></description><category></category></item><item><title><![CDATA[从 Token 到 Harness Engineering：一文搞懂 AI 应用开发的核心概念]]></title><link>https://blog.csdn.net/beiluoL/article/details/164124124</link><guid>https://blog.csdn.net/beiluoL/article/details/164124124</guid><author>beiluoL</author><pubDate>Thu, 27 Aug 2026 19:24:38 +0800</pubDate><description><![CDATA[这几年，AI 应用开发中出现了越来越多的新词：这不是严格意义上的技术架构，而是一条比较适合入门的。需要特别说明的是：这些词并不完全处于同一个层级。下面按照“它是什么、可以干什么、使用场景、如何实现”的方式，把这些概念讲清楚。]]></description><category></category></item><item><title><![CDATA[如何使用 DeepSeek 驱动 Codex：无需 OpenAI 账号，从原理到实战完整配置]]></title><link>https://blog.csdn.net/beiluoL/article/details/164090122</link><guid>https://blog.csdn.net/beiluoL/article/details/164090122</guid><author>beiluoL</author><pubDate>Wed, 26 Aug 2026 15:57:31 +0800</pubDate><description><![CDATA[DeepSeek 接入 Codex 的本质，不是“把 Codex 改成 DeepSeek”，而是让 Codex 通过自定义 Model Provider，把 Responses API 请求发送到 DeepSeek，同时通过告诉 Codex 如何理解和使用这个第三方模型。Codex│▼│▼│▼ ▼│ │▼ ▼│ │▼│▼│▼“怎么找到并连接模型？“Codex 应该怎样认识这个模型？这两个部分组合起来，才构成了完整的第三方模型接入。]]></description><category></category></item><item><title><![CDATA[RAG 到底是怎么工作的？一文彻底搞懂 RAG 原理与完整流程]]></title><link>https://blog.csdn.net/beiluoL/article/details/164061407</link><guid>https://blog.csdn.net/beiluoL/article/details/164061407</guid><author>beiluoL</author><pubDate>Tue, 25 Aug 2026 17:11:40 +0800</pubDate><description><![CDATA[实际系统不会把所有知识都返回。100万条 Chunk不可能全部交给大模型。Top-KTop-K = 5也就是：找出最相关的 5 个知识片段。用户问题↓↓Top 5↓Chunk 12Chunk 893Chunk 1024Chunk 2048Chunk 9999RAG││ │↓ ↓【知识库构建】 【用户问答】│ │↓ ↓PDF/Word 用户问题↓ ↓文档解析 Query处理↓ ↓↓ ↓↓ ↓↓ ↓↓ ↓│ ││ ↓│ │↓LLM↓。]]></description><category></category></item><item><title><![CDATA[Spring AI Prompt 实战：System Prompt、User Prompt 与 PromptTemplate]]></title><link>https://blog.csdn.net/beiluoL/article/details/164035123</link><guid>https://blog.csdn.net/beiluoL/article/details/164035123</guid><author>beiluoL</author><pubDate>Mon, 24 Aug 2026 23:26:02 +0800</pubDate><description><![CDATA[我们发送给大模型的指令和上下文。请介绍一下 Spring AI。这就是一个最简单的 Prompt。你是一名 Java 高级工程师。请介绍一下 Spring AI。要求：1. 使用中文回答2. 面向 Java 初学者3. 先介绍概念4. 再介绍核心原理5. 最后给出一个简单代码示例这同样是 Prompt。Prompt ≈ 给 AI 的任务说明 + 上下文 + 约束请介绍 Java。显然不够灵活。实际项目中，我们往往需要动态参数。请介绍一下 {technology}。请介绍一下 Java。]]></description><category></category></item><item><title><![CDATA[Spring AI 实战：Spring Boot + DeepSeek 实现第一个 AI 聊天接口]]></title><link>https://blog.csdn.net/beiluoL/article/details/164035055</link><guid>https://blog.csdn.net/beiluoL/article/details/164035055</guid><author>beiluoL</author><pubDate>Mon, 24 Aug 2026 23:18:10 +0800</pubDate><description><![CDATA["message" : "什么是 Spring AI？" }这样更符合 REST API 的开发习惯。↓Spring AI↓ChatClient↓DeepSeek↓ChatClientChatModelPromptcall()content()可以把用户问题发送给 DeepSeek，并获得 AI 返回结果。]]></description><category></category></item><item><title><![CDATA[Spring AI 是什么？Java 程序员为什么要学习 Spring AI？]]></title><link>https://blog.csdn.net/beiluoL/article/details/164035028</link><guid>https://blog.csdn.net/beiluoL/article/details/164035028</guid><author>beiluoL</author><pubDate>Mon, 24 Aug 2026 23:14:30 +0800</pubDate><description><![CDATA[到这里，我们已经回答了本文最开始的几个问题。]]></description><category></category></item></channel></rss>