ZILLIZ

The Most Widely-Adopted Vector Database.

  • 博客(935)
  • 收藏
  • 关注

原创 微博、EXA、亚马逊云科技是怎么用好向量检索的,看这一篇就够了|活动回顾

他开篇明确指出,当下AI Agent要实现真正的实用化,可靠的记忆系统是不可或缺的核心前提,传统仅依赖大模型上下文窗口的模式存在天然局限——即便窗口持续扩容,也如同内存再大仍需磁盘存储,而向量数据库正是AI Agent的“外置大脑”,承载着长期记忆的存储、检索与更新核心需求。随着非结构化数据的爆发与AI技术的快速迭代,向量数据库作为核心支撑技术,正与AI Agent、AI搜索、对话助手等各类场景深度融合,推动技术创新与产业落地,成为企业数字化转型的核心基础设施。记忆管理低效,无法实现动态筛选与精准召回。

2026-04-15 18:10:42 752

原创 MCP彻底被抛弃了吗?

用大模型的话,MCP server 是一个独立进程,它访问不了外层 agent 的 LLM,我得在 server 里另外配一个 LLM client,另外填 API key,另外管调用逻辑。agent 的 LLM 全程参与,哪些留、哪些扔、要不要继续往深了挖,都是它自己决定的。紧接着,这句话传到社交媒体上就炸了。三月中旬,Perplexity 在自家的 Ask 2026 大会上,CTO Denis Yarats 毫无预兆的,对MCP做了开火:我们内部正在放弃 MCP,转回 REST API 和 CLI。

2026-04-07 18:31:02 797

原创 Harness Engineering是什么?为什么Harness来了,也得用混合检索?

每次新模型发布,Harness Engineer 要做的第一件事,就是重新审视整套 Harness 系统,找出那些不再是承重墙的组件,把它们拆掉——因为这些组件的存在,反而会增加系统的冗余,降低 Agent 的运行效率。这种方式能保住任务的连续性,但无法消除 Agent 的焦虑感,毕竟压缩的是历史信息,没有压缩快撑不住了的心理预期。在 AI 工程里,它指的是包裹在 Agent 外层的整套执行框架——定义它能调用哪些工具,从哪里获取信息,如何验证自己的决策,什么情况下应该停下来。

2026-04-02 19:20:50 593

原创 2026 年,Embedding要怎么选?(实测Gemini 、jina、Qwen、BGE、OpenAI十大模型)

—清楚自己的业务场景和数据长什么样,用自己的数据搭一套能快速验证新模型的测试流程,新东西出来的时候跑一轮就知道行不行。另一边,335M 以下的模型在 4K 字符(大概 1000 tokens)就掉到了 0.46-0.60——如果你的 RAG 系统文档平均超过 2000 字,用这些模型需要留意。如果不需要维度压缩,这个项目的参考价值有限。,覆盖 API 服务和开源本地部署两种形态,也加上了 OpenAI text-embedding-3-large、CLIP ViT-L-14 这些经典模型作为对照。

2026-03-23 18:38:14 959

原创 黄仁勋GTC演讲上,Milvus为什么能站稳非结构化数据处理C位

举个简单的例子,在一个拥有 800 个租户的平台上,通常来说,过去 24 小时内被访问的租户仅占 15%,而剩余 85% 的租户数据几乎不会被访问,如果所有数据在存储资源的分配上一视同仁,带来的,就是无穷无尽的资源浪费。"AI的价值,不在于技术本身,而在于技术的落地、在于技术对社会的改变。只有开放的生态,才能让AI的创新活力充分释放,才能让AI真正走进每一个行业、每一个角落,才能让数万亿美元的AI基建时代,真正成为惠及全人类的时代。在此基础上,相似性搜索,取代了精确匹配,成为检索非结构化数据的新范式。

2026-03-17 20:43:25 710

原创 Gemini Embedding 2把多模态信息整合同一向量空间了,还需要多向量列吗?

举个最常见的例子:搭建一个短视频库的语义检索系统,一条短视频里的画面帧、人声、字幕,三者围绕同一个内容主体,过去需要用图片、音频、文本三个独立的 Embedding 模型,分别生成三套向量,存成三个独立的向量列,检索时还要做多路召回、结果融合与去重,开发和维护成本不小。但如果,用户除了需要 “外观长得像的裙子”,也可能要找 “参数规格匹配的同类型商品”,这时候,就需要通过多向量列,把这些不同维度的向量分开存储、分别构建索引(关键词与语义),才能支撑这种灵活、精准、分维度的混合检索需求。

2026-03-12 18:23:13 931

原创 Embedding相似度虚高,如何用langchain+Milvus搭建CRAG解决?

我们之前做了个运维助手,用户查 “如何在 Nginx 上配置 HTTPS 证书”,检索出来的 Top3 高分文档,分别讲的是 Apache 的配置方法、早就停更的旧版本教程、甚至是 HTTPS 的原理解析。如果是快速验证、小流量场景,用 gpt-4o-mini 这类托管模型,不用自己运维,落地快,就是延迟和成本会高一些。一旦检索到过时的 API 用法,生成了错误代码,这段错误内容又被存进了记忆库,接下来就是彻底的恶性循环:新旧版本内容共存,向量检索次次都能命中旧内容,越用越错,连回滚都找不到抓手。

2026-03-11 18:36:10 538

原创 养虾实战教程:我用OpenClaw做了个能盯盘,也能深度复盘的投资agent

用 Exa 搜隔夜全球市场动态,从 Milvus 里捞出我的持仓情况和相关历史经验,喂给大模型生成一份定制化的简报,推送到手机上,告诉我隔夜发生了什么、跟我的持仓有没有关系。此外,我还把自己喜欢的投资大师的风格,写成了skill,模拟类似的情况,他们会怎么决策,作为我自己的决策参考之一。,我之前试过硬刷财经 App,但里面会有大量的不相关信息,淹没了我真正关心的内容;此外,需要注意一点,我们比较关注RSI、MACD这些指标,千万别交给AI去算,直接无脑调用,或者自己写函数,大模型在这方面经常会出现bug。

2026-03-10 18:11:46 1034

原创 Qwen3.5-397B+Milvus+ColQwen2,如何做基于PDF的多模态RAG知识库

对于查询的每个 token 向量,找到文档中最匹配的 patch(最大内积),然后将所有 token 的最大匹配分数求和,作为该文档的总分。这套架构唯一的小代价,是ColQwen2约4.4GB的模型体积,以及图片编码比文本编码稍高的推理耗时,但对比它带来的检索精度与兼容性提升,在绝大多数实际场景中,都是完全可以接受的。是的,相比相比上一代Qwen3-Max的万亿参数,尺寸变小了,但性能基本持平甚至超越。,用查询的每个token向量匹配最相关的patch,再聚合文档分数,能精准锁定与问题最相关的页面,

2026-03-05 18:18:41 810

原创 开源|Milvus2.6又有功能上新啦!Embedding Function、N-gram、decay ranker、field-level boosting、Highlighting解读

值越高(如 0.7)越平缓。Milvus 2.6 新增的 N-gram 索引,是基于倒排索引实现的高效检索技术,通过将字符串拆分为更小的重叠字符序列例如把 "coffee" 拆成 3-grams:cof、off、ffe、fee),实现子串、模糊、通配符风格的灵活匹配,彻底解决了子串检索性能差、模糊匹配能力弱的问题,大幅提升模糊查询、输入补全、模糊搜索、域名检索等场景的效率,无需全表扫描即可实现高速匹配。在时效、地理位置这类检索场景中,向量检索只能匹配语义相似度,无法对时间、距离等数值字段做加权排序。

2026-03-04 19:11:54 659

原创 80%的 Multi-Agent都是伪需求!如何判断是否需要Multi-Agent,以及如何搭?

token 消耗通常是单智能体的 3 到 10 倍,而且每个智能体都是潜在的故障点,智能体间传递上下文的过程中信息会持续损耗,协调开销有时甚至比实际工作还多。合理的做法是分别创建 CRM 智能体、营销智能体和消息智能体,每个配备 8 到 10 个专属工具和定制化的系统提示词,再加一个协调智能体负责把请求路由到合适的专业智能体。这个场景的触发条件是工具总数超过 20 个且频繁选错,工具跨越多个无关领域,以及不同任务需要截然不同的行为模式,比如客服场景需要同理心,代码审查场景需要严谨性。

2026-03-03 18:13:06 550

原创 实测|春节我用三种姿势在手机上用Claude Code,上班路上也能当牛马了

SSH 连接太脆弱,网稍微抖一下会话就直接断了,而 tmux 会在服务端一直保住会话状态,断线重连后执行tmux attach,Claude Code 还在原地等你,进度完全不丢。此外,Remote Control 的本质是手机控制本机 Claude Code,这也需要你的电脑一直开着、Claude Code 必须跑着,要是没有常年开机的主机,它就无能为力了。去年起,我们公司全员配了Claude Code,生产力提升不是一点半点,但唯一的美中不足是Claude Code 是个命令行工具,跑在电脑上。

2026-03-02 18:08:21 1266

原创 教程:Nano Banana2+ Milvus+ qwen3.5,打造电商生图爆款流水线

Nano Banana 2:完成度直接拉满,加了窗框做前景有纵深感,东方明珠细节清、黄浦江有船只,光影层次分明,雨滴和水渍的质感几乎和实拍没差,4:1 超宽比例也没透视畸变,电商图绕不开文字,价签、营销标语、跨境多语言文案,这些都是是过去 AI 生图的通病,Nano Banana 2 的优势在于,能生成无错漏的易读文本,还支持多语言翻译和本地化。整体效果可以看到,初代 Nano Banana比较中规中矩,色调灰蓝平淡, 雨滴质感不错,大小分布自然,但建筑细节虚化丢太多,东方明珠辨识度低,分辨率也不够;

2026-02-28 15:28:38 1268

原创 一个春节烧掉3个$200 Claude Max plan,我终于明白了怎么用AI写infra代码

我一步步走,只盯着眼前的小问题:Windows过了就提交,Linux挂了再修,修完Mac崩了再调,从来没有站在更高的维度,看一眼整个跨平台编译的全局。回到跨平台编译的例子,第一次尝试时,Claude完美搞定了Windows编译,它精确地解决了我给的局部问题,但它不知道,这个局部解会影响全局。,不是具体的代码实现?:我反复跟Claude强调“不要hacky的修改”“给我干净的解决方案”,它每次都乖乖答应,生成的patch看起来也确实更整洁,结果这个“干净”的patch,转头就把另外三个平台的编译搞崩。

2026-02-26 17:59:25 457

原创 如何在记忆与检索环节,解决OpenClaw 的token消耗爆炸问题?

内置Sparse-BM25(将BM25转为稀疏向量预存,检索时无需重新计算),同一个Collection可同时存储稀疏向量(BM25)和稠密向量(语义Embedding),通过Reranker融合结果,兼顾精确匹配和语义匹配。这里有一个关键技术点需要重点说明——BM25(Best Matching 25),它是降低检索类Token消耗的核心:通过词频和逆文档频率计算内容相关性,关键词匹配比纯向量检索更精准,尤其适合技术文档和代码检索,能有效过滤无关信息,从根源减少Token浪费。

2026-02-25 18:05:01 1035

原创 不会做RAG、agent的本地数据管理?都来学Claude Code!附深度拆解

摘要: Claude Code针对企业级本地AI编程场景的存储痛点,提出了一套系统化解决方案。通过多项目物理隔离(路径编码+独立存储)、实时持久化(JSONL流式写入)、完整消息链追溯(uuid+parentUuid)和操作可撤销(文件历史快照)四大机制,解决了传统方案在数据隔离、崩溃恢复、上下文追溯和操作回滚等方面的问题。采用三级配置体系(全局/本地/项目)实现灵活管理,配合插件扩展架构,在保障数据隐私合规的同时,兼顾了安全性与可定制性。该存储架构为企业级AI编程助手提供了可靠的数据管理基础。

2026-02-24 15:22:18 1435

原创 开源:我们复刻了OpenClaw的mem系统,为所有Agent打造透明、可控的记忆

旧的 embedding 就过期了,需要重新计算。:计算每个chunk的SHA-256哈希,重复内容只索引一次——比如两处都提到“PostgreSQL 16”,只调用一次embedding API,能省20%以上的成本(具体测算:500KB文本,去重后每月可省$0.15,大规模使用可省数百美元)。而我们,也正是被这套记忆系统打动,然后做了一件事:把它的核心设计抽离出来,做成了memsearch,让任何开发者都能给自家Agent加上持久、透明、可控的记忆,不用被OpenClaw的单一形态所限制。

2026-02-11 19:39:40 1400

原创 chunk大小没有最优解!多尺寸逐级chunk如何提升RAG40%准确率

当然,业内早就有研究者意识到了固定尺寸chunk的问题,也提出过不少优化方案,比如:Anthropic 的上下文检索,会给chunk补充文档级的上下文信息,弥补小尺寸chunk的上下文缺失;与此同时,相比单一索引查询,它的推理耗时会明显变长,对低延迟要求的实时场景不友好。:将语义chunk和多尺寸chunk结合,先做语义chunk保证文本的语义完整性,再对每个语义块做小尺度的细切分,兼顾语义完整和多尺度的查询匹配性,解决了滑动窗口硬切分的语义割裂问题,是目前工程落地的优选方案之一;

2026-02-10 17:59:04 717

原创 拆解:OpenClaw就是agent记忆的最佳范式!其逻辑与RAG有何区别?

需要注意的是,这种裁剪只作用于传递给模型的上下文,磁盘里的完整执行结果不会被修改,后续想找的话,还是能通过记忆检索找到。其中,AGENTS.md存着智能体的指令和记忆使用规则,SOUL.md定义了它的性格和说话语气,USER.md专门记你的相关信息,TOOLS.md则是外部工具的使用指南。,结合语义检索和关键词检索,兼顾了检索的精准度和灵活性(这里原始版本用的是sqlite分别执行关键词与语义检索,然后对两路检索结果进行手动合并,这里我们建议可以直接采用Milvus混合检索,可以用一次检索搞定两个环节)。

2026-02-09 18:12:45 1824

原创 Skills 比MCP好在哪儿?如何用Milvus-Skills 搭建知识库

本文介绍了Anthropic推出的Skills工具调用标准,相比传统MCP方法具有更精简的上下文、更高标准化和更强可控性。文章详细讲解了Skills的目录结构(SKILL.md核心文件、scripts执行脚本、templates文档模板和resources参考资料),并以创建Milvus Skills为例,演示了如何通过自然语言描述自动构建RAG系统或Milvus Collection。实战部分包含环境配置、目录创建、核心代码编写和测试验证等完整流程,展示了Skills在简化技术操作、封装最佳实践方面的价值

2026-02-09 14:41:31 2017

原创 自动驾驶+百亿向量,全球GPU龙头如何用Milvus加速模型训练

用4-5亿向量数据完成POC后,我们迅速将Milvus落地生产,而它带来的价值,甚至超出了我们的预期——不仅稳定支撑了百亿向量的写入与查询,实现了降本增效,版本升级与监控变得便捷,数据分发、segment管理、查询路由也都能自动完成,团队研发效率大大提升。最直观的就是数据管理的瓶颈:路测数据转化为embedding数据后,会对应一个FAISS索引文件,日积月累竟达到了数十万之多,这些文件孤立又重叠,跨天跨区域查询时,工程师得手动调取上百个文件,不仅成本高,效率也完全失控。

2026-02-05 18:46:26 629

原创 高效索引之HNSW_SQ:如何同时兼顾RAG的速度、召回率与成本

和传统的按维度独立计算极值的非均匀标量量化(逐维量化)方式不同,SQ4U采用的是全局均匀量化策略:它会为整个向量或向量段计算一个统一的最小值 vmin 和数值范围 vdiff,然后把这个范围平均分成16个区间,所有维度的浮点数值都用这一套参数映射成0-15的4比特整数。节点之间会根据向量相似度建立连接,搜索的时候,算法可以从上层稀疏的图快速定位到下层密集的图中的区域,大大缩小需要遍历的范围,这也是它能实现。搜索参数里的 ef 很关键,它决定了搜索时的遍历广度,数值越大精度越高,但速度越慢,。

2026-02-04 18:09:01 575

原创 企业级RAG教程 | langchain+AWS Bedrock+Zilliz,适合80%企业

本文介绍了基于AWS云平台构建企业级RAG(检索增强生成)系统的实践方案。针对传统大模型在企业应用中的知识时效性差、幻觉率高等问题,提出采用MVC架构设计,整合AWS Bedrock、Nova模型、Titan Embeddings和Zilliz Cloud等组件。文章详细阐述了系统架构设计思路、技术选型依据(包括AWS Lambda、Bedrock多模型支持、Zilliz向量数据库优势等),并提供了环境配置和核心功能实现的代码示例。该方案强调组件解耦、弹性伸缩和快速部署,旨在帮助企业利用现有云资源高效落地R

2026-02-04 09:30:00 648

原创 唯品会、虎牙、YY,是怎么用好向量检索的,看这一篇就够了|活动回顾

目前的分布式自研架构为存算分离设计,基于Raft一致性协议实现数据一致性,分为平台层、接入层、协调层、计算层、存储层五大模块,通过Raft架构实现数据分片与分布式管理,支持弹性伸缩、秒级容灾与故障恢复,可适配直播业务的流量波动。作为专注非结构化数据处理的开源向量数据库,Milvus在开源界向量数据库领域排名第一,核心聚焦向量数据的存储、检索与管理,目前已服务全球超万家企业,合作方涵盖英伟达、eBay、微软、沃尔玛等国际巨头,以及国内各大银行、互联网运营商、车企,成为企业级场景的优选方案。

2026-02-03 18:44:47 499

原创 <span class=“js_title_inner“>Spark做ETL,与Ray/Daft做特征工程的区别在哪里,如何选型?</span>

首先,针对Spark模型重复加载、内存浪费的问题,Ray/Daft采用Actor Pool机制,让模型只加载一次,多个Task复用同一个Actor,彻底避免重复加载带来的资源消耗,大幅节省内存。——把原始数据(图像、文本、音视频)转换成模型能理解的数值信号(Embedding向量、结构化特征),或者提取结构化数据(日志、表格)的结构化特征(数值、类别),供模型训练使用。数据不跨分区、无网络I/O,每行数据独立处理(比如给每张图片生成Embedding,各算各的,互不干扰)。

2026-02-02 18:44:47 674

原创 Spark做ETL,与Ray/Daft做特征工程的区别在哪里,如何选型?

首先,针对Spark模型重复加载、内存浪费的问题,Ray/Daft采用Actor Pool机制,让模型只加载一次,多个Task复用同一个Actor,彻底避免重复加载带来的资源消耗,大幅节省内存。——把原始数据(图像、文本、音视频)转换成模型能理解的数值信号(Embedding向量、结构化特征),或者提取结构化数据(日志、表格)的结构化特征(数值、类别),供模型训练使用。数据不跨分区、无网络I/O,每行数据独立处理(比如给每张图片生成Embedding,各算各的,互不干扰)。

2026-02-02 18:44:47 552

原创 POC避坑指南|VectorDBBench自定义数据集测试实战教程

本文介绍了企业在大模型落地过程中面临的向量数据库选型难题,指出传统测试数据集(如SIFT)与真实业务场景存在维度差异,导致性能评估失真。为解决这一问题,文章推荐使用真实业务数据进行测试,并详细介绍了Zilliz团队开源的VectorDBBench工具。该工具支持多种数据库性能评测,允许用户接入自定义数据集。文章提供了从数据准备到测试的完整指南,包括如何将CSV/NPY格式数据转换为符合要求的Parquet文件,以及如何运行测试脚本。通过使用真实数据测试,企业可以更准确地评估向量数据库的QPS、延迟、召回率等

2026-02-02 11:08:08 1094

原创 教程:如何用飞书+Moltbot,打造你的MilvusAI小助手

一台可通外网的服务器(linux)(另外,阿里云在内的云平台已经出了Moltbot专属云端方案,能简化部署,因此本文重点讲自建部署)接下来,本文教你如何在自己的 Mac 或 Linux 上,部署 Moltbot,对接飞书,搭建属于自己的MilvusAI小助手。也就是说,有了它,我们就约等于给自己配备了一个能思考、能回答问题,还能直接动手操作的24小时赛博助理。最好跑在不要的设备,或者虚拟机环境,毕竟给大模型增加工具调用能力后,就不存在绝对安全的部署方案。不过,教程最后,给一个衷心劝告,

2026-01-29 18:21:57 618

原创 RAG优化不抓瞎!Milvus检索可视化,帮你快速定位嵌入、切块、索引哪有问题

而 Project_Golem 的核心,就是把这个看不见的高维向量空间,通过 UMAP 算法将 768/1536 维的高维向量降维至 3 维,再利用 Three.js 完成 3D 空间渲染,让所有文档向量以节点形式呈现在 3D 界面中,语义相似的节点会自然聚集形成簇;在线阶段,当用户发起查询时,先在高维空间计算余弦相似度完成检索,再根据返回的文档索引,在 3D 界面中 点亮对应的节点,检索结果的空间位置自然就能一目了然。同时绘制从查询点到命中节点的半透明连线,摄像机平滑聚焦到激活簇所在区域。

2026-01-28 18:09:38 721

原创 Milvus+印度最大电商平台,如何打造服务两亿月活用户的商品比价系统

举个中文环境的例子,同一台洗衣机,商家A的标题是“全自动10kg变频滚筒”,商家B的标题是“10公斤变频滚筒洗衣机 静音节能”,对应的图片分辨率更是从300x300到2000x2000不等,甚至有商家用好几个角度的实物图的情况下,有的商家只用示意图。也是因此,在服务第三方商家、给自营产品定价时,比价系统的建设,举足轻重。也是因此,比价服务不仅要在平台内找相似款,还要监控全市场动向,提供竞对情报、平台动态定价建议,并通过跨目录匹配,精准识别自家平台上的空白细分品类,助力商家优化商品结构。

2026-01-27 18:06:06 485

原创 Claude通过Cowork实现模型主动记忆,要如何复现?我们还需要RAG吗?

指的是短期、非持久化记忆,仅在会话启动时注入一次,会话结束后销毁,主要用于让模型适配当前场景(如移动端简化回复格式),不影响长期记忆。,是长期、可编辑的核心记忆,用于记录用户稳定属性(,如姓名、职业目标、过往经历、项目成果、学习偏好),每次对话都会强制注入。具体来说,模型会选择性的记住我们每次与它交互的过程,以及产生的结论,这些数据可以被实时写入、快速检索、并且以短期记忆、用户属性、长期记忆等形式被分门别类的保存,然后被主动复用在下一次的会话中。整个过程的核心是检索,而检索是只读的,不会往数据库里写东西。

2026-01-26 18:06:13 939

原创 深度解读:从Two Sum到 Kafka 再到Milvus与iceberg,数据库寻址中,计算永远优于查找

高延迟的访问动作,哪怕多一次,都是致命的性能损耗。查询时,只需读取对应 Segment 下拆分后的指定 Parquet 文件,结合字段拆分存储+Parquet 的列裁剪特性,只读取业务需要的字段,无需读取全量数据,也无需加载无关字段的文件。写入时花少量成本收集文件的min/max、分区等统计信息,读取时就能用这些信息做前置判断,精准跳过不可能命中的文件,这是计算的极致体现。,它把所有文件的元数据(目录树、文件→块的映射、块→数据节点的映射)全部加载在内存中,而且这些元数据的核心存储结构,就是我们上文讲的。

2026-01-20 18:13:32 470

原创 熠智AI+Milvus:从Embedding 到数据处理、问题重写,电商AI客服架构怎么搭?

比起单纯使用RAGflow的技术框架,我们在Milvus基础上设计了更加灵活集中功能组件的方案,让商品在多种业务场景下检索的召回率大大提升,在商品检索的召回率提升至95%。如前面困境所说,用户的 Query 实际是多种多样的,有简单的 Query,也有指代不明的 Query。Milvus对检索精度极高的掌控力以及原生支持的混合检索的能力,以及极高的性能扩展性和社群活力,挖掘出了我们产品更大的潜力。,借助Milvus及Agent的能力实现自定义表格的检索功能,既保证了查询的精确性,也保证了语义检索的准确性。

2026-01-19 18:08:32 627

原创 官宣 | Milvus 2.6云上GA:三层存储降本85% 、速度快ES 4-7 倍,多数据类型支持

在多个向量代表一个实体的场景中(如电商场景,一个商品可能包含多个角度的图片和描述),Struct 允许将不同类型的数据(如标量、向量、字符串等)组织成一个结构化的对象。从场景角度出发,该方案非常适配冷热数据二八分(热数据占比不到20%,但贡献80%以上访问的)的长尾场景,比如电商产品搜索、企业文档库、新闻媒体库等冷热数据分明的场景。这就导致一个尴尬的结果:即便大部分资源处于闲置状态,:社交平台的历史内容向量库中,90% 的查询集中在最近 7 天产生的内容上,而归档内容(占总量的 95%)几乎不会被访问。

2026-01-15 18:06:26 1195

原创 官宣,Milvus开源语义高亮模型:告别饱和检索,帮RAG、agent剪枝80%上下文

Open Provence好的一点是,它的数据来自公开的问答数据集,然后使用了一个小的LLM,对句子相关度进行标注,并生成 silver label(银标签)。多语言方面,中英文都是重点优化语言。目前,市面上也已经出现了一些能够初步解决这些问题的模型,但它们要么只支持英文,要么上下文窗口太小(512 token),要么协议不友好(不允许商业使用)。目前,Semantic Highlight模型已经开源,MIT协议,可以放心用在商业项目中,也欢迎大家基于这个模型的二次开发和改进,让开源的力量薪火相传。

2026-01-14 18:00:33 883

原创 索引选不对,成本贵十倍!ScaNN就是电商推荐的最优解

而ScaNN对这个过程进行了修改,首先它提出了loss的概念。loss和上面的量化误差略有不同,这个loss指的是两个向量的实际距离和使用量化方法计算的近似距离之间的误差,ScaNN主要针对的是IP距离,IP距离的误差和查询向量的分布可以用公式描述。首先这里假设x是q1的近邻的话,那么x和q1的方向是接近的,所以x的平行分量可以近似认为和q1也是平行的,那么这个平行分量会让误差增大。下图是一个二维空间下的例子,说明平行分量带来的误差是更大的,会导致最后近邻结果的错误,所以应该施以更严厉的惩罚项。

2026-01-13 18:23:50 788

原创 索引选不对,成本贵十倍!ScaNN可否是电商推荐的最优解

而ScaNN对这个过程进行了修改,首先它提出了loss的概念。loss和上面的量化误差略有不同,这个loss指的是两个向量的实际距离和使用量化方法计算的近似距离之间的误差,ScaNN主要针对的是IP距离,IP距离的误差和查询向量的分布可以用公式描述。首先这里假设x是q1的近邻的话,那么x和q1的方向是接近的,所以x的平行分量可以近似认为和q1也是平行的,那么这个平行分量会让误差增大。下图是一个二维空间下的例子,说明平行分量带来的误差是更大的,会导致最后近邻结果的错误,所以应该施以更严厉的惩罚项。

2026-01-13 18:23:50 385

原创 都有混合检索与智能路由了,谁还在给RAG赛博哭坟?

需要强调的是,若仅评估最终答案质量,会导致问题定位失效。无论是依赖大模型全量加载上下文,还是沿用传统RAG模式,最终都难以实现输出质量的稳定提升,核心症结在于两者均存在无法规避的底层检索质量问题,且这些问题在企业规模化落地场景中会被进一步放大。二是检索失效,面对复杂问题时,原始查询表达往往不够精确,容易导致检索效果下滑,同时同义词、多语言表达的匹配失败,也会直接造成召回率不足。,全量加载token不仅浪费算力,大模型本身的注意力也是有限的,过长的上下文,只会导致上下文输出时模糊重点,反而导致质量下滑。

2026-01-08 18:04:55 389

原创 GUI都流行四十年了!数据库操作怎么还和DOS一样难搞?

Milvus 节点的任务管理页面,包含五种任务类型:QueryCoord 任务、压缩(Compaction)任务、索引构建任务、Import 任务和 Sync 任务。除了版本号外,系统还详细记录了代码的Git提交版本号、Go语言运行环境信息,以及系统的构建时间和部署创建时间,这些时间戳帮助管理员追溯系统的部署历史。Attu可以解决大部分的日常管理场景,它能让你从写脚本操作解放出来,把时间花在更有价值的事情上——比如优化RAG的召回策略,设计agent架构。甚至只是切换不同环境的数据库,都要手动改配置。

2026-01-07 18:33:09 460

原创 转 | 当 Vector Database 还不是主流时,这家公司(Zilliz)看见了未来

甚至今年,他脑子里也不断冒出新的想法,如果不做向量数据库,他可能会去做一个 agent 的 sandbox,让它们在更安全、更高效的环境中运行。从历史角度看,向量数据库的发展路径也印证了这一判断。与其说这是一次追逐风口的决定,不如说是一次基于数据库工程直觉的判断:如果AI会落地千行百业,而向量搜索会成为 AI 系统的核心能力,那么它迟早需要一套真正的基础设施来承载,而不仅仅是零散的算法调用。最后,他建议开发者保持持续评估的习惯,嵌入模型、重排序模型和搜索算法的演进速度极快,半年不更新,往往就意味着落后。

2026-01-05 18:10:31 1211

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除