自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(378)
  • 收藏
  • 关注

原创 同样 PASS,路径为何不同|用 Jev 逐 Span 评估 Agent Trace

两个 Agent 跑过同一批测试,最后生成的 patch 甚至逐字节相同。只看 PASS 率,它们几乎没有区别。展开 Trace,也就是一次任务中模型请求、工具调用和验证过程的完整记录,一个可能很快找到问题,另一个可能经历多次重复扫描和无效重试。本文介绍一套逐 span 评估 Agent Trace 的方法。Databend 保存并分析海量 Trace,普通代码处理可以直接确定的事实,Jev 判断每一步是否相关、是否带来新进展。

2026-09-25 10:06:42 291

原创 Jev 爆火之后,我们把它集成进了数据湖仓

Jev 最近很火,它擅长的语义判断如果直接放进数据库,能否让分类、筛选这类任务留在 SQL 里完成?本文以 Databend 的 Python UDF 集成为例,走通接入和查询过程,也看看远程模型调用的性能、成本与数据边界。最近Jev 突然火起来了,稍微试了下做分类任务效果非常不错,成本也低廉。所以给 Databend 的 Python UDF 写了一个 Jev 集成,顺手把过程和想法整理成这篇文章。

2026-09-22 09:24:49 237

原创 Databend 原生数据血缘:追溯指标来源,检查变更影响

Databend 原生 Data Lineage 自 v1.2.935 起可用,在数据库内部采集数据流动关系,支持表级和列级追踪,并提供 Databend Cloud 血缘图和 SQL 查询两种分析方式。采集到的对象和字段依赖关系可用于变更影响分析、数据问题定位、数据资产治理和敏感数据传播追踪。

2026-09-17 15:38:40 122

原创 只看 PASS 会骗你,6 条 Agent Trace 里的 Coding Agent 评测真相

我让。

2026-09-10 18:31:11 257

原创 AI 时代的数据工程挑战:从复杂链路走向统一数据底座

AI 系统越做越多、开发速度越来越快,为什么数据链路反而越来越长,数据工程也越来越复杂?:本文根据吴炳锡在厦门“智能体落地方法论:从技术构建到企业落地”行业技术沙龙的演讲实录整理而成。演讲结合头部模型公司、工业制造、公共数据平台、金融机构和 AI 应用企业的真实实践,讨论了 Agent Trace 与 Evals 数据的采集、加工、存储和分析难题,以及如何借助云原生湖仓简化跨云、多组件、高吞吐的数据链路。

2026-09-03 17:48:06 319

原创 Databend 增量物化视图:基于 Change Tracking 的增量刷新与一致性读取

物化视图当前只能基于。

2026-09-03 17:13:53 340

原创 Cluster Key 最佳实践:列怎么选、顺序怎么排与粒度设计

Cluster Key 没有固定的“最佳列顺序”。定位累计扫描成本最高的查询族↓提取长期共享且有选择性的过滤条件↓根据典型窗口选择时间粒度↓根据前导条件和写入顺序形成候选布局↓在相同物理参数下构造受控实验↓用 clustering_information 判断数据组织↓用 EXPLAIN ANALYZE 验证真实扫描↓确认长期查询收益覆盖数据重组与维护成本这套方法背后有五条原则:高频过滤列不一定具有裁剪价值;低基数和高基数都不是单独的选择标准;

2026-08-26 11:28:37 354

原创 从传统分区到微分区,Snowflake 与 Databend 如何减少数据扫描

随着评测任务不断运行,这张表可能积累数亿甚至数十亿行数据。这种分区方式有四个典型特征:分区字段由用户选择;分区边界通常由用户预先定义;每个分区都有明确的逻辑范围;一个分区内部仍然可能包含大量文件、Row Groups 或 Blocks。引擎可以先排除 7 月和 9 月,只访问 8 月分区。这就是传统的 Partition Pruning。问题在于,Partition Pruning 通常只能把范围缩小到一个较粗的边界。进入 8 月分区后,如果缺少更细粒度的统计信息,引擎仍然可能读取大量数据。

2026-08-21 15:05:44 320

原创 从 Kafka 到 Databend Cloud:万亿级 Agent Trace 接入链路的工程实践

本文是《从万亿级大模型到全线应用:Databend Cloud 助力头部 AI 企业构建全链路 Trace 数据管道》的技术延伸,面向正在建设 Agent Trace、日志分析、Kafka 入仓或高吞吐半结构化数据管道的数据工程师,重点拆解 Agent Trace 从 Kafka 进入 Databend Cloud 的接入链路,以及开源项目 bend-ingest-kafka 在其中的设计与实现。

2026-08-13 09:23:29 351

原创 从万亿级大模型到全线应用:Databend Cloud 助力头部 AI 企业构建全链路 Trace 数据管道

从万亿级大模型到全线应用:Databend Cloud 助力头部 AI 企业构建全链路 Trace 数据管道

2026-08-07 15:51:50 246

原创 Databend 产品更新:从 Spatial Index Join 到 Eval 数据管道

回看 6–7 月,Databend 一边继续收敛生产环境中的正确性与稳定性问题,一边扩展优化器、空间分析和开放湖仓能力。优化器开始用 KLL Histogram、Count-Min Sketch 和 Top-N 更准确地理解数据;空间索引从扫描剪枝进入 Join;Paimon 通过社区贡献接入 Databend;Stage、Stream 和 Task 则逐渐组合成更完整的数据管道能力。这些改进也让 Databend 更适合 Agent Trace 场景。

2026-08-06 15:03:33 339

原创 从全表排序到概率统计:Databend 如何用 KLL、Top-N 与 CMS 改进基数估计

KLL以一次扫描和可合并 Sketch 近似分位点,降低等深直方图构建的排序与内存开销。Top-N精确记录最常见值,修正直方图对突出热点的估计。CMS用固定空间覆盖更宽的热点集合,弥补 Top-N 容量有限的问题。kll_fast适合快速、低内存地生成范围统计,但单独用于等值估计时误差较大;kll_full提高了桶级精度,却不一定缩短执行时间;CMS 则能以有限的额外开销显著改善宽热点数据的等值估计。对 Databend 这样的云原生分析数据库而言,优化器统计不是一个孤立的内核功能。更低的。

2026-07-29 10:49:57 368

原创 用 QUALIFY 写出更清晰的窗口函数 SQL

QUALIFY是否让 SQL 更清楚,很多时候不取决于能不能少写一层子查询,而取决于这条查询是不是天然就在表达:先计算窗口值,再按窗口值筛选。当查询的核心语义是每组取最新一条、保留 Top N、去重、排名过滤或状态提取时,QUALIFY往往能让 SQL 更平、更直接、更容易 review。但它也不应该变成所有复杂逻辑的容器。保持WHEREHAVINGQUALIFY各自语义清晰,才是让复杂 SQL 长期可维护的关键。

2026-07-22 09:53:49 352

原创 AST Visitor API 迁移,怎么证明 AI 没改坏 SQL 语义?

旧 visitor API 换成新 API,真正困难的从来不是批量写出代码,而是建立足够可信的迁移证据。这套方法也不是一开始就以最终形态出现的。源码扫描、运行时观测、独立比较和失败定位。在此之上,真实 SQL 语料扩大了输入范围,覆盖率反馈又让尚未验证的范围保持可见,最终形成完整闭环。AI 可以加速迁移代码的生产,但它不负责为自己的输出提供可信度。真正让这种大规模基础设施迁移变得可控的,是独立观测、集中判断、真实输入、可诊断差异以及持续可见的覆盖边界。

2026-07-15 10:10:46 361

原创 从 S3 到 Databend Cloud:Airflow 数据入仓编排实践

Apache Airflow 是一个用 Python 定义、调度和监控工作流的开源编排平台,最早由 Airbnb 开源,现为 Apache 顶级项目,也是数据工程领域广泛采用的事实标准。DAG(有向无环图):一个工作流就是一张 DAG,用来描述有哪些任务,以及任务之间的依赖关系。Task(任务):DAG 里的一个节点,是实际执行工作的最小单元。Operator(算子):任务模板。比如执行 Python 函数的,以及把本地文件上传到 S3 的。Scheduler(调度器)

2026-07-10 10:48:26 174

原创 小 Bitmap,大优化:Databend 如何加速大规模集合聚合

小集合轻量处理,大集合按需切换,降低 Bitmap 聚合开销。

2026-07-09 09:31:23 370

原创 2KB histogram 背后:Databend 如何低成本追踪长尾延迟

导读:本文介绍 Databend / OpenRaft 中一个轻量级 histogram 实现:仅用约 2KB 内存,即可支持 O(1) 延迟记录,并在 P50 / P95 / P99 等 percentile 估算中,将典型 latency 场景误差控制在 0.2% 以内。文章亮点是从数据库内核的真实约束出发,讲清楚如何在低内存、低开销和高精度之间取得平衡,适合数据库内核工程师、后端性能优化工程师、SRE、可观测性系统开发者阅读。阅读时间约 8 分钟。

2026-07-03 16:28:46 356

原创 从湖仓升级为 Agent 时代的数据控制面,Snowflake 和 Databricks 有哪些布局

湖仓的竞争正从「SQL 多快、存储多便宜」,转向「Agent 多可靠、业务任务多安全」

2026-07-03 14:35:46 530

原创 Agent 轨迹分析与归因的数据工程实践

AI Agent 落地,如何攻克稳定性、成本与评估难题?

2026-07-02 15:50:01 410

原创 在 AWS 中国峰会逛了一天,我在 Databend 展台看到了 Agent 数据基础设施的新思路

今年 AWS 中国峰会逛下来最大的感受是,大家已经不太讨论模型参数、排行榜或者谁家的模型更聪明了。无论是 Keynote 还是展区交流,讨论最多的话题其实是 Agent 如何真正进入生产环境。

2026-06-25 21:47:44 410

原创 Databend 数据写入实测:从 3千行/秒 到 230万行/秒,4种方式该怎么选

本文对比了Databend支持的四种数据写入方式性能差异及适用场景:INSERT(云上直接写入对象存储)、INSERT_NO_PRESIGN(私有化转发写入)、STREAMING_LOAD(实时流式写入)和STAGE_LOAD(批量加载)。测试显示STREAMING_LOAD在200k批次可达127k行/秒,STAGE_LOAD最高达800k行/秒。建议私有化场景优先考虑简单实现,云上则应结合成本选择INSERT或STAGE_LOAD以节省流量费用,避免使用可能产生高成本的INSERT_NO_PRESIGN

2026-01-07 14:36:29 873

原创 Databend 2025:海量数据 × AI 一体化底座,v1.3 即将发布

Databend 正式从单一数仓进化为 Analytics + Search + AI 一体化数据库,v1.3 版本即将发布

2026-01-06 15:24:52 398

原创 Databend UDF的StageLocation支持

Databend 增加非结构化数据和AI整合的处理方案

2025-12-23 09:29:31 939

原创 构建海量记忆:基于 Databend 的 2C Agent 平台 | 沉浸式翻译 @ Databend meetup 上海站回顾及思考

文章根据沉浸式翻译技专家陈琦在 Databend Meeup 上海站分享总结和思考构建。 通过本次活动也让我初步去理解 AI 长记忆体的实现及用途。 陈琦分享属于一个比较硬核的技术分享,所以在回顾这个 PPT 时,我在陈琦分享的思路的基础上长了一些案例,来帮助读者更容易理解这个实践。沉浸式翻译(Immersive Translate),作为 AI 翻译领域的头部产品,拥有近千万用户。在 Databend Meeup 上海站沉浸式翻译团队透露他们启起阶段是自我搭建一个HTAP库用于承接业务及数据分析,但面临运

2025-12-10 17:15:21 711

原创 Databend 11 月月报:多模态查询智能

Hi,Databend 的朋友们!🚀11 月,我们发布了,致力于打造更丰富的数据体验。本月上线了 TimestampTz 支持、HTTP Arrow payloads、支持 RBAC 的脱敏策略,并进行了三轮 Runtime Filter 调优,同时针对多模态负载改进了全文索引和 VECTOR 支持。现在的查询接口支持从 JSON、Arrow IPC 到几何数据等多种输出格式,助力分析团队更高效地构建多样化应用。

2025-12-04 17:33:52 1180

原创 如何打造AI时代的数据基石

Databend 通过其云原生、一体化的架构,将复杂的大数据技术栈简化为以 SQL 为核心的开发体验,从根本上降低了数据开发的门槛、成本和运维负担。它不仅是一个高性能的数据仓库,更是一个内置了流处理、任务调度和强大扩展能力的数据平台操作系统。在 AI 时代,其原生及可扩展的 AI 能力进一步使其成为企业构建智能化应用的理想数据基石,完美契合了当下企业追求降本增效和快速创新的核心诉求。构建海量记忆:基于 Databend 的 2C Agent 平台|沉浸式翻译。

2025-12-03 16:41:06 1039

原创 如何打造AI时代的数据基石 | Databend Meetup 上海站

数据洪流奔涌,AI 浪潮澎湃。当 Data 与 AI 深度交织,如何构建面向未来的技术栈?如何基于亚马逊云科技构数据分析业务?11月29日「如何打造AI时代的数据基石 | Databend Meetup 上海站」 应势而来!我们力邀多位来自明星开源项目与一线大厂的资深专家,为您全景解析数据平台架构、AI 创新实践与职业发展路径,开启一场思想与技术的碰撞。

2025-11-27 17:07:22 301

原创 DATA AI Databend Meetup 2025上海站邀您共话未来

数据洪流奔涌,AI 浪潮澎湃。当 Data 与 AI 深度交织,如何构建面向未来的技术栈?如何在这场变革中抢占先机?11月29日「DATA AI Databend Meetup」 应势而来!我们力邀多位来自明星开源项目与一线大厂的资深专家,为您全景解析数据平台架构、AI 创新实践与职业发展路径,开启一场思想与技术的碰撞。

2025-11-21 11:54:59 777

原创 Databend SQL 存储过程使用指南

存储过程(Stored Procedure)是一组预编译的 SQL 语句集合,它们被保存在数据库中,可以像函数一样被重复调用。想象一下,如果你经常需要执行一系列复杂的数据处理操作,与其每次都手动输入这些 SQL 语句,不如将它们封装成一个存储过程,需要时直接调用即可。

2025-11-14 17:39:29 868

原创 Databend SQL nom Parser 性能优化

nom 是 Rust 生态中非常受欢迎的解析框架:性能优秀、组合灵活,并且能很好地利用 Rust 的类型系统。Databend 在 SQL 表达式和语句解析上大量使用 nom,开发体验不错,可读性也高。不过,组合式 parser 容易在不经意间埋下性能隐患——尤其是当多个分支结构相似、再加上递归嵌套时,回溯成本会指数级膨胀。/// 一个简单的 parser:匹配 "foo" 或 "bar"alt(())(input)合并结构相似的 parser,避免深度优先 + 回溯导致的指数级爆炸。

2025-11-14 11:45:45 1089

原创 Databend 十月月报:存储过程正式可用,数据流程全面自动化

存储过程的正式可用标志着 Databend 迈入新的阶段:从查询引擎进化为完整的数据平台。用户可以在统一的 Rust 引擎上,用 Snowflake 兼容的 SQL 语法,处理结构化分析、半结构化搜索、向量检索、地理空间分析和数据自动化——所有功能开箱即用,完全开源。我们即将推出功能,让数据表像代码一样支持分支、测试和合并,敬请期待!

2025-11-07 17:23:13 988

原创 BendSQL v0.30.3 Web UI 功能介绍

查看或创建配置文件[server]bind_address = "0.0.0.0" # 允许外部访问bind_port = 8999 # 固定端口BendSQL v0.30.3 的 Web UI 功能极大地提升了用户体验,使得 SQL 查询和性能分析变得更加直观和高效。无论是日常的数据查询还是复杂的性能调优,这个现代化的界面都能提供出色的支持。

2025-11-05 11:37:52 1021

原创 Databend 九月月报:自增列 AUTOINCREMENT 与行级安全

Hi,Databend 的朋友们!🚀九月我们把重点放在了上。这个月上线了行级访问控制、Check 约束、AUTOINCREMENT 自增列、基于事务的表名交换(SWAP),还有智能的 SQL 错误提示。这些都是企业用户一直在等的功能。

2025-10-11 17:42:12 693

原创 Raft 中的 IO 执行顺序:内存状态与持久化状态的陷阱

在 Raft 实现中,处理 appendEntries 请求时需要持久化两类数据:term 和 log entries。Raft 论文要求"在响应 RPC 之前必须更新持久化状态",但并未明确说明这两类数据的持久化顺序。这个看似无关紧要的细节,却可能导致已提交数据的丢失。问题的根源在于:Raft 论文描述的是一个简单的抽象模型(只有磁盘状态),而实际实现为了性能会分离内存状态和持久化状态。这种状态分离引入了论文中未定义的行为,当 IO 操作允许重排序时,就可能破坏 Raft 的安全性保证。

2025-10-11 14:02:23 620

原创 MySQL 数据归档的技术困境与 Databend 解决之道

在企业数字化转型的浪潮中,MySQL 作为最受欢迎的开源数据库,承载着越来越多的业务数据。从最初的几百 GB,到现在动辄几个 TB 甚至数十 TB 的数据规模,MySQL 数据库的体量增长速度常常超出企业的预期。然而,一个不容忽视的现实是:这些庞大数据库中真正的热点数据往往只占 20-30%,剩下的大部分都是历史数据、日志记录和归档信息。这种现象在各个行业都很普遍。电商平台需要保留多年的订单记录用于用户查询和监管合规;金融机构必须长期存储交易流水以满足审计要求;政务系统要保存大量的办事记录和操作日志;

2025-09-19 17:33:52 822

原创 Databend 亮相 RustChinaConf 2025,分享基于 Rust 构建商业化数仓平台的探索

十年前,当 Graydon Hoare 在 Mozilla 的支持下发布 Rust 1.0 时,很少有人能预见到这门语言会在今天成为系统编程的新标杆。十年后的今天,当我们站在 2025 年的节点回望,Rust 不仅兑现了当初"安全、并发、实用"的承诺,更在商业化道路上走出了一条独特的轨迹。在刚刚结束的 RustChinaConf 2025 杭州大会上,Databend 技术 VP 陈小玉的主题演讲《基于 Rust 构建商业化数仓平台的探索》引起了与会者广泛关注。

2025-09-18 14:32:29 887

原创 基于 Databend 的实时数据汇聚平台建设

Databend 是一个类似于 Snowflake 架构的存算分离的云原生数据平台,在国内落地中帮着用户节省大量的数据基础架构投入,大大简化了。目前在国内已经替换过 CDP, Greenplum, 多种大数据平台。

2025-09-12 16:38:12 1067

原创 Databend 八月月报:向量检索重磅上线,性能飞跃几十倍

Hi,Databend 的朋友们!🚀。通过 HNSW 索引算法实现了,AI 应用终于可以在对象存储上高效运行了。结合我们已有的结构化数据和 JSON 处理能力,。

2025-09-11 17:39:28 708

原创 CRC32 自包含退化现象分析

传输数字 1234 时,如何检测错误?1234 ÷ 97 = 12 余 70余数70就是1234的指纹。校验原理数据=1234, 校验=70接收:重新计算 received % 97 的余数余数不是 70 → 检测到错误判断收到的消息正确性的方式是接收到:数据=1234, 校验=701. 计算 1234 % 97 = 702. 比较:计算余数(70) == 收到的校验码(70)?3. 相等 → 数据很可能正确4. 不等 → 数据肯定有错误。

2025-09-09 10:38:07 1154

原创 传统大数据 Hadoop 和 云原生湖仓 Databend 对比

随着数据需求的不断增加,大数据架构的演变成为了现代数据工程师的重要课题。本文将对比传统大数据架构与新一代云原生湖仓 Databend,通过对比它们在实时与离线架构中的区别,感受 Databend 的优势。

2025-09-02 18:12:38 1707 2

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除