<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[youziguo的专栏]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/youziguo</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; youziguo]]></copyright><item><title><![CDATA[Lakehouse之Medallion Architecture]]></title><link>https://blog.csdn.net/youziguo/article/details/164745460</link><guid>https://blog.csdn.net/youziguo/article/details/164745460</guid><author>youziguo</author><pubDate>Thu, 10 Sep 2026 06:15:00 +0800</pubDate><description><![CDATA[**Medallion Architecture（奖章架构）**是现代 Lakehouse 数据平台里非常核心的一种分层设计模式。你最近一直在研究 Lakehouse、Iceberg、AI-Ready Data、Semantic Layer、数据治理、AI 数据平台，所以这个架构其实是把这些东西串起来的一个非常重要的基础。

Databricks 对它的定义是：通过 Bronze → Silver → Gold 多层逐步提升数据质量、结构化程度和业务可用性；它本质上是一个数据设计模式，而不是某个具体产品。]]></description><category></category></item><item><title><![CDATA[主流云厂商大数据组件介绍]]></title><link>https://blog.csdn.net/youziguo/article/details/163673266</link><guid>https://blog.csdn.net/youziguo/article/details/163673266</guid><author>youziguo</author><pubDate>Tue, 11 Aug 2026 18:01:54 +0800</pubDate><description><![CDATA[阿里云和腾讯云的大数据组件都覆盖了「数据采集→存储→计算→开发治理→BI应用」全链路，但产品命名和侧重点略有差异，下面按模块拆解对比]]></description><category></category></item><item><title><![CDATA[分布式 SQL 查询引擎之Trino]]></title><link>https://blog.csdn.net/youziguo/article/details/163198927</link><guid>https://blog.csdn.net/youziguo/article/details/163198927</guid><author>youziguo</author><pubDate>Sun, 26 Jul 2026 06:15:00 +0800</pubDate><description><![CDATA[Trino 是目前最流行的 分布式 SQL 查询引擎（Distributed SQL Query Engine） 之一，定位是：

通过 SQL 联邦查询（Federated Query）访问各种数据源，实现跨数据湖、数据库、消息系统的高速交互式分析。

它最初来自 Facebook 的 Presto 项目，后来社区分裂，原 PrestoSQL 改名为 Trino。]]></description><category></category></item><item><title><![CDATA[OLAP数据库之DuckDB]]></title><link>https://blog.csdn.net/youziguo/article/details/163190203</link><guid>https://blog.csdn.net/youziguo/article/details/163190203</guid><author>youziguo</author><pubDate>Sat, 25 Jul 2026 12:03:34 +0800</pubDate><description><![CDATA[​DuckDB 是近几年数据分析领域非常火的一款 嵌入式 OLAP 数据库（Embedded Analytical Database）。它经常被称为 “分析领域的 SQLite”：像 SQLite 一样轻量、无需部署服务器，但定位不是事务处理，而是高性能分析查询。
​]]></description><category></category></item><item><title><![CDATA[AI数据平台之Snowflake]]></title><link>https://blog.csdn.net/youziguo/article/details/163051631</link><guid>https://blog.csdn.net/youziguo/article/details/163051631</guid><author>youziguo</author><pubDate>Mon, 20 Jul 2026 17:28:43 +0800</pubDate><description><![CDATA[Snowflake 是目前全球最成功的云原生数据平台（Cloud Native Data Platform），它最初定位于云数据仓库（Cloud Data Warehouse），目前已经发展成为一个完整的 AI Data Cloud，支持：

数据仓库（Data Warehouse）
数据湖（Data Lake）
数据湖仓（Lakehouse）
数据工程（Data Engineering）
数据共享（Data Sharing）
数据应用（Data Apps）
AI/ML
LLM、RAG、Agent开发]]></description><category></category></item><item><title><![CDATA[消息队列之MQTT]]></title><link>https://blog.csdn.net/youziguo/article/details/162908085</link><guid>https://blog.csdn.net/youziguo/article/details/162908085</guid><author>youziguo</author><pubDate>Wed, 15 Jul 2026 15:58:29 +0800</pubDate><description><![CDATA[MQTT（Message Queuing Telemetry Transport）是一种轻量级、基于发布/订阅（Publish/Subscribe）模式的消息传输协议，最初由IBM于1999年开发，目前已经成为物联网（IoT）、车联网、工业互联网、智能家居、边缘计算、AI设备最广泛使用的通信协议之一。

随着AI Agent、机器人、智能穿戴、自动驾驶的发展，MQTT的重要性越来越高。例如：
ChatGPT智能硬件
人形机器人
无人机
自动驾驶汽车
工业PLC
智能电表
摄像头
AI眼镜
智能穿戴设备
]]></description><category></category></item><item><title><![CDATA[AI计算框架之Ray]]></title><link>https://blog.csdn.net/youziguo/article/details/161311009</link><guid>https://blog.csdn.net/youziguo/article/details/161311009</guid><author>youziguo</author><pubDate>Fri, 22 May 2026 11:56:06 +0800</pubDate><description><![CDATA[​
Ray 是一个面向 AI 和 Python 的分布式计算框架，最初由 UC Berkeley RISELab 开发，后来由 Anyscale 推动商业化。
Ray 本质上是：
AI 时代的分布式执行引擎
Python 原生分布式框架
AI 平台基础设施层
“AI 版 Spark + Kubernetes + Serving”的融合趋势

​]]></description><category></category></item><item><title><![CDATA[湖仓一体之Delta Lake]]></title><link>https://blog.csdn.net/youziguo/article/details/161191300</link><guid>https://blog.csdn.net/youziguo/article/details/161191300</guid><author>youziguo</author><pubDate>Mon, 18 May 2026 12:54:23 +0800</pubDate><description><![CDATA[Delta Lake 是一个开源的 Lakehouse 存储层。
它由 Databricks 开源，核心目标是：
在 Data Lake 上实现 Data Warehouse 级别的数据可靠性与性能。]]></description><category></category></item><item><title><![CDATA[湖仓一体之Apache Hudi]]></title><link>https://blog.csdn.net/youziguo/article/details/161160610</link><guid>https://blog.csdn.net/youziguo/article/details/161160610</guid><author>youziguo</author><pubDate>Sun, 17 May 2026 11:02:56 +0800</pubDate><description><![CDATA[Hudi（Hadoop Upserts Deletes and Incrementals）是一个面向数据湖（Data Lake）的开放表格式（Open Table Format）与数据管理框架，主要解决：
数据湖实时写入
Upsert（更新插入）
Delete（删除）
增量查询
流批一体
小文件治理
数据版本管理
CDC（Change Data Capture）
本质上：
Hudi = “支持数据库能力的数据湖表格式”]]></description><category></category></item><item><title><![CDATA[湖仓一体之Apache Iceberg]]></title><link>https://blog.csdn.net/youziguo/article/details/161100613</link><guid>https://blog.csdn.net/youziguo/article/details/161100613</guid><author>youziguo</author><pubDate>Fri, 15 May 2026 09:19:27 +0800</pubDate><description><![CDATA[Apache Iceberg 是一个面向大规模分析数据集的 开放表格式（Open Table Format），最初由 Netflix 开发，后来捐赠给 Apache Software Foundation。

它的核心目标是：

解决传统 Hive 表在数据湖中的缺陷

提供类似数据仓库（DW）的能力

支持 PB 级数据管理

支持批流一体

支持 ACID 事务

支持多引擎统一访问]]></description><category></category></item><item><title><![CDATA[深度学习框架之PyTorch]]></title><link>https://blog.csdn.net/youziguo/article/details/161022443</link><guid>https://blog.csdn.net/youziguo/article/details/161022443</guid><author>youziguo</author><pubDate>Wed, 13 May 2026 05:30:00 +0800</pubDate><description><![CDATA[​
PyTorch 是一个开源深度学习框架，由 Meta AI 主导开发，最初来源于 Torch（Lua 版深度学习框架）。

它目前已经成为：

AI / 大模型领域最主流框架之一

学术界事实标准

大模型训练核心框架

多模态、LLM、Agent、Diffusion 的基础生态]]></description><category></category></item><item><title><![CDATA[AI大模型之RAG]]></title><link>https://blog.csdn.net/youziguo/article/details/160599347</link><guid>https://blog.csdn.net/youziguo/article/details/160599347</guid><author>youziguo</author><pubDate>Wed, 29 Apr 2026 06:00:00 +0800</pubDate><description><![CDATA[RAG（Retrieval-Augmented Generation，检索增强生成）是当前大模型落地中最核心的一种架构模式，本质上是把“信息检索系统”和“生成式大模型”结合起来，让模型不再只依赖参数记忆，而是动态查资料再回答。]]></description><category></category></item><item><title><![CDATA[向量数据库之Milvus]]></title><link>https://blog.csdn.net/youziguo/article/details/160253020</link><guid>https://blog.csdn.net/youziguo/article/details/160253020</guid><author>youziguo</author><pubDate>Fri, 17 Apr 2026 15:14:42 +0800</pubDate><description><![CDATA[Milvus 介绍，从架构、核心机制、性能原理、生态集成、以及在 AI 场景（尤其 RAG / 多模态）中的使用讲清楚。]]></description><category></category></item><item><title><![CDATA[AI中台需要什么]]></title><link>https://blog.csdn.net/youziguo/article/details/159250851</link><guid>https://blog.csdn.net/youziguo/article/details/159250851</guid><author>youziguo</author><pubDate>Thu, 19 Mar 2026 18:58:16 +0800</pubDate><description><![CDATA[企业级 AI 数据平台完整架构（Production 级）。
这个架构通常出现在：

互联网公司

自动驾驶公司

AI 公司

大模型公司

核心目标：

打通 数据 → 特征 → 训练 → 模型 → 推理 → 反馈 的完整闭环

整个体系一般叫：

AI Data & ML Platform]]></description><category></category></item><item><title><![CDATA[AI Agent 项目--OpenClaw]]></title><link>https://blog.csdn.net/youziguo/article/details/158888085</link><guid>https://blog.csdn.net/youziguo/article/details/158888085</guid><author>youziguo</author><pubDate>Tue, 10 Mar 2026 16:44:00 +0800</pubDate><description><![CDATA[OpenClaw 是一个近几年非常火的 开源 AI Agent（自主智能体）框架，目标是打造 真正能执行任务的 AI 助手，而不仅仅是聊天机器人。它可以连接各种大模型，并通过插件或工具 自动执行现实世界任务（如发送邮件、控制电脑、自动化工作流）]]></description><category></category></item><item><title><![CDATA[大数据领域核心 SQL 优化框架Apache Calcite介绍]]></title><link>https://blog.csdn.net/youziguo/article/details/158389361</link><guid>https://blog.csdn.net/youziguo/article/details/158389361</guid><author>youziguo</author><pubDate>Wed, 25 Feb 2026 17:26:25 +0800</pubDate><description><![CDATA[Apache Calcite是一个开源的动态数据管理框架，专注于SQL解析、关系代数转换和查询优化。作为大数据领域SQL处理的&quot;编译器内核&quot;，它被Flink、Hive等主流系统广泛采用。核心功能包括：SQL语法解析为关系代数树（RelNode）、基于规则的优化器（RBO）和成本模型（CBO）、多数据源联邦查询支持。其模块化设计允许开发者自定义规则、物理算子和数据源适配器。虽然不负责具体执行和存储，但Calcite通过可插拔架构实现了查询优化的标准化，成为大数据SQL处理的关键基础设施。典]]></description><category></category></item><item><title><![CDATA[阿里羚羊Dataphin智能数据建设与治理平台介绍]]></title><link>https://blog.csdn.net/youziguo/article/details/158388961</link><guid>https://blog.csdn.net/youziguo/article/details/158388961</guid><author>youziguo</author><pubDate>Wed, 25 Feb 2026 17:18:14 +0800</pubDate><description><![CDATA[阿里Dataphin是企业级数据中台平台，提供从数据集成到服务化的全生命周期管理。核心功能包括可视化数仓建模、统一指标管理、数据资产治理和API服务输出。其优势在于规范化企业数据建设，自动生成血缘关系，解决指标口径混乱问题。相比DataWorks更侧重数据治理而非开发调度。适合多业务线集团企业构建统一数据体系，但存在阿里生态依赖性强、成本较高等局限。]]></description><category></category></item><item><title><![CDATA[Kafka之消费者分区分配策略]]></title><link>https://blog.csdn.net/youziguo/article/details/155135832</link><guid>https://blog.csdn.net/youziguo/article/details/155135832</guid><author>youziguo</author><pubDate>Sun, 23 Nov 2025 05:45:00 +0800</pubDate><description><![CDATA[Consumer Group 中有多个消费者（Consumer），Topic 有多个分区（Partition），分区如何分给各 Consumer？
这就是 Partition Assignment Strategy 的职责。

Kafka 自 0.9 开始支持多种策略，2.4+ 又增加了新的 Sticky 版本。]]></description><category></category></item><item><title><![CDATA[Spring boot注解介绍]]></title><link>https://blog.csdn.net/youziguo/article/details/151046178</link><guid>https://blog.csdn.net/youziguo/article/details/151046178</guid><author>youziguo</author><pubDate>Sun, 31 Aug 2025 14:30:58 +0800</pubDate><description><![CDATA[Spring boot注解介绍，包括Spring核心注解和Srping boot特有注解。]]></description><category></category></item><item><title><![CDATA[Flink之CEP]]></title><link>https://blog.csdn.net/youziguo/article/details/148541788</link><guid>https://blog.csdn.net/youziguo/article/details/148541788</guid><author>youziguo</author><pubDate>Tue, 10 Jun 2025 05:15:00 +0800</pubDate><description><![CDATA[Spring CEP（Complex Event Processing，复杂事件处理）是基于 Spring 框架 的一类解决方案，用于处理高吞吐、低延迟的数据流事件，尤其适用于金融风控、物联网监控、日志分析、实时监控等实时流处理场景。]]></description><category></category></item></channel></rss>