<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[Piepis的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/bug4pie</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; bug4pie]]></copyright><item><title><![CDATA[Doris 快速写入原理]]></title><link>https://blog.csdn.net/bug4pie/article/details/159727579</link><guid>https://blog.csdn.net/bug4pie/article/details/159727579</guid><author>bug4pie</author><pubDate>Wed, 01 Apr 2026 14:19:15 +0800</pubDate><description><![CDATA[Apache Doris 快速写入的核心原理在于。通过将大规模写入任务分片到多个节点（BE）并行执行，利用内存缓冲区进行攒批写入减少磁盘 I/O 次数，并结合顺序写盘的列式存储，实现高吞吐量与实时入库。]]></description><category></category></item><item><title><![CDATA[ClickHouse 的高速查询原理]]></title><link>https://blog.csdn.net/bug4pie/article/details/159720502</link><guid>https://blog.csdn.net/bug4pie/article/details/159720502</guid><author>bug4pie</author><pubDate>Wed, 01 Apr 2026 10:46:31 +0800</pubDate><description><![CDATA[ClickHouse 的高速查询原理主要基于。它在读取数据时仅需加载所需的列，减少了 90% 以上的磁盘 I/O 耗时，并通过多核并行处理技术在单机或集群上实现极高的分析效率。]]></description><category></category></item><item><title><![CDATA[Flink一致性实现原理]]></title><link>https://blog.csdn.net/bug4pie/article/details/159719394</link><guid>https://blog.csdn.net/bug4pie/article/details/159719394</guid><author>bug4pie</author><pubDate>Wed, 01 Apr 2026 10:23:40 +0800</pubDate><description><![CDATA[Apache Flink 的一致性原理它贯穿周期性保存分散式快照状态，在故障发生时将任务恢复至一致的状态，实现了从数据源到下游系统的「精确一次」（Exactly-Once）处理语义。]]></description><category></category></item><item><title><![CDATA[Flink 状态后端核心原理]]></title><link>https://blog.csdn.net/bug4pie/article/details/159716472</link><guid>https://blog.csdn.net/bug4pie/article/details/159716472</guid><author>bug4pie</author><pubDate>Wed, 01 Apr 2026 09:54:39 +0800</pubDate><description><![CDATA[Flink 状态后端（State Backend）是决定有状态算子如何存储、访问及持久化状态数据的核心组件。其原理在于。状态后端负责在运行期管理状态快照，在故障时恢复数据一致性。]]></description><category></category></item><item><title><![CDATA[Linux 下升级 Python 3.7 → 3.9（离线）并内网安装本地python-packages]]></title><link>https://blog.csdn.net/bug4pie/article/details/159283334</link><guid>https://blog.csdn.net/bug4pie/article/details/159283334</guid><author>bug4pie</author><pubDate>Fri, 20 Mar 2026 15:05:21 +0800</pubDate><description><![CDATA[💡 小提示：如果内网机器平台和外网机器不同，需要确保下载的 wheel 平台一致（比如 Linux x86_64）。这会把 requirements.txt 中所有包及依赖下载到 /tmp/packages。注意选择合适的平台的 .whl（Linux/Windows/macOS）-r requirements.txt：安装指定的包及版本。4️⃣ 在内网 Python 3.9 下离线安装。2️⃣ 下载离线 .whl 包（本地/外网）1️⃣ 在外网/本地机器导出已有包。3️⃣ 拷贝到内网服务器。]]></description><category></category></item><item><title><![CDATA[新手-NPM安装OpenClaw指南]]></title><link>https://blog.csdn.net/bug4pie/article/details/158689563</link><guid>https://blog.csdn.net/bug4pie/article/details/158689563</guid><author>bug4pie</author><pubDate>Thu, 05 Mar 2026 13:48:49 +0800</pubDate><description><![CDATA[背景：博主使用的是mac电脑，所以本文档前面的npm安装流程，windows用户自行安装。]]></description><category></category></item><item><title><![CDATA[集成式智能体开发流程提示词]]></title><link>https://blog.csdn.net/bug4pie/article/details/154649478</link><guid>https://blog.csdn.net/bug4pie/article/details/154649478</guid><author>bug4pie</author><pubDate>Mon, 10 Nov 2025 14:45:26 +0800</pubDate><description><![CDATA[本文介绍了一个三合一集成式智能体的开发流程，该智能体整合了产品经理、软件工程师和代码审查员三种角色功能。工作流程分为四个阶段：1)产品经理负责需求分析、问题诊断、功能拆解和验收标准制定；2)软件工程师完成项目结构设计和代码实现；3)代码审查员进行架构、安全、质量和性能审查；4)最后生成项目文档和自动化脚本。该流程强调代码质量、规范性和安全性，要求每个阶段独立完成且严格审核，最终产出可直接运行的生产级代码和完整文档。]]></description><category></category></item><item><title><![CDATA[Doris Docker 完整部署指南]]></title><link>https://blog.csdn.net/bug4pie/article/details/154649330</link><guid>https://blog.csdn.net/bug4pie/article/details/154649330</guid><author>bug4pie</author><pubDate>Mon, 10 Nov 2025 14:42:45 +0800</pubDate><description><![CDATA[本文提供了Doris数据库在Docker环境中的完整部署指南。主要内容包括： 准备工作：创建宿主机目录结构和克隆Doris源码 容器构建与运行：通过Dockerfile构建镜像并配置自动重启 编译Doris：详细说明首次编译步骤和编译产物位置 配置管理：包括FE/BE的启动脚本编写和自动启动配置 数据库连接验证和常用操作命令 故障排查方法和端口说明 备份恢复方案 该指南采用Docker容器化部署方案，通过挂载目录实现数据持久化，使用host网络简化网络配置，并提供了完整的生命周期管理方案。]]></description><category></category></item><item><title><![CDATA[数仓面试常见问题:5.实时数仓与流处理]]></title><link>https://blog.csdn.net/bug4pie/article/details/146156217</link><guid>https://blog.csdn.net/bug4pie/article/details/146156217</guid><author>bug4pie</author><pubDate>Mon, 10 Mar 2025 16:32:06 +0800</pubDate><description><![CDATA[实时数仓（Real-time Data Warehouse）和传统离线数仓（Batch Data Warehouse）在数据处理方式、架构、应用场景等方面存在明显区别。当前的 OLAP 数据库替换和用户行为分析项目，可能需要结合实时计算（Flink）+ 离线数据分析（Presto / Hive），来满足不同业务需求。融合层：通过 Presto、ClickHouse 混合查询实时+离线数据。离线层：提供大规模数据统计（如年度报表）。实时层：提供秒级数据查询（如监控报警）。(2) 实时数仓架构。]]></description><category></category></item><item><title><![CDATA[数仓面试常见问题:4.ETL流程与调度]]></title><link>https://blog.csdn.net/bug4pie/article/details/146153683</link><guid>https://blog.csdn.net/bug4pie/article/details/146153683</guid><author>bug4pie</author><pubDate>Mon, 10 Mar 2025 15:32:33 +0800</pubDate><description><![CDATA[ETL 是数据仓库的入口，负责将来自不同来源的数据提取、清洗和整合，解决数据分散和格式不统一的问题，形成统一的分析数据源。]]></description><category></category></item><item><title><![CDATA[数仓面试常见问题:3.数据倾斜与处理]]></title><link>https://blog.csdn.net/bug4pie/article/details/146153200</link><guid>https://blog.csdn.net/bug4pie/article/details/146153200</guid><author>bug4pie</author><pubDate>Mon, 10 Mar 2025 14:11:17 +0800</pubDate><description><![CDATA[假设在 JOIN 操作中，存在一个小表（如用户信息表），需要与大表（如订单表）进行 JOIN。通过以上几种方式处理数据倾斜问题后，任务的执行时间显著减少，内存使用更加均衡，整个数据处理过程变得更加高效。这样，原本集中在一个用户上的数据就被分散到多个 reduce 任务中，缓解了数据倾斜问题。）中，数据在不同分区或节点上分布不均衡，导致部分任务执行时间过长，从而影响整体作业的性能。操作时，如果某些键的值过于集中，部分计算任务会比其他任务处理更多的数据，导致资源利用不均衡。比如将用户 ID 变成。]]></description><category></category></item><item><title><![CDATA[数仓面试常见问题:2.SQL与性能优化]]></title><link>https://blog.csdn.net/bug4pie/article/details/146150115</link><guid>https://blog.csdn.net/bug4pie/article/details/146150115</guid><author>bug4pie</author><pubDate>Mon, 10 Mar 2025 13:14:26 +0800</pubDate><description><![CDATA[尽量使用内连接（INNER JOIN），因为它只返回两个表中都存在的记录。避免使用 OUTER JOIN，因为它会增加计算量。：在可能的情况下，使用子查询或者提前过滤数据，减少 JOIN 需要处理的数据量。：在参与 JOIN 的字段上创建索引，可以极大提升 JOIN 的性能。特别是对大表的联接字段，索引能加速查找过程。：如果你的 JOIN 语句涉及到某些字段，确保这些字段上有索引。例如，在连接字段上使用B-tree索引。：除了 JOIN 字段外，查询条件字段（例如WHERE。]]></description><category></category></item><item><title><![CDATA[数仓面试常见问题:1.数仓基础与设计]]></title><link>https://blog.csdn.net/bug4pie/article/details/146148922</link><guid>https://blog.csdn.net/bug4pie/article/details/146148922</guid><author>bug4pie</author><pubDate>Mon, 10 Mar 2025 12:04:10 +0800</pubDate><description><![CDATA[缓慢变化维（Slowly Changing Dimension, SCD）缓慢变化维指的是 维度表中的数据会随着时间推移而发生变化，但变化的速度相对较慢，例如客户的地址、产品的价格、员工的职位等。处理缓慢变化维的方法（SCD 类型）针对缓慢变化维的不同业务需求，常见的处理方法有以下几种SCD 类型处理方法适用场景优缺点SCD1（覆盖更新）直接用新值覆盖旧值，不保留历史记录不需要追踪历史数据，如用户的最新手机号简单高效，但丢失历史数据SCD2（新增记录）]]></description><category></category></item><item><title><![CDATA[软件架构-4R架构定义]]></title><link>https://blog.csdn.net/bug4pie/article/details/129403141</link><guid>https://blog.csdn.net/bug4pie/article/details/129403141</guid><author>bug4pie</author><pubDate>Wed, 08 Mar 2023 14:59:57 +0800</pubDate><description><![CDATA[架构是顶层设计；框架是面向编程或配置的半成品；组件是从技术维度上的复用；模块是从 业务维度上职责的划分；系统是相互协同可运行的实体。]]></description><category></category></item><item><title><![CDATA[Docker 项目快速部署Flask项目]]></title><link>https://blog.csdn.net/bug4pie/article/details/128323697</link><guid>https://blog.csdn.net/bug4pie/article/details/128323697</guid><author>bug4pie</author><pubDate>Thu, 15 Dec 2022 00:59:10 +0800</pubDate><description><![CDATA[打造 flask + gunicron + nginx + Mysql  环境nginx +  Mysql   使用docker 快速部署使用 supervisor 对 gunicron  做监控。]]></description><category></category></item><item><title><![CDATA[Centos 7手动安装Docker]]></title><link>https://blog.csdn.net/bug4pie/article/details/126606895</link><guid>https://blog.csdn.net/bug4pie/article/details/126606895</guid><author>bug4pie</author><pubDate>Tue, 30 Aug 2022 17:40:33 +0800</pubDate><description><![CDATA[学习docker ，并在centos上手动安装docker]]></description><category></category></item><item><title><![CDATA[shell log文件压缩保存并清空]]></title><link>https://blog.csdn.net/bug4pie/article/details/126271015</link><guid>https://blog.csdn.net/bug4pie/article/details/126271015</guid><author>bug4pie</author><pubDate>Wed, 10 Aug 2022 17:33:42 +0800</pubDate><description><![CDATA[log文件压缩并清空]]></description><category></category></item><item><title><![CDATA[pandas groupby to csv]]></title><link>https://blog.csdn.net/bug4pie/article/details/126127174</link><guid>https://blog.csdn.net/bug4pie/article/details/126127174</guid><author>bug4pie</author><pubDate>Tue, 02 Aug 2022 17:48:36 +0800</pubDate><description><![CDATA[csv 数据分组]]></description><category></category></item><item><title><![CDATA[Flink典型应用场景]]></title><link>https://blog.csdn.net/bug4pie/article/details/118756374</link><guid>https://blog.csdn.net/bug4pie/article/details/118756374</guid><author>bug4pie</author><pubDate>Thu, 15 Jul 2021 12:30:06 +0800</pubDate><description><![CDATA[背景
随着网络迅速发展，大数据的处理呈现出非常明显的实时化趋势。在实时化的大趋势底下，了解并熟悉Flink常用的三大典型应用场景，对于我们理解并使用Flink具有很大的帮助。
事件驱动型应用

事件驱动表示一个事件会触发另一个或者是很多个后续的事件，然后这一系列事件会形成一些信息，基于这些信息需要做一定的处理。

通俗讲，事件驱动型应用是一类具有状态的应用，会根据事件流中的事件触发计算、更新状态或进行外部系统操作。
常见于实时计算业务中，比如：实时推荐，金融反欺诈，实时规则预警等。
常见的事件驱动型场景举例]]></description><category></category></item><item><title><![CDATA[语音情感识别]]></title><link>https://blog.csdn.net/bug4pie/article/details/114660231</link><guid>https://blog.csdn.net/bug4pie/article/details/114660231</guid><author>bug4pie</author><pubDate>Thu, 11 Mar 2021 15:05:31 +0800</pubDate><description><![CDATA[背景
NLP和图像比较普遍，语音识别文字做的很多，今天尝试下做语音情感识别。
语音情感识别系统图

wav格式的语音包
做特征提取的语音包（包含中文和英文）
https://download.csdn.net/download/bug4pie/15725652
特征提取方法-mfcc
在这里我选用了mfcc算法来提取语音基于谱的特征
算法如下
https://download.csdn.net/download/bug4pie/15727165
主函数调用
#!/usr/bin/env python
# -]]></description><category></category></item></channel></rss>