自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(210)
  • 资源 (1)
  • 收藏
  • 关注

原创 Hadoop DistCp 使用详解与原理分析

摘要 DistCp是Hadoop内置的分布式数据拷贝工具,基于MapReduce实现跨集群/目录的高效数据同步。相比单机hadoop fs -cp的串行拷贝,DistCp通过多Mapper并行处理大幅提升性能。本文详细解析DistCp的核心功能与使用场景: 基本用法:支持单/多源拷贝、文件列表指定、增量同步(-update)和删除多余文件(-delete) 三种拷贝模式:增量更新(-update)、全量覆盖(-overwrite)、原子提交(-atomic) 关键参数: 并行控制(-m设置Mapper数)

2026-08-20 09:50:54 38

原创 RAG 工具怎么选:LangChain、LlamaIndex、Dify 实测对比

RAG 工具怎么选:LangChain、LlamaIndex、Dify 实测对比

2026-08-12 19:36:42 224

原创 手撸一个 RAG,没那么难

这篇文章介绍如何用Python快速搭建一个简单的RAG(检索增强生成)系统。主要步骤包括:1)使用LangChain加载本地文档并切分成段落;2)通过OpenAI的embedding模型将文本转为向量,存入Chroma向量数据库;3)构建问答链,实现"用户提问→检索相关段落→生成回答"的流程。文中提供了完整代码示例(约100行),并建议了参数调优方案(如检索段落数量)和本地模型替代方案。作者强调RAG的优势在于能提供回答依据来源,并预告后续将探讨RAG工具选型。整个系统无需复杂配置,适合快速验证RAG基础功

2026-08-10 16:06:19 246

原创 RAG 是怎么回事

摘要: RAG(检索增强生成)是一种让AI基于外部知识库回答问题的技术,通过将用户提问与文档向量匹配,再结合检索结果生成答案,有效解决大模型的幻觉和时效性问题。其核心流程包括文档向量化、构建向量数据库、检索与生成三步骤。近年来,随着向量数据库和框架(如LangChain)的成熟,RAG成为企业知识管理标配,常与Agent、MCP协同工作,分别负责知识查询、任务拆解和实时操作。但RAG依赖检索质量,无法处理高频变更数据或复杂推理,需结合其他技术互补。本质是让AI“开卷考试”,提升回答准确性。

2026-08-04 14:27:38 253

原创 AI Agent、Skill 和 MCP 到底都是什么

本文系统梳理了AI领域Agent、Function Calling、Skill和MCP等核心概念的关系与差异。Agent通过自主规划、工具调用和记忆能力实现任务自动化,区别于传统对话模式;Function Calling让AI掌握工具使用方法;Skill以自然语言指导AI处理特定任务;MCP协议则标准化AI与工具的交互方式。这些技术共同构建了AI自主工作的能力框架,使AI从简单对话转向实际执行,但也面临安全控制和权限管理等挑战。文章还推荐了一个AI学习网站,帮助读者深入理解这些前沿概念。

2026-08-01 08:00:00 257

原创 大模型到底需要什么硬件?显卡、参数、显存、部署全说清楚

本文详细分析了不同规格显卡运行大语言模型的硬件需求,重点探讨了显存容量与模型参数的关系。文章指出,FP16精度下显存需求约为参数量的2倍(如7B模型需14GB显存),但通过量化技术(如Q3/Q2量化)可大幅降低需求。2026年主流显卡如RTX 5090(32GB显存)已能运行70B量化模型(2-8 tok/s)。文章对比了不同显卡的适用范围,提供了从入门到高性能的配置方案,并强调实际使用中32B量化模型往往已能满足需求。最后指出硬件迭代和优化工具(如Ollama 2.0)正持续降低大模型本地部署门槛。

2026-07-30 16:14:01 327

原创 各家大模型详解与对比:2026 版

本文梳理了2026年主流AI大模型市场格局,分为海外闭源、国内闭源和开源三类。海外方面,OpenAI的GPT-5.6 Sol、Anthropic的Opus 4.8、Google的Gemini 3.5 Flash和xAI的Grok 4.5各具特色,在综合能力、工程编码、多模态处理等方面形成差异化优势。国内闭源模型以Kimi K3、豆包2.1 Pro、通义Qwen3.7等为代表,在超长上下文、中文处理、多模态等场景表现突出。开源领域则以MiniMax M3、DeepSeek-V4等为主力,兼顾高性能与商用友好性

2026-07-29 17:49:43 697

原创 大模型的“参数“到底是什么

本文用通俗易懂的方式解释了人工智能大模型中的"参数"概念。通过做菜类比说明参数是模型存储的经验值,参数数量决定了模型的记忆容量(如7B模型相当于小本子,70B模型如同厚书)。文章指出参数并非越多越好,效果提升会边际递减,训练数据和架构同样重要。同时解释了参数与运行成本的关系,参数越大对硬件要求越高。最后总结强调参数只是衡量模型的一个维度,训练方法、数据质量和架构设计才是关键差异因素。

2026-07-28 13:56:42 328

原创 Spark 源码 | Standalone Client 模式提交流程(七)

本文分析了Spark Standalone Client模式的提交流程,主要特点包括: Driver运行在提交客户端,通过反射执行用户主类 提交流程分为8个关键步骤: SparkSubmit准备阶段设置childMainClass为用户主类 客户端启动Driver进程并初始化SparkContext 创建StandaloneAppClient向Master注册应用 Master分配资源并调度Worker启动Executor Executor反向注册到Driver并执行任务 核心RPC通信: Client与M

2026-07-27 09:07:47 644

原创 大模型进化史:从没人在意到无所不在

《大模型进化史:从RNN到GPT-3的技术跃迁》 本文系统梳理了大模型的发展历程: 早期技术(2014年前):RNN面临梯度消失问题,LSTM通过"遗忘门"机制部分解决了短时记忆缺陷,Word2Vec实现了词向量表示但无法处理一词多义。 关键突破(2017年):Google提出Transformer架构,通过自注意力机制实现并行计算和长程依赖处理。2018年出现BERT(双向理解)和GPT-1(单向生成)的技术分叉。 规模跃升(2019-2020): GPT-2(15亿参数)因"太危险"声明引发关注 GPT

2026-07-24 21:13:47 361

原创 大模型到底是怎么回事

本文通俗易懂地解析了AI大模型的核心原理:通过海量数据训练学习词语间的统计规律,用预测方式生成回答。文章拆解了大模型训练的三阶段(预训练、微调、RLHF),解释了为何会产生"幻觉"错误,并对比了不同模型的差异(参数规模、上下文窗口、数据质量等)。最后给出实用建议:适合处理信息总结、初稿撰写等任务,但不适合事实核查和复杂决策。全文用生活化比喻取代技术术语,帮助读者理解AI的本质与边界。

2026-07-23 20:26:25 166

原创 Claude Code 安装使用文档

《终端AI编程助手Claude Code安装与使用指南》摘要:本文介绍了一款独立于IDE的终端AI编程工具Claude Code,支持通过命令行与Claude交互完成代码编写与调试。安装需Node.js 18+环境,提供npm全局安装和备用方案。重点说明五种认证方式,尤其推荐国内用户通过配置文件映射云服务商API。详细讲解交互模式、单次提问、带上下文提问等基础用法,并分类介绍项目初始化、会话管理、模型切换等斜杠命令,帮助开发者快速上手这款终端AI助手

2026-07-22 20:55:18 313

原创 2026程序员AI工具盘点|不折腾、真提效、日常刚需

2026程序员AI工具盘点|不折腾、真提效、日常刚需

2026-07-22 19:46:07 251

原创 Spark 源码 | Yarn Cluster 模式提交流程(六)

Yarn Cluster 模式 Driver 运行在 AM 内,与 Client 模式有何本质不同?本文从客户端提交到 AM 启动、SparkContext 初始化、资源申请,完整梳理提交流程,重点剖析 YarnClusterScheduler 信号枪和跨线程 wait/notify 同步。

2026-07-20 14:27:58 301

原创 Oracle CDC 抽取 BLOB 字段完整踩坑与解决指南

Oracle CDC 抽 BLOB 的完整踩坑记录:从 BLOB 为 null,到 ORA-01291 频繁报错,最终定位 Debezium 源码 SCN 推进 bug 并修复。附 __debezium_unavailable_value 占位符的触发器方案。

2026-07-19 19:33:12 305

原创 Spark 源码 | Yarn Client 模式提交流程(五)

Spark Yarn Client 模式完整提交流程源码分析。从SparkSubmit提交、Driver本地启动,到Client与ResourceManager通信申请ApplicationMaster,再到ExecutorLauncher启动YarnAllocator申请Container,最终Executor反注册到Driver,含核心调用链总结。

2026-07-18 11:53:58 303

原创 Spark 源码 | SparkContext 初始化与 TaskScheduler 创建流程(四)

本文深入剖析 SparkContext 初始化与 TaskScheduler 创建流程。以 Yarn Client 模式为例,详解 SparkSession → SparkContext → createTaskScheduler → ClusterManager(SPI 加载)→ TaskScheduler.start() 完整链路,助你掌握 Spark 任务调度的核心机制。

2026-07-15 09:22:54 214

原创 Spark 源码 | SparkSubmitArguments 参数解析(三)

在第二篇基础上深入解析参数解析逻辑。介绍 SparkSubmitArguments 字段定义、五步解析流程(parse → 合并配置 → 过滤属性 → 加载环境变量 → 参数验证)、三个核心回调方法及参数优先级:命令行 > --conf > 配置文件 > 环境变量 > 默认值

2026-07-13 08:54:18 315

原创 Spark 源码 | SparkSubmit 提交流程分析(二)

分析 SparkSubmit 提交流程,介绍 submit、prepareSubmitEnvironment、runMain 三个核心方法,说明 Client 和 Cluster 模式下 childMainClass 的不同

2026-07-09 08:58:14 315

原创 Flink CDC2Kafka 总结

本文介绍了CDC(变更数据捕获)到Kafka的配置细节,重点以MySQL-CDC为例。主要内容包括:1)通过添加时间字段实现数据排序;2)配置相同主键落入同一Kafka分区;3)处理Blob类型图片字段并转换为base64格式;4)提供了完整的SQL示例和配置参数。文章还探讨了CDC格式数据在Hive不支持ACID时的替代方案,以及如何在Kafka中存储CDC格式数据(debezium-json等)来实现增量变更日志与历史数据合并。配置细节涵盖了字段类型转换、分区策略、二进制数据处理等实际问题,并附有数据示

2026-07-03 14:41:36 1881

原创 Flink DataStream2Table 总结

Flink DataStream2Table 总结

2026-03-17 10:37:54 491

原创 Hive 集群安装配置

Hive 集群安装配置

2025-11-18 09:10:11 1064

原创 Hadoop HA 集群安装配置

Hadoop HA 集群安装配置

2025-09-24 16:14:06 923

原创 异常解决记录 | Yarn NodeManager 注册异常

异常解决记录 | Yarn NodeManager 注册异常

2025-09-20 14:04:28 1254

原创 PolarDB-for-PostgreSQL CDC 总结

PolarDB-for-PostgreSQL CDC 总结

2025-09-17 15:12:58 1441

原创 PolarDB-for-PostgreSQL 安装配置

PolarDB-for-PostgreSQL 安装配置

2025-09-13 10:57:28 1324

原创 ZooKeeper 安装配置

ZooKeeper 安装配置

2025-08-29 10:04:08 886

原创 Conda 安装配置及常用命令

Conda 安装配置及常用命令

2025-08-27 08:54:30 1643

原创 Minio 分布式集群安装配置

Minio 分布式集群安装配置

2025-08-07 19:35:32 978

原创 Yarn Application 日志总结

Yarn Application 日志总结

2025-08-05 15:42:32 1208

原创 Flink Savepoints 总结

Flink Savepoints 总结

2025-07-01 09:59:57 889

原创 Flink Oracle CDC 总结

Flink Oracle CDC 总结

2025-06-26 08:57:31 1022

原创 Flink On Yarn HA 重启次数

Flink On Yarn HA 重启次数

2025-06-19 16:17:54 774

原创 Docker 安装 Oracle 11G

Docker 安装 Oracle 11G

2025-06-17 16:14:25 1128

原创 Docker 安装 Oracle 12C

Docker 安装 Oracle 12C

2025-06-12 17:48:55 1835

原创 Dinky 安装部署并配置提交 Flink Yarn 任务

Dinky 安装部署并配置提交 Flink Yarn 任务

2025-05-13 17:20:00 1878

原创 记录 Flink jdbc、mysql-cdc 连接 mysql8 碰到的适配问题

记录 Flink jdbc、mysql-cdc 连接 mysql8 碰到的小问题

2025-04-29 16:15:23 1512

原创 Flink HA 总结

总结 Flink HA。

2025-04-28 15:29:57 1521

原创 Flink 源码编译

Flink 源码编译

2025-04-24 14:26:58 1625

原创 Ollama 简介及安装部署

Ollama 是一个专注于本地化部署和运行大型语言模型(LLM)的工具,旨在让用户能够在自己的设备上高效地运行和微调模型。它由 Ollama 团队开发,这是一家独立的初创公司,由 Michael Chiang 和 Jeffrey Morgan 创立,总部位于加利福尼亚州帕洛阿尔托。,用户可以自由查看、修改和分发。跨平台支持:兼容 Windows、Linux、MacOS 系统。丰富模型库:提供 1700 + 大语言模型,如 Qwen、Llama 等,可在官网 model library 中直接下载使用。

2025-02-27 19:56:11 2097

flink.tar.gz

flink

2024-07-20

hudi-spark3.2-bundle-2.12-0.13.0.jar hudi sql 保存 extraMetadata

hudi-spark3.2-bundle-2.12-0.13.0.jar hudi sql 保存 extraMetadata

2024-06-13

QQ截图工具独立版-不需要安装QQ

不安装QQ、不登录QQ即可使用QQ截图工具 使用方法:1、下载文件之后先解压; 2、运行Init.bat 3、桌面会有一个图标,双击运行可以启动QQ截图; 4、在右下角拖盘有可以设置的地方

2024-02-18

flink-sql-connector-hbase-2.2-1.15.4.jar

flink 读写 hbase 添加参数 hbase.conf.dir,支持参数自定义hbase-site.xml

2023-12-08

Spark SQL增量查询Hudi表-Spark3.1.2-jar包

通过修改源码,支持set方式增量查询Hudi包

2022-11-30

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除