自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

架构师思考实践

Life is too short, don’t live the same day twice.

  • 博客(301)
  • 资源 (4)
  • 收藏
  • 关注

原创 Hadoop源码分析---TextInputFormat、FileInputFormat、LineRecordReader

作用:1、将输入切分成split,确定split大小,map个数。 由getSplits方法实现。 2、为mapper提供输入数据,key/value形式。getRecordReader方法核心算法:1、文件切分算作用:确定split个数。概念: globalSize: totalsize/numSplits  ; minSize: InputSplit 最小值 配

2015-08-19 22:36:21 1855

原创 什么是 AI Agent?从能力边界到核心技术,一文讲透智能体的本质

AI Agent 不是大模型的简单封装,而是下一代 AI 应用的核心范式:它让 AI 从「回答问题的工具」变成「解决问题的执行者」,从「需要人步步引导」变成「给定目标就能自主闭环」。• 长期持久记忆:基于向量数据库与 RAG 检索机制,持久化存储历史任务记录、领域知识、用户偏好、成功与失败案例,任务启动时按需召回,突破上下文窗口的物理限制;• 短期工作记忆:依托大模型上下文窗口,存放当前任务的会话内容、中间执行结果、临时变量,是模型实时决策的直接信息来源,容量受模型上下文长度限制;

2026-06-20 10:56:48 281

原创 卷积神经网络(CNN)全景解析:原理、价值与落地实践

一句话总结:卷积神经网络是专门为图像、视频等二维空间数据设计的神经网络架构,核心解决传统全连接网络处理图像时「参数量爆炸、空间信息丢失」两大致命痛点,是计算机视觉领域的技术基石。1. 破解全连接网络的图像处理困局在 CNN 出现之前,行业用全连接网络处理图像,存在两个无法绕过的本质缺陷:参数量爆炸,训练不可行全连接网络要求输入层与隐藏层神经元两两相连。一张 224×224 的彩色图片展平后约 15 万个输入节点,单一层参数规模就可达百亿级,远超单卡显存上限,深层网络完全无法训练。

2026-06-20 10:38:12 403

原创 彻底搞懂 Self-Attention 自注意力机制:大模型之所以强大的核心根源

自注意力机制:让序列中每一个字,都和全文所有字做关联匹配,自动计算彼此的相关权重。通俗翻译:模型在读每一个字的时候,会自动判断:全文中哪些字和我关系最大,重点关注、加权理解。举例:句子:“小明丢了书包,他很着急”- 看到“他”,注意力自动聚焦到“小明”- 看到“着急”,注意力关联“丢了书包”这就是语义关联、上下文理解的本质。1. Self-Attention 是 Transformer、所有现代大模型的核心基石;2. 核心逻辑:Q匹配K、权重加权V,实现全局上下文关联;

2026-06-09 07:12:21 244

原创 SFT数据集制作手把手实战教程:从0到1构建高质量微调数据

1. SFT拼的不是数量,是纯度与规范性2. 预训练学知识,SFT学习惯、风格、任务、格式3. 3成通用+7成行业,是最稳落地配比4. 数据集干净,模型效果一定涨;数据集脏,怎么调参都没用5. 标准、统一、真实、多样、正确,是SFT数据五维黄金标准如果你需要,我可以继续输出:1. SFT数据集清洗Python脚本2. 数据集自动去重、过滤、格式统一工具3. 多轮对话SFT数据集制作教程需要的话告诉我!

2026-06-08 08:27:35 362

原创 大模型SFT监督微调完全解析:原理、数据集、训练流程、实战调优、避坑指南

SFT(Supervised Fine-Tuning)监督微调:基于预训练底座大模型,使用高质量人工标注指令数据集,以有监督学习的方式,让模型学习「用户指令 → 标准回答」的映射关系。1. SFT 是大模型从“能用”到“好用”的第一道门槛;2. 预训练学知识,SFT学任务,RLHF学审美;3. SFT效果核心不在于参数,而在于高质量、高纯净数据集;4. 所有私有化行业模型、企业专属模型,必须经过SFT训练;5. 工程落地最优解:SFT定风格,RAG补知识,RLHF提体验。

2026-06-05 08:02:20 356

原创 告别盲目试错,AI策略平台:企业高效落地AI的“导航系统”

AI时代,企业的竞争不再是“要不要用AI”,而是“能不能高效、安全、低成本地用AI”。普通企业还在零散试错、高价咨询时,头部企业早已通过AI策略平台,构建起“战略清晰、落地高效、风险可控”的AI体系,实现降本增效、快速增长。AI策略平台,不是简单的工具升级,而是企业运营模式的革命性重构——它让AI从“昂贵的奢侈品”变成“普惠的生产力”,让每个企业都能轻松享受AI红利。未来已来,选择AI策略平台,就是选择高效、安全、可持续的AI转型之路,让企业在AI浪潮中,不落后、不迷茫,抢占先机、赢得未来。

2026-06-02 07:12:11 183

原创 彻底吃透大模型微调

大模型预训练阶段,依托海量全网通用数据,学习基础语言逻辑、通识知识,形成通用能力;微调(Fine-Tuning):以预训练原始模型为基底,使用行业专属、业务专属标注数据集,在原有参数基础上二次训练,小幅更新模型权重,让模型适配垂直业务、行业话术、固定输出风格。简单直白概括:• RAG:给模型外挂资料库,模型临时检索资料作答,不改变模型本身;• 微调:重塑模型大脑,把知识、风格、指令习惯直接写入模型权重,永久生效。1. 微调本质:基于专属标注数据,二次更新模型权重,固化行业能力与输出风格;

2026-05-31 13:43:14 587

原创 RAG技术深度解析:核心原理+全链路调优+主流开源框架选型

1. RAG核心逻辑:文档解析→分块→向量化→向量存储→检索→Prompt增强→LLM生成,链路每一环都会影响最终效果。2. 调优核心:文本分块、混合检索、重排模型、Prompt约束是提升精度的四大关键,也是项目落地的重点工作。3. 框架选型:新手/快速落地选国内一站式框架(FastGPT/Dify);深度开发、定制化需求选择LangChain/LlamaIndex。RAG目前已经成为大模型工程落地的基础技术,随着多模态、智能体技术融合,RAG的形态也在不断演进。

2026-05-30 08:57:03 888

原创 2026 Codex 高效使用技巧|从“代码生成器”到“全栈开发队友”

避免 Codex “自认为做完”,最后返工:完成后请确保:1. npm run lint 无报错2. 单元测试全部通过3. 不新增无关依赖4. 只修改 src/auth 目录文件5. 输出修改清单+验证结果关键:把“工程标准”告诉AI,不是让它自由发挥。2026 用 Codex 的核心:把它当“开发队友”,不是“代码生成器”。• 用 /plan 控方向,用 @文件 给上下文• 需求写具体、验收讲标准、规范放 AGENTS.md• 按场景选模型、控权限、避坑点。

2026-05-28 08:24:14 754

原创 2026最全AI学习路线:零基础从入门到实战,拒绝盲目内卷(保姆级攻略)

2026年的AI行业,早已告别“只会聊天就能上岗”的初级阶段,同时也并非只有钻研底层算法才能入局。对于绝大多数人来说,最优解就是:夯实基础、深耕应用层,吃透提示词、RAG、多模态、智能体四大核心技术,通过实战项目沉淀经验。未来不会被AI淘汰的人,从来不是懂所有技术的人,而是能熟练驾驭AI、借助工具放大自身能力的人。

2026-05-27 08:07:57 648

原创 一文透彻解析多模态处理

何为多模态?简单来说,模态就是信息的载体。我们常见的文本、图片、音频、视频、3D图像,都属于不同模态。早期传统AI属于“单模态模型”,能力十分单一:语言模型只能解读文字,视觉模型只能识别图片,各司其职无法互通。而多模态处理,就是让AI模拟人类的感知方式,同步接收、理解、融合多种类型信息,打破数据壁垒,实现跨模态理解与生成。

2026-05-26 12:26:27 254

原创 一文吃透机器学习

和监督学习不同,无监督学习没有标准答案,机器面对杂乱无章的原始数据,自主挖掘内在关联、划分规律、归类分组,是大数据分析的核心工具。最常用的两大算法是K-Means聚类和PCA降维算法。K-Means聚类的核心是“物以类聚”,电商平台根据用户浏览、下单习惯,将用户分为刚需用户、潜在用户、流失用户,实现千人千面的精准推荐;运营人员也可通过客户聚类,制定差异化营销方案。

2026-05-25 07:26:12 231

原创 读懂Transformer:大模型时代的“万能基石”

Transformer的伟大,不在于复杂的算法,而在于用简单的“注意力”,解决了AI理解世界的核心问题。它让AI从“逐字串行”走向“全局并行”,从“单一任务”走向“通用智能”,彻底打开了大模型时代的大门。今天,无论是聊天机器人、AI绘画、智能翻译,还是自动驾驶、医疗影像分析,背后都有Transformer的身影。未来,随着技术迭代,它还将持续进化,成为AI赋能千行百业的核心引擎。#AI科普 #Transformer #大模型底层逻辑 #人工智能基础。

2026-05-23 11:20:17 235

原创 Harness底层原理与落地实操

大模型的能力是上限,Harness工程化是下限。如今AI开发早已不是单纯比拼模型效果,真正的落地壁垒,是如何通过标准化、强制化的约束体系,让AI能力稳定、安全、持续地产生价值。掌握Harness的原理与搭建方法,既能解决模型输出不稳定的常见问题,也是从“AI调用者”进阶为“AI工程开发者”的核心关键。

2026-05-22 08:33:08 227

原创 告别“胡说八道”,RAG凭什么成为企业AI标配?

你是否遇过AI自信满满地说错信息?这是大模型的“幻觉”问题。2026年,RAG(检索增强生成) 成为解决该问题的核心技术,更是企业落地AI的首选方案。

2026-05-21 08:52:42 28

原创 2026最火AI技术:世界模型到底是什么?

过去AI靠“堆数据、堆算力”,现在靠“理解规律、推演未来”。它让AI从“只会聊天的工具”,变成了“能在真实世界干活的智能体”。你刷到的Sora生成的逼真视频,特斯拉自动驾驶的精准预判,人形机器人的灵活动作——背后都是同一个核心技术:世界模型。• 视频生成:Sora、Genie 3能生成物理一致的长视频,再也不会出现“六根手指”“穿模”的bug。世界模型会在内部模拟杯子掉落的全过程,计算出落地时间、破碎角度,甚至碎片飞溅的方向。未来已来,当AI真正理解了这个世界,我们的生活和工作方式,都将被彻底改变。

2026-05-20 08:07:39 262

转载 十分钟读完《金字塔原理》

十分钟读完《金字塔原理》作者简介芭芭拉·明托 (Barbara Minto)哈佛商学院第一批女学员之一,麦肯锡顾问公司有史以来第一位女性顾问。一个致力于为人们提供训练思考、表达和解决问题的逻辑的专业咨询培训人士,1973年成立个人公司-明托国际公司(Minto International Inc.),为社会各界人士讲授金字塔原理,该理论应用遍及美国、欧洲、澳大利亚、新西兰等国家和地区绝大部分公司和管理咨询公司。推荐语比起欣赏一朵花漫溢的馨香,我们需要更加关注它盛开的过程。一些人...

2021-04-06 20:03:39 1323

原创 【FlinkSQL】一文读懂流join方式

目录一、常规join二、时间窗口join三、时态表join基于事件时间的时态 Join基于处理时间的时态 Join四、时态表函数join对于离线计算、批处理,join操作比较好理解,可以参考文章hive 各种 join (left outer join、join、full outer join)。但是数据流的join和离线join是有差异的,流是无限的,没有边界的。目前Flink Sql有四种join方式。一、常规join需要将所有的历史记录存放到state中,所有历史.

2021-03-30 19:57:05 2537

原创 【FlinkSQL】一文读懂 动态表-时态表

一、FLink Sql 简介Flink SQL 是基于Apache Calcite来实现的标准 SQL。它是一种关系型 API,可以来做流批统一处理。不管是在有限批数据上还是在无限的流式数据上,Flink Sql都有相同的语义。二、动态表 (Dynamic Table)...

2021-03-28 16:49:56 1614

原创 Flink基础概念

1、keyby、partitionCustom 区别(1)KeyBy DataStream → KeyedStream: 通过制定字段,将流转化成带key的流,之后相同key的数据,分发到相同的算子上。属于逻辑上的分区。 dataStream.keyBy("someKey") // 通过 "someKey"进行分组 dataStream.keyBy(0) // 通过Tuple的第一个元素进行分组(2)物理分区(1)Custom partitioning...

2021-03-24 20:45:35 935

原创 Flink架构

FLink是一个有状态的分布式实时计算架构。一、Flink API介绍1、最底层的是有状态的流处理,已经继承到DataStream API中,一般不直接使用。2、第二层核心API,分为流处理DataStream和批处理DataSetAPI,一般用于java、scala开发,使用较多。3、第三层TableAPI,以表为中心的声明式编程API,可以把一个流程定义为一个table,有元数据schema,可以执行部分sql操作,例如select、join等。table api可以和第二层API很

2021-03-11 19:47:10 352 2

原创 Flink Mac本地安装、运行

一、flink本地安装先看下是否有java,不过没有也没事,用的是open-jdk,命令如下:#1、查看java版本java -version#2、安装flinkbrew install apache-flink#3、查看flink版本flink --version

2021-02-26 18:18:57 2683 1

原创 Error: homebrew-core is a shallow clone.

mac brew update 失败,报错信息如下:解决办法:cd /usr/local/Homebrew/Library/Taps/homebrewrm -rf homebrew-corerm -rf homebrew-caskbrew upgrade

2021-02-24 19:59:25 1640

原创 Flink watermark浅析

一、功能问题:Flink实时计算使用窗口时,消息会乱序,使用Event Time计算时,会有消息晚到。解决方案:假设我们把延迟超过5秒的消息丢掉(或特殊处理),那么在每条消息上打一个时间戳(watermark 水位线),这个时间是事件时间减去5s,表示的含义是这个水位线之前的数据都到了,告诉窗口可以出发计算了。补充时间概念:(1)事件时间:业务系统的业务发生或更新时间。(2)抽取时间:进入到消息队列的时间。(3)处理时间:实时计算的时间。二、原理1、watermark本.

2021-02-22 19:57:04 386

转载 Hive--对空值和NULL的处理

问题描述Hive中默认将NULL存为\N,NULL类型的字符串如何检索?创建一个测试表及准备测试数据,SQL如下:create table test_null (id int, age string) ROW FORMAT DELIMITEDFIELDS TERMINATED BY ','LINES TERMINATED BY '\n'STORED AS TEXTFILE;测试数据如下:1,232,24c3,32d4,305,NULL6,\N将数..

2020-10-04 16:17:49 3152

原创 java使用--Exception 异常信息 StackTraceElement

在某些场景下,直接使用e.printStackTrace(); 或者使用log4j打印异常,在日志收集系统中不好检索。下面方法将异常拼接成一行,使用 StackTraceElement。package com.ajl.usage.exception;/** * @Author anjinlong * @create 2020-10-02 17:05 * @description description */public class ExceptionUsage { ...

2020-10-02 20:41:37 1892

原创 java用法--HashMap putAll

类:HashMap方法:putAll()作用:将map2的数据全部放入到map1中,如果map1中已经存在key则更新,如果不存在则插入。测试代码:public static void putAllTest() { System.out.println("putAll 将map2的数据全部放入到map1中,如果map1中已经存在key则更新,如果不存在则插入。"); HashMap<String, String> map1 = new H.

2020-10-02 20:37:29 1288

转载 Git: Github提示Key is already use

背景:在Github中为用户添加SSH Key的时候报Key is already use,根据错误提示很显然,所添加的SSH Key已经被其他账号使用后,才会出现这个错误。现在有两种解决办法,第一,找到帐号删除Key;第二,重新生成Key找到使用该Key的帐号,在Github个人信息中有SSH and GPG keys这一栏,管理着所有的SSH Keys,找到匹配的Key删除,另外一个账号就可以使用该Key了重新生成SSH Key,仅需几个简单的步骤1.打开终端2.输入以下命令,并执行$ s

2020-09-28 14:08:14 971

原创 HDFS 写流程

待写,敬请期待

2017-07-10 21:30:02 548

原创 hadoop HDFS Federation

参考文档:http://hadoop.apache.org/docs/r2.7.3/hadoop-project-dist/hadoop-hdfs/Federation.html

2017-07-10 21:28:35 505

原创 Hadoop partitioner及自定义partitioner

一、hadoop partitioner所有partitioner都继承自抽象类Partitioner ,实现getPartition(KEY var1, VALUE var2, intvar3),hadoop自带的partitioner有:(1)TotalOrderPartitioner(2)KeyFieldBasedPartitioner(3)BinaryPartiti

2017-07-10 21:06:07 889

原创 Hadoop MapReduce 修改输出文件名 MultipleOutputs

需求:修改mapreduce的输出文件名称 为自己想要的名字工具:MultipleOutputs默认文件名:part-r-xxx 或者000178_0修改后为: 自定义名字-r-xxx 后边的r-xxx还没有去掉主要流程:声明 multipleOutputs在setup方法中初始化在reduce方法中调用 public voidwrite(KEYOUT key, VALUEOUT value, String baseOutputPath)在cleanup放中close

2017-07-07 22:45:49 2620

原创 HBase源码分析 -- HBase Region 拆分(split)

代码版本:hbase-1.2.6工程:hbase-server类:org.apache.hadoop.hbase.regionserver.HRegion1、判断是否需要切分方法: checkSplit返回值: splitpoint做了一些判断后,其实是调用:byte[] ret = splitPolicy.getSplitPoint();2、切分策略o

2017-07-01 23:34:02 1054

原创 hive优化总结

1、列裁剪、分区裁剪只查询需要的字段和分区,不使用select*2、join优化小表放左边3、空值处理(1)NULL和数字相加的问题,为避免这种情况先nvl 或者coalesce 先处理(2)NULL 值关联时,可排除掉不参与关联,也可随机分散开避免倾斜4.    排序优化不需要全局排序时,可用distribute by sort by  而不用

2017-06-11 11:48:22 1085

原创 一次hive reduce oom 处理:Execution Error, return code 2 from org.apache.hadoop.hive.ql.exec.mr.MapRedTas

问题: hive job失败,现象reduce失败,起了新的reduc而后还是失败,最终job失败错误:2017-06-07 16:43:20 INFO Examining task ID: task_*** (and more) from job job_***2017-06-07 16:43:21 INFO FAILED: Execution Error, return code

2017-06-11 11:04:22 16649

原创 hive2.0 存储过程 hplsql

在hive2.0中集成了hplsql,可用用hplsql命令执行存储过程。hplsql是一个开源项目,地址:http://www.hplsql.org/home,现在集成到hive2.0了。使用方式:hplsql -f script.sql hplsql -e "sql" hplsql -e "PRINT a || ', ' || b" -d a=Hello -d b=worl

2016-08-28 10:28:14 8803

翻译 LLAP

全称: Live Long and Process (LLAP)在hive2.0中添加了LLAP功能(HIVE-7926),文档jira 是HIVE-9850。配置LLAP可以参考 Configuration Properties. 中的llap部分概览在最近几年,hive的速度有了显著的提升,这要感谢社区贡献的多种特征和提升其中包括Tez和CBO,下边是我们要把h

2016-08-28 09:58:05 7553

原创 hive源码分析--row_number源码分析

前言row_nubmer使用说明: row_number接收到的数据是已经分区排序的数据, row_number() OVER (PARTITION BY c ORDER BY d)description = @Description( name = "row_number", value = "_FUNC_() - The ROW_NUMBER function as

2016-08-13 19:46:54 4246

原创 hive源码分析--导入到eclipse

先去hive官网下载源代码,我现在阅读hive2.1.0官网: http://mirrors.cnnic.cn/apache/hive/通过import maven工程后需要修改两个地方:1、修改 .project hive-exec org.eclipse.jdt.core.javabuilder org.ecli

2016-08-13 19:30:08 1374

简单的php入门,一些基础知识

一个简单的php入门,喜欢php的朋友们可以看看,一点简单点的基础

2009-06-16

离散数学(左孝凌)课后习题答案 很详细是计算机的基础课

离散数学(左孝凌)课后习题答案 很详细是计算机的基础课 课后习题 理论分析

2010-02-03

swing 简介 小例子

swing 简介 小例子 里面有一些小例子,学swing的可以看一下

2013-04-07

《MATLAB程序设计》中文版ppt教程 有源代码

详细讲解了MATLAB,是ppt,想要搞数学建模的很有用。 有源代码,很实用 想要学的不要错过呀

2010-04-27

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除