- 博客(162)
- 资源 (4)
- 问答 (1)
- 收藏
- 关注
原创 milvus可视化界面工具Attu
Zilliz 已经提供支持 Milvus 3.0 的桌面端 Attu,这个工具必须和 milvus 工具版本匹配,查看 milvus 的版本。找到最新版 Attu(新版本已经兼容 Milvus 3.0)点击测试连接,显示测试成功之后,再点击一下,才能保存连接。
2026-07-29 11:52:56
180
原创 Docker Desktop的安装
我安装的时候,经常会遇到卡顿,总是拉取不了镜像,其实原因就在于没有配置好国内镜像源。我们需要打开Docker界面,来到右上角的【设置⚙️】,点击【Docker Engine】,复制我提供的国内源代码,需要整体复制粘贴的喔!一般来说,至少几十个G啊,安装到非C盘,可以节省C盘空间,提高性能,便于备份和管理。首次启动会看到 Docker Desktop 的设置向导,来到登录账号这里,我们可以暂时跳过登录,点击"但是由于系统的问题,如果修改报错,C盘空间也比较大,不修改也能用,这里只是建议。
2026-07-05 10:01:07
422
原创 Python 同步与异步
你是否遇到过这样的场景:用 Python 写了一个下载图片的脚本,它却要一张下载完才能开始下一张,效率低得让人着急;或者写了个简单的 Web 服务,一个慢请求就能卡住后面所有用户?其实,这背后藏着 Python 中同步与异步的核心逻辑——它们决定了程序如何“安排时间”,直接影响着代码的效率。今天我们就用最通俗的语言,拆解同步与异步的本质,再通过实战案例告诉你:什么时候该用同步,什么时候该用异步,以及异步到底是怎么“提速”的。
2026-07-02 23:31:36
329
原创 doris4.1.1安装教程
Doris 2.1.10 版本 存算一体架构 (不需要依赖任何的别的技术)Doris3存算分离算(doris 的计算引擎) 存(可以使用第三方比如 hdfs s3 的)也当然支持存算一体Doris4 加入了 AI 功能Doris 概述Apache Doris 是一款基于MPP架构的高性能、实时分析型数据库。它以高效、简单和统一的特性著称,能够在亚秒级的时间内返回海量数据的查询结果。Doris 既能支持高并发的点查询场景,也能支持高吞吐的复杂分析场景。
2026-06-26 16:21:22
266
原创 Doris4.x中的AI功能
Apache Doris 是一款高性能、实时分析型数据库,深度融合文本搜索、向量搜索、AI 函数与 MCP 智能交互能力,构建从数据存储、检索到分析的完整 AI 数据栈,为 AI 应用提供一体化的数据基础设施。下表列出常见 AI 场景与 Doris 提供的对应能力,帮助快速定位适合的方案。
2026-06-26 16:15:09
277
原创 Claude Code使用教程(vibe coding)(中)
比如你想获取 bilibili 上的视频数据,就需要用到工具,这些工具可能别人已经写过了,在 github 上开源了,此时,你不需要去学习它,知道名字就可以,让 context7 去解读它,供 cc 使用。每一次关闭 claude 之后,再重新打开,对话清空了,可以采用 claude -c 启动,这样就可以恢复到上一次关闭之前的对话状态了。也可以在新打开的 claude 对话中,输入/resume ,然后选择最近的一次对话,不过这个命令可以回到很多个会话点上,非常的方便。分析需求并制定执行步骤。
2026-06-05 08:49:20
339
原创 pinecone向量数据库急速入门
pinecone - 松果英式发音为/ˈpaɪnˌkəʊn/,美式发音为/ˈpɑɪnˌkoʊn/AI 向量数据库服务Pinecone 是一家 2019 年成立于美国纽约的人工智能公司,专注于开发向量数据库技术,其核心产品通过 API 服务帮助开发者将向量搜索功能集成到应用程序中。1)什么是高维向量1. 普通低维向量(你能理解的)2 维:平面坐标 (x, y),比如 (3,5)3 维:空间坐标 (x, y, z),比如 (1,2,3)就是一组数字,有几个数字就叫几维。
2026-05-08 22:27:34
472
原创 FastAPI急速入门
FastAPI 是一个用于构建 API 的现代、快速(高性能)的 Python Web 框架,专为构建 RESTful API 而设计。FastAPI 使用 Python 3.8+ 并基于标准的 Python 类型提示,使用 Starlette 和 Pydantic 构建,能够自动生成 API 文档并进行数据校验。
2026-05-08 17:51:27
246
原创 使用Datax批量将mysql数据导入hive
试想一个场景,将mysql中的jrxd 数据库中的所有表导入到hive中的finance数据库中。
2026-04-01 09:02:02
406
原创 Spark On Hive 系统整合
Hive on Spark:Hive 为主,Spark 为辅。你用 Hive CLI/Beeline 写 HQL,Hive 解析优化,最后交给 Spark 跑任务。Spark on Hive:Spark 为主,Hive 为辅。你用 Spark SQL/Spark 代码,Spark 自己解析优化,直接读 Hive 元数据和表数据。目前Spark On Hive 是市场的主流。
2026-04-01 08:51:32
362
原创 How to Fix Your Entire Life in 1 Day 如何在一天内彻底改变你的人生(中英文最强完整版,无删减)
但如果你接纳了一个想法——无论是来自自己、老师、父母、朋友、广告,还是其他任何渠道——并且坚信这个想法是正确的,那么它对你产生的影响,就如同催眠师的话语对被催眠者产生的影响一样强大。我指的是,改变你的思维视角。而靠近第4阶段的人,才是真正渴望改变的人——你总觉得自己值得更好的生活,却又无法理清头绪,因为显然有太多因素在影响着你。你可能会觉得是自己没勇气,不是个"敢冒险的人",但真相是,你在追求安稳、可预测的生活,同时也是为了在那些同样干着没前途工作的人面前,找个借口不让自己显得像个失败者。
2026-03-13 08:51:17
2557
原创 OpenClaw安装与使用教程
他创立 Amantus Machina 公司深耕超个性化 AI 智能体,仅用 10 天,就借助 AI 工具完成了 Clawdbot 的开发,这个诞生于 2025 年 11 月的开源项目,从一开始就跳出了 “聊天机器人” 的局限,立志成为能真正动手操作本地系统、处理邮件、编写脚本、分析数据的 AI 行动者,“Clawd” 的命名,既致敬了 Anthropic 的 Claude 模型,又以 “Claw(爪子)” 寓意强大的执行能力,俏皮又贴切。需要注意,这⾥是多选,不能直接回⻋,直接回⻋会有⼀堆问题。
2026-03-10 16:13:42
1372
原创 SpringAI智能助手案例
接下来,我们就利用SpringAI发起与大模型的第一次对话。Java 领域 实现大模型开发(LLM),有两个非常重要的框架SpringAI 最低支持的 jdk 版本是 17LangChain4J 最低支持的版本是 8。
2026-01-09 14:24:03
897
1
原创 JWT权限认证快速入门
pom.xml引入起步依赖--java jwt坐标-->编写工具类JwtUtil//接收业务数据,生成token并返回//接收token,验证token,并返回业务数据.build().asMap();单元测试类JwtTest// 生成加密后的token@Testclaims.put("username", "张三");// 生成jwt代码.withClaim("user", claims) // 添加载荷。
2026-01-01 22:08:12
270
原创 Doris2.x连载文章(4)
同步物化视图是将预先计算(根据定义好的 SELECT 语句)的数据集,存储在 Doris 中的一个特殊的表。Doris 会自动维护同步物化视图的数据,无论是新增数据还是删除数据,都能保证基表(Base Table)和物化视图表的数据同步更新并保持一致,只有同步完成后,相关命令才会结束,无需任何额外的人工维护成本。查询时,Doris 会自动匹配到最优的物化视图,并直接从物化视图中读取数据。物化视图作为一种高效的解决方案,兼具了视图的灵活性和物理表的高性能优势。
2025-12-22 22:48:48
1201
原创 Doris2.x连载文章(3)
- 创建一个名为 func,参数为 INT, INT 的别名函数,实际指向的表达式为 abs(foo + bar);-- 创建一个名为 func,参数为 DATETIMEV2(3), INT 的别名函数,实际指向的表达式为 date_trunc(days_sub(foo, bar), 'day')步骤:和 hive 差不多先写代码,打成 jar,编写一个函数,指向 jar 包以及类的全路径。
2025-12-22 08:38:04
850
原创 Doris2.x连载文章(2)
最后一个列随意指定个名称占位即可。user_id=1001 TO_BITMAP(1001) --> 下标 10 --> [0,0,0,0,0,0,0,0,0,0,1,0,0,0,0,0,0,0]user_id=1001 TO_BITMAP(1001) --> 下标 10 -->[0,0,0,0,0,0,0,0,0,0,1,0,0,0,0,0,0,0]user_id=1002 TO_BITMAP(1002) --> 下标 11 -->[0,0,0,0,0,0,0,0,0,0,1,1,0,0,0,0,0,0]
2025-12-21 22:16:38
785
原创 Doris2.x博客连载(1)
Doris 2.1.10 版本 存算一体架构 (不需要依赖任何的别的技术)Doris3 存算分离 算(doris 的计算引擎) 存(可以使用第三方比如 hdfs s3 的)也当然支持存算一体Doris4 假如了 AI 功能1.1 Doris 概述Apache Doris 是一款基于MPP架构的高性能、实时分析型数据库。它以高效、简单和统一的特性著称,能够在亚秒级的时间内返回海量数据的查询结果。Doris 既能支持高并发的点查询场景,也能支持高吞吐的复杂分析场景。
2025-12-21 22:14:18
1271
原创 大数据项目阿里云抢占式服务器
获取公网 IP,通过 finalshell 连接。输入公网 IP 和密码,连接成功!找一个 2 核 8G 的配置。不足 100 元,需要充值。点击控制台,跳转到实例界面。百度中输入我的 IP。可以获取 IP 地址。
2025-12-14 20:47:20
337
原创 FlinkSQL一篇文档讲清楚
同样还是用户的一组点击事件,我们可以查询出某个用户(例如Alice)点击的url列表,也可以统计出每个用户累计的点击次数,这可以用两句SQL来分别实现。由于流中的数据本身就是定义好的POJO类型WaterSensor,所以我们将流转换成表之后,每一行数据就对应着一个WaterSensor,而表中的列名就对应着WaterSensor中的属性。在代码上,输出一张表最直接的方法,就是调用Table的方法executeInsert()方法将一个 Table写入到注册过的表中,方法传入的参数就是注册的表名。
2025-12-09 23:08:31
1321
1
原创 redis8.0集群搭建(三主三从)
集群:多个节点(服务器)组合成了一个共同的平台,对外提供相同的服务。--redis集群之前的redis主从复制,不算是集群。
2025-12-08 15:38:45
950
原创 Redis8.0哨兵模式搭建
如果是哨兵模式,jedis代码做稍微的调整,当然以前的也可以使用(但是假如主节点发生了变化,代码会连接不上)。解决的问题是,主从模式下,master节点挂掉以后,从节点无法自动升级为主节点的问题。哨兵模式解决的是:主从模式下主节点挂掉后从节点无法主动成为主节点的问题。哨兵模式是基于主从复制的,假如你还没有搭建主从模式,请移步到。另一个sentinel3.conf 修改为 26381 .将sentinel2.conf 端口修改为 26380。关于配置文件中,正式环境修改一下,咱们这里就不修改了。
2025-12-08 15:35:29
508
原创 redis8.0快速搭建主从复制
mysql是否可以主从复制?在公司里面,至少也得有两台mysql服务器(一主一从,读写分离,也可以实现数据的备份)redis也是可以实现主从复制的,好处有两个:1)数据同步,达到备份的效果 2)读写分离,减轻主节点的压力。验证主节点挂了,从节点顶上去。
2025-12-05 15:43:31
366
原创 FlinkCDC极速入门,一篇文章就够啦
CDC 是 Change Data Capture(变更数据获取)的简称。核心思想是,监测并捕获数据库的变动(包括数据或数据表的插入、更新以及删除等),将这些变更按发生的顺序完整记录下来,写入到消息中间件中以供其他服务进行订阅及消费。CDC就是监听数据库的变化,有任何风吹草动,直接获取到即可。topicafterop目标:将上面的 binlog 的 java 对象SourceRecord,提取有用的信息,封装成一个 json 字符串打印出来。
2025-12-03 15:38:58
1941
1
原创 Flink doesn‘t support ENFORCED mode for PRIMARY KEY constraint
id INT NOT NULL primary key 修改为 id INT NOT NULL PRIMARY KEY NOT ENFORCED。
2025-12-03 15:33:15
281
原创 java.lang.NoSuchMethodError: org.apache.commons.cli.CommandLine.hasOption(Lorg/apache/commons/cli/Op
今天在进行checkpoint的时候,编写代码没有问题,将代码上传至linux集群,然后运行flink任务没问题,但是带上checkpoint检查点运行就报如上问题。将本地的 windows 上的 common-cli 拷贝到服务器上。flink 集群不需要重启,直接就起作用了。答案是:common-cli版本冲突。
2025-12-02 09:12:22
224
原创 Windows版本的kafka的搭建与使用
在这个目录下:D:\tools\kafka_2.13-3.8.1\bin\windows。可以编写一个 windows 版本的 shell 脚本,点击一下,直接启动。可以创建 topic,并且收发消息进行测试,发现非常快速,测试完成。接着在桌面上点击这个 bat 文件即可。重命名 zoo.cfg。
2025-12-01 14:32:24
603
1
原创 Caused by: java.lang.NullPointerException: No key set. This method should not be called outside of a
方法中,Flink 运行时环境可能已经无法确定具体的 key,因此调用。但我 map 的前面确实使用的是 keyby 操作呀。在进行flink中状态测试的是时候,报以上问题。检查你的代码逻辑,确保。操作后的处理函数中被调用。
2025-12-01 12:02:56
329
原创 eventTime+watermarker+allowedLateness到底窗口关闭时间是什么?
此时触发了一个区间的运行 【2025-11-28 12:18:55->2025-11-28 12:19:00) ,我们不关系,而关系的是【2025-11-28 12:18:50->2025-11-28 12:18:55) 有没有关闭?得到了一个结论: 水印时间 (12:18:58)>= 区间结束时间 就会触发该区间的计算 【2025-11-28 12:18:50->2025-11-28 12:18:55)触发条件不是当前的时间-3 ,而是 最大的那个时间 -3 ,以前放的最大的事件时间是12:18:58。
2025-11-28 15:58:10
332
2
原创 使用datax将mysql数据抽取到hive分区表无数据
今天遇到一个问题,使用datax将mysql数据抽取到hive的分区表中,抽取完后没有数据,也不报错。使用datax抽取数据到hdfs(其实就是hive)导入之后,假如查询没有数据,使用修复语句修复这个表。具体是这样的,先常见ods层的表。
2025-11-24 21:33:29
295
原创 datagrip中执行sparksql插入语句报:java.io.IOException: Filesystem closed
【代码】datagrip中执行sparksql插入语句报:java.io.IOException: Filesystem closed。
2025-11-18 21:19:10
176
原创 geohash入门指南
在地球经纬度范围内,不断通过二分来划分矩形范围,通过观察gps坐标点所落的范围,来反复生成0/1二进制码。Geohash编码是一种地理位置编码技术,它可将一个gps坐标(含经、纬度)点,转化为一个字符串;gps坐标 转码成 geohash编码,这个算法不需要自己手写,有现成的工具包。通过编码后得到的字符串,表达的是:包含被编码gps坐标点的一个矩形范围;字符串长度越长,表达的精度越高,矩形范围越小,越逼近原gps坐标点;相反,长度越短,表达的精度越低,矩形范围越大;GEOHASH码的精度。
2025-11-15 22:27:22
351
原创 flume抽取kafka数据到kafka,数据无法从topicA抽取到topicB
也就是说如果想把结果发送topicB, 可以在event的header中添加 topic=topicB,
2025-11-15 22:22:02
551
原创 spark on hive中,spark远程连接创建数据库路径错误问题的解决方案
首先启动 sparksql 的远程服务:start-thriftserver 服务。使用datagrip 重新连接一下,记得刷新一下连接。修改spark下的hive-site.xml。
2025-11-12 21:09:49
235
原创 sparksql远程服务thriftserver.sh启停脚本
最近做项目的时候,经常会开启和关闭spark的远程服务,thriftserver,其实这个服务和hive的hiveserver2服务很像,不妨照着试着修改一下吧。在/usr/local/bin 下创建一个脚本:spark-service-manager.sh。
2025-11-12 21:08:02
350
原创 sqoop从hive导出mysql常见错误汇总
选择 sqoop 的原因是,datax 不能直接将 mysql 的数据导入 hive,需要提前创建表,然后将数据导入表对应的 hdfs 上。假如我导入表的时候,表中的一个日期字段是 0000-00-00 00:00:00 就会报错。比如 这个表 user_quota、dict_provinces。
2025-10-25 08:52:20
276
原创 商业银行中各个主题可视化展示
某某银行项目是一个以面向销售交易、财务、风险监控等分析主题的数据仓储项目,数据来源于柜面业务、贷款系统等各个系统以及各业务负责人员的手工导入,通过这些源数据加工汇总成分析数据,并以仪表盘、柱状图、折线图、报表等形式为甲方管理层分析决策提供数据指标方面的支持,直观的监测企业运营情况,并对异常关键指标预警和挖掘分析。
2025-10-25 08:43:01
871
大型语言模型问题求解中的思维树方法论
2025-03-11
基于自注意力机制的序列转换模型-Transformer的提出及其应用
2025-03-11
美国劳动力市场中大型语言模型的影响潜力:早期评估及其广泛应用前景
2025-03-11
自然语言处理领域的深度双向变压器预训练模型BERT及其应用
2025-03-11
基于交互式可视化的Transformer模型注意机制探索工具-DODRIO及其应用
2025-03-11
自我一致性提升自然语言模型链式思维推理能力的研究与应用
2025-03-11
深度解析注意力模型在神经网络中的发展与应用及其对解释性的促进
2025-03-11
深度解析GPT-4架构与基础设施:模型参数超1.8万亿的秘密
2025-03-11
java程序员上班那些事
2010-03-11
关于手机开发的一些想法
2011-01-05
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅