- 博客(399)
- 资源 (1)
- 收藏
- 关注
原创 5分钟搞懂词嵌入向量的底层原理
举个例子,如果在训练时,模型看到了句子“猫喜欢吃鱼”,在Skip-gram模型中,如果选择“喜欢”作为输入单词,模型便会试图预测它周围的“猫”和“吃鱼”。简单来说,Word2Vec 并不是一个具体的神经网络模型,而是一个由很多生成词向量的模型(算法)组成的词向量生成框架,或者词向量生成工具。我们通过观察可以很轻松的看出来,“猫”和“狗”的两个向量很相近,“鱼”和“跑”代表的两个向量则相差很远。相同的是,这两种方法都是让模型来学习大量的文本,以及文本中单词的使用环境来生成高质量的词向量。
2026-06-26 21:29:40
201
原创 英伟达“秀肌肉”,微软“出神经”
但如果你懂系统调用、能看懂模型量化原理、会做端云架构设计、能把业务逻辑拆解成 AI 可执行的 Pipeline,那你的身价只会水涨船高。你跑个模型、剪个视频、开几十个 Chrome 标签页,CPU/GPU轮流加班,最后的结果是——有了 AI 的 PC 就真正成为了你的个人助理,而且是信息保密的本地 AI 助理。有人说"AI PC 元年终于来了",也有人说"又是换壳加 NPU 的挤牙膏"。但前提是本地部署的模型得足够的好,围绕着模型的基建要足够扎实。过去的笔记本,架构是"CPU 管逻辑,GPU 管渲染"。
2026-06-03 10:36:18
207
原创 5分钟入门卷积算法
于是,在深度学习的网络中,每个黑点(神经元)都有一个与之对应的数字(实际的网络中,不是0或者1这样简单的数字,而是一些复杂的数字,这里仅仅是为了说明),这些数字,在深度学习中,我们称之为。4x4的方格上移动的灰色阴影,那个3x3的像素方格就是卷积核,可以把它理解为人眼此时聚焦看到的区域(称之为感受野,人眼的视野),只不过,这个示意图中每次看到的都是一个3x3的像素方格!整个推理过程你应该注意到了一件事,所有的黑点都可能是有记忆的,只不过记得东西各有不同,有的认识猫,有的认识狗,就像下面这样。
2026-06-01 22:16:50
724
原创 AI 会吃了天涯吗?
而大模型训练时,会不断抹平个性、趋同表达,再通过二次生成,把天涯里的故事、观点、行文风格扩散到全网。原本独一无二的精华内容,会变得随处可见,稀缺性大幅下降,用户也就没有必要再专门回到天涯阅读原文。天涯帖子的魅力,很多在于小众观点、冷门知识、个性化表达,这些都是它区别于其他平台的独特之处。天涯真正的核心资产,不是界面,不是用户情怀,而是海量长文本讨论、深度观点和真实的民间表达。从这个角度看,AI不是在赋能天涯,而是在慢慢吃掉它的内容壁垒。说到底,数据可以喂给AI,但社区的灵魂,AI替代不了。
2026-06-01 21:02:02
224
原创 5分钟搞懂矩阵乘法的本质
假设输入的数据是一张图片,那么图片中一个通道维度代表图片的一个特征,通过矩阵乘法对通道进行乘累加操作,便可以实现特征之间的整合和再创。我们知道矩阵乘法的规则是,左矩阵的第一行乘以右矩阵的第一列,得到第一个值,第一行乘以第二列得到第二个值,…卷积和全连接算法,或多或少都是一种矩阵乘法,将其转换为矩阵乘法之后,那么和权值矩阵对应的另一个矩阵,就是输入数据。矩阵乘法,通过相乘累加的操作,实际上是对资源(鸡尾酒的原料)的整合和再创(创造出了新的口味,如自由古巴)。
2026-05-26 18:09:16
223
原创 他把 Claude Code 玩通关了
大家好,我是董章鱼。Claude Code 的作者 Boris 最近分享了一份他们团队内部使用 Claude Code 技巧的帖子。这个帖子总结了他们自己内部使用 Claude Code 的技巧,Boris 没藏着,一股脑的全分享出来了。我把它们看了一遍,发现非常有价值,这里挑几条我感觉最有价值的技巧跟大家分享一下。
2026-04-23 12:36:02
426
原创 马斯克在用炸火箭的方式训练 AGI。。。
大家好,我是董章鱼。昨天马斯克在 X 平台上放话了,说 Grok 5 就是 AGI(通用人工智能)。他没有弯弯绕,简单直白的说了:Grok 5 可以实现 AGI。作为一名一直在跟 AI 打交道的开发者,我读到这条消息第一反应不是兴奋,而是想,老马是真藏了什么牌,还是故弄玄虚为 Grok 4.x 版本造势?
2026-04-22 10:07:58
512
原创 库克不再担任苹果 CEO,附全员信
大家好,我是董章鱼。苹果官宣 CEO 换帅了。从今年9月开始,现在的苹果CEO库克不再担任 CEO ,由硬件工程高级副总裁 John Ternu 接任。
2026-04-21 10:01:25
403
原创 荣耀一个做手机的,凭啥机器人夺冠?
大家好,我是董章鱼。昨天机器人马拉松,荣耀的机器人"闪电”以 50 分 26 秒的用时夺冠。目前人类的半马世界纪录是 56 分 42 秒,由 Jacob Kiplimo 保持。荣耀的机器人,跑赢了人类最快的半马运动员,快了 6 分钟。虽然机器人是烧电的,人是吃饭的,我们不能直接这么对比。但是,如果再看一下去年的成绩,就知道今年机器人进步有多大了。去年首届机器人马拉松比赛,冠军天工用时 2 小时 40 分 42 秒,而且去年只有 6 支队伍完赛。
2026-04-20 11:54:10
27740
原创 DeepSeek 开始融资,又打了一手新牌
大家好,我是董章鱼。今天一起床,就看到一条消息:DeepSeek 正在寻求首次外部融资,估值不低于 100 亿美元,计划筹集至少 3 亿美元。那个曾经坚决不融资的 DeepSeek,终于松口了。而松口的原因,从一些资料上看也能看出一些端倪——希望彻底脱离英伟达生态,全面转向华为昇腾芯片。
2026-04-18 10:16:25
249
原创 MinMax 发布会进化的 AI 助手,有点强
大家好啊,我是董章鱼。这两天 MiniMax 上线了一款产品叫 MaxHermes,官方定义是全球首个云端沙箱 Hermes(文末有使用链接)。这个产品的核心卖点只有一句话:AI 会自我进化,越用越强。
2026-04-18 09:38:23
327
原创 Opus 4.7 来了,我并不建议你升级
大家好啊,我是董章鱼。Anthropic 正式发布了 Claude Opus 4.7,距离上一代 Opus 4.6 才过去了两个多月。看完官方公告和社区的真实反馈后,说实话有点"五味杂陈",值得聊一聊。先说这次模型升级的硬指标。Opus 4.7 的上下文窗口扩展到了 100 万 token,最大输出 128k token。视觉分辨率从约 1.15MP 提升到了 3.75MP,在 SWE-bench Pro 编程测试中得分从 53.4% 跃升至 64.3%。
2026-04-17 20:35:02
452
原创 封了几百万个账号的 Claude, 路走窄了
大家好啊,我是董章鱼。昨天 Anthropic 发了一篇文章,标题是"Claude 上的身份验证"。文章内容很简单:从现在起,部分用户在使用 Claude 的功能时,会被要求提交身份证件,并实时自拍进行人脸比对。人脸验证由第三方公司进行。Anthropic 说这是为了"防止模型滥用、履行法律义务"。很明显,这是要看你的身份证了。因为中国大陆一直在 Claude 服务条款的"不支持地区"名单上。持有中国身份证的用户,大概率是通不过这个验证的。
2026-04-17 10:23:39
478
1
原创 放风的 Claude 你怕不怕
大家好啊,我是董章鱼。这两天 AI 圈出了一件非常荒诞的事:两个还没发布的模型,在社交媒体上打的不可开交。一个是 Anthropic 的 Claude Mythos,另一个是 OpenAI 代号为 Spud 的神秘模型。这两个模型目前都还没正式上线,但国内外社交媒体上的讨论热度已经拉满了。
2026-04-16 09:56:34
324
原创 Claude Code 一夜重构
大家好啊,我是董章鱼。昨天 Anthropic 官宣了 Claude Code 桌面端的重构计划,同时上线了一个名为 Routines 的新功能。把这两件事放在一起看,对使用 AI 工具的开发者来说,就有点意思了。桌面端的重构:不用来回切窗口重构之后的 Claude Code 桌面端最大的变化是引入了侧边栏管理系统,开发者可以在同一个窗口内同时跑多个 Claude 会话,并排显示。也就是说,你可以一边让 Claude 修 Bug,一边在另一个窗口生成测试用例,不用再在命令行和编辑器之间反复横跳了。
2026-04-15 18:48:21
481
原创 拼多多才是真正的职场
大家好啊,我是关注大厂的熊猫。最近看到不少人在讨论拼多多的工作体验,正好熊猫认识一位在拼多多工作过一段时间的朋友,他用四个字总结了自己的感受:痛并快乐着。今天就来聊聊他眼中真实的拼多多。
2026-04-15 18:46:38
218
原创 调研了下2026年AI岗位的薪资情况。。。
比如智能体开发、AI工具链、垂直领域的AI解决方案,这些方向对实际工程能力和行业理解的要求更高,反而是传统开发者转型的机会。优先录用的话,月薪27K-30K,另外有 3W 签字费和价值 6W 的股票,总包能到40W-50W。一方面,企业对AI人才的需求还在增长,另一方面,AI相关专业的毕业生也在快速增加,竞争会越来越激烈。先说结论:AI 岗位的薪资确实在涨,而且涨得很厉害,但门槛也在同步拉高,不是谁想进就能进的。如果是卓越录用,月薪30K-32K,签字费5W,股票6W,总包可以超过50W。
2026-04-01 10:07:30
427
原创 人人都用智能体,但别忘了 Harness 才是重点
如果把智能体当做一个公司实习生,他刚来公司工作,你只给他提了一个需求:“帮我把A产品做好”,而不给他产品对应的调研报告、需求手册,甚至连如何叫“把产品做好” 的“好”的都不说。在你发现智能体变笨的时候,你的解决办法可能是为它提供更多有用的素材、更鲜明的案例、更有用且贴合自己需求的技术方法。将这些材料分目录整理,让智能体在需要的时候,知道该去哪里查资料、该如何不断迭代产品,这才能发挥智能体的最大价值。智能体也是这样,在进行某项任务之前,围绕着这个任务,给智能体提供全面、结构化的工作框架,它的工作会越干越好。
2026-03-25 11:55:49
383
原创 大模型连载8:词向量如何表示近义词?
在进行文本处理之前,文本转换为词嵌入向量是必须的,并且要转换为具有多个维度的高维向量,以此来衡量文本的语义。在GPT-4的词嵌入空间中,推荐使用余弦相似度来衡量向量的“距离”,这是因为 GPT-4 把嵌入向量标准化到了1,从而使得余弦相似度与欧氏距离在衡量向量相似性上具有一样的排名。在其他的场景下,也可以使用余弦相似度这一指标来衡量向量的相似性。比如衡量两个文本或图像是否相似,直接计算其余弦相似度,也是一种简单有效的办法。参考:^维基百科余弦相似度:董章鱼的公开 AI 空间。
2026-03-16 21:01:17
356
原创 大模型连载7:词向量的通俗理解
首先,词嵌入的作用,是将整数(这里就理解为 token ID 就好了)转换为一个固定大小的向量。这些转换过程可以通过模型的大规模训练来完成。转换完之后的向量可以捕获以及表达 token 之间的复杂关系,比如语义关系、语法关系等。这些向量通常被称为嵌入向量,用多维数据进行表示,每一维都代表 token 的一些隐含特征。举个例子,假设 cat 转换为词嵌入向量后为 [100, 200, 300]。这里是为了举例子,用了一个仅包含3个特征(通常情况下为512个特征)的向量。
2026-03-10 20:50:06
331
原创 大模型连载6:词汇表用来做文本到数值的转换
前面几节一直在介绍 token 相关的内容,相信你看到这里,对 token 肯定很了解了吧。如果对 token 本身还有其他疑问,可以在本文下留言。本节开始,进入下一步骤,由 token 到数值的转换。以上3个步骤中,每一个其背后都有重要的意义和作用。本节先介绍第一个步骤:文本到数值的转换。
2026-03-09 21:52:49
418
原创 大模型连载5:GPT4 的 token 可视化网站
在你了解了 token 的概念以及对文本进行分词的大致过程后。本节给出一个使用 GPT4 模型(当前 OpenAI 最强大的模型)拆分 token 并将拆分结果进行可视化的网站,你可以去这个网站上测试一下分词效果。
2026-03-08 10:42:59
278
原创 大模型连载4:文本 token 化的过程是怎样的
前面两节分别通过两个代码示例展示了模型将文本转换为 token 之后是什么样的,希望你可以对此有一个感性的认识。本节来简要介绍一下将一个连续的文本转换为 token 序列的大致过程,这个过程被称为,也叫。在你没了解这方面的知识之前,如果让你实现一个类似的算法,你会如何来实现呢?我想你可能最先想到便是。
2026-03-07 21:21:05
382
原创 大模型连载3:利用 GPT2 将文本 token 化
在上一节,利用 BERT 模型将一个文本进行了 token 化。那你可能会问,是不是所有的模型将同一个文本 token 化之后,结果都一样呢?这是因为不同的模型对文本进行 token 化时使用到的算法不一样。在 BERT 中用到的是 WordPiece 算法,而 GPT 系列模型将文本进行 token 化时,使用的则是 Byte-Pair Encoding(BPE)算法,这两种算法虽然不是本专栏的重点,但后面也会专门来讲解一下。
2026-03-06 22:58:48
329
原创 9、传统 CV 之图像分割(大津算法)
在图像处理和计算机视觉中,"前景"和"背景"是指图像中的两个主要部分。前景:前景是图像中引起人们兴趣或希望被重点关注的区域,通常指图像中的主要目标,或者在图像处理中你想要从图像中提取或识别的对象。背景:简单理解就是除了前景之外的其余图像区域,作为陪衬的、通常是图像中次要的区域。举个例子,上述图片一只猫在一个花园中,那么照片中的猫就是前景,而周围的花园景色就是背景。
2026-03-04 19:35:53
345
原创 AI 视觉连载8:传统 CV 之边缘检测
边缘检测是通过一些算法来识别图像中物体之间或者物体与背景之间的边界,也就是边缘。图像边缘通常是图像中灰度变化显著的地方,标志着不同区域的分界线。在一张图像中,边缘可以是物体的实际边界,也可以是纹理、颜色或亮度等特征变化比较明显的位置。边缘检测有助于提取图像的结构信息,是许多计算机视觉和图像处理任务的基础,例如物体识别、图像分割和目标跟踪。比如下面这张图片,我用红笔粗略的画出了一些物体的边缘,猫耳朵和背景很明显的边缘,椅子和背景以及椅子和猫咪的边缘等。
2026-03-03 22:19:41
371
原创 大模型连载2:初步认识 tokenizer 的过程
在上一节,我们介绍了 token 的概念。你可以这么认为, token 是自然语言处理场景(如文本生成、AI聊天)下,AI 模型能够处理的最小单位。在计算机视觉中,模型以像素为单位来处理图像像素之间的关系,而语言模型则是以 token 为单位理解 token 之间的关系。下面通过一个小例子,来展示一下语言模型是如何将一段文本转换为 token 的,以及模型将文本转换为 token 之后是什么样子。通过这个例子,希望你可以对模型处理 token 的过程有一个感性的认识,。
2026-03-02 21:47:31
787
原创 大模型连载1:了解 Token
在计算机相关领域中,token 通常是指一串字符或符号。比如微信公众平台的密钥,就被称作一个 token,其实就是一长串的字符串。在人工智能领域,尤其是自然语言处理(Natural Language Processing, NLP)领域中, “token” 指的是处理文本时所能处理的最小单元或基本元素。它可以是一个单词、一个词组、一个标点符号、一个子词或者一个字符。
2026-03-01 22:55:04
869
原创 AI 视觉连载7:传统 CV 之高斯滤波实战
本节一起绘制一个可视化的高斯滤波器,同时对一个彩色图像增加高斯噪声,最后通过一个高斯滤波器对图像进行降噪处理。就像上节说的那样,滤波不是学习重点,下面通过实操了解下原理即可。
2026-02-27 22:45:04
356
原创 零基础带你用 AI 搞定命令行
其他再复杂的任务,只要你能用“人话”描述清楚,这个 copilot cli 就可以帮你搞定,包括但不限于:文件整理(移动、删除)、代码修改、项目测试以及 debug 等,这些复杂功能你可以边用边发掘。你可以把它当做一个能听懂人话的命令行管家,有了它,你不用再记那些绕口的命令和参数,说句人话,就可以让这个 AI Agent 帮你搞定所有的终端操作。第一次打开时,会问题是否信任当前目录下的所有文件,一般选择 Yes 就可以,这样 copilot cli 工具就可以拥有对该目录下文件的操作权限。
2026-02-27 21:22:12
1184
原创 AI 视觉连载6:传统 CV 之高斯滤波
这一节在上一节的基础上,再进阶一下,来了解一下什么是高斯滤波。首先,如上一节所说,均值滤波是利用一个窗口在图片上滑动,每次都计算窗口内能看到的像素的平均值,然后将平均值作为滤波的输出,从而可以起到平滑图像、去噪点的作用。有没有发现,此时并没有特别说明这个窗口是什么,以及窗口是否带有参数。在介绍高斯滤波之前,进一步说明一下均值滤波的这个窗口。上图是均值滤波示意图,中间一个 3x3 的正方形即为均值滤波的窗口。
2026-02-25 22:11:39
258
原创 AI 视觉连载5:传统 CV 之均值滤波
估计在很多场合你都听说过滤波的概念。图像滤波是图像处理中最常见的一种操作,它的主要目的是改变图像中的某些特征,比如去除图像中的噪声。滤波操作的是通过一定的数学算法来完成的,最常见的滤波方式包括均值滤波、中值滤波和高斯滤波。从名字就可以看出,均值滤波是取一些像素值的平均值作为滤波的输出,中值滤波便是取一些像素的中值作为滤波后的输出。高斯滤波就稍微复杂一些,人们特意设计了一个符合高斯分布的滤波器,完成对图像像素的高斯滤波运算。以均值滤波为例,它是取图像中的哪些像素值来计算平均值呢?
2026-02-24 21:29:57
346
原创 AI 视觉连载4:YUV 的图像表示
上一篇描述了 RGB 这种彩色图像表示,这一节我们再看另一种图像表示:YUV。YUV 和 RGB 不同,区别主要在于颜色信息的存储和传输上。
2026-02-12 20:47:52
73
原创 AI 视觉连载3:RGB与通道
在的最后,给出了一个由彩色图片转成灰度图的示例,并且通过获取了图片的格式:彩色图片获取到的格式为 RGBA,灰度图为 L。这一节再介绍一下 RGB 图片以及通道的概念。举个例子——在很多时候,对AI神经网络中的一些算法做工程化实现,或者做性能优化,除了关注算法本身之外,还会关注数据存储格式。一般在 pytorch 中(一个AI模型框架),数据的存储格式 NCHW, C指代的就是通道(channel), 如此一来,对于需要在通道维度做归一化(如 reduce)的算法,是很不友好的。
2026-02-11 23:51:09
895
原创 AI元年过去了
现在 Agent 的能力,毫不夸张的讲,完全可以替代中等水平程序员,有了 AI,一个人同时做多件事也成为了可能。写这个程序的过程中,AI 大概贡献了 30% 的代码量,并且程序的基础框架是 AI 搭建的。2025年的时候很多人说是AI编程的元年,没错。第一件事,是我花了大概3天的时间,写了一个文档管理程序,用来管理我多如牛毛的文档。AI 编程的质量随着 AI 模型能力的提升,早已经比 2025 年年初大了一大截。在未来徐徐展开的 AI 纪年中,最先而且最容易被替代的,就是程序员。
2026-02-11 17:55:24
343
原创 AI 视觉连载2:图像识别之灰度图
上一篇文章中说到:像素是计算机视觉任务中的原材料。很多图像处理任务以像素的局部性为基础,在不同尺度下完成图像特征的提取。你可以这么理解这些图像的特征,小的特征可能为图像的细节,大的则为图像轮廓。现在我们来了解一种十分简洁但非常高效的图像表示方法——灰度图。了解灰度图,有助于我们更好的了解图像的特征。灰度图是一种只包含亮度信息而不包含颜色信息的图像。在灰度图中,每个像素的亮度通过一个灰度级别来表示,通常用整数值表示,范围从0(黑色)到 255(白色)。解释一下为什么是 0 - 255。
2026-02-09 21:10:24
173
原创 AI视觉连载1:图像识别之像素
今天就先开个头,从像素说起,说到了像素具有局部连接性的,人眼识别图像也是通过获取像素的局部连接性信息来完成的。幸运的是,卷积这一算法,可以很好的模拟这一过程。最后,为了使计算机更高效的处理图片数据,引出NHWC的图片数据表示方法,所以,之后我们说图片,不仅仅局限于图片的长和宽,还多了一个维度信息,那就是channel。下一篇会继续,聊聊图像的色彩空间。为什么有了RGB,还需要YUV?什么时候用RGB, 什么时候用YUV?以及图像压缩对于深度学习来说,意味着什么?
2026-02-08 22:15:38
63
原创 适合小白的 DeepSeek 基本原理介绍
昨天 DeepSeek 发布了一篇文章,介绍 DeepSeek AI 大模型的基本原理和训练相关的知识。文章的内容写的比较通俗易懂,比较适合想“粗略地了解” DeepSeek 大模型技术的朋友。我将其中一部分内容摘抄整理了一下,希望可以帮助到想了解 DeepSeek 甚至 AI 大模型技术的朋友。
2025-09-02 08:37:30
793
原创 5分钟搞懂大模型微调的原始能力退化问题
微调是指在一个已经训练好的大模型基础上,用特定领域的数据再重新进行训练,让它更适应某个具体任务。所以说,微调本质上也是一种“训练”的过程。比如,你拿一个已经预训练好的语言模型,喂给它一堆法律文档,想让它变成“法律专家”;或者喂给他一些医疗数据,让它学会回答医学问题。这个过程其实就是在教一个“通用的语言模型”重点强化某一技能。模型的原始能力呢,其实就是大模型在微调之前具备的通用的知识和技能。
2025-08-27 21:18:03
1234
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅