- 博客(1773)
- 资源 (17)
- 收藏
- 关注
原创 别让大模型“顺序盲”:一文读懂旋转位置编码(RoPE)
RoPE 没有神经网络层,没有可学习参数,只靠一段三角函数和向量旋转,就解决了 Transformer 诞生十年来的位置难题。我们真正关心的,从来不是“第几个词”,而是“词与词之间隔了多远”。factor: 32不妨想象一下:成千上万个微型指南针正在序列里悄然转动,用相对的角度,默默编织出语言的秩序。📌延伸思考:RoPE 是 1D 的,如果换成图像/视频/多模态网格,该怎么旋转?(答案:RoPE-2D / 多轴频率解耦,下期聊)💬 你在长上下文微调中遇到过哪些 RoPE 相关的诡异 bug?
2026-04-12 22:30:24
742
原创 深度解析大模型中的旋转位置编码(RoPE):从数学直觉到工程实践
RoPE 的成功并非偶然。它将位置信息从“额外添加的噪声”转化为“向量空间的几何变换”,在数学简洁性、工程兼容性与语义表达力之间找到了罕见的平衡点。随着 1M+ 上下文、多模态对齐、稀疏 Attention 的演进,RoPE 仍在持续进化(如 RoPE-2D、可学习频率基、与 SSM 的混合架构等)。理解 RoPE,不仅是掌握一个位置编码技巧,更是理解现代大模型如何将结构化先验优雅地嵌入到数据驱动的优化框架中。当你下次在配置文件中写下。
2026-04-12 22:19:47
978
原创 AI 词向量模型详解:让机器理解词语的奥秘
词向量模型:让机器理解词语的语义关系 本文系统介绍了词向量技术的发展与应用。传统One-Hot编码存在维度灾难和语义缺失问题,而词向量通过低维稠密向量实现语义编码。重点讲解了Word2Vec模型(包括CBOW和Skip-Gram架构)及其优化技术(层次Softmax和负采样),并提供了Python实现示例。同时介绍了GloVe模型如何结合全局统计与局部上下文信息,通过共现矩阵构建更优的词向量表示。这些技术使计算机能够捕捉词语间的复杂语义关系,支持"国王-男人+女人≈女王"等语义运算,为自
2026-04-08 23:05:28
667
原创 AI:词向量模型详解(Word Embedding)
词向量(Word Embedding)是自然语言处理中的基础技术,将词语映射为低维实数向量以捕捉语义关系。经典模型包括Word2Vec(CBOW/Skip-gram架构)、GloVe(融合全局统计)和FastText(引入子词信息)。训练过程涉及预处理、超参数调优等步骤,评估分内在(词相似度/类比)和外在(下游任务表现)两类。静态词向量存在一词一义、上下文无关等局限,现逐步被动态上下文模型(如BERT)取代,但在资源受限场景仍有价值。建议根据任务需求选择模型,注意领域适配和维度选择。词向量技术虽演进为更复杂
2026-04-08 22:58:11
646
原创 AI:词袋模型(Bag of Words, BoW)详解
词袋模型(BoW)详解摘要 词袋模型是NLP基础文本特征表示方法,本质是特征提取技术。其核心思想是将文本视为无序词集合,统计词频生成固定维度的数值向量(文档-词项矩阵)。典型流程包括预处理、构建词典、向量化和矩阵化。常见变体包括二元词袋、TF-IDF加权和N-gram扩展。 优点在于简单高效、可解释性强,适合传统机器学习;缺点包括维度灾难、丢失词序语义。应用场景涵盖文本分类、信息检索等。现代应用中,词袋仍作为基线模型,与深度学习方案形成互补。代码实现可通过scikit-learn的CountVectoriz
2026-04-08 22:51:57
592
原创 AI:sigmod函数详解
摘要:Sigmoid函数是深度学习中经典的激活函数,表达式为σ(x)=1/(1+e^-x)。其核心特性包括值域(0,1)、严格单调递增、平滑可微,且导数具有自指性质σ'(x)=σ(x)(1-σ(x))。主要应用于二分类输出层、概率建模和门控循环网络。虽然输出表示概率直观,但存在梯度消失、非零中心化、计算成本高等缺陷。现代深度学习中,Sigmoid多用于输出层和门控机制,隐藏层推荐使用ReLU等更高效的激活函数。理解Sigmoid的数学特性及局限性对网络设计具有重要意义。
2026-04-08 21:33:43
534
原创 首发阿里云龙虾JVS Claw生成的《中美 AI 行业全产业全链路对比调研报告》
维度美国优势中国优势整体差距基础设施GPU 垄断 (95%+)、云计算领先应用场景丰富、部署成本低芯片差距 3-5 年框架工具PyTorch/TensorFlow 主导百度 PaddlePaddle 国产替代生态影响力差距明显大模型GPT-4/Claude 领先通义千问/文心一言追赶能力差距缩小至 1-2 年应用落地ToC 创新活跃ToG/ToB 规模化能力强各有所长人才储备顶尖人才聚集工程师红利、规模大高端人才差距明显资本投入风险投资活跃政府引导基金为主市场化程度美国领先。
2026-03-25 14:41:25
849
原创 AI精读《Attention Is All You Need》
《Attention Is All You Need》提出了革命性的Transformer架构,完全基于注意力机制,摒弃了传统RNN/CNN。该模型在机器翻译任务上达到SOTA性能,训练效率显著提升(12小时/8 GPU)。核心创新包括多头注意力机制和位置编码,解决了长距离依赖问题。实验显示Transformer在WMT数据集上表现优异(BLEU 28.4 EN-DE),且注意力可视化揭示了其捕捉语法关系的能力。这一突破性工作为后续BERT等模型奠定了基础,开创了NLP领域的新范式。
2026-03-13 00:31:32
641
原创 OpenClaw 本地运行到底花不花钱?一次把话说清楚
问题答案本地运行免费吗?看模型:本地模型免费,商业模型收费OAuth 免费吗?OAuth 只是登录方式,与收费无关现在为啥不扣费?Qwen Portal 有免费额度能读我密码吗?不能,安全设计不允许权限边界在哪?工作区内自由,系统级受限,外部操作需授权。
2026-03-11 00:51:17
1256
原创 OpenClaw 本地运行与权限详解 —— Q&A 整理 (整理者:龙虾Rook)
✅ 读写工作区文件✅ 调用大模型 API✅ 执行 Shell 命令(受策略限制)✅ 管理 OpenClaw 配置✅ 创建/管理子代理和 Cron 任务❌ 访问系统密码/Keychain❌ 读取其他应用私有数据❌ 未经同意发送外部消息(邮件、推文等)❌ 访问摄像头/麦克风❌ 修改系统级配置问题答案本地运行是否免费?取决于模型:本地模型免费,商业模型按 token 计费OAuth 是否免费?OAuth 只是认证方式,与费用无关当前为何不收费?
2026-03-11 00:10:57
1649
原创 OpenClaw “龙虾” 养活啦~
我刚才调模型能成功,说明 OpenClaw 可能用的是浏览器当前的登录状态(你打开 https://chat.qwen.ai 登录后的 Cookie/会话),而不是本地存储的 token。你现在去 https://chat.qwen.ai 看看登录的是哪个账号?简单说: 用的是你在浏览器里登录的 Qwen 账号。用带 token 的 URL 重新打开了!🏰 —— 你的 AI 助手兼数字守护者。你用了我的什么账户在调用token?有什么想让我帮忙的?随便用哪个都行,或者一起用!两个都可能同时一起用的吗。
2026-03-09 23:29:21
271
原创 OpenClaw深度技术指南
OpenClaw代表了AI代理范式的根本转变——从被动的对话工具转变为主动的执行系统。工程优雅性:分层架构、插件化设计、事件驱动模型隐私可控性:本地优先设计、数据主权完全掌握生态开放性:开源社区驱动、快速迭代更新随着AI Agent元年的到来,OpenClaw正在重新定义"AI能帮你做什么"的边界。从一人开发团队到7×24小时自动化运维,从金融交易到内容创作,OpenClaw展示了AI作为"数字员工"的无限潜力。
2026-03-06 00:23:25
1979
原创 OpenClaw:从“聊天”到“干活”
OpenClaw的爆红与争议,本质上是AI大模型时代,开源工具爆发与平台规则收紧的必然碰撞。它既有“自主执行、高效提效”的核心优势,也存在“安全隐患、合规风险”的明显短板;既让我们看到了AI智能体的巨大潜力,也提醒我们,技术的发展从来都不是“一刀切”的追捧或否定。对于普通用户而言,OpenClaw可能还不是一个成熟的生产力工具,但它代表了一个明确的趋势:AI正在从“对话”走向“执行”,从“工具”走向“劳动力”。随着技术的不断成熟和安全机制的完善,未来的AI助手或许真的能成为我们工作中不可或缺的数字同事。
2026-03-06 00:15:37
607
原创 macbook 安装Java
摘要: 在 MacBook 上安装 Java 的四种主流方案: Oracle JDK:官网下载 DMG 安装包,适合企业项目; Homebrew + OpenJDK(推荐):通过 brew install openjdk@版本号 安装,支持多版本管理; SDKMAN:使用 sdk install java 灵活切换版本,适合开发者; JetBrains Runtime:IDE 内置,适合 JetBrains 工具用户。 验证与问题解决: 通过 java -version 检查安装; M1/M2 芯片优先选择
2026-03-06 00:03:22
1127
原创 Mac sdkmanmac java 8.0.472-amzn 和 8.0.482-zulu 两个版本有什么区别,装哪个好
Amazon Corretto和Azul Zulu的Java 8版本核心区别在于厂商、更新频率和平台优化。Zulu提供更频繁的月度更新和更好的macOS优化,适合桌面开发;Corretto则深度集成AWS服务,适合云部署。性能差异微小,选择建议:macOS用户优先Zulu(8.0.482),AWS环境选择Corretto(8.0.472)。两者均通过TCK认证,支持ARM架构,可通过SDKMAN轻松安装管理多版本。
2026-03-05 23:57:31
614
原创 Mac java 版本17.0.18-zulu 和17.0.18-fx.zulu 有什么区别
**Zulu JDK 提供标准版和带 JavaFX 的版本。标准版包含完整的Java开发工具,适用于服务器和命令行应用;而fx.zulu版本额外集成了OpenJFX运行时库,支持图形界面开发。主要区别在于是否包含JavaFX组件,文件大小相差约30-50MB。选择标准版适合后端开发,选择fx.zulu则适合桌面应用开发。对于不确定需求的开发者,推荐安装fx.zulu版本以获得更全面的开发支持。
2026-03-05 23:56:00
494
原创 AI:反向传播算法里程碑论文《Learning representations by back-propagating errors》逐段翻译与精读
我们一起来逐段精读并讲解这篇深度学习的奠基之作——《Learning representations by back-propagating errors》。
2025-12-14 16:24:48
974
原创 AI论文《Learning representations by back-propagating errors》反向传播算法解读
这篇1986年发表在《Nature》上的开创性论文提出了反向传播算法,解决了多层神经网络训练的关键难题。论文通过链式法则计算误差梯度,使网络能够自动学习隐藏层表征,成功解决了XOR等非线性问题。实验证明网络不仅能分类,还能学习抽象关系。该工作复兴了神经网络研究,为深度学习奠定了基础,虽然存在梯度消失等局限,但其核心思想至今仍是训练现代神经网络的标准方法。论文将数学工具创新应用于机器学习,推动了AI从手工特征设计向自动表征学习的范式转变。
2025-12-14 16:12:08
1411
原创 AI反向传播的里程碑论文《Learning representations by back-propagating errors》
这篇发表于1986年的论文《Learning representations by back-propagating errors》(通过反向传播误差学习表示),由David Rumelhart、Geoffrey Hinton和Ronald Williams合作完成,是深度学习领域的一座里程碑
2025-12-14 16:10:11
1561
原创 AI神经网络中的导数
导数在神经网络中量化了损失函数对参数变化的敏感程度,是反向传播算法的核心数学工具。它通过切线斜率表示函数瞬时变化率,指导参数调整方向与幅度。前向传播中,激活函数的导数影响信号传递;反向传播通过链式法则高效计算各层梯度,实现参数更新。从单变量导数到多变量梯度,导数揭示了损失函数的最速下降方向。现代框架利用自动微分技术简化求导过程,而梯度值还能诊断训练问题(如梯度消失/爆炸)。作为优化基础,导数如同"导航仪",指引神经网络沿着误差轨迹精准优化参数,是深度学习高效训练的关键所在。
2025-12-14 15:57:27
1054
原创 AI:深度学习中反向传播中的链式法则和梯度
反向传播中的链式法则是神经网络训练的核心数学工具,它将复杂的梯度计算分解为逐层的简单计算。通过从输出层误差反向推导各层参数的更新方向,链式法则实现了高效训练。其核心公式将全局导数分解为局部导数的乘积,避免了直接计算高维参数的复杂性。具体应用中,误差信号通过权重矩阵转置逐层反向传播,激活函数导数调控传播强度。链式法则的计算复杂度仅为O(N),远优于传统方法的O(N^2),这得益于中间结果的重用。该法则不仅指导理论推导,也是现代自动微分框架的实现基础,使深度学习模型能够沿着误差信号精准调整参数。
2025-12-14 15:55:04
1212
原创 AI:深度学习的前向传播和反向传播
深度学习通过前向传播和反向传播实现模型训练。前向传播从输入层到输出层逐层计算,通过线性变换和激活函数生成预测结果并计算损失。反向传播则利用链式法则从输出层反向传递梯度,更新权重参数以最小化损失。二者形成完整迭代循环:前向计算预测,反向优化参数。现代框架通过自动微分简化了反向传播的实现,理解这一机制对网络设计、调试和优化至关重要。
2025-12-14 15:53:57
1254
原创 AI 从线性回归到神经网络那些事
我们从简单的线性回归出发,一步步深入到复杂的神经网络,这一演进过程展现了机器学习模型的内在逻辑和发展脉络。通过这条路径,我们可以理解每个环节的必要性和连续性。表:从线性回归到神经网络的核心概念演进模型关键创新解决的问题遗留的挑战线性回归建立特征与目标的线性关系连续值预测无法处理非线性与分类问题逻辑回归使用Sigmoid函数输出概率二分类问题本质仍是线性模型激活函数引入非线性变换拟合非线性关系单层模型表达能力不足神经网络多层非线性变换组合复杂函数逼近。
2025-12-10 23:19:19
1071
4
原创 AI 深度学习神经网络在线演示网站
摘要:本文汇总了多个深度学习神经网络交互式演示网站,帮助初学者直观理解AI概念。包括TensorFlow Playground(基础神经网络)、CNN Explainer(卷积网络可视化)、GAN Lab(生成对抗网络)等工具,涵盖从入门到专业的不同需求。建议初学者从TensorFlow Playground开始,视觉方向学习者使用CNN Explainer,研究者可选用Netron分析模型结构。这些工具通过可视化交互降低学习门槛,使抽象的深度学习原理变得生动易懂。(149字)
2025-11-08 22:26:48
1661
原创 AI: 激活函数ReLU
ReLU激活函数是深度学习的核心组件,其定义为f(x)=max(0,x),具有计算高效(比Sigmoid快6倍)和缓解梯度消失的优势。主要变体包括Leaky ReLU和PReLU,用于解决神经元死亡问题。实际应用中建议配合He初始化,保持30-50%的激活率。ReLU是CNN、Transformer等模型的默认选择,但不适用于输出层。典型问题如神经元死亡可通过Adam优化器、BN层或改用ELU/Swish来改善。
2025-11-08 22:24:24
1009
原创 AI神经网络的“灵魂” 常见激活函数 ReLU Sigmoid Tanh
摘要:本文深入介绍了三种常见激活函数(ReLU、Sigmoid、Tanh)的特性与应用。ReLU计算简单、缓解梯度消失,是CNN等现代网络隐藏层的首选;Sigmoid输出(0,1)适合概率输出,但存在梯度消失问题;Tanh零中心化(-1,1),在RNN中表现较好。文章通过函数公式、导数范围、优缺点对比及可视化代码,阐明了不同场景下的选择策略:隐藏层优先ReLU(或变体),输出层根据任务选择Sigmoid(分类)或线性(回归)。最后简要提及Leaky ReLU等改进方案。(149字)
2025-11-08 21:58:32
743
原创 AI:不同缩放方法对具体模型(如SVM、神经网络)性能影响的对比
数据缩放对SVM和神经网络等机器学习模型性能影响显著。标准化(StandardScaler)对异常值稳健,适合正态分布数据;归一化(MinMaxScaler)在数据范围明确时表现更优但对异常值敏感;RobustScaler抗异常值能力强;Normalizer适用于文本等方向敏感任务。实验表明最佳缩放方法因模型和数据集而异,需通过对比测试选择。关键要避免数据泄露,必须用训练集参数同时转换训练和测试集。标准化通常是稳妥起点,归一化在特定场景更有效,实际需根据数据特性和模型需求选择。
2025-11-07 23:27:06
432
原创 AI训练中的归一化 (Normalization)和标准化 (Standardization)及实现方式
在AI训练中,归一化和标准化是两种关键的数据预处理方法。归一化(如Min-Max Scaler)将数据缩放到指定区间(如[0,1]),适用于输出范围有要求的场景,但对异常值敏感;标准化(如Z-score)使数据均值为0、标准差为1,适用于含异常值或基于距离的算法。Scikit-learn提供MinMaxScaler和StandardScaler等工具实现这两种方法。选择依据包括:1)模型类型(梯度下降类模型需缩放);2)数据特性(异常值多选标准化);3)需注意仅基于训练集拟合参数。标准化因鲁棒性较强通常为首
2025-11-07 23:18:14
883
原创 AI训练中的归一化 (Normalization) 和 标准化 (Standardization)
数据预处理中,归一化通过线性变换将数据映射到指定区间(如[0,1]),适用于消除量纲差异和加速梯度下降收敛,但对异常值敏感。标准化则通过Z-score变换调整数据均值为0、标准差为1,能表征数据相对位置,适用于假设数据呈正态分布的算法,对异常值更鲁棒。选择方法需考虑数据特性与模型需求:归一化适合数据分布稳定且无极端值的情况,标准化则更通用,尤其适合存在异常值或基于距离的模型。两种技术都能提升机器学习模型的训练效果和性能。
2025-11-07 23:13:32
737
原创 DeepSeek-OCR全面应用指南
摘要 DeepSeek-OCR是DeepSeek AI推出的创新多模态模型,采用"上下文光学压缩"技术实现高效文本处理,在10倍压缩比下精度达97%。该系统支持五种分辨率模式,日处理20万页数据,可识别文档、表格、公式等复杂内容。安装需24GB以上显存GPU和Python 3.12.9环境,提供本地部署和云端服务两种方案。应用场景包括企业文档数字化、学术研究、金融法律等领域,通过提示词工程和批量处理可优化性能。推荐初学者从云端服务体验,企业用户采用Linux服务器部署以获得完整功能。随着
2025-11-03 23:31:58
6211
原创 DeepSeek-OCR:视觉压缩长文本的理论突破与架构解析
摘要: DeepSeek-OCR是DeepSeek AI发布的革命性视觉-文本压缩模型,通过将文本视为连续视觉信号进行高效压缩,突破传统Transformer二次方复杂度限制。其核心架构包括DeepEncoder视觉编码器(3.8亿参数)和MoE解码器(30亿参数,稀疏激活),支持多分辨率动态处理,实现最高20:1的压缩比。训练采用两阶段策略,结合3000万页多语言数据,在文档数字化、知识管理等领域展现显著优势。该技术验证了"视觉作为文本压缩器"的可行性,为LLM长上下文处理提供新范式,
2025-11-03 23:29:18
1505
原创 DeepSeek-OCR 视觉-文本压缩 创新多模态模型
摘要:DeepSeek-OCR是DeepSeek AI团队推出的创新多模态OCR模型,采用"视觉-文本压缩"技术实现高效文档处理。其双模块架构包含3.8亿参数的视觉编码器和3B-MoE解码器,支持5种分辨率模式,在10倍压缩率下仍保持97%准确率。该模型突破性地解决了传统OCR的结构保持、多语言支持和复杂内容解析等痛点,支持PDF/图像批量处理并输出结构化Markdown。典型应用场景包括企业文档数字化、学术研究及LLM训练等。该模型已完全开源,提供完整工具链和技术文档,为长文本处理提供
2025-11-03 23:24:00
1283
原创 AI:梯度下降法实现线性回归步骤
梯度下降算法是机器学习中优化模型参数的核心方法,通过迭代调整参数使预测值逼近真实值。其核心思想是沿损失函数梯度反方向更新参数,逐步降低误差。算法实现包括初始化参数、计算梯度、更新参数和迭代优化四个步骤。学习率的选择至关重要,过大会导致震荡,过小则收敛缓慢。梯度下降有三种变体:批量、随机和小批量,各有优缺点。该算法通用性强、效率高,但可能陷入局部最优或鞍点。通过多初始值、自适应学习率和特征缩放等策略可提升性能。梯度下降为线性回归和更复杂模型提供了基础优化框架。
2025-10-23 00:42:32
1068
原创 AI机器学习:梯度下降算法实现线性回归的详细解析
本文详细解析了梯度下降算法实现线性回归的原理与过程。首先介绍了线性回归的基本概念和损失函数,然后深入讲解了梯度下降的数学原理和参数更新规则。通过房屋价格预测的具体示例,展示了梯度下降的计算步骤和可视化效果,包括损失函数曲面、参数更新路径和损失值变化曲线。最后提供了Python实现代码,涵盖数据准备、参数初始化、梯度下降迭代和结果可视化等完整流程。文章通过理论推导与代码实践相结合的方式,帮助读者全面理解梯度下降算法在解决线性回归问题中的应用。
2025-10-23 00:40:33
1249
原创 SQL Oracle 中,将 纵表(行结构存储属性值)转换为 横表
Oracle纵表转横表主要有两种方法:1.使用PIVOT子句(Oracle 11g以上),通过指定属性列和聚合函数(如MAX)实现转换;2.使用条件聚合(兼容所有版本),通过CASE WHEN语句实现。关键注意事项包括:合理选择聚合函数、处理空值(NVL)、动态列名需用动态SQL。对于属性值不固定的情况,需要构建动态SQL语句。两种方法都需要预先知道要转换的属性值,静态属性可直接转换,动态属性则需额外处理。
2025-10-10 20:04:21
743
原创 Android布局 占位view layout_weight layout_height
摘要:文章分析了Android布局中layout_weight属性的核心机制,指出其行为取决于layout_width/height的设置。当设为wrap_content时,系统会先分配内容空间再分配剩余空间,可能导致布局异常。解决方案是将占位View的layout_height改为0dp或使用Space视图替代。最佳实践包括:权重与尺寸搭配使用0dp、避免过度嵌套、明确设置weightSum。掌握这些规律能有效实现自适应布局。
2025-10-10 01:02:16
437
原创 Android布局 将按钮左右分开的方案
摘要:针对界面按钮布局需求,提供了三种实现方案对比。方案一(推荐)使用权重+占位视图实现左右分区,简单可靠;方案二采用嵌套LinearLayout使结构更清晰;方案三利用ConstraintLayout实现精准对齐。表格对比了各方案特点,并附具体实现代码,适用于不同开发场景下的灵活布局需求。
2025-10-10 00:59:28
463
原创 Android 分批发送蓝牙数据 MTU请求和服务发现的顺序问题
摘要:优化蓝牙数据传输的关键在于调整操作顺序和增强错误处理。建议在发现服务成功后再请求MTU,并严格检查特征属性是否支持所需操作。关键改进包括:1)将MTU请求移至服务发现后;2)添加特征属性验证;3)完善状态管理;4)在关键操作间加入短暂延迟。这些调整能提升连接稳定性,确保数据可靠传输。代码示例展示了如何实现特征属性检查和状态更新,流程图则清晰呈现优化后的BLE打印数据流。
2025-10-10 00:46:50
1254
原创 Android 典型的 BLE 数据传输限制问题 蓝牙发送时被截断
蓝牙BLE传输中JSON数据被截断的解决方案:BLE协议默认单次传输限制为20字节有效数据。解决方案包括:1) 协商更大的MTU(最大247字节);2) 实现数据分段发送,按MTU大小切分数据;3) 检查特征值属性,选择合适的写入类型;4) 添加传输状态监控。实践建议从测试小数据开始,逐步增加长度,并加入数据校验机制。通过优化传输协议和分段处理,可有效解决BLE数据传输限制问题。
2025-10-10 00:40:27
1330
原创 GIT: git checkout 将文件从 A 分支合并到 B 分支的方法
git中将x文件的所有更新 从A分支合并B分支,只包含这个文件的更新,其它提交不合并过去。
2025-09-22 19:47:49
1359
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅