- 博客(654)
- 资源 (8)
- 收藏
- 关注
原创 Kimi K3架构设计
摘要:月之暗面(Moonshot AI)发布旗舰模型Kimi K3(2026年7月16日),作为全球首个开源的3万亿级模型(2.8万亿参数)。其核心架构创新包括:1)KDA混合线性注意力机制,实现百万token长上下文高效处理;2)AttnRes注意力残差,提升训练效率25%;3)Stable LatentMoE极端稀疏专家系统(896专家仅激活16个)。配合量化训练与优化技术,整体扩展效率较K2提升2.5倍,支持1M tokens上下文窗口及多模态理解。模型权重计划于2026年7月27日前开源。(149字
2026-07-26 13:49:42
210
原创 Richard S. Sutton(理查德・萨顿)介绍
萨顿从零搭建强化学习完整数学与算法体系,提出TD、Actor-Critic、Dyna、Options四大基石,定义领域标准教材;晚年提出《苦涩的教训》算力缩放思想,最终推出OaK通用智能架构,横跨理论、工业、下一代AGI三大时代,是现代强化学习无可争议的奠基人。
2026-07-19 21:56:22
196
原创 Richard Sutton:OaK 架构解析
OπOβOOπOβOπO\pi_OπO:Option内部策略,输入当前状态,输出连续多步原子动作(不是单步动作);βO\beta_OβO:终止条件函数,任意状态输入,输出0/1,判断该技能何时结束、退出高层行为,回到基础动作决策。普通强化学习只能一步一决策(原子动作:前进、抬手、点击);Option是跨时间、可嵌套、可复用、可中断的完整行为片段底层原子动作:左移一步、抓取、拧开关;高层Option:走到厨房、接一杯水、打开冰箱、写完一段文字。
2026-07-19 21:45:33
663
原创 【IntelliJ IDEA 2026.1.1】的Shelf功能的git显示Merge的坑
摘要:在IntelliJ IDEA中使用shelf功能跨分支转移代码时,Git可能错误生成合并提交信息(如显示Merge branches 'release','feature_a_bug')。这是因为shelf保留了原始分支的Git元数据。推荐解决方案:1)改用git stash暂存修改后切换分支恢复;2)对已提交修改使用git cherry-pick;3)直接手动复制文件;4)通过git commit --amend修正错误提交信息。最佳实践建议优先使用Git原生命令(stash/cherry-pick
2026-07-17 21:35:57
159
原创 FP16 vs FP32 【精度】及算力【速度】比较
摘要:FP16与FP32的核心差异与应用场景 FP16(半精度)和FP32(单精度)浮点数各有优势: 算力与显存:FP16算力是FP32的2倍(如RTX4090 FP16达166 TFLOPS),显存占用减半,适合大模型推理和AI绘图。 精度与稳定性:FP32精度更高(23位尾数),数值范围广,适合模型训练、科学计算等对误差敏感的场景。 混合精度(AMP):主流训练方案,结合FP16计算速度和FP32梯度精度,平衡性能与稳定性。 结论:FP16侧重效率,适合推理;FP32强调精度,适合训练和高精度计算。
2026-07-15 23:59:14
337
原创 Seedance 2.0 Mini 底层原理与完整架构设计
摘要: Seedance 2.0 Mini是字节Seed团队推出的轻量化多模态视频生成模型,基于标准版蒸馏优化,主打低成本与高速推理(成本降50%,速度提升2倍)。其核心采用Flow Matching时序扩散架构,通过裁剪注意力头、隐空间降维、INT8量化等技术实现轻量化,保留文生视频、图生视频、音画同步等基础能力,聚焦短视频/写真生成场景(如古风人像特写)。模型通过**轻量级特征锚定(LFA)**确保人物一致性,简化时序流场适配慢动作,但牺牲了4K分辨率、复杂交互及高清音频生成能力。架构分层设计涵盖轻量化
2026-07-14 06:54:51
212
原创 git revert merge的代码操作步骤总结
摘要:本文详细介绍了如何安全撤销Git中的merge操作。当开发人员误将release分支合并到feature分支时,可使用git revert -m 1 <merge-commit-hash>命令撤销合并,保留当前分支代码。文章分步骤说明操作流程,包括定位merge提交、执行revert、处理冲突和验证结果,并对比了-m 1和-m 2参数的区别。该方法不修改历史记录,适合团队协作环境,是解决错误合并的安全方案。(149字)
2026-07-10 19:37:42
198
原创 [The Wave Thesis]-Wangshenwei
摘要: 《波论》提出以载波共振层作为硅基生命编程语言的底层本体,其核心观点为“波是意识之源,学习即共振,驻波即知识记忆”。作者王申玮通过alang项目的开创性格言,探讨了波动原理在构建新型智能系统中的应用框架,试图为硅基生命形式建立基于波动力学的编程范式与认知模型。该研究或为人工智能、意识模拟及跨介质认知科学提供新的理论工具。(字数:149)
2026-06-16 01:09:34
26
原创 Mac OS NPM执行报错:npm error code EACCES
文章摘要:执行npm install -g @xxx时出现EACCES权限错误,原因是普通用户无权限写入/usr/local/lib/node_modules目录。提供四种解决方案:1)临时使用sudo(不推荐);2)修改目录权限为当前用户(推荐快速解决);3)将npm全局目录移至用户主目录(官方推荐);4)使用nvm管理Node(长期开发最佳)。建议先用方案二快速解决问题,长期开发推荐采用方案三或nvm彻底解决权限问题。每种方案均附有具体操作命令。(149字)
2026-06-10 10:13:16
187
原创 Homebrew国内源配置
摘要:本文介绍了如何为 macOS 的 Homebrew 包管理工具配置国内镜像源以提升下载速度,包括替换 brew.git 和 homebrew-core.git 源为清华大学镜像,以及设置 Homebrew Bottles 的国内源。同时提供了恢复默认源的方法,涵盖 bash 和 zsh 两种终端环境的配置调整。(149字)
2026-06-04 16:41:34
397
原创 Mac OS 在根目录下创建目录
摘要:在macOS Catalina(10.15+)系统中,由于SSV签名系统卷和SIP保护机制,根目录为只读状态。若需创建/xxx目录,推荐使用synthetic.conf方案:先在/System/Volumes/Data/下创建真实目录,再通过配置synthetic.conf实现虚拟映射,重启后即可使用。同时提供了目录权限设置方法,包括修改所有者(chown)和权限(chmod),支持普通用户读写或NFS共享所需的777权限。该方案无需关闭SIP,永久有效。
2026-06-03 16:11:33
316
原创 MAC OS M3 jdk和maven配置
本文介绍了在MacOS系统(M3 Pro ARM64)上安装和配置JDK 11与Maven 3.9.16的步骤。首先提供了微软OpenJDK 11.0.31和Apache Maven的下载链接,然后详细说明了如何通过修改.zshrc文件配置环境变量(JAVA_HOME和MAVEN_HOME),最后通过source命令使配置生效并验证安装是否成功。整个过程包括创建路径、编辑配置文件、设置环境变量以及验证版本号等关键步骤。
2026-06-03 11:08:20
205
原创 git配置用户名邮箱和密码操作
该摘要介绍了Git的基本全局配置命令,用于设置用户信息: 使用git config --global user.name设置用户名 使用git config --global user.email设置用户邮箱 使用git config --global user.password设置密码(注意:实际使用中密码通常不这样配置) 这些配置信息将用于标识代码提交者的身份,确保版本控制记录准确。配置为全局(--global)表示这些设置将应用于当前用户的所有Git仓库。
2026-06-02 21:00:38
77
原创 git代码显示LF和CRLF的区别
摘要: Windows换Mac后,Git显示大量文件差异,仅因换行符不同(CRLF vs LF)。这是由于系统差异导致。解决方法:在Mac/Linux统一提交时转换为LF,检出不转换。执行命令: git config --global core.autocrlf input 以标准化换行符处理。
2026-06-02 20:49:20
339
原创 java单元测试错误:Unnecessary stubbings detected in test class
摘要: 单元测试报错显示检测到不必要的Mockito打桩(when(...))代码,这会导致测试失败。原因是Mockito默认开启了严格校验模式,会检查未使用的打桩方法。解决方法是将测试类的@RunWith注解替换为MockitoJUnitRunner.Silent.class或MockitoJUnitRunner.Lenient.class来放宽校验规则。更彻底的解决方案是直接删除未被调用的打桩代码,以保持测试代码的简洁性。
2026-05-29 15:18:39
223
原创 人工智能硕士毕业后的职业发展前景
人工智能硕士依然是当前性价比极高的学历选择:需求大、薪资高、覆盖广、成长快。但红利已从“学历红利”转向能力红利技术深度 + 工程落地 + 行业理解,三者兼备者长期最稳、上限最高。
2026-04-22 19:03:51
688
原创 Harness Engineering 架构落地设计文档
本文档提出企业级AI Agent生产环境的Harness Engineering架构设计,基于六层闭环架构和两大横切能力,确保可靠性、可控性和可演进性。核心架构包括接入与接口层、执行编排层、记忆与状态层、工具集成层、评估与观测层及约束校验恢复层,贯穿安全与治理能力。设计优先级依次为可靠性(错误不复现)、可控性(权限审计)、扩展性(多模型支持)、可观测性(全链路透明)和演进性(知识回流)。详细落地设计包含各层组件清单(如API网关、权限服务)、标准接口定义(OpenAPI 3.0规范)及可直接复用的规则模板(
2026-04-22 11:44:43
394
原创 Harness Engineering 架构设计解读
Harness Engineering 架构设计摘要(148字) Harness Engineering是由Mitchell Hashimoto提出的AI工程范式,通过六层闭环架构实现"人类掌舵,智能体执行":1)接口层处理协议转换与权限控制;2)编排层实现任务分解与多步骤协同;3)记忆层管理短期/长期/元记忆三级知识体系;4)工具层提供标准化能力接口;5)评估层进行全链路质量监控;6)约束层通过护栏机制确保错误永不复现。两大横切能力(安全沙箱与持续治理)贯穿始终,形成控制平面与数据平面
2026-04-22 11:05:49
754
原创 【IOException: Can not attach to current VM】UT测试问题解决
摘要:在执行UT测试时出现"java.io.IOException: Can not attach to current VM"错误,该错误源于JMockit无法附加到当前虚拟机。解决方法是在IDEA运行配置中添加VM参数:打开Run/Debug Configurations → 找到JUnit默认配置 → 在VM options中添加-Djdk.attach.allowAttachSelf=true。这个参数允许JVM附加到自身,解决了JMockit初始化时的问题。虽然该异常不影响调试
2026-04-16 13:59:24
314
原创 使用了Lombok但是UT单元测试总是找不到问题
摘要:在IDEA中遇到注解处理问题时,可通过启用Annotation Processing解决。具体步骤为:打开设置(File→Settings),在Compiler→Annotation Processors中勾选"Enable annotation processing"并确保选中"Obtain processors from project classpath",应用设置后重启IDEA并重新构建项目(Build→Rebuild Project)。这是解决注解处理
2026-04-16 11:37:39
49
原创 Redis + Lua 实现分布式限流:从原理到实践
Redis + Lua 分布式限流方案摘要 本文介绍了一种基于Redis + Lua的高性能分布式限流方案,主要包含以下核心内容: 限流必要性:防止系统过载、避免服务雪崩,是微服务架构中的重要防护措施 方案优势: 原子性操作保证数据一致性 单次网络往返减少延迟 支持复杂业务逻辑的灵活限流策略 核心技术: 使用Lua脚本实现原子化限流判断 采用PTTL实现毫秒级精度控制 自动过期机制实现滑动窗口效果 实现要点: 边界条件处理(如无效请求直接放行) 配额不足时返回剩余量及TTL Java集成示例展示了完整调用流
2026-04-14 16:02:15
508
原创 深度学习优化算法与实践->随机梯度下降及其在深度学习中的应用
摘要 本课程主要介绍了随机梯度下降(SGD)的原理和应用。对于凸优化问题,SGD在适当的学习率下能收敛到最优解;但对于深度学习等非凸问题,收敛性保证较为复杂。文章详细分析了SGD的动态学习率策略,包括分段常数、指数衰减和多项式衰减等方法,并通过代码示例展示了不同学习率策略的效果。特别指出,在凸优化情况下,可以通过理论分析确定学习率计划,而非凸问题则需要更多实验调参。最后讨论了SGD在凸目标函数下的收敛性证明框架,为理解优化过程提供了理论基础。
2026-04-14 14:09:44
347
原创 深度学习优化算法与实践:小批量随机梯度下降及其优化策略
摘要 本课程介绍了小批量随机梯度下降(SGD)的核心概念。该方法结合了计算效率与统计效率的优势:通过向量化操作减少框架开销,利用CPU/GPU缓存优化内存访问,同时通过随机小批量降低方差。实验显示,批量矩阵运算比逐元素计算快100倍以上。课程还演示了如何高效读取数据集并实现小批量SGD算法,包括学习率调整策略。相比全批量梯度下降和单样本SGD,小批量SGD能更快收敛且风险更小,是深度学习中广泛采用的优化方法。
2026-02-01 00:23:07
650
原创 【计算的终结:全息记忆时代的物理复兴】
《计算的终结:全息记忆时代的物理复兴》提出颠覆性的APU架构,通过物理共振替代传统计算。该技术利用全息波场协议实现O(1)检索速度,能效提升1000倍,方糖大小介质可存储PB级数据。商业上通过能源套利和开源协议建立新型算力经济,最终实现人类知识的数字化永生。演示对比显示APU在能效、速度和任务执行上的绝对优势,标志着从"计算"到"唤醒"的范式转变。
2026-01-30 15:48:44
617
原创 深度学习优化算法与实践:随机梯度下降及其在深度学习中的应用
本文介绍了随机梯度下降(SGD)方法及其在深度学习中的应用。主要内容包括:1)SGD通过随机采样样本计算梯度,将每次迭代计算代价从O(n)降至O(1),是梯度下降的高效替代方案;2)动态学习率策略(分段常数、指数衰减、多项式衰减)对优化过程至关重要,实验显示多项式衰减能获得更好的收敛效果;3)在凸函数假设下分析了SGD的收敛性,证明其能逐步逼近最优解。文章通过Python代码示例展示了SGD的实际表现,并比较了不同学习率策略的效果,指出在非凸情况下(如深度学习)SGD的最优性保证通常不成立。
2026-01-29 23:04:32
726
原创 深度学习优化算法与实践:梯度下降与优化算法
梯度下降是一种优化算法,通过沿目标函数负梯度方向迭代更新参数来寻找最小值。本文介绍了梯度下降的基本原理,包括一维和多元情况下的实现。关键点包括:学习率的选择至关重要,过大会导致发散,过小收敛缓慢;梯度下降可能陷入局部极小值;高维情况下需要调整学习率和预处理;牛顿法在凸问题上收敛更快。通过代码示例展示了不同学习率对优化过程的影响,并演示了梯度下降在非凸函数中的应用。
2026-01-20 23:14:03
748
原创 深度学习优化算法与实践:凸性理论与应用
本文介绍了凸性的基本概念及其在优化中的重要性。首先定义了凸集和凸函数,并分析了它们的性质:凸集的交集保持凸性,而并集不一定;凸函数的局部极小值即为全局极小值。通过詹森不等式说明了凸函数的期望性质,并展示了如何利用凸性简化复杂表达式。文章还讨论了凸优化问题的求解方法,如拉格朗日乘数法和投影法。最后通过Python代码示例直观展示了凸函数与非凸函数的区别。这些概念为后续优化算法设计奠定了基础。
2026-01-20 16:25:22
705
原创 深度学习优化算法与实践 :深度学习中的优化算法与挑战
本文探讨了优化与深度学习的关系及在深度学习中使用优化的挑战。深度学习通过定义损失函数并使用优化算法最小化损失,但两者的目标不同:优化关注最小化训练误差,而深度学习旨在降低泛化误差。文章分析了深度学习优化的三大挑战:局部最小值、鞍点和梯度消失。局部最小值可能阻碍达到全局最优;鞍点使梯度消失但非极值点;梯度消失导致训练停滞。尽管存在这些问题,现代优化算法仍能有效处理深度学习任务,且近似解通常已足够实用。文中通过数学函数示例和可视化展示了这些优化挑战的具体表现。
2026-01-19 17:18:30
976
原创 深度学习优化算法与实践
本文系统介绍了深度学习中的优化算法体系,涵盖基础理论到前沿技术。主要内容包括:凸性理论、梯度下降系列算法(标准/随机/小批量)、动量法、自适应优化算法(AdaGrad/RMSProp/Adadelta/Adam/Yogi)以及学习率调度策略。该学习路径从理论到实践,全面解析了深度学习模型训练中的优化挑战与解决方案,为模型性能提升提供系统化指导。
2026-01-19 16:27:09
225
原创 注意力机制与Transformer实践:Transformer模型架构与实现
本课程将学习Transformer的模型架构并实现Transformer。Transformer是编码器-解码器架构的一个实践,尽管在实际情况中编码器或解码器可以单独使用。在Transformer中,多头自注意力用于表示输入序列和输出序列,不过解码器必须通过掩蔽机制来保留自回归属性。Transformer中的残差连接和层规范化是训练非常深度模型的重要工具。Transformer模型中基于位置的前馈网络使用同一个多层感知机,作用是对所有序列位置的表示进行转换。
2026-01-19 11:32:01
948
原创 注意力机制与Transformer实践:自注意力和位置编码原理与实现
本课程介绍了自注意力机制和位置编码在序列处理中的应用。主要内容包括:1) 自注意力原理及其与CNN、RNN的比较,自注意力具有并行计算优势但计算复杂度较高;2) 位置编码通过添加正弦/余弦位置信息来保留序列顺序,弥补自注意力忽略位置关系的缺陷;3) 详细解析了位置编码矩阵的设计思路,展示了不同维度上的频率变化模式。通过代码示例演示了多头自注意力实现和位置编码的可视化效果,帮助理解这些机制如何协同工作来处理序列数据。
2026-01-16 16:57:50
758
原创 注意力机制与Transformer实践:多头注意力机制深度解析
多头注意力机制摘要 多头注意力是一种改进的注意力机制,允许模型同时学习序列数据中不同范围的依赖关系。其核心思想是通过多组独立的线性变换(查询、键、值)并行计算注意力,然后将各头输出拼接并通过线性变换生成最终结果。每个注意力头可以关注输入的不同部分,从而捕获短距离和长距离等多种依赖模式。实现时通常采用缩放点积注意力作为基础单元,并通过转置操作实现多头并行计算。这种设计在保持计算效率的同时,显著增强了模型的表达能力。
2026-01-16 16:21:39
958
原创 数字孪生:通向物理AI的技术路径探究
摘要:GIS、BIM和CIM是数字孪生技术的三大核心支撑技术,分别从宏观、微观和中观层面构建物理世界的数字化映射。GIS处理地理空间数据,BIM专注于建筑全生命周期管理,CIM则整合城市多维信息。随着物联网、大数据、AI等新技术的发展,数字孪生正从静态建模向动态智能预测转变,实现多尺度模型融合和自主决策。未来,数字孪生将推动各行业数字化转型,成为连接物理与数字世界的桥梁。(149字)
2026-01-16 15:01:03
1357
原创 注意力机制与Transformer实践:Bahdanau注意力机制原理与实现
摘要 本文介绍了Bahdanau注意力机制在循环神经网络编码器-解码器架构中的应用。Bahdanau注意力通过计算上下文变量作为注意力集中的输出,使模型能够动态关注输入序列中与当前预测相关的部分。文章详细阐述了注意力解码器的实现过程,包括初始化解码器状态、处理编码器输出以及计算注意力权重等关键步骤。通过小批量测试验证了Bahdanau注意力解码器的有效性,并提供了使用fra-eng数据集进行训练的指导。该机制克服了传统seq2seq模型单向对齐的限制,显著提升了机器翻译等序列转换任务的性能。
2026-01-16 11:18:53
790
原创 注意力机制与Transformer实践:注意力评分函数原理与实现
本文介绍了注意力评分函数的基本原理和应用。主要内容包括:1)注意力评分函数通过计算查询与键的相似度生成注意力权重,输出为值的加权和;2)掩蔽softmax操作可过滤无效词元;3)加性注意力适用于查询和键长度不同的情况,通过多层感知机计算评分。文章还提供了相关代码实现,展示了如何在实际中应用这些技术。这些方法为构建更复杂的注意力机制奠定了基础。
2026-01-15 17:43:19
814
原创 注意力机制与Transformer实践:Nadaraya-Watson核回归与注意力机制应用
本文介绍了Nadaraya-Watson核回归模型及其基于注意力机制的实现方法。主要内容包括:1) 通过生成非线性函数数据集展示平均汇聚的局限性;2) 提出非参数注意力汇聚模型,使用高斯核计算注意力权重,实现更准确的预测;3) 扩展为带参数注意力汇聚模型,引入可学习参数提升模型性能;4) 讲解批量矩阵乘法在高效计算小批量数据注意力权重中的应用。实验结果表明,注意力汇聚模型相比简单平均汇聚能更好地拟合非线性数据,且注意力权重可视化直观展示了查询-键对的相似度关系。
2026-01-15 17:20:12
913
原创 注意力机制与Transformer实践:注意力机制及其在神经网络中的应用
本文介绍了注意力机制的基本概念及其在人类认知和神经网络中的应用。首先指出注意力是一种稀缺资源,解释了注意力经济现象。然后通过生物学视角分析了非自主性和自主性注意力提示的区别,并引入神经网络中的注意力框架,将感官输入抽象为键值对,查询作为自主性提示。最后通过可视化方法展示了注意力权重的分布模式,为理解注意力机制提供了直观示例。文章为后续深入学习注意力模型奠定了理论基础。
2026-01-15 14:00:17
788
原创 注意力机制与Transformer实践
本文系统介绍了注意力机制及其在神经网络中的应用。首先探讨了Nadaraya-Watson核回归与注意力机制的关系,随后详细解析了注意力评分函数的原理与实现。文章重点阐述了Bahdanau注意力机制、多头注意力机制和自注意力机制的工作原理及实现方法,并讨论了位置编码在Transformer中的关键作用。最后,全面剖析了Transformer模型的整体架构及其实现细节,为深度学习中的注意力机制应用提供了完整的理论框架和实践指导。
2026-01-15 11:09:25
240
[The Wave Thesis]-Wangshenwei
2026-06-16
【Python科学计算】Anaconda基础教程:从安装到高级技巧及环境管理详解文档所属领域(
2025-05-28
【数据科学与机器学习】Anaconda基础教程及使用案例:涵盖环境管理、包管理及多领域项目实践
2025-05-28
软件工程UML图元素符号详解:类图、用例图、活动图及状态图符号图例与应用对比
2025-05-21
Hadoop Impala connect hive2 jdbc related
2018-05-24
AndroidFailedtoallocatememory8错误提示的原因及解决办法
2014-08-28
hive service
2018-07-25
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅