- 博客(1869)
- 资源 (119)
- 收藏
- 关注
原创 深度解读 SmallThinker:专为手机设计的 MoE 大模型,以及我们能否给 Qwen3 动“手术“
端侧 MoE 的速度瓶颈不是算力不够,而是"不知道提前该加载谁"导致的 I/O 阻塞。解决它需要架构层面的改动(router 前移),不是工程优化(madvise/N-slot)能弥补的。但好消息是:router 前移的改动技术上可行,且训练成本低(只微调很小的 router 层)。SmallThinker 论文用实证证明了这条路走得通,只是他们选择了从头训练;我们可以在现有 Qwen3 上"动手术"尝试。
2026-06-04 10:57:20
75
原创 把 300 亿参数的 Qwen3-30B-A3B 塞进 16GB 手机:MoE、mmap 与内存轮转的完整拆解
这篇文章详细拆解了如何在16GB内存手机上运行305亿参数的Qwen3-30B-A3B大模型。作者通过MoE(专家混合)架构、内存映射(mmap)和专用NPU内存(rpcmem)的巧妙结合实现了这一"不可能"的任务。 核心原理在于:MoE模型将庞大的前馈网络拆分为128个专家,每个词只激活8个专家,97%的权重处于闲置状态;通过mmap技术按需加载当前需要的专家权重;同时利用NPU专用内存高效计算关键部分。三个关键开关(GGML_HEXAGON_MOE_PAGING=1、--mmap、GGML_CPU_RE
2026-06-03 10:06:00
101
原创 读懂高通 Hexagon NPU:HVX、HMX、FastRPC、VTCM 和 arch 版本
我把大模型跑到高通 Hexagon NPU 上的过程中,被 arch 版本不匹配、VTCM 不够、HMX 布局、FastRPC 权限这些概念反复绊倒。这篇把这些硬件概念系统讲清楚——从「写编译器/调运行时的人」的视角,讲它有哪些执行单元、内存什么样、怎么和 CPU 通信、各 arch 版本有什么坑。是我这份笔记的整理。
2026-06-02 17:01:20
103
原创 手机 NPU 上的大模型,到底快在哪、慢在哪:HMX、带宽与延迟
我把 Llama-3.2-1B-Instruct(Q4_0,773MB)跑在一台 SM8845(Hexagon v81)手机的 NPU 上,反复跑 benchmark、扫参数,搞清楚了这台 NPU 的瓶颈在哪。结论是:prefill 快得离谱、decode 卡在内存带宽。这篇是数据、分析和调优实战。理解「prefill 吃算力、decode 吃带宽」这一点,是看懂所有端侧 LLM 性能数字的钥匙。文中设备序列号用代替。more。
2026-06-02 17:00:16
72
原创 一个让大模型输出乱码的 v81 指令 bug:从现象到根因到修复
先隔离再定位。用-ngl 0让它纯 CPU 跑,一步确认问题不在模型/build,把范围从整个系统收缩到 NPU 计算路径。不要一上来就读算子代码。贪心解码排除采样。--temp 0后乱码依旧,说明是计算错误,不是采样随机性。LLM 调试一定要先把随机性关掉。变量最小化。同模型、同 prompt、同 build,只换 skel 版本,几组对比直接把问题收敛到具体 arch。二进制对比排除法。文件大小一样、符号一样,立刻排除「链接了错误的库」这类低级错误,把注意力逼到编译 flag 和条件编译分支上。
2026-06-02 16:58:51
237
原创 容器里没有 Docker,如何交叉编译 llama.cpp 的 Hexagon NPU 后端
本文详细记录了在没有 Docker 容器的 Linux 环境下,如何直接交叉编译 llama.cpp 的 Hexagon NPU 后端。主要步骤包括:准备 Android NDK r28b 和 Hexagon SDK 6.4.0.2,修复三个关键问题(HEXAGON_TOOLS_ROOT 路径错误、CMake 预设文件位置问题、NDK 版本过旧),最终成功编译出 host 端的可执行文件和 DSP 端的 HTP skel 库。文中特别强调了 host 端和 DSP 端使用不同编译器(Android NDK
2026-06-02 16:57:42
182
原创 逐算子 offload 是测试工装,不是部署:手机 NPU 推理的两种架构
本文揭示了手机NPU推理中两种架构的关键差异:逐算子offload测试工装与部署运行时的本质区别。通过实际案例分析,作者发现测试工装模式下每个算子调用都需要重建执行环境(8-9秒/次),导致真实模型生成一个token耗时20分钟,其中99.999%时间消耗在通信而非计算(NPU计算仅78微秒)。相比之下,部署运行时采用持久会话、权重常驻、异步提交等机制,使端到端时间与算子数脱钩,最终将性能提升至35token/s。文章强调理解这一架构差异是从功能验证转向高效部署的关键,并提供了判断当前工装类型的特征指标,指
2026-06-02 16:56:10
249
原创 用 ggml-hexagon 在手机 NPU 上跑 Llama:从 20 分钟一个 token 到毫秒级
这篇文章详细记录了作者如何将Llama-3.2-1B-Instruct模型部署到一加手机的Hexagon NPU上运行的过程。文章分为以下几个关键部分: 前期尝试:作者最初使用高通hexagon-mlir逐算子offload方案,发现每个token生成需要20分钟,原因是频繁的adb数据传输而非计算瓶颈。 正确方案:转向llama.cpp的ggml-hexagon后端,该方案采用持久FastRPC会话、权重常驻DSP、异步算子队列等优化,实现了真正的部署级运行。 技术实现:详细记录了交叉编译过程(包括NDK
2026-06-02 16:54:24
237
原创 # 低精度分块量化 (LPBQ) 原理:Per-Block vs Per-Channel ## 背景 在将大模型部署到手机端时,我们需要把 FP16/FP32 的权重压缩到 INT4 (W4A16
精度: Per-Block (LPBQ ON) > Per-Channel (LPBQ OFF)速度: Per-Channel (LPBQ OFF) ≈ 2× Per-Block (LPBQ ON)原因: block 粒度的 scale 隔离了 outlier,但推理时多了大量 dequant 操作如果模型本身够大(7B+),per-channel 的精度损失可以接受,优先选速度如果模型很小(2B),per-channel 精度下降明显,建议保留 LPBQ。
2026-05-27 12:13:49
85
原创 Claude Code大规模部署指南:解锁大型代码库生产力的核心模式
在大规模代码库中成功应用Claude Code,是一场关于工程严谨性和组织协同的实践。它要求我们将AI助手视为一个需要精心配置和持续维护的强大工具,而非一个开箱即用的“魔法黑盒”。从建立分层的CLAUDE.md开始,逐步引入钩子、技能和插件,并配以LSP集成和清晰的组织职责,你就能构建一个与你的代码库共同成长、持续释放开发团队生产力的智能编码环境。
2026-05-19 11:32:39
216
原创 大模型可解释性-颠覆认知:大语言模型在预训练中并非“稳定变聪明”
这项研究打破了我们关于模型学习是线性成熟的美好想象。它揭示的“模式跳跃”现象,要求我们以更动态、更复杂的视角来审视预训练过程。但同时,它也带来了新的希望和工具。它表明,模型内部确实存在强烈的、趋向于“智能泛化”的倾向,只是这种倾向在与“捷径”的竞争中起伏不定。理解并监控这种动态,为我们提供了优化模型、引导其向更鲁棒、更可泛化方向发展的全新“杠杆”。预训练的黑箱,似乎又打开了一扇新的窗户。而我们手中,多了一副观察其内部风云变幻的“眼镜”和一套可能进行干预的“工具”。
2026-05-19 10:37:19
390
原创 我是怎么理解 Orthrus 这套并行生成实现的
Orthrus 真正值得学的,不是“并行生成”这四个字,而是它把并行提案、共享 KV cache 和分布校正放进了同一个生成循环里。对做 LLM 推理的人来说,这种设计比单纯的 benchmark 数字更有参考价值。因为速度曲线可以随着硬件和实现变化,但“怎么在系统上少引入一个模型、少维护一份缓存、同时不把分布搞坏”这件事,才是更难、也更通用的工程问题。
2026-05-19 10:28:10
386
原创 HRM-Text 技术解析:一个把“高阶推理”做进预训练框架的 1B 级文本模型仓库
HRM-Text技术解析:1B级文本模型的创新训练框架 HRM-Text是一个专注于高效预训练的文本模型框架,其核心创新在于将高阶推理能力直接融入预训练过程。该框架采用分层递归的HRM模型结构,包含高层推理模块和低层细化模块的双层设计,通过多轮内部计算实现深度推理。技术亮点包括: 独特的训练机制:采用逐步增加反向传播路径的warmup策略,前期保证训练稳定,后期开启深度递归 优化的PrefixLM实现:基于FlashAttention 3定制注意力内核,区分前缀区和回答区的注意力模式 高效的动态打包:使用L
2026-05-19 09:54:35
592
原创 Pedagogical RL:让模型学会“教自己”,而不是盲目等运气
对每个位置tttatmaxargmaxaπθa∣xτtatmaxargamaxπθa∣xτtdtlogπθatmax∣xτtπθτt∣xτtdtlogπθτt∣xτtπθatmax∣xτtdtd_tdt。
2026-05-19 09:47:03
108
原创 科技早报晚报|2026年5月19日:本地优先笔记、隐私自动化与 Agent 后端,今天更值得跟进的 3 个技术机会
这篇文章从 2026 年 5 月 18 日到 5 月 19 日的技术社区动态里筛出 10 个值得关注的项目与产品,重点拆解本地优先 Markdown 工作台、隐私删除自动化和 Agent 原生后端平台三个更接近真实付费场景的方向。
2026-05-19 08:19:09
621
原创 科技早报|2026年5月19日:AI 编码开始补 SDK、API 和审计链路
这篇 5 月 19 日科技早报聚焦 AI 编码平台最近更值得技术团队关注的一步:Anthropic 通过收购 Stainless,把 SDK、CLI 和 MCP server 这类开发者连接层直接拉进 Claude 平台;GitHub 则连续开放 cloud agent task API、审计接口、Spaces API、远程控制和低成本模型选项。相比单纯争夺聊天入口,这些变化更接近生产环境真正需要的接入、治理和复用能力。
2026-05-19 07:15:07
604
原创 科技早报晚报|2026年5月18日:Agent 原生语言、代码语义图谱与 Rust 数据层,今天更值得跟进的 3 个技术机会
今天这轮科技新闻更值得看的,是三类开始向工程底座下沉的能力:给 Agent 写工具的原生语言、低 token 成本的本地代码语义图谱,以及更适合现代异步服务的 Rust 数据层。文章从 15 个候选项目里筛出 10 个,并重点拆解最适合继续做成产品或基础设施的 3 条路线。
2026-05-18 08:10:43
569
3
原创 科技早报|2026年5月18日:AI 平台开始补生产级控制面
这篇 5 月 18 日科技早报不追模型排行,而是聚焦更接近生产现场的变化:SAP 和 NVIDIA 把 agent 运行时安全前置到企业平台,Hermes 推动本地常驻 agent,AWS 用 M3 Ultra Mac 承接更重的 Apple 开发负载,Cloudflare 则复盘了一个会把 QUIC 打进死循环的底层优化陷阱。
2026-05-18 07:21:51
556
原创 科技早报晚报|2026年5月17日:调度基础设施、自托管邮件引擎与 AI 仪表盘代码,今晚更值得跟进的 3 个技术机会
今晚这轮科技新闻更值得看的,是三类已经存在明确预算线、但正在被开源和 AI 重新改造的基础设施:可自控的调度系统、自托管的邮件与订阅引擎,以及面向 AI 协作的 Dashboard-as-Code 工作台。文章从 15 个候选项目里筛出 10 个,并重点拆解最适合继续做成产品或团队基础层的 3 条路线。
2026-05-17 19:29:48
445
原创 科技晚报|2026年5月17日:AI 开始进入国家与企业制度层
这篇 5 月 17 日科技晚报聚焦一个更长周期的变化:Anthropic 与 PwC 把 Claude 推向企业函数重构,OpenAI 与马耳他把 ChatGPT Plus 变成国家级 AI 普及计划,AWS 则继续把多云互联与业务流程 agent 产品化。对技术读者来说,AI 竞争正在从模型能力进一步转向组织制度、网络架构和真实工作流的默认入口。
2026-05-17 18:14:36
759
原创 科技早报晚报|2026年5月17日:建筑估算自动化、支持排障录屏与端侧多语言 TTS,今天更值得跟进的 3 个技术机会
今天这轮科技新闻更值得看的,不是新的聊天壳,而是三类更贴近真实业务链路的工具:把施工图自动转成工程量清单的建筑估算自动化、把录屏与日志合并成支持排障证据的上下文采集层,以及能本地部署到多端设备的多语言 TTS 引擎。文章从 15 个候选项目里筛出 10 个,并重点拆解最适合继续做成垂直产品或底层能力层的 3 条路线。
2026-05-17 08:11:05
508
原创 科技早报|2026年5月17日:AI 工具开始补长期工作能力
这篇 5 月 17 日科技早报不追模型榜单,重点放在开发平台真正决定落地效果的几件事:Google 用 ADK 讲清长任务 agent 的暂停、恢复与持久上下文,GitHub 把 Issues 导航做到接近瞬时,Cloudflare 复盘 ClickHouse 隐性瓶颈,Google 和 Vercel 则分别从治理模板与部署安全边界补齐组织级落地条件。
2026-05-17 07:11:07
594
原创 科技早报晚报|2026年5月16日:语音代理平台、苹果构建控制面与白盒 AI 渗透测试,今晚更值得跟进的 3 个技术机会
今晚这轮科技新闻更值得看的,不是新的聊天壳,而是三类把 AI 接进真实生产环节的控制面:自托管语音代理平台、苹果开发构建控制面,以及白盒 AI 渗透测试门禁。文章从 15 个候选项目里筛出 10 个,重点拆解最适合继续做成垂直产品或团队基础设施的 3 条路线。
2026-05-16 19:18:45
540
原创 科技早报晚报|2026年5月16日:本地化闸门、训练前优化与设备信任栈,今天更值得跟进的 3 个技术机会
今天这轮科技新闻更值得看的,不是新的聊天壳,而是三类把昂贵错误前移拦截的工具:本地化质量闸门、训练前 GPU 优化与成本预检,以及设备信任验证与嵌入式 SPDM 测试工具链。文章从 15 个候选项目里筛出 10 个,重点拆解最适合继续做成垂直产品的 3 条路线。
2026-05-16 08:15:54
909
原创 科技早报|2026年5月16日:AI 正往高门槛场景下沉
5 月 16 日这篇科技早报聚焦一个更实用的变化:AI 不再只在通用聊天和代码生成里打转,而是开始下沉到个人理财、无障碍审查、公共健康和强化学习基础设施。OpenAI、GitHub、Anthropic 和 NVIDIA 的几条更新放在一起看,说明下一轮竞争点正从模型能力,转向高信任场景里的数据边界、评估体系和长期运行能力。
2026-05-16 07:22:51
654
原创 科技早报晚报|2026年5月15日:本地大表分析、零 ETL 远程搜索与去中心化监控,今晚更值得跟进的 3 个技术机会
今晚这轮科技新闻更值得看的,不是再造一个通用 Agent,而是三类真正吞吐真实工作流的工具:本地大表分析、零 ETL 远程数据搜索和多节点监控。文章从 15 个候选项目里筛出 10 个,重点拆解三条适合继续做成垂直产品或团队基础设施的路线。
2026-05-15 19:16:04
462
原创 科技晚报|2026年5月15日:AI 代理开始补协作、编排和护栏
5 月 15 日这篇科技晚报聚焦 AI 代理平台开始进入生产治理阶段:AWS Transform 同时补 IDE 入口与客户自管产物存储,Microsoft 用 Conductor 把多代理编排做成可审 YAML,GitHub 下钻到团队级 Copilot 指标,Google 则给 Genkit 加上拦截、回退和工具审批中间件。对技术团队来说,AI 开始从“会用”进入“能管”。
2026-05-15 18:14:22
547
原创 科技早报晚报|2026年5月15日:无摄像头空间感知、Android 设备实验室与视频检索代理,今天更值得跟进的 3 个技术机会
今天从 GitHub Trending、GitHub API 和 Show HN 整理了 16 个候选项目,重点不是再做一个通用 Agent,而是三条更贴近现实世界入口的产品机会:无摄像头空间感知、自托管 Android 设备实验室、以及视频检索与总结代理基础层。正文给出了各自的用户痛点、二次开发方向、MVP、技术栈和风险提醒。
2026-05-15 08:14:31
542
原创 科技早报|2026年5月15日:AI 安全开始补信任层
5 月 15 日这篇科技早报聚焦 AI 产品和开发平台正在补齐的信任层:OpenAI 收紧账号安全、敏感对话和供应链响应,Microsoft 提醒 AI 应用最危险的往往是配置失误,GitHub 则把 Copilot app、自动模型选择和 Actions 镜像迁移一起推到前台。对技术人来说,今天最值得关注的是安全、身份和运行时治理。
2026-05-15 07:22:12
560
原创 科技早报晚报|2026年5月14日:调试工作台、Agent 证据格式与多智能体编排,今晚更值得做成产品的 3 个技术机会
今晚这轮技术机会,真正值得看的不是又一个更聪明的 coding agent,而是 AI 工具链开始补上的三块工程基础设施:调试工作台、Agent 审计证据格式、多智能体声明式编排。文章从 16 个候选项目中筛出 10 个,并重点拆解 3 个可二次开发的产品方向。
2026-05-14 19:24:11
460
原创 科技晚报|2026年5月14日:Gemini 进系统层,开发平台开始补长期控制面
5 月 14 日这篇科技晚报聚焦几条更偏系统层和控制面的更新:Google 在 Android Show 2026 把 Gemini Intelligence 推到 Android 系统层,Google Docs 开始支持 Gemini 自定义指令;Vercel 则继续补模型网关速度、防火墙 CLI 和渐进式发布控制面,GitHub 同步推进企业从 GHES 向云平台迁移。对技术人来说,今天更值得关注的是入口、治理和迁移,而不是单点炫技。
2026-05-14 18:24:19
365
原创 科技早报晚报|2026年5月13日:科研技能包、可审计数据副驾与端侧 TTS,今天更值得跟进的 3 个技术机会
今天从 GitHub Trending、GitHub API、Hacker News 和官方页面筛出 18 个候选,重点看到 AI 正在从通用聊天走向专业技能包、可审计数据分析和端侧语音基础设施。文章拆解了 3 个更容易做成产品的方向,并给出 MVP、技术栈和风险提醒。
2026-05-14 13:59:40
432
原创 科技早报晚报|2026年5月13日:Agent 记忆、编程控制台与本地研究工作台,今天更值得动手的 3 个机会
今天从 GitHub Trending、GitHub API 和 Hacker News 筛选 18 个候选项目,重点关注 AI 编程代理从单次对话走向长期记忆、可编排控制台和本地优先知识工作流。文章拆解了团队级 agent 记忆网关、多 CLI 编程代理控制台、本地研究/会议工作台 3 个可二次开发方向,并给出 MVP、技术栈和风险提醒。
2026-05-14 13:58:01
600
原创 科技晚报|2026年5月13日:AI 开始补全库审查、移动入口和弹性调度
5 月 13 日这篇科技晚报聚焦 AI 真正走向生产后最关键的三条补课线:AWS 把安全审查推进到全代码仓库上下文级别,也为 Lambda Managed Instances 增加计划性扩缩容;Google 把 Gemini in Chrome 推进到 Android 入口;OpenAI 则展示 NVIDIA 团队如何把 Codex 接入真实工程协作。对技术人来说,安全、入口和成本治理正在一起收紧。
2026-05-14 13:56:55
563
原创 科技早报晚报|2026年5月14日:数据库沙箱、文档解析与 GPU 共享,今天更值得做成产品的 3 个技术机会
今天筛了 15 个候选项目,最值得跟进的不是新的聊天壳,而是 AI 研发和生产真正缺的三层基础设施: 数据库测试沙箱、LLM-ready 文档解析、Kubernetes GPU 共享。正文拆了这 3 个方向的用户痛点、MVP、推荐技术栈和主要风险。
2026-05-14 13:44:38
563
原创 科技早报晚报|2026年5月12日:GUI Agent、编程会话工作台与 npm 安装门禁,今晚更值得做的 3 个技术机会
今晚的技术机会集中在 AI 工具落地后的工程化问题:GUI Agent 需要可控执行和审计,AI 编程需要管理多个会话与 Git worktree,npm 依赖安装需要显式信任门禁。文章从 16 个候选项目中筛出 10 个,并重点拆解 3 个可二次开发的产品方向。
2026-05-12 19:15:01
302
原创 科技晚报|2026年5月12日:Claude 进 AWS,AI 落地拼控制面
5 月 12 日科技晚报聚焦 AI 生产化控制面:Claude Platform on AWS GA,让企业可用现有 AWS 账号、IAM、账单和 CloudTrail 接入 Anthropic 原生平台;P6-B200 进入 SageMaker Studio notebooks,Blackwell 算力更贴近交互式实验;Google 的 AI 威胁报告、REPLIQA 和 RCS 加密 rollout 则提醒技术团队同步关注安全、科研验证和跨平台协议。
2026-05-12 18:20:25
847
2
原创 科技早报晚报|2026年5月12日:本地推理、轻量 Native 与加密资料箱,今天更值得动手的 3 个技术机会
2026年5月12日的科技早报晚报,从 GitHub、Show HN、README 和官方文档中筛出 15 个候选项目,最终聚焦本地长上下文推理、轻量 Web-to-Native 应用壳、客户端加密资料箱三条机会。相比继续追逐聊天入口,这些方向更接近本地部署、原生集成和数据可控的真实需求。
2026-05-12 08:07:17
325
原创 科技早报|2026年5月12日:OpenAI 押注企业部署
5 月 12 日科技早报聚焦企业 AI 从模型能力转向部署能力:OpenAI 推出 Deployment Company,Anthropic 也用企业服务公司推进 Claude 落地;Codex 安全部署、AlphaEvolve 生产优化和 GitHub agent secrets 管理则说明,真正进入生产前,企业需要同时补齐治理、评估、安全和可持续运营。
2026-05-12 07:14:12
3163
4
原创 别把 `autoresearch` 当成“AI 科学家”:真正值得学的是它怎样把训练实验关进一个可审计的闭环
本文围绕 Karpathy 的热门项目 autoresearch,顺着 README、prepare.py、train.py、program.md 和父项目 nanochat 源码,拆解它为什么不是简单的“AI 科学家”,而是一个固定评价、固定 5 分钟预算、单文件修改、自动 keep/discard 的训练实验闭环。文章结合 GitHub issue、MLE-bench、PostTrainBench、MLAgentBench 和本地 toy budget probe,帮助读者判断如何把训练型 Agent
2026-05-12 06:10:29
48
STM32F103VET6 正点原子 移植 模板 ,模仿正点原子工程
2019-12-17
TI tiva tm4C ARM 库函数手册
2019-11-26
LCD12864 万年历 单片机 农历 显示 温度DS18B20 DS1302 AT24C02
2019-12-05
avr MEGA16 DS1302 LCD1602 万年历 时钟显示 proeus 仿真 + 程序
2019-09-11
kaggle 猫狗数据集二分类 系列(1)构建模型进行二分类,保存模型,画出走势图 代码
2019-09-16
51单片机 示波器 LCD12864 淘宝资料 论文 淘宝爆款
2020-01-19
android P 9.0 支持HTTP
2019-09-25
PIC16F887 官方文档 用户手册 另加2个仿真例程 LCD1602 矩阵键盘 拨号 计算器 音乐盒
2019-09-19
STM32F103RCT6 PCB 原理图 打板 原子 mini
2019-11-29
SHT3x_Datasheet_digital英文手册.pdf
2021-02-21
51单片机 普中V2 数字时钟 电子时钟 万年历 DS1302 LCD1602 AT24C02
2020-10-26
Gitxmind GIt bash 使用 xmind
2021-07-11
STM32F103C8T6 单片机 ESP8266 12F接入机智云
2020-09-05
工具软件 MSP430F149下载程序所需要用到的软件
2020-07-05
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅