自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(169)
  • 资源 (2)
  • 收藏
  • 关注

原创 Jev 实测版:948 次真实调用,我画出它「什么时候能信」的那条线

Jev 实测版:948 次真实调用,我画出它「什么时候能信」的那条线 > 实测系列 · 承接上一篇《爆火的 Jev 精读》——那篇是引用版,这篇是把 Key 拿到手之后的实测版 上一篇我只做了资料研究:Jev 需要注册才能调用,本机跑不了,所有数字标了出处。9 月 21 日拿到 Key 之后,我把能测的都测了一遍——948 次真实调用,包括延迟拆解、中英配对

2026-09-21 13:10:22 463

原创 爆火的 Jev 精读:把“生成文本“整个砍掉,AI 判断打到 70ms 和 0.042 美元/百万 token

爆火的 Jev 精读:把"生成文本"整个砍掉,AI 判断打到 70ms 和 0.042 美元/百万 token > 数据说明:本文三类信息源,逐条标注——①官方一手:TypeSafe AI 发布博客与文档(2026-09-15,typesafe.ai);②第三方:独立评测与多家媒体交叉印证(文中标注);③本机实测:无。Jev API 需注册账号获取 Key,

2026-09-21 10:22:53 174

原创 模型用量统计为何“对不上“?relay 非流式 accountId 丢失与 Claude Code 后台流量的完整排查

模型用量统计为何"对不上"?relay 非流式 accountId 丢失与 Claude Code 后台流量的完整排查 > 摘要:一个 AI 平台的用量面板里,同一个模型出现了"供应商空白"的独立行;同时另一个第三方用量工具与平台统计始终对不上。本文记录一次完整排查:从"供应商名为什么是空的"一路追到一个 3 行的网关 bug,再顺带揭开 Claude Co

2026-09-17 09:52:53 44

原创 DeepSeek Harness 本地部署与第三方插件排障实录:从 fetch failed 到 preset not found

DeepSeek Harness 本地部署与第三方插件排障实录:从 fetch failed 到 preset not found > 本文是一次完整真实的排障复盘:在 Windows 上从零跑通 DeepSeek Harness(dsh), > 再装上一个第三方 client UI 插件,然后把踩到的每一个坑连根因带修法全部拆开。 > 文中所有报错原文、版

2026-09-15 15:42:25 470

原创 十篇“最 X 的前十名 X“打完收官:本机实测翻了 3 处旧案,公开数据拆了 7 块招牌——贯穿全季的 5 条硬规律

十篇"最 X 的前十名 X"打完收官:本机实测翻了 3 处旧案,公开数据拆了 7 块招牌——贯穿全季的 5 条硬规律 > 盘点系列总结篇 · 全系列汇总(含 10 篇目录、数据口径表与全部关键结论) 【数据说明】本文是《最 X 的前十名 X——数据说话版》系列(10 篇)的总结篇,不含新增实验——文中每一个数字都来自已发各篇,逐篇附原文链接可溯源。系列数据分

2026-09-04 14:35:36 164

原创 十个 AI 项目的典型死法:88% 死在 demo 到生产之间,而且大多不是模型的问题

十个 AI 项目的典型死法:88% 死在 demo 到生产之间,而且大多不是模型的问题 > 盘点系列第 10 篇 · 项目死法复盘(本季收官篇) 【数据说明】本篇无本机实跑,全部为外部引用层:Anaconda/Forrester 2026、Gartner 2025-2026、Forrester 根因分析(占比数据)、MIT NANDA 2025、RAND、D

2026-09-04 11:05:52 245

原创 十个 AI 编程助手怎么选:榜首每个月都在换人,但你的语言栈不会

十个 AI 编程助手怎么选:榜首每个月都在换人,但你的语言栈不会 > 盘点系列第 9 篇 · 编程助手横评 【数据说明】本篇无本机实跑(编程助手的 SWE-bench 等基准需要完整 agent + 云环境),全部为外部引用层:2026 年多来源的 SWE-bench Verified / SWE-bench Pro / Terminal-Bench 2.1

2026-09-04 11:04:13 377

原创 十种最省钱的模型部署方案:我在本机跑了基准,结论是“最省钱“的分母不是单价

十种最省钱的模型部署方案:我在本机跑了基准,结论是"最省钱"的分母不是单价 > 盘点系列第 8 篇 · 部署成本核算 【数据说明】本篇分两层:本机实测层——Qwen3.5-0.8B(本机 2026-09 换代后的主力模型)在纯 NumPy CPU 引擎上 bf16/int8/int4 三档基准(固定 workload:404 token prompt + 3

2026-09-03 10:37:30 167

原创 十大 Agent 框架怎么选:star 最多的两家,都不是生产默认

十大 Agent 框架怎么选:star 最多的两家,都不是生产默认 > 盘点系列第 7 篇 · Agent 框架横评 【数据说明】本篇无本机实跑(框架横评的统一标尺部分采用第三方公开评测数据),数据分两层:公开核算层——GitHub star / PyPI 月下载量(2026-07 快照,多来源交叉)+ 企业采用案例;外部引用层——"同一 4-agent 流

2026-09-03 10:32:55 239

原创 十个立竿见影的 Prompt 技巧:小模型 A/B 实测排名,冠军还是“教它闭嘴“

十个立竿见影的 Prompt 技巧:小模型 A/B 实测排名,冠军还是"教它闭嘴" > 盘点系列第 6 篇 · Prompt 技巧实测 【数据说明】本篇全部本机实跑,且跨两代模型各跑了一遍:Qwen3.5-0.8B-Instruct + 纯 NumPy CPU 引擎(本机 2026-09 换代口径),8 道可自动判分的短任务(算术/抽取/常识/知识/计数/翻

2026-09-02 10:12:02 517

原创 十个最被吹过头的 AI 概念:我给每条“宣传话术“配上了打脸数据

十个最被吹过头的 AI 概念:我给每条"宣传话术"配上了打脸数据 > 盘点系列第 5 篇 · 概念纠偏 【数据说明】本篇无本机实跑,全部为外部引用层:TEKsystems、Gartner、Forrester、MIT NANDA、RAND、Deloitte、BCG、McKinsey、S&P Global 等 2025-2026 年报告,每条"宣传 vs 现实"

2026-09-02 10:10:21 226

原创 十个最容易翻车的大模型应用坑:我在 0.5B 和 0.8B 上各复现了一遍,一半结论变了

十个最容易翻车的大模型应用坑:我在 0.5B 和 0.8B 上各复现了一遍,一半结论变了 > 盘点系列第 4 篇 · 应用坑复现 【数据说明】本篇全部本机实跑,且跑了两代模型:Qwen3.5-0.8B-Instruct(本机 2026-09 换代后的主力)+ 纯 NumPy CPU 推理引擎,greedy 解码 + 可控温度采样,脚本 top10_ep4_p

2026-09-01 13:39:53 337

原创 十个最值得做的 AI 副业方向:我扒了平台的真实需求数据,“月入十万“的请先冷静

十个最值得做的 AI 副业方向:我扒了平台的真实需求数据,"月入十万"的请先冷静 > 盘点系列第 3 篇 · AI 副业方向 【数据说明】本篇无本机实跑(副业市场没法"跑"出来),全部为公开核算层:Upwork/Fiverr 官方财报与技能报告、Upwork Future Workforce Index 2026、GigRadar 2026、Ramp Eco

2026-09-01 13:38:14 558

原创 十个主流大模型 API 的真实账单:同一个客服 workload,最贵和最便宜差 31 倍

十个主流大模型 API 的真实账单:同一个客服 workload,最贵和最便宜差 31 倍 > 盘点系列第 2 篇 · API 成本核算 > ✅ 【数据说明】:本文为公开核算——单价来自各比价站对官方定价的核验(CloudZero 声称已对照 OpenAI/Anthropic/Google/DeepSeek 官方文档,截至 2026-08-20;国内厂人民币

2026-08-31 10:10:21 361

原创 2026 最能打的十个开源大模型:我本机跑了最小那档,榜单只信一半

2026 最能打的十个开源大模型:我本机跑了最小那档,榜单只信一半 > 盘点系列第 1 篇 · 开源模型选型 > ✅ 【数据说明】:本文数据分三层。① 本机实跑:最小档模型数据来自本机实测(纯 NumPy CPU 引擎 + 本地 Qwen3.5-0.8B 权重,无 GPU、无 torch,2026-09 重跑口径),逐条附数据文件可溯源;② 公开核算:下载量

2026-08-31 10:08:32 1090

原创 AI 鉴伪实战收官:刻意「骗」检测器的招几乎全跪,活下来的全是它自己的盲区——10 期实测的 7 条硬规律

AI 鉴伪实战收官:刻意「骗」检测器的招几乎全跪,活下来的全是它自己的盲区——10 期实测的 7 条硬规律 > 系列总结篇 · 全系列汇总(含 10 篇目录与全部关键结论) > ✅ 【实测说明】:本文是《AI 鉴伪实战:猫鼠对抗,我替你试了》系列(10 篇)的总结篇,不含新增实验——文中每一个数字都来自已发各期的本机真跑(纯 NumPy 引擎加载本地 Qwe

2026-08-28 10:22:05 201

原创 十期猫鼠对抗打完,我把它收成了一张「骗术存活率表」和两份清单

十期猫鼠对抗打完,我把它收成了一张「骗术存活率表」和两份清单 > 系列第 10 篇 · 收官:防御方法论 > ✅ 【实测说明】:本篇是《AI 鉴伪实战》收官,汇总前 9 期全部本机真跑结论(文本/图像/水印/翻译/改写/字符/跨模态/长短/文风),并给出一张「骗术存活率总表」+ 两份落地清单(读者防骗 / 检测方怎么做更稳)。第 9 期起检测器升级为「困惑度

2026-08-27 13:47:37 262

原创 让 AI 模仿「老工程师毒舌腔」写,检测器会被文风带偏吗?我本机试了 few-shot 仿写

让 AI 模仿「老工程师毒舌腔」写,检测器会被文风带偏吗?我本机试了 few-shot 仿写 > 系列第 9 篇 · 文风对抗 > ✅ 【实测说明】:本篇本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-0.5B,做两组对照:① 平铺直叙的 AI 科普文(3 段);② 给 2 段「老工程师毒舌腔」范例做 few-shot,让同一模型模仿该文风写 3

2026-08-27 11:41:06 331

原创 同样一段 AI 文,写 60 字和写 1000 字,检测器判得一样准吗?我本机测了 4 档长度

同样一段 AI 文,写 60 字和写 1000 字,检测器判得一样准吗?我本机测了 4 档长度 > 系列第 8 篇 · 长短文本差异 > ✅ 【实测说明】:本篇本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-0.5B,生成 4 档长度(~60 / ~160 / ~320 / ~640 字)的 AI 文各 3 段,配同长度的人写文,跑「困惑度(PP

2026-08-26 10:04:45 611

原创 一张 AI 图配段人写解说,检测器就全盘信了?我本机试了「图文组合伪造」的盲区

一张 AI 图配段人写解说,检测器就全盘信了?我本机试了「图文组合伪造」的盲区 > 系列第 7 篇 · 跨模态盲区 > ✅ 【实测说明】:本篇本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-0.5B 做「困惑度(PPL) + n-gram 冗余度」双信号文本检测器,对 4 段 AI 图注与 4 段人类图注复测判定;图像侧对 4 张本机生成的 AI

2026-08-26 10:03:07 305

原创 往 AI 文里塞零宽空格、同形字,检测器就瞎了?我本机试了,谣言破了——但有两个真盲区

往 AI 文里塞零宽空格、同形字,检测器就瞎了?我本机试了,谣言破了——但有两个真盲区 > 系列第 6 篇 · 字符干扰 > ✅ 【实测说明】:本篇「字符干扰」部分本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-1.5B 做困惑度(PPL)检测器,对 4 段 AI 中文文注入 4 类「人眼看不出、但分词器可能炸」的字符(零宽空格 / BOM+ZW

2026-08-25 11:21:23 299

原创 把 AI 文「改写成人话」,检测器就认不出了?我本机试了两种写法,结果反了

把 AI 文「改写成人话」,检测器就认不出了?我本机试了两种写法,结果反了 > 系列第 5 篇 · 改写绕弯 > ✅ 【实测说明】:本篇「改写绕弯」部分本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-1.5B,生成 4 段 AI 中文文,再做两种「改写成人话」:(①) 用同一模型做 LLM 人话重写(模拟市面上的 AI humanizer,本身也

2026-08-25 11:19:45 663

原创 把 AI 文机翻一遍再翻回来,检测器就认不出了?我本机试了,真管用——但代价很蠢

把 AI 文机翻一遍再翻回来,检测器就认不出了?我本机试了,真管用——但代价很蠢 > 系列第 4 篇 · 翻译绕弯 > ✅ 【实测说明】:本篇「翻译绕弯」部分本机真跑——用纯 NumPy 引擎加载本地 Qwen2.5-1.5B,生成 4 段 AI 中文文,逐段做「中→英→中」往返翻译,再用第 1 期自建的困惑度+突兀度检测器复测判定变化。全程无 key、无

2026-08-24 10:47:37 335

原创 我给 AI 图纹了身:肉眼看不见的水印,扛不扛得住裁切和重压?

我给 AI 图纹了身:肉眼看不见的水印,扛不扛得住裁切和重压? > 系列第 3 篇 · 水印攻防 > ✅ 【实测说明】:本篇「隐形水印」部分本机真跑——用纯 NumPy 实现分块 DCT(频率域)隐形水印,把一枚全局水印比特嵌进一张 AI 图(1024×1024)的亮度通道,再用 10 种常见操作去攻击它,看这枚「纹身」还在不在。全程无 key、无 torc

2026-08-24 10:45:58 235

原创 我用主流工具生成 4 张 AI 图,逐张查「出生证」:0 张带溯源元数据

我用主流工具生成 4 张 AI 图,逐张查「出生证」:0 张带溯源元数据 > 系列第 2 篇 · 图像鉴伪 > ✅ 【实测说明】:本篇「能本机真跑」的部分均来自本地实测——用图像生成工具产出 4 张不同主题 AI 图(存盘),再用纯本地 PIL + NumPy 脚本逐张查 EXIF / XMP / C2PA 溯源字节、做「元数据伪造 + 8 种常见转换存活

2026-08-21 14:15:34 202

原创 我把 4 段 AI 文和 4 段人话喂给自搭检测器:全判对,却暴露了所有检测器共有的死穴

我把 4 段 AI 文和 4 段人话喂给自搭检测器:全判对,却暴露了所有检测器共有的死穴 > 系列第 1 篇 · 文本鉴伪 > ✅ 【实测说明】:本篇所有数字均来自本机真跑。检测器用纯 NumPy CPU 引擎加载真实的 Qwen2.5-0.5B 权重,靠 teacher_logits 算困惑度(perplexity)、句级标准差算突兀度(burstines

2026-08-21 14:13:53 291

原创 大模型工程实测 2026 收官:账单砍了 79%、端侧跑通了、Agent 却九死一生——10 篇实跑下来的硬规律

大模型工程实测 2026 收官:账单砍了 79%、端侧跑通了、Agent 却九死一生——10 篇实跑下来的硬规律 > 系列终篇 · 全系列汇总(含 10 篇目录与全部关键结论) > ⚠️ 来源声明(先看这段):本文是《大模型工程实测 2026:我实跑给你看》系列的汇总篇,非原创研究,是对本系列 10 篇实操文章的二次梳理。文中数字分两类:本机真跑(端侧延迟/

2026-08-20 14:04:20 232

原创 长上下文实测:prompt 越长首 token 越慢多少?0.5B/1.5B 真跑拆解 TTFT

长上下文实测:prompt 越长首 token 越慢多少?0.5B/1.5B 真跑拆解 TTFT > 系列第 10 篇 · 长上下文代价 > ✅ 本文性质说明:本篇全部延迟数据来自本机真跑。纯 NumPy CPU 引擎(OpenBLAS)加载真实 Qwen2.5-0.5B / 1.5B 权重,对 6 档不同长度的输入(0.5B)和 2 档(1.5B)分别测量

2026-08-20 14:00:58 282

原创 函数调用实测:0.5B 调工具比 1.5B 还准?12 个真实场景我拿本机真跑了一遍

函数调用实测:0.5B 调工具比 1.5B 还准?12 个真实场景我拿本机真跑了一遍 > 系列第 9 篇 · 工具调用(Function Calling) > ✅ 本文性质说明:本篇全部结论来自本机真跑。我用纯 NumPy CPU 引擎(OpenBLAS)加载真实的 Qwen2.5-0.5B / 1.5B 权重,把 12 个自然语言请求喂给模型、走真实的 c

2026-08-20 13:57:13 321

原创 表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错了

表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错了 > 系列第 8 篇 · 反直觉优化 > ✅ 本文性质说明:token 数、prefill 延迟、问答正确率全部本机真跑(Qwen2.5-0.5B-Instruct,纯 NumPy CPU,脚本 eng_repr_tokens.py 给全)。成本金额是「本

2026-08-19 10:07:06 686

原创 零能力 Agent 骗过评测实测:朴素 harness 被骗 75%,加固后仍漏掉「抄答案」

零能力 Agent 骗过评测实测:朴素 harness 被骗 75%,加固后仍漏掉「抄答案」 > 系列第 7 篇 · 评测防作弊 > ✅ 本文性质说明:本篇全部结论来自本机真跑。我写了 5 个 agent(1 个诚实 + 4 个零能力),每个都在独立临时目录里真实 subprocess 调用 pytest 9.1.1,读真实退出码与真实统计行——不是伪代码、

2026-08-19 10:05:17 171

原创 表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错

表征格式实测:JSON 换 HTML 省 33% token 且质量不掉,Markdown 最省却答错了 > 系列第 8 篇 · 反直觉优化 > ✅ 本文性质说明:token 数、prefill 延迟、问答正确率全部本机真跑(Qwen2.5-0.5B-Instruct,纯 NumPy CPU,脚本 eng_repr_tokens.py 给全)。成本金额是「本

2026-08-18 14:03:17 318

原创 SWE-bench 拿了 80% 分,人工却只合并 50%:榜单正在系统性高估你的 Agent

SWE-bench 拿了 80% 分,人工却只合并 50%:榜单正在系统性高估你的 Agent > 系列第 5 篇 · Agent 评测 > ⚠️ 本文性质说明:「通过 SWE-bench 的 patch 仅 ~50% 被人工合并」为 METR 公开研究结论(外部数据,引用);同时本文给了本机真跑的轻量评测方案——你用本地 0.5B 就能搭确定性小评测,验证

2026-08-18 14:01:34 420

原创 小模型选型对决 2026:我用 0.5B 和 1.5B 真跑了一遍,再给你一张决策树

小模型选型对决 2026:我用 0.5B 和 1.5B 真跑了一遍,再给你一张决策树 > 系列第 4 篇 · 小模型选型 > ✅/⚠️ 本文性质说明:本机真跑了 Qwen2.5-0.5B vs 1.5B 的对比(延迟、吞吐、质量探针均为本机实测,命令/数据可复现);但 Gemma4 / Phi-4 / Qwen3 等同档模型的跨模型对比,本机无对应权重,无法

2026-08-18 13:58:38 255

原创 手机跑大模型不是梦:我在 CPU 上把 Qwen2.5 跑出了真实速度

手机跑大模型不是梦:我在 CPU 上把 Qwen2.5 跑出了真实速度 > 系列第 3 篇 · 端侧推理 > ✅ 本文性质说明:本篇是本机真实跑出来的数。我用纯 NumPy + OpenBLAS 引擎(无 GPU、无 torch)在 CPU 上实跑 Qwen2.5-0.5B / 1.5B,下面所有延迟、吞吐、量化 KL 都是本机实测,可复现。厂商数字(LFM

2026-08-18 13:56:53 259

原创 再砍 70%:语义缓存 + 按复杂度路由 + 硬上限,账单还能再塌一轮

再砍 70%:语义缓存 + 按复杂度路由 + 硬上限,账单还能再塌一轮 > 系列第 2 篇 · 推理降本 > ⚠️ 本文性质说明:本篇与第 1 篇一样,是公开数据核算 + 配置演示,非本机真实 API 调用实测(本机无 API key)。引用的省钱数字来自公开工程案例并标注来源;配置模板可直接套你自己的网关。它不违反「严禁编造」红线——凡引用外部数据均注明出

2026-08-17 09:55:12 207

原创 账单砍 79%:只改一个参数,LLM API 成本就崩了

账单砍 79%:只改一个参数,LLM API 成本就崩了 > 系列第 1 篇 · 推理降本 > ⚠️ 本文性质说明(务必先读):本篇是公开数据核算 + 厂商定价机制推演,非本机真实 API 调用实测。所有数字都标注了来源,你可以照文末模板套自己的账单复算。它不违反「严禁编造」红线——凡引用外部数据均注明出处,凡属推算均标明假设。第 3、4、7、8 篇才是本机

2026-08-17 09:52:04 325

原创 AI 前沿论文精读收官:最强模型在真实长程任务里只做对 38.6%——10 篇读下来的 7 条硬规律

AI 前沿论文精读收官:最强模型在真实长程任务里只做对 38.6%——10 篇读下来的 7 条硬规律 > 系列终篇 · 全系列汇总(含 10 篇目录与全部关键结论) ICLR 2026 的 Toolathlon 把当前最强模型扔进「32 个真实软件 + 604 个工具 + 108 个长程任务」的环境,成功率只有 38.6%;同期的另一篇 ICML 2026

2026-08-14 14:11:14 526

原创 OpenAI 的竞赛编程报告:o3 在 Codeforces 跑到 2724 分、超过 99.8% 人类——推理模型怎么把代码玩成竞技

OpenAI 的竞赛编程报告:o3 在 Codeforces 跑到 2724 分、超过 99.8% 人类——推理模型怎么把代码玩成竞技 > 系列第 10 篇 · 子领域:代码模型 / Code LLM 【来源信息】 - 类型:机构技术报告 - 标题:Competitive Programming with Large Reasoning Models - 作

2026-08-14 09:53:00 213

原创 Agentic RAG 不是搜得越多越好:ACL 2026 的 AutoSearch 给过度搜索踩了刹车

Agentic RAG 不是搜得越多越好:ACL 2026 的 AutoSearch 给过度搜索踩了刹车 > 系列第 9 篇 · 子领域:检索增强 / RAG 【来源信息】 - 类型:顶会论文 - 标题:AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement

2026-08-13 09:54:00 528

最新Windows版本nvm安装包

nvm用于控制node.js版本切换。

2024-10-11

前端Vue面试题.docx

该面试题分为选择题、判断题、简答题三部分,总分为100。涵盖了大部分Vue及其全家桶相关知识点。

2021-03-30

俄版team viewer

俄版 teamviewer,可随时随地修改本机id,无限制访问!直接解压安装即可。

2019-03-26

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除