- 博客(1810)
- 资源 (3)
- 收藏
- 关注
原创 PostgreSQL 热备是怎么实现的?一文讲清 Base Backup、WAL、LSN、Checkpoint 与 PITR
本文系统讲解 PostgreSQL 在线物理热备与恢复机制,重点解析 WAL、LSN、Checkpoint、Base Backup、WAL Replay 与 PITR 之间的工作关系,并说明 PostgreSQL 如何在数据库持续读写的情况下完成一致性物理备份。文章进一步介绍 WAL Archive、Timeline、Restore Point、backup_manifest、pg_verifybackup,以及 PostgreSQL 17+ 基于 WAL Summary 的原生增量备份和 pg_combi
2026-08-26 14:17:14
369
原创 REALITY 技术深度解析从 TLS 伪装、抗主动探测到 VLESS + XTLS Vision 完整实践
Xray中的TLS层代理认证机制 REALITY是Xray代理工具中工作在TLS/传输安全层的一套创新机制,其核心原理是利用目标网站的TLS外观配合自身客户端认证,实现代理连接的隐蔽性。与传统方案不同,REALITY无需服务器持有目标站点私钥,而是通过模拟目标站点的TLS握手特征和REALITY专属认证逻辑,将代理服务身份与普通TLS访问行为分离。 该机制包含多层验证: 客户端通过uTLS模拟浏览器TLS指纹 服务端验证SNI与预设serverNames匹配 使用X25519密钥对进行身份认
2026-08-13 11:31:05
446
原创 XHTTP 和 HTTP 到底有什么区别?从协议原理到 VLESS + XHTTP + REALITY 一次讲透
HTTP 与 XHTTP 是不同层级的协议:HTTP 是标准的 Web 资源交换协议,而 XHTTP 是建立在 HTTP 之上的代理数据传输系统。XHTTP 作为传输方式(Transport Method),负责将代理流量映射到 HTTP 模型中,并与 VLESS(代理协议)、TLS/REALITY(传输安全)、TCP/QUIC(网络传输)协同工作。 XHTTP 提供三种模式以适应不同场景: packet-up:将上行数据拆分为多个 HTTP POST 请求,下行通过流式响应实现,兼容性高; stream-
2026-08-11 14:09:24
442
原创 CloakBrowser 深度解析从 Playwright 包装层到源码级指纹 Chromium,讲透架构、Humanize、GeoIP、供应链安全与生产实战
浏览器自动化一致性解决方案 CloakBrowser是一款专注于解决现代浏览器自动化中身份一致性的开源框架,其核心价值在于构建多层次的浏览器身份一致性平台。通过分析其技术架构和底层原理,我们可以理解它在反自动化检测领域的创新之处。 关键技术创新点: 深度指纹一致性处理:直接在Chromium源码层修改Canvas、WebGL、WebGPU等核心API,确保指纹信号从底层生成时就具备真实性,而非简单的JS属性覆盖。 网络身份系统:智能整合代理IP、时区、语言和WebRTC地址
2026-08-04 13:26:50
539
原创 yt-dlp 从入门到架构一篇讲透提取器、格式选择、分片下载、FFmpeg 与生产级集成
本文介绍了命令行音视频下载工具yt-dlp的核心功能、技术架构和使用建议。yt-dlp不仅是一个下载器,还是一个可扩展的媒体处理框架,支持从页面解析到最终文件生成的全流程。文章详细说明了其六层核心架构(入口层、协调层、提取层、传输层、网络层和后处理层),并强调了合法使用边界。安装建议包括独立可执行文件和Python集成方式,同时指出FFmpeg在媒体处理中的关键作用。最后提供了最小可用命令示例和调试技巧,并讨论了不同环境下的版本更新策略。
2026-08-02 10:49:05
510
原创 Crawlee 用 Node.js 构建可扩展的网页采集与浏览器自动化系统
Crawlee 是一款强大的 JavaScript/TypeScript 网页采集与浏览器自动化框架,由 Apify 开源。本文全面介绍 Crawlee 的核心架构、Crawler 选型指南,并通过完整案例演示如何采集 Quotes to Scrape 网站。内容涵盖动态页面处理、生产级配置及常见问题解决方案,帮助开发者构建可扩展的爬虫项目。文章重点对比了 CheerioCrawler(静态页面)与 PlaywrightCrawler(动态页面)的适用场景,并提供了项目创建、路由配置、数据存储等实
2026-07-31 11:45:36
403
原创 Mamba-2 / SSD 状态空间对偶与高效长序列建模
从 Tri Dao 与 Albert Gu 于 2024 年发表的《Transformers are SSMs》出发,完整剖析 Mamba-1 的三个效率天花板(小状态、用不上 Tensor Core、系统适配差)、选择性状态空间模型回顾、半可分矩阵——SSM 的矩阵视角、SSD(State Space Duality)对偶——SSM 与掩码注意力是同一类结构化矩阵的两种计算方式、标量 A 简化与 8-16 倍状态扩容、块内注意力+块间递推的 SSD 分块算法、原生多头与张量并行、2-8 倍训练提速、Mam
2026-07-28 12:45:42
139
原创 KAN Kolmogorov-Arnold 网络深度解析
从 MIT 刘子鸣(Ziming Liu)等于 2024 年提出的 KAN 出发,完整剖析它对 MLP 的"对偶翻转"(可学习函数在边上、节点只做求和)、Kolmogorov-Arnold 表示定理与通用逼近定理的对比、B 样条对可学习一元函数的参数化、残差式激活与训练方法、网格细化(grid extension)带来的阶梯式精度提升与 N⁻⁴ 缩放定律、剪枝-可视化-符号回归的可解释性流水线、在物理公式拟合与数学猜想上的科学发现应用、KAN vs MLP 的全面对比、PyTorch/pykan 实现要点,
2026-07-28 11:48:57
51
原创 KimiLinear线性注意力深度解析
从月之暗面(Moonshot AI)于 2025 年发布的 Kimi Linear 出发,完整剖析为什么需要线性注意力(KV Cache 与长上下文的成本困境)、线性注意力的数学基础(从 softmax 到核分解与固定状态)、Delta 规则的"擦除-写入"快速权重更新、KDA(Kimi Delta Attention)的细粒度通道级遗忘门控、分块并行算法与硬件高效实现、KDA 与全注意力 MLA 的 3:1 混合架构、KV Cache 削减 75% 与百万级上下文解码提速约 6 倍、Kimi Linear
2026-07-24 16:30:12
501
原创 让 AI Agent 真正操作浏览器ego (lite) 两分钟快速上手与技术原理解析
ego (lite):让AI Agent操作真实浏览器的技术架构 核心价值 ego (lite) 通过连接AI Agent与真实Chromium浏览器,解决了传统AI工具只能"阅读"网页而无法"操作"登录态网站的问题。它使Agent能够在用户授权范围内完成登录、点击、表单填写等真实网页操作任务。 技术架构 系统分为三层: 任务层:由Codex等AI Agent理解用户目标并规划流程 自动化层:ego-browser Skill提供操作接口 浏览器层:ego (lite) Chromium浏览器保持用户登录态
2026-07-24 11:26:44
1631
原创 Titans 会在测试时学习记忆的神经网络
从 Google Research 于 2024 年底提出的 Titans 出发,完整剖析为什么需要"测试时记忆"、上下文窗口 vs KV Cache vs 固定状态的三重局限、神经长期记忆模块如何把历史写进网络权重、惊讶度(surprise)信号驱动的记忆更新、测试时(推理时)的在线梯度学习、遗忘门与动量的自适应记忆管理、三种架构变体(MAC/MAG/MAL)、短期记忆(注意力)与长期记忆(神经记忆)的协同、2M+ token 超长上下文能力、Titans vs Transformer vs Mamba
2026-07-23 11:41:42
196
原创 11 天、64 个 Claude、百万行级改动Bun 为什么从 Zig 转向 Rust?
Bun 团队没有因为 Zig “不够好”而放弃 Zig。真正推动迁移的,是 JavaScriptCore 的垃圾回收体系与手动内存管理长期交织后,产生的大量生命周期、异常路径和资源释放问题。Bun 最终选择 Rust,并使用 Claude Code 组织约 64 个并行智能体,在 11 天内完成机械式迁移、编译修复、对抗审查和全平台测试。这个案例真正值得研究的,不是“AI 写了多少代码”,而是如何把编译器、测试套件、代码审查和工作流约束组合成一条可验证的工程流水线
2026-07-23 11:16:03
304
原创 Jamba Transformer + Mamba + MoE 的生产级混合架构
AI21 Labs于2024年推出的Ja从 Amba模型开创性地融合了Transformer、Mamba和MoE三种架构,通过1:7的注意力层与Mamba层交错设计,结合MoE的稀疏扩容机制,在质量、效率与容量间实现平衡。该模型具备256K超长上下文处理能力,单卡可支持140K tokens的高吞吐推理,总参数量52B但仅激活12B参数。Jamba的创新在于:用少量注意力层保障检索质量,主体Mamba层维持线性计算效率,MoE专家系统扩展模型容量,解决了传统Transformer的O(N²)复杂度痛点。作为
2026-07-22 15:54:35
157
原创 RWKV 一个可并行训练的 RNN
从 Bo Peng(彭博)发起的开源项目 RWKV 出发,完整剖析 Transformer-RNN 混合网络的设计哲学、为什么需要"训练并行 + 推理高效"的两全其美、线性注意力如何从 softmax 中解放出来、Time-mixing 与 Channel-mixing 双模块、WKV 机制与时间衰减、训练并行与推理循环的两种等价形式、Token Shift 与感受野、RWKV vs Transformer vs Mamba/SSM 的全面对比、从 RWKV-4 到 RWKV-7 (Goose) 的版本演进
2026-07-22 11:41:58
79
原创 GraphSAGE 让图神经网络走向大规模与归纳式
百科级深度长文:从 2017 年 William Hamilton、Rex Ying、Jure Leskovec 在斯坦福那篇 *"Inductive Representation Learning on Large Graphs"* 出发,完整剖析直推式与归纳式学习的根本区别、GCN 的局限、邻居采样为何能控制计算爆炸、Mean/Pooling/LSTM 三种聚合函数、逐层聚合的前向传播数学、归纳式学习如何泛化到新节点和新图、无监督与有监督训练、GraphSAGE vs GCN vs GAT 的全面对比
2026-07-21 13:08:46
46
原创 编译原理NFA 与 DFA——Thompson 构造与子集构造法图解(十)
本文系统讲解了从正则表达式到确定有穷自动机(DFA)的转换过程。主要内容包括: 理论基础:有穷自动机的五元组定义,NFA与DFA的核心差异在于转移函数和ε转移的允许性。 Thompson构造法:通过五条归纳规则将正则表达式转换为NFA,每个规则对应一个NFA构建模块,保证线性状态增长。 子集构造法:通过ε闭包和move操作将NFA转换为DFA,DFA状态对应NFA的可能状态集合,文中通过(a|b)*abb示例详细演示了转换过程。 复杂度分析:比较了NFA模拟(O(n|r|))和DFA运行(O(n))的性能差
2026-07-20 15:57:10
50
原创 编译原理硬核词法分析器实战——转换图、最长匹配与 Lex/Flex(九)
本文介绍了词法分析器的实现方法,将正则表达式转换为可执行的转换图,并最终生成词法分析代码。主要内容包括: 转换图的定义与组成部件,重点解释了星号状态(需回退字符)的必要性,以满足最长匹配原则。 通过识别字符串"i<=10"的完整过程,展示了转换图的工作机制和两次回退操作的不同场景。 介绍了Lex/Flex工具的三段式结构,以及其两条核心冲突解决规则:最长匹配优先和先列优先。 提供了Python实现示例,演示如何将转换图直接翻译为代码,包括标识符、数字和关系运算符的识别逻辑。 文章强调词法分析的关键在于正确处
2026-07-17 14:48:34
54
原创 编译原理硬核正则表达式的数学基础——从串、语言到形式化规约(八)
本文是《编译器前端核心》课程的第三阶段开篇,重点讲解词法分析中的正则表达式与语言理论基础。内容分为六个部分: 词法与语法分离的原因:从简化设计、效率和可移植性三个角度分析,并指出正则语言与上下文无关语言的数学能力差异。 语言与集合基础:定义字母表、串、连接、幂运算等概念,强调语言是符号串的任意集合。通过集合运算(并、连接、闭包)构建复杂语言。 正则表达式定义:归纳式给出五条基本规则(ε、a、r|s、rs、r*),并说明优先级和结合性。通过实例演示如何枚举正则语言成员。 匹配过程可视化:通过动画展
2026-07-17 14:41:03
438
原创 编译原理硬核——编译器核心概念的全景速览(七)
本文系统梳理了编译器前端设计的核心思想与技术路线。通过四篇笔记的递进关系,展现了从文法定义到代码生成的完整流程:CFG文法→分析树→SDD语义定义→SDT翻译方案→递归下降实现→三地址码生成。文中汇总了关键公式与定理,建立微型编译器代码与理论的对应关系,并指出第2章内容在全书的深化路径(如词法分析、语法分析、属性计算等)。最后提供综合自测清单和三个思考题,考察读者对语法制导翻译本质的理解,包括动作差异、语言特性扩展和工程实践考量。全文强调"最小可用版"到"系统化保证"的学习方法论,为后续编译器深层技术的学习
2026-07-17 14:36:19
48
原创 编译原理硬核从零构建一个微型编译器——中间代码生成实战(六)
本文介绍了一个完整的微型编译器实现,分为四个核心部件:词法分析器、递归下降分析器、符号表和三地址码生成。通过左递归消除公式将文法转换为递归下降可解析的形式,并展示了分析器如何同步执行语义动作生成中间代码。符号表采用链式结构实现静态作用域规则,词法分析器处理多位数字和关键字识别。最终组装成的编译器支持基本表达式、变量声明、嵌套块和作用域检查,体现了"边分析边翻译"的一遍式编译核心思想。文章通过动画演示了"9-5+2"的完整解析过程,强调如何在不构建显式语法树的情况下直接生成三地址码。
2026-07-17 14:33:36
256
原创 编译原理硬核语法制导翻译——给文法赋予“含义“(五)
本文介绍了如何通过语法制导定义(SDD)和语法制导翻译方案(SDT)将中缀表达式转换为后缀表达式。主要内容包括: 后缀表达式的归纳定义及其栈式求值原理 综合属性的概念及其与后序遍历的关系 完整的中缀转后缀SDD示例及其属性求值过程动画演示 SDT的实现方式及其与SDD的区别 Python实现中缀表达式到后缀表达式的转换及求值 关键点: 综合属性可通过后序遍历一次完成求值 后缀表达式天然适合栈式求值 SDD是声明式定义,SDT是操作式实现 实现完整的中缀→后缀→求值处理链
2026-07-17 14:18:02
127
原创 深度学习生成模型全景收官 (一百零四)
本文是深度学习笔记系列的完结篇,全面总结了深度生成模型的知识体系与评估方法。文章首先绘制了生成模型的全景图,将主流方法分为六大类:能量模型(RBM/DBM)、VAE、GAN、自回归模型、归一化流和扩散模型,分析了它们在精确似然、采样速度和质量之间的权衡关系。 在评估方法部分,作者揭示了生成模型比较中的常见陷阱,包括不同近似方法的不可比性、评估工具偏差带来的误导,以及预处理对概率分布的根本性影响,提出了按下游任务评估的务实建议。最后,文章系统回顾了全书三大部分的知识脉络:从数学基础到深度网络实践,再到生成模型
2026-07-15 09:47:57
78
原创 深度学习有向生成网络 —— 可微生成器、VAE 与 GAN(一百零三)
本文系统梳理了现代主流的两种有向生成网络模型——变分自编码器(VAE)和生成对抗网络(GAN)。可微生成器网络通过将简单潜变量z变换为复杂样本x,巧妙避开了传统生成模型的配分函数难题。VAE采用编码器-解码器架构,通过最大化变分下界(ELBO)实现训练,兼具重构准确性和隐空间规整性,但存在生成样本模糊的问题。GAN则通过生成器与判别器的对抗博弈进行训练,无需推断网络和配分函数,但面临模式崩溃等稳定性挑战。二者共同构成了当前生成式AI的核心方法论,在图像生成等领域展现出强大潜力。
2026-07-14 11:05:09
173
原创 深度学习深度信念网络与深度玻尔兹曼机 —— RBM 的深层扩展(一百零二)
本文介绍了深度信念网络(DBN)和深度玻尔兹曼机(DBM)这两种深度生成模型。DBN是混合模型,顶部两层为无向RBM,下层为有向网络;DBM则是完全无向的多层模型。DBN在2006年的提出开启了深度学习复兴。文章详细分析了两者的结构、概率分布、采样方法及推断复杂性,并指出DBM通过二部图结构实现高效的块Gibbs采样。最后对比了RBM、DBN和DBM在隐层数、连接类型、推断难度等方面的差异,突出了它们在深度学习发展史上的重要地位。
2026-07-14 11:01:23
95
原创 深度学习]玻尔兹曼机与受限玻尔兹曼机 —— 深度生成模型开篇(一百零一)
本文介绍了深度生成模型中的经典方法——玻尔兹曼机及其变种受限玻尔兹曼机(RBM)。主要内容包括: 玻尔兹曼机作为能量模型,通过能量函数定义二值变量的概率分布,但仅建模成对相互作用,表达能力有限。 引入隐变量后,玻尔兹曼机成为离散概率分布的通用近似器,能建模高阶交互,类比于MLP通过隐藏单元增强表达能力。 玻尔兹曼机具有生物学合理的学习规则,基于局部统计信息更新权重,符合Hebbian学习机制。 RBM通过限制层内连接形成二部图结构,保留了通用近似能力,同时使条件分布可分解,支持高效的块Gibbs采样。 RB
2026-07-12 22:03:46
206
原创 Tailwind CSS v4.3 从入门到实战Vite 安装、响应式布局、暗黑模式与主题配置
Tailwind CSS 是一款工具类优先的CSS框架,通过组合原子类(如p-6、bg-white)快速构建响应式界面。文章基于v4.3版本,介绍其核心功能: 快速体验:通过CDN引入,直接编写工具类HTML。 工程化集成:结合Vite安装,配置@tailwindcss/vite插件。 布局与样式:Flex/Grid布局、间距控制、响应式设计(如md:grid-cols-2)。 交互状态:支持hover:、focus:等变体,简化交互样式。 主题定制:通过CSS变量自定义颜色、圆角等设计规范。 暗黑
2026-07-12 11:55:17
659
原创 深度学习学成近似推断 —— 推断网络与醒眠算法(一百)
本文介绍了学成近似推断的核心思想,通过神经网络直接输出近似后验分布,实现一步到位的快速推断。主要内容包括: 摊还推断:将优化代价摊到训练阶段,用神经网络近似从输入到最优后验分布的映射函数,实现一次前向传播完成推断。 醒眠算法:解决潜变量无监督标签的问题,通过模型自身生成数据配对训练推断网络,分为醒(更新生成模型)和眠(训练推断网络)两个交替阶段。 生物解释:提出做梦可能是大脑训练推断机制的一种方式,较蒙特卡洛解释更合理。 应用扩展:学成推断可加速DBM等模型的推断过程,通过训练网络直接输出改进的估计。 理论
2026-07-11 23:25:56
91
原创 深度学习变分推断与变分学习 —— 用简单分布近似复杂后验(九十九)
本文介绍了变分推断的基本原理及其在深度学习中的应用。主要内容包括: 核心思想:通过限制在简单分布族中寻找最接近真实后验的近似分布,以解决精确后验难计算的问题。 平均场近似:假设潜变量独立,将复杂后验分解为简单分布的乘积,便于优化。 优化方法:通过最大化证据下界(ELBO)等价于最小化KL散度,采用不动点方程迭代优化近似分布的参数。 KL散度方向:反向KL(变分推断使用)倾向于捕捉单一众数,而正向KL覆盖多峰分布。 深度学习联系:变分推断是变分自编码器(VAE)的理论基础,其优化过程与RNN的循环更新类似。
2026-07-08 14:08:56
245
原创 深度学习推断作为优化问题与 EM 算法 —— 直面推断难题(九十八)
本文介绍了概率模型中推断问题的核心挑战及其解决方法。推断困难主要源于多层潜变量模型后验分布的高计算复杂度(指数级时间),表现为无向模型的潜变量直接相互作用和有向模型的"解释消除"效应。为解决这一问题,文章提出将推断转化为优化问题,通过证据下界(ELBO)这一关键工具实现近似推断。 ELBO作为log p(v)的下界,由联合分布期望和近似后验q的熵组成,其与真实对数概率的间隙正是KL散度。通过最大化ELBO,可以找到最接近真实后验的q分布。EM算法利用这一思想,通过E步(固定参数优化q)和M步(固定q优化参数
2026-07-08 13:39:56
89
原创 深度学习估计配分函数 —— 退火重要采样 AIS(九十七)
本文探讨了直接估计配分函数的方法,核心是退火重要采样(AIS)。首先分析了为何需要估计配分函数(如比较模型、评估测试似然),指出模型比较只需配分函数比率而非绝对值。然后揭示简单重要采样在高维多峰分布中会失效的问题,由此引出AIS方法——通过构建中间分布序列(加权几何平均)和MCMC转移,逐步"退火"从简单分布过渡到目标分布,从而准确估计配分函数比率。文章还介绍了桥式采样作为替代方案,并比较了两种方法的优劣。这些技术为评估RBM等复杂无向模型提供了有效工具。
2026-07-08 13:33:47
60
原创 深度学习伪似然、得分匹配与噪声对比估计 —— 绕开配分函数的巧妙方法(九十六)
用链式法则,但每个条件都只条件化其他所有变量logpPLx∑i1nlogpxi∣x−ilogpPLxi1∑nlogpxi∣x−i其中x−ix−i表示除xix_ixi外的所有变量。伪似然用nnn个"单变量条件分布"的乘积,代替真实的联合似然。对数密度关于输入的导数∇xlogpx∇xlogpx被称为其得分(score)。注意:是对输入x。
2026-07-08 13:24:45
153
原创 深度学习对数似然梯度与对比散度 —— 直面配分函数难题(九十五)
本文探讨了无向概率模型中配分函数带来的计算难题及其解决方案。主要分析了: 对数似然梯度可分解为正相(提升数据概率)和负相(降低模型样本概率),负相计算需要从模型分布采样,导致计算困难。 朴素MCMC方法因计算代价过高不可行,而对比散度(CD)算法通过从数据初始化马尔可夫链并仅运行少量步骤来提升效率,但可能无法抑制虚假模式。 持续对比散度(PCD)/随机最大似然(SML)通过保持马尔可夫链的持续性状态,能更好地探索和抑制虚假模式,适合深度模型训练。 文章比较了CD和PCD的特点,指出PCD能更有效地训练深度模
2026-07-08 11:14:07
61
原创 深度学习不同峰之间的混合挑战 —— MCMC 的致命弱点与回火破局(九十四)
蒙特卡洛基础(92):用样本平均估计期望重要采样(92):集中采样于重要区域MCMC(93:马尔可夫链从任意分布采样Gibbs 采样(93):逐变量条件采样混合挑战(94):峰间混合困难 + 回火破局。
2026-07-03 19:01:06
430
原创 深度学习马尔可夫链蒙特卡洛与 Gibbs 采样 —— 走出鸡生蛋困境(九十三)
本文介绍了马尔可夫链蒙特卡洛(MCMC)方法,特别是Gibbs采样,用于解决无向模型中无法直接采样的"鸡生蛋"困境。主要内容包括: 问题背景:无向模型存在变量间的循环依赖,导致难以直接采样,而有向模型可通过祖先采样避免。 马尔可夫链原理:通过设计转移分布T,使链最终收敛到目标分布p,采样时需丢弃初始未收敛的"燃烧期"样本。 Gibbs采样:逐个变量从其条件分布中采样,交替更新各变量,只需局部条件分布而非全局联合分布。 块Gibbs采样:对条件独立的变量组同时采样,提高效率,如RBM中可同时更新所有可见或隐藏
2026-07-03 18:05:02
229
原创 深度学习蒙特卡洛采样与重要采样 —— 用随机数算积分(九十二)
上图展示最优采样分布 q*(x)∝p(x)|f(x)|:它把采样权重集中在被积函数 |f| 大的地方(结合了 p 和 |f| 的形状)。上图汇总采样的三大动机:加速可处理的求和(如小批量 SGD 子采样训练代价)、近似难处理的积分(如估计配分函数对数的梯度)、采样本身就是目标(如训练生成模型)。这与确定性数值积分(误差随维度指数恶化的维度灾难)形成鲜明对比——这正是蒙特卡洛战胜维度灾难、处理高维积分的关键优势。直接从 N(0,1) 采样,点都在中心,x>4 几乎采不到(估计差)→。速度下降(与维度无关!
2026-07-03 16:06:38
339
原创 Bililive-go 一个 Go 实现的多平台直播自动录制系统
Bililive-go 是一个用 Go 编写的开源直播录制系统,支持多平台自动录制、Web 管理、后处理等功能。它采用模块化设计,包含平台适配层、监听器、录制器、事件系统等核心组件,支持 FFmpeg/Native FLV 等多种下载器,提供弹幕录制、失败重试、流选择等特性。系统还内置 Pipeline 后处理流程,可进行转码、修复、上传等操作,并通过 Web 界面提供配置管理和实时监控。适用于需要长期稳定录制直播内容的场景,支持 Docker 部署和 NAS 环境。
2026-07-01 14:04:13
480
原创 JoyAI-VL-Interaction 实时视频语言交互模型如何从“被动问答”走向“主动在场”
用户提出问题模型读取图片或视频片段模型给出回答等待下一轮提问这种方式适合做图片问答、视频总结、内容识别,但它并不适合真实世界里的连续场景。真实场景不会等待用户提问。锅快溢出来了,孩子靠近危险区域了,比赛关键瞬间出现了,手机页面已经跳到下一步了,字幕已经切换到下一句了。等用户再开口问 AI,很多关键时机已经过去。的核心价值就在这里:它不只是回答问题,而是持续观看视觉流,自己判断什么时候应该说话,什么时候应该保持安静,什么时候应该把复杂任务交给后台模型或智能体处理。分类:首页介绍说明。
2026-06-30 16:06:01
326
原创 百度开源 Unlimited-OCR一次前向解析长文档,支持 Transformers、vLLM 与 SGLang 部署
本文介绍了百度开源的长文档OCR模型Unlimited-OCR,它通过端到端方式解析图片、PDF等多页文档,直接输出结构化文本或Markdown格式。相比传统OCR的分步骤处理,该模型采用R-SWA技术控制注意力范围,降低了长序列推理成本,支持一次性解析长达32768字符的文档。文章详细对比了传统OCR与Unlimited-OCR的区别,说明了后者在表格还原、多栏文本处理等方面的优势,并提供了环境配置和Python调用示例,包括单图识别和PDF多页解析的实现方法。该模型适合处理合同、论文、报告等复杂文档,输
2026-06-30 13:43:48
1690
1
原创 深度学习图模型的优势、学习与深度学习方法(九十一)
本文总结了结构化概率模型的核心优势及其在深度学习中的应用风格差异。结构化模型通过省略变量间直接作用降低计算成本,分离知识与算法实现灵活组合。与传统图模型相比,深度学习采用大量无预设含义的隐变量、密集矩阵连接和分布式表示,依赖高效近似推断而非精确计算。受限玻尔兹曼机(RBM)作为典型案例,通过受限结构实现条件独立和高效块Gibbs采样,展现了深度学习图模型的设计理念。文章最后指出图模型为后续蒙特卡洛采样、配分函数计算和深度生成模型奠定了基础,形成概率建模的统一框架。
2026-06-29 10:01:05
85
原创 深度学习分布式表示与因果因子 —— 什么是好的表示(八十八)
分布式表示的概念(由很多元素组合的表示,这些元素之间可以设置成可分离的)是表示学习最重要的工具之一。什么原因能够使一个表示比另一个表示更好?预训练(87):无监督学习有助监督学习迁移(88):表示跨任务、跨分布流动分布式表示(89):指数级表达能力好表示(89):解开因果因子 + 先验线索。
2026-06-24 14:57:31
671
Wav2Vec2模型文件
2024-02-29
arcface模型文件
2024-02-28
Resnet152模型文件基于2048维度的向量
2024-02-28
建议一个名称为 FusionDepthSR,即“融合深度超分辨网络” 这个名称突出了项目核心:利用 RGB 图像引导,实现深度图的超分辨率重建,并通过多尺度与反馈机制融合特征,提升重建效果
2025-03-08
Middlebury2014 & RGB TRAIN 深度超分数据集
2025-03-08
axure web元件库.zip
2024-05-17
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅