- 博客(374)
- 收藏
- 关注
原创 otes on LLMs 更新:一份更系统的大模型工程学习手册
最近,我对做了一次比较大的更新。这不是一次简单的内容补充,而是一次围绕“大模型工程学习路径”的整体重构。新版希望解决一个很常见的问题:LLM 资料很多,但真正能把 Prompt、RAG、Agent、MCP、训练微调、多模态和工程落地串起来的中文资料并不多。我想把这个项目做成一份可以持续更新、反复查阅的大模型技术手册。
2026-08-27 14:10:27
377
原创 什么是 BFF?从前后端解耦到微服务与 Agent 架构中的实践
BFF 并不是什么复杂的新技术。前端需要的数据,与后端提供的业务能力之间存在天然差异。Frontend↓BackendFrontend↓十几个 Microservices服务发现接口聚合数据转换异常处理权限拼装业务编排系统边界会越来越混乱。Frontend↓BFF↓Gateway 解决“请求怎么进系统”,BFF 解决“前端需要什么”。BFF 可以负责点菜、协调和拼盘,但不要让它自己下厨房炒菜。
2026-08-26 18:17:34
423
原创 Agent 到底该怎么评?从 RAG 指标到科学的 Agent Evaluation 体系
这个 Agent 到底怎样才算完成任务?case:input:messages:content: "帮我退掉订单 A123"order:id: A123expected:outcome:required:forbidden:response:- 应告知用户需要退货- 不得承诺立即退款run:这会成为整个开源项目最重要的核心抽象之一。LLM 时代,我们问的是:模型回答得对不对?RAG 时代,我们进一步问:模型回答的内容有没有证据?这个 AI 到底做了什么?
2026-08-26 17:52:20
322
原创 GEO 到底怎么做?从 Prompt 研究到 AI Citation 的完整落地方法
用户真正会问什么?↓AI 现在怎么回答?↓AI 为什么引用这些 Source?↓为什么竞争对手有,我没有?↓↓修改之后重新跑 Dataset↓Research↓Measure↓Analyze↓Optimize↓Evaluate↓Learn↓Repeat这才是我认为目前最合理的 GEO 方法论。
2026-08-24 22:15:00
467
原创 从 SEO 到 GEO:当搜索引擎开始直接回答问题,内容优化发生了什么?
SEO 是让机器找到你。GEO 是机器找到你以后,愿不愿意选择你。因此真正值得研究的,并不是:怎么在文章里多塞几个 GEO 技巧?为什么当 AI 需要回答这个问题的时候,我应该成为它最值得使用的信息源之一?最终决定这件事情的,很可能并不是某一个神奇标签、某一个关键词密度,或者某一个所谓 AI 专用文件。×Relevance××Evidence×Authority×在传统互联网时代,内容稀缺,所以“写出来”本身就有价值。而在生成式 AI 时代,普通内容正在变得越来越廉价。
2026-08-24 20:15:00
687
原创 实时 3D 数字人落地全记录:SDK 深拆、接大模型、7 个坑、开源工程一键部署
本文介绍了如何利用魔珐星云具身驱动SDK实现"会说话的3D数字人"项目。核心采用"参数流+AI端渲"架构,通过下发音频、表情、动作等多路参数实现本地实时渲染,具有低延迟、轻量化的优势。文章详细解析了speak接口的流式调用、SSML动作控制、事件系统、状态管理、签名鉴权等关键技术点,并重点演示了如何对接大模型实现AI实时对话功能。项目已开源并支持CI/CD一键部署,提供在线体验地址和注册优惠码。
2026-08-17 16:34:57
488
原创 5 分钟,让网页里站着一个会说话的 3D 数字人
本文介绍了如何通过魔珐星云SDK在网页中实时渲染3D数字人,实现文本驱动语音、表情和动作同步。主要内容包括:效果展示(非预录视频,而是实时AI渲染)、接入步骤(引入SDK、创建实例、调用speak方法)、开源控制台项目封装(支持即兴对话/舞蹈/流式播报等交互功能),以及技术优势(参数流+端渲染/超低延迟/全终端适配)。文末提供体验链接、邀请码(XDZARL7NEP注册送积分)和开源地址,适合开发者快速集成智能数字人功能。后续将解析毫秒级多模态联动的技术实现。
2026-08-17 16:29:18
312
原创 从 Agent Run 到 Agent LongTask:以 Coding Agent 为例理解长时复杂任务的执行架构
摘要:Agent LongTask 与普通 Agent Run 的本质区别 本文深入探讨了 Agent 系统中 LongTask 与普通 Run 的核心差异。关键结论是:LongTask 并非简单的时间延长版 Agent Run,而是系统执行抽象的质变。 核心区别: 关注点不同:普通 Run 关注单次执行完成;LongTask 关注由多 Run、人工审批等组成的复杂目标可靠完成 架构层级:LongTask 编排下层 Run(如 Stage/Step → Agent Run/Worker Task) 执行模型
2026-08-12 19:30:00
525
原创 从 Subagent 到 MAS:深入理解多 Agent 协作、任务分工与并行执行
本文讨论了Agent系统中的三个关键概念:Subagent(子智能体)、MAS(多智能体系统)和Multi-Agent Parallelism(多智能体并行)。Subagent指由主Agent委派执行边界清晰的子任务,并返回结果的智能体,其核心价值在于Context Isolation(上下文隔离),能有效压缩信息。MAS则是组织多个自主Agent协作完成复杂目标的系统,各Agent承担更完整的领域责任。两者的主要区别在于任务范围:Subagent处理明确子任务,而MAS Agent负责更持续的领域工作。M
2026-08-12 16:48:08
345
原创 为什么流式接口经常返回 streamUrl:从一次 Agent 请求理解流式任务架构
文章摘要:文章探讨了复杂Agent系统中streamUrl的设计原理。传统聊天系统采用单请求流式响应,而Agent系统将任务创建(POST /runs)与事件订阅(GET /events)分离,通过streamUrl实现执行与观察的解耦。这种架构支持任务后台持续运行,允许页面刷新/重连时通过lastEventId恢复事件流,并明确区分取消任务与取消订阅。streamUrl本质是任务事件订阅入口,体现了Agent系统中控制面与事件面的分离设计,适用于长周期、多步骤的复杂场景。
2026-08-10 19:00:00
787
原创 深入理解 Agent Runtime:智能体真正运行起来的核心执行引擎
文章摘要: Agent Runtime 是大模型应用的核心执行系统,负责管理 Agent 任务的完整生命周期,而不仅仅是简单的“LLM + Tool”调用。生产级 Agent 任务可能涉及多工具调用、子任务协调、人工审批、上下文管理等复杂流程,需要 Runtime 提供状态控制、事件处理、错误恢复等能力。 Agent Runtime 的核心是 Run(任务实例),通过状态机(如运行、暂停、完成)和循环执行(Think-Act-Observe)驱动任务推进。其关键模块 Context Builder 动态组装
2026-08-10 15:03:59
410
原创 从 Chat UI 到 Agent UI:如何设计一个真正可用的智能体交互界面
文章摘要: 随着AI Agent的发展,传统聊天界面(Chat UI)已无法满足复杂任务需求。本文分析了Chat UI与Agent UI的本质差异:Chat UI围绕消息展开,适合简单问答;而Agent UI需处理持续运行的任务执行过程,涉及计划制定、工具调用、用户确认等多个环节。作者提出Agent UI应围绕"执行过程"设计,采用三栏布局(会话列表、对话执行区、工作区),将聊天沟通与实际成果展示分离。核心设计理念是将Agent内部状态转化为用户可理解的界面元素,采用模块化消息结构(Message Part
2026-08-05 19:45:00
454
原创 从一次请求到整套推理集群:彻底理解大模型的 QPS、TPM、并发与性能指标
摘要:大模型性能指标解析 本文系统阐述了大模型服务中的关键性能指标及其相互关系。核心内容包括: 请求生命周期:大模型请求经历Prefill(处理输入)和Decode(生成输出)两个关键阶段,分别影响首字延迟和输出流畅度。 业务压力指标: QPS/RPM反映请求数量,但需结合平均Token数才有意义 TPM(Tokens Per Minute)更准确描述实际计算量,需区分输入/输出TPM 并发机制:并发数不同于QPS,高并发不直接提升处理能力,需与平均响应时间平衡 用户体验指标: TTFT(首字时间)决定响应
2026-08-05 18:04:11
477
原创 Agent 对话中的 SSE 状态恢复:切换页面、重新进入与刷新后如何继续流式输出
本文探讨了AI Agent对话系统中SSE(Server-Sent Events)的设计挑战与解决方案。主要问题在于如何应对用户切换会话、页面刷新、网络中断等场景导致的状态丢失问题。作者提出"快照+事件日志+实时流"的三层架构:通过数据库快照恢复完整状态,事件日志补发断线事件,SSE推送实时更新。文章详细阐述了核心数据对象(会话、消息、执行流、事件)的设计,建议采用结构化事件类型而非简单文本流,并针对不同中断场景提出了具体处理方案。最终目标是实现可恢复的对话状态,确保用户体验的连续性。
2026-08-04 21:45:00
641
原创 从分布式系统到 Celery + Redis:一篇文章讲清异步任务工作流程
异步任务处理:Celery + Redis 解决方案 本文介绍了在Web系统中处理耗时任务的异步解决方案。传统同步模式在处理PDF解析、OCR识别、批量邮件等长时间任务时存在超时、连接断开和服务阻塞等问题。通过Celery和Redis构建的分布式任务系统可以有效解决这些问题: 核心架构:将耗时任务从Web服务中分离,采用"提交-队列-异步执行"的模式 组件分工: Celery作为任务队列框架,负责任务定义、调度和执行 Redis作为Broker(任务中转站)和Result Backend(结果存储) 工作流
2026-08-04 20:30:00
419
原创 Playwright 深度解析:从浏览器自动化到动态爬虫、自动化测试与 AI Agent
Playwright 是一个由微软开发的开源浏览器自动化框架,支持Chromium、Firefox和WebKit三大浏览器引擎,提供多语言接口。它不仅能用于Web自动化测试,还能处理动态网页采集、自动登录、iframe操作等复杂场景。相比传统爬虫工具,Playwright能模拟真实用户操作浏览器,解决JavaScript渲染、动态Token、验证码等问题,适用于现代前端框架构建的网站。尽管资源消耗较高,但通过合理架构设计,可结合轻量级HTTP客户端提升效率。此外,它还支持登录状态保存、网络请求监听和拦截等高
2026-07-30 19:15:00
710
原创 数据库连接池详解:从连接复用、参数配置到生产故障排查
应用程序想要访问 MySQL、PostgreSQL 等数据库,首先需要建立一条数据库连接。创建 TCP 连接;完成数据库协议握手;进行用户名和密码认证;初始化会话状态;设置字符集、时区、事务隔离级别等参数;等待应用发送 SQL;执行 SQL 并返回结果。但这一行代码背后,实际上发生了网络通信、身份认证、资源分配和会话初始化等一系列操作。会话状态;网络缓冲区;权限上下文;事务上下文;临时表信息;排序和查询缓冲区;数据库线程或进程资源。
2026-07-28 21:00:00
435
原创 大模型输出 JSON 不完整怎么办?从 Prompt 问题到工程稳定性治理
文章摘要:大模型输出JSON不完整是一个常见的工程稳定性问题,表现为语法不完整或内容缺失。原因包括输出长度限制、输入上下文过长、Schema设计复杂等。解决方案需从多层面治理:优先使用结构化输出能力,避免一次性生成大JSON,建立JSON修复机制,设计Schema校验,实施业务完整性检查,并引入重试补偿机制。核心思路是将模型输出视为候选结果,通过工程化流程确保最终JSON的完整性和准确性,而非单纯依赖Prompt优化。
2026-07-09 20:00:00
526
5
原创 文件上传一致性:为什么对象存储直传不是一个简单的 Upload 接口
文件上传一致性问题与对象存储直传架构解析 摘要 本文深入探讨了文件上传服务在生产环境中的复杂性,指出对象存储直传架构下的核心挑战。文章分析了数据库与对象存储的分工(前者保存元数据与状态,后者存储文件内容),重点阐述了直传模式下的关键问题:数据库事务无法回滚对象存储操作,导致潜在不一致。针对大文件上传,详细说明了multipart分片上传的复杂性及双边对账机制的必要性。文章提出可靠文件上传系统的设计原则:短事务+状态机+幂等接口+对象校验+补偿机制,并强调complete接口作为业务承诺点的重要性。最后,作者
2026-07-07 23:15:00
413
原创 RAG 优化实践:别让分块毁掉你的知识库
RAG优化实践:保护Markdown文档结构的三个关键点 本文针对RAG系统中Markdown文档处理面临的三大问题提出解决方案: 表格截断问题:提出"原子语义块"概念,建议小表格整体保留,大表格按行分组并重复表头,同时生成语义摘要辅助检索。 代码块丢失问题:强调代码块应整体识别,按函数/类切分超长代码,并生成自然语言摘要以提升语义检索效果。 图片语义缺失问题:建议将图片URL转化为结构化数据块,包含原始链接、文本描述和OCR内容,解决纯URL无语义的问题。 文章指出,RAG系统效果不佳往往源于文档预处理阶
2026-06-10 18:34:06
504
原创 一个 URL 参数,为什么可能打穿你的内网?
SSRF,全称是 Server-Side Request Forgery,中文通常叫“服务端请求伪造”。它的核心问题是:攻击者无法直接访问某个目标资源,但可以诱导服务端替他访问。用户输入 URL↓服务端请求该 URL↓服务端把内容返回给用户攻击者↓业务服务器↓内网服务 / 本机端口 / 云元数据服务攻击者控制了服务端请求的目标地址。这种做法很容易被绕过。
2026-06-10 15:18:26
446
原创 从 LSP 到 MCP、ACP:AI Agent 时代的协议体系设计详解
AI Agent 时代,协议会变得越来越重要。AI ClientIDEAgentToolResourcePrompt这些组件之间如果没有统一协议,就会变成大量脆弱的胶水代码。JSON-RPC:消息格式底座stdio / HTTP / SSE:传输方式LSP:IDE 调语言能力MCP:AI 调外部工具ACP:IDE 调 AI AgentGateway Plugin:聊天平台接入 Agent它们之间不是替代关系,而是分工关系。
2026-05-20 00:30:00
1079
原创 OpenAI-wire 与 Anthropic-wire 的差异:从 Function Calling 协议看 Agent 框架的 Provider 适配设计
摘要 本文探讨了AI Agent框架中不同大模型厂商工具调用格式的差异问题。OpenAI和Anthropic采用完全不同的消息格式(分别称为OpenAI-wire和Anthropic-wire),主要差异体现在工具调用的放置位置、参数格式、消息角色定义等方面。为保持Agent核心逻辑的通用性,建议采用中间表示层进行格式转换,使Agent主循环仅维护一套逻辑。文章详细对比了两种格式的核心特点:OpenAI-wire将工具调用置于assistant.tool_calls数组,参数为JSON字符串,使用独立too
2026-05-19 01:15:00
578
原创 AI Agent 工程化实践:Skill as Prompt 与渐进式加载机制
本文探讨了AI Agent系统中Prompt管理失控的问题,并提出Skill体系解决方案。传统方式将所有能力集中在一个系统Prompt中,导致上下文浪费、能力污染等问题。Skill体系将能力拆分为独立模块,每个Skill包含元数据和提示词正文,采用渐进式披露原则按需加载。这种设计减少初始化成本、节省上下文窗口、降低指令冲突,使Prompt工程更接近软件工程,提升复杂Agent项目的可维护性。
2026-05-19 00:15:00
744
原创 新一代知识图谱与检索增强生成技术全景解析
摘要 本文探讨了新一代检索增强生成(RAG)技术如何通过知识图谱与本体论优化解决传统RAG的局限性。GraphRAG利用层次化社区发现实现全局检索,LightRAG通过双层网络兼顾效率与推理能力,KAG则专注于专业领域的逻辑推理。文章对比了各架构在计算成本、动态更新等方面的表现,并深入解析了本体(Ontology)作为知识图谱基石的关键作用,包括类结构、属性网络和逻辑约束。最后介绍了开放学术图谱(OAG)如何将静态知识转化为决策能力,为构建智能科研系统提供了技术路线:本体设计→图谱索引→混合检索→闭环决策的
2026-04-03 18:45:00
680
原创 大语言模型智能体架构深度解析:为什么必须通过 Tool Result 注入外部数据而非篡改 System Prompt
摘要: 大语言模型(LLM)智能体设计中,工具执行结果(Tool Result)不应直接拼接至系统提示词(System Prompt),而是需通过标准 tool_result 注入。这一架构原则基于以下核心原因: 分词器与注意力机制:系统提示词和工具结果在底层分词时被赋予不同控制词元,动态拼接会破坏指令层次结构,导致认知过载; KV缓存与成本优化:修改系统提示词会破坏缓存前缀匹配,显著增加延迟和计算成本; 安全性:工具结果隔离可防御提示词注入攻击,避免外部数据获取“Root权限”; 可观测性:结构化工具流支
2026-03-17 16:07:17
477
原创 Ralph 架构深度解析报告:自主代理循环与软件工程的确定性重构
《Ralph架构:AI自主编程的范式革新》摘要 Ralph架构代表AI辅助编程从"副驾驶"到"自主代理"的范式转移。该开源架构通过无限循环和即时反馈机制,使AI能独立完成需求分析、编码、测试到提交的全流程。其核心创新包括: 1)"Human-on-the-loop"模式,人类仅定义标准而非干预过程 2)清洁上下文理论,每次迭代都重置环境避免污染 3)确定性笨拙策略,通过低成本试错实现最终正确性 4)严格背压机制,依赖编译器和测试保证质量 架构包含状
2026-02-03 12:40:31
1080
原创 构建下一代语境感知型 AI Agent:AGENTS.md 与 SKILL.md 发现系统的深度工程架构报告
摘要: Agent技术正从对话式转向自主行动能力,其效能核心在于项目语境获取。行业通过标准化协议解决"语境孤岛"问题:AGENTS.md定义治理规则(宪法),SKILL.md封装可执行能力(技能包)。报告详细解析了构建此类Agent的完整技术路线,包括文件系统遍历、AST解析、MCP协议沙箱执行等核心模块。对比主流方案(OpenAI/Anthropic/Cursor)后提出四层架构:发现引擎→认知解析→语境管理→执行运行时,强调安全隔离与动态Prompt构建。未来将向自我进化型Agent
2026-02-03 09:42:24
1259
原创 现代文件上传架构权威指南:从二进制流到分布式对象存储的深度剖析
《文件上传技术的深度解析与架构设计》摘要:本文深入探讨了文件上传在互联网基础设施中的复杂性与技术挑战。从HTTP协议层分析了传统编码方式的效率瓶颈,详细解读了multipart/form-data标准及其边界检测算法。重点阐述了服务器端流式处理架构设计,包括内存管理优化、TCP背压机制和无磁盘透传模式。同时探讨了文件格式路由策略、安全威胁防御机制,以及分布式存储环境下的高可用架构设计。通过显微镜级别的技术剖析,揭示了现代文件上传系统在网络协议、二进制流处理、安全防御等方面的核心原理与最佳实践。
2026-02-02 17:48:34
1243
原创 权威指南:企业级文档权限管理架构深度解析——从 ACL 到 RBAC 及未来的演进
摘要 本文系统探讨了企业文档权限管理的技术演进与核心机制。从基础权限三要素(主体、客体、操作)出发,深入剖析了ACL与RBAC两大模型的原理及实现:NTFS通过安全描述符和ACE实现精细控制但面临管理复杂性;Linux ACL创新引入掩码机制;而RBAC通过角色抽象层解决了大规模权限管理难题。文章对比了不同模型在颗粒度、扩展性与管理成本间的权衡,揭示了现代企业权限体系从直接控制向间接管理的演进趋势,为零信任架构的实施提供了理论基础。
2026-02-02 17:46:20
891
原创 对象存储架构演进与AI大模型时代的深度融合:从S3基础到万亿参数训练的技术全景
摘要: 生成式AI和大语言模型的爆发推动云计算基础设施转向对象存储(如Amazon S3),其无限扩展性和扁平化命名空间更适配AI工作负载的I/O特征。相比传统块存储和文件存储,对象存储解决了海量小文件的元数据瓶颈,并通过强一致性模型支持分布式训练。报告深入解析了S3的架构创新,包括存储分层、智能生命周期管理及低延迟的S3 Express One Zone,并探讨了其在AI数据管道中的实践,如数据摄取优化和训练检查点管理。对象存储已成为AI数据基础设施的核心底座。
2026-02-02 17:29:27
1195
原创 从「文件URL」到「模型可理解内容」:一套完整的文件上传与解析处理流程详解(含PDF/Excel/图片)
本文详细拆解了从文件URL到AI模型可理解内容的完整处理流程。核心步骤包括:1) 文件下载获取二进制数据;2) 通过文件类型识别选择合适解析器;3) 将不同格式文件转换为模型可处理的文本或Base64格式;4) 根据内容类型自动切换文本或多模态模型。文章特别强调了工程实现中的关键点:并行处理提升I/O效率、临时文件管理、安全校验机制,以及针对PDF/Excel/Word/图片等不同格式的解析策略。该流程为构建RAG、文档问答等AI应用提供了标准化的文件处理范式。
2026-01-22 16:47:45
1576
原创 现代数据库系统全景深度研究报告:从理论范式到分布式架构的演进与实践
数据库系统演进与技术解析 本报告系统梳理了数据库管理系统的完整发展历程与技术架构。从早期的打孔卡机械数据处理到现代云原生数据库,报告详细分析了关系型数据库的数学基础(关系代数与规范化理论)、事务处理机制(ACID特性与隔离级别),以及非关系型数据库在CAP定理下的设计权衡。重点探讨了B+树与LSM树等存储引擎的核心数据结构,分布式共识算法(Paxos/Raft)的实现原理,以及向量数据库、时序数据库等新型数据库的技术特点。通过对数据库系统理论深度与工程实践的全面剖析,为理解现代数据基础设施提供了系统性的知识
2026-01-19 17:58:44
1344
原创 企业级 AI 系统分层存储架构深度研究报告
摘要 随着大语言模型(LLM)与检索增强生成(RAG)技术的普及,企业数据架构面临新挑战。本文分析了传统"All-in-Postgres"架构在处理亿级数据时的性能瓶颈,提出多层持久化架构(Polyglot Persistence)解决方案。该架构通过精确分工实现优化: 关系型数据库(PostgreSQL/MySQL)作为控制平面,负责元数据管理和ACID事务 向量数据库(Milvus/OpenSearch)专注高维向量检索,采用HNSW图算法 内存存储(Redis)处理低延迟会话状态
2026-01-19 17:02:12
1073
原创 PostgreSQL 高维向量存储架构深度解析:架构限制、核心原理与行业解决方案
摘要:高维向量存储与检索的优化策略 随着大语言模型(LLM)的发展,向量维度从384维(BERT)扩展到4096维(Mistral/Llama),对传统数据库存储架构提出了挑战。PostgreSQL的pgvector扩展面临2000维的物理限制,这源于其8KB页面结构和索引存储机制。 报告分析了2000维限制的底层原因:PostgreSQL索引条目必须完整存储在单个页面内,而高维向量会超出8KB容量。虽然TOAST机制允许存储高维数据,但索引需要直接访问完整向量,导致性能瓶颈。 行业解决方案包括: 标量量化
2026-01-19 15:41:43
1178
原创 LangChain 架构深度解析:从中间件机制到人机协同 SQL 智能体实战报告
摘要 随着大语言模型从确定性链条向概率性智能体演进,AI应用开发面临非确定性输出、资源消耗和安全风险等挑战。LangChain通过中间件架构和人机协同机制,为企业级智能体提供了标准化解决方案。报告深入解析了中间件的生命周期管理、拦截钩子设计及状态/上下文管理机制,详细介绍了内置中间件功能如对话摘要、资源限流、敏感信息检测等的最佳实践。通过构建具备生产级安全防护的SQL智能体案例,展示了如何将理论转化为工程实践,有效解决数据库查询中的幻觉和破坏性操作风险。
2026-01-12 18:58:12
1298
原创 Git Worktree 终极指南:解锁多 AI 并行开发的“影分身”之术
摘要:本文介绍如何利用Git Worktree实现多AI并行开发,解决传统Git流程中频繁切换分支和代码冲突的问题。通过抖音视频提取工具案例,演示了如何为不同AI任务创建独立工作目录(Worktree)和分支,实现物理隔离开发。关键优势包括:真并行开发能力、毫秒级上下文切换、环境隔离等。文章还提供了具体操作步骤、避坑指南和最佳实践,如命名规范、依赖管理注意事项等。这种"Human-in-the-loop"模式让开发者作为架构师坐镇主分支,多个AI在不同Worktree中并行推进任务,大幅
2026-01-09 23:42:34
1957
1
原创 深度解析:FFmpeg 远程流式解复用原理与工程实践
摘要:MP4容器格式与流式传输的底层机制 本文深入剖析了MP4容器格式(ISO BMFF)实现流式传输的核心原理。首先明确了编码流与容器格式的本质区别:编码流(H.264等)只处理压缩数据,而容器格式(如MP4)则负责组织索引、同步和时间映射。重点解析了MP4的盒子结构,特别是moov盒子中的样本表系统,包括stts(时间到样本映射)、stss(关键帧定位)、stsc(样本块映射)等关键索引表,这些构成了从逻辑时间到物理偏移量的精确转换机制。通过这种精密的索引结构,FFmpeg等播放器无需下载完整文件即可实
2026-01-09 23:38:39
1326
1
原创 2025年大语言模型技术全景报告
2025 年最大的技术突破在于模型训练范式的根本性转移:从单纯追求更大的预训练语料库(Pre-training Scaling),转向利用强化学习(RL)来提升模型的推理能力,即**“推理扩展”(Inference Scaling)**。的技术路线,使得模型在回答问题前能够进行思维链(Chain of Thought, CoT)的自我博弈与验证,从而在根本上解决了数学、编码和复杂逻辑领域的诸多痛点,将 AI 从一个“概率性的文本生成器”升维为一个“具备逻辑验证能力的推理引擎”。
2026-01-07 18:09:14
1596
原创 掌握 Claude Code:从创意到发布,构建 MVP 的 PSB 系统
《AI编程三阶段法:PSB系统高效构建Claude Code项目》摘要:本文介绍了Avthar提出的PSB系统(规划-设置-构建),帮助开发者利用Claude Code高效构建项目。规划阶段强调明确目标、分解里程碑并创建详细规格文档;设置阶段提供7步配置清单,包括GitHub仓库、环境变量、文档自动化等;构建阶段介绍三种工作流(通用模式、基于Issue模式和多智能体模式)及生产力技巧。该系统通过结构化流程,能显著提升AI辅助编程效率,减少返工,适合从新手到资深开发者使用。
2026-01-07 18:05:39
1455
5.图像分类算法原理与实战.pptx
2023-10-02
4.深度学习网络模型.pptx
2023-10-02
3.深度学习算法基础.pptx
2023-10-02
2.深度学习开发框架.pptx
2023-10-02
计算机视觉-飞桨深度学习实战-学习ppt-1
2023-10-02
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅