• 博客(1145)
  • 资源 (3)
  • 收藏
  • 关注

原创 RDMA 与 RoCE 深度解剖:撑起千卡大模型集群的网络基石

本文深度解析了支撑千卡大模型训练的网络基石——RDMA与RoCE。针对传统TCP在延迟、CPU开销和丢包重传上的瓶颈,RDMA通过内核旁路、零拷贝和CPU卸载实现微秒级低延迟通信。RoCEv2基于无损以太网,结合PFC、ECN与DCQCN机制,在成本可控前提下逼近InfiniBand性能。配合NVLink、GPUDirect RDMA与NCCL集合通信库,构建起从节点内到跨节点的高效数据通路。未来,UEC与超节点技术将进一步重塑AI网络架构,让GPU真正“不等数据”,全力投入计算。

2026-09-20 13:57:36 196

原创 智能聚类:从海量 Trace 中理解 Agent 的行为和表现

尽管有指标和Trace,Agent问题仍难看清,因汇总数据无法定位波动根源。云监控2.0通过智能聚类,将请求与会话按用户意图和任务主题归类,实现从交互到场景的洞察:Trace聚类识别执行意图,Session聚类拆分用户任务,结合语义向量与自动归因,精准发现高耗时、高摩擦场景。团队可按主题分析资源消耗、交互表现,下钻异常案例,持续追踪需求变化与优化效果,推动从被动排查转向主动改进。

2026-09-20 13:49:28 93

原创 Windows 资源管理器无限重启?一招揪出微信/企业微信“WXDrive”插件作祟

Windows10 1607系统中,explorer.exe无限重启致桌面崩溃,经排查锁定罪魁祸首为微信/企业微信的WeDrivePlugin64_97.dll。该DLL因堆栈溢出(异常码0xc0000409)导致资源管理器崩溃。通过命令行禁用自动重启、重命名损坏DLL并修复注册表,可临时恢复系统。建议卸载或更新微信/企业微信,并尽快升级至受支持的Windows版本,以彻底解决兼容性与安全问题。

2026-09-18 10:29:43 272

原创 同创星图正式发布:让金融智能体实现「全链路可管可控」(THS)

过去20年我们学会管控代码,未来需驾驭AI。同创星图(AgentAtlas)是同花顺打造的金融智能体全链路运维平台,通过评测、观测、监测、安全四大功能,将智能体从“不敢用”变为“敢用”。它实现上线前准入、运行中实时监控、输出合规审查与全链路安全防护,沉淀可复盘的归因数据,驱动智能体持续进化。目前已有200+智能体接入,稳定观测超1.2亿次调用,真正让智能体走进真实业务生产环境。

2026-09-18 10:04:26 482

原创 Agent 的基本任务循环:目标、计划、执行、观察、修正

本文拆解Agent的核心任务循环:目标澄清→计划拆解→执行动作→观察反馈→修正路线→验证结果。强调Agent不是一次性回答,而是通过持续迭代推进任务,将模糊目标转化为可验收成果。关键在于每一步都依赖真实反馈,动态调整,最终实现从“看起来完成”到“真正完成”的验证。人类应在目标、权限、高风险操作和最终验收等关键节点介入,确保安全与责任边界。真正的智能不在于生成答案,而在于构建可靠的任务推进系统。

2026-09-17 09:52:02 318

原创 deepseek-v3-moe-mla

DeepSeek-V3 以 671B 总参数实现仅 37B/token 激活,通过 MoE 稀疏架构与 MLA 低秩注意力,大幅降低训练与推理成本。其无辅助损失负载均衡保障专家均衡,MLA 将 KV Cache 压缩至原体积的 1.8%,显存占用下降超 90%。结合 FP8 训练、DualPipe 流水线与 MTP 多 token 预测,278.8 万 H800 小时完成训练,8 卡 H800 即可部署,实现高性能与低成本的平衡。

2026-09-17 09:43:18 261

原创 大模型管理中台模型探活设计方案(THS)

本文提出大模型管理中台的“探活”设计方案,解决Gateway对下游模型副本健康状态“盲知”问题。通过管理面主动探测、状态机动态维护、Nacos快照同步与数据面过滤,实现健康副本自动摘除与恢复。核心创新包括:基于config_hash的状态重置、四态健康机(HEALTHY/UNHEALTHY/CONFIG_ERROR/UNKNOWN)、动态配置支持及可视化聚合状态。方案确保高可用、低延迟,从“瞎猜”走向“精准摘除”,显著提升大模型服务稳定性。

2026-09-16 11:02:16 450

原创 K8s云原生-GPU 虚拟化切分与算力调度实战

本文记录了在K8s 1.35.6环境下实现GPU资源池化的完整实践,针对T4显卡不支持MIG的限制,选用开源方案HAMi v2.10.0实现显存与算力双维度隔离。通过关闭GPUOperator的驱动和DevicePlugin组件,结合HAMi的调度扩展与运行时拦截机制,将一张物理卡虚拟为10个可调度单位,支持多Pod共享并严格控制资源使用。验证表明,超额申请会被真实拦截,且互不影响。关键经验包括:前置检查、版本对齐、运行时诊断与分层验证。最终实现从“一卡一Pod”到“按需分配”的高效利用,显著提升GPU利用

2026-09-16 10:43:02 582

原创 GPT Image 2.5 发布:AI 生图开始真正进入生产力时代

OpenAI 在 9 月 8 日正式发布 ChatGPT Images 2.5。相比 Images 2.0,官方重点其实就四个:生成速度最高提升 50%、参考图人物/主体保持更好、局部编辑更精准、多轮编辑一致性明显增强。同时新增了 Sketch 草图输入、图片局部评论修改、Poster / Merch 等模板。

2026-09-15 15:48:00 190

原创 Agent 到底是什么?它不是人格,而是任务执行系统

Agent 不是一个更像人的 AI 角色,而是一套围绕目标运转的任务执行系统。

2026-09-15 15:43:59 344

原创 Workspace 与 Sandbox:代码在哪里改,命令在哪里跑

本文通过一个Node.js项目示例,演示了Agent在修改代码、运行测试时的权限控制机制。核心在于工作区(Workspace)与沙箱(Sandbox)的分离:Agent仅能访问指定目录,系统通过Runtime根据配置规则(如denyRead)限制文件和网络访问。以修复slugify()函数为例,沙箱确保其无法读取~/Private等敏感目录,即使命令被允许执行。权限检查在启动前完成,失败则直接拒绝,不依赖运行时错误。实现依赖操作系统级沙箱(如macOS Seatbelt、Linux bubblewrap),

2026-09-15 15:41:07 268

原创 MCP 的基本结构:Host、Client、Server、Tools、Resources、Prompts

本文厘清MCP基础结构:用户通过Host(AI应用)接入,由Host内部的Client连接外部Server,Server则提供Tools(行动)、Resources(上下文)和Prompts(流程模板)三类能力。关键在于理解角色分工——模型不直连外部系统,而是由Host统筹管理能力接入与上下文组织。强调先建立“Host-Client-Server”关系图,再深入协议细节,避免将MCP误解为简单工具调用。

2026-09-14 15:10:41 596

原创 K8S GPU调度——DRA动态资源分配

DRA(Dynamic Resource Allocation)是Kubernetes中用于管理专用硬件资源(如GPU、TPU等)的原生API框架,通过声明式方式实现设备按属性精确调度。相比传统的DevicePlugin+ExtendedResources模型,DRA支持细粒度匹配(如显存大小、型号、拓扑结构)、资源共享与动态分配,并解耦设备初始化与Pod生命周期。其核心机制类比于存储的CSI,采用DeviceClass定义资源类型,ResourceSlice描述可用资源,ResourceClaim申请资源

2026-09-14 14:10:52 254

原创 MCP 已死?不,它正在进化:三个关键变化

新版MCP协议实现三大关键升级:一是协议级无状态化,取消会话ID与握手流程,简化部署与扩容;二是引入MRTR(多轮交互),通过独立请求完成信息补充,提升交互灵活性;三是正式支持Tasks扩展,实现长时任务的异步执行、状态查询与实时订阅。相比A2A,MCP+Tasks更适配企业系统集成,简洁高效;而A2A则更适合复杂多轮协作。两者可协同使用,共同构建稳定的企业级Agent连接体系。

2026-09-14 09:52:39 228

原创 RAG for Agent:Agent 什么时候需要查知识库?

本文系统阐述了RAG(检索增强生成)在Agent中的核心作用:当模型需依赖外部事实时,通过“按需取证”机制,从权威知识源精准检索并验证证据。强调检索非固定流程,而应结合上下文判断是否需查、何时查、查何处,并确保数据源可信、切分合理、元数据完整、权限过滤前置。提出“结构化证据返回”与分层评估体系,避免盲目依赖向量相似度或模型记忆。最终实现可追溯、可验证的决策闭环,真正达成“基于知识的回答”。

2026-09-11 13:41:44 312

原创 MoE架构原理与算力基础设施重估

MoE架构通过稀疏激活实现“参数量大、计算量小”的突破,使模型在保持高性能的同时降低算力开销。然而,其代价是显存全量驻留与跨节点all-to-all通信激增,导致成本重心从算力转向HBM容量与网络带宽。真实案例如Mixtral、Grok、DeepSeek-V3表明,训练与推理的瓶颈已由FLOPs转移至负载均衡、专家并行与高速互联(如NVLink、InfiniBand)。因此,真正决定MoE系统成败的,是其对显存、通信与调度的精细化工程能力。

2026-09-11 13:39:18 243

原创 Tool Schema 设计:为什么你的 Agent 总是调用错工具?

本文系统阐述了如何将模糊的工具能力转化为可信赖的ToolSchema,强调命名应清晰表达动作、描述需界定使用边界、参数应结构化且约束明确。通过实例展示如何设计高效、可校验、可授权的工具接口,并指出避免模型误用的关键:合理拆分工具、关闭额外字段、依赖上下文而非模型传参。最终,Schema不仅是类型定义,更是模型决策、运行时校验与权限控制的契约。

2026-09-10 10:29:58 444

原创 QwIndustry 如何用知识图谱给 LoRA 专家分科,做一个工业 AI 副驾驶

这篇论文不是再做一个“轴承模型”或“表面缺陷模型”,而是用一个7B级多模态大模型统一处理振动/声学、时频图像和文本,再让任务知识图谱决定应该激活哪组  LoRA 专家;同时用 GPT-4o 生成的显式推理样本做蒸馏,使模型既能跨任务、跨机器迁移,又能给工程师输出可读的诊断理由。

2026-09-10 10:17:16 137

原创 把FDE招成一个人,是企业最容易踩的坑

懂业务、懂产品、懂技术、懂 AI,能写代码、能做方案、能驻场、能交付,最好还能直接和业务负责人对话。发出去才发现这种人根本招不到。就算招到了,你也得想清楚一件事:你想招的可能不是 FDE,而是一个什么都会的超级工程师。这是现在企业理解 FDE 时最容易犯的错误:把一种团队作战方式,当成了一个岗位。结果就是,FDE 没建起来先累垮了一个人。

2026-09-09 10:25:11 651

原创 QLoRA 原理与实战:4-bit 量化如何让单卡微调 70B 大模型

全参微调 7B 模型需要约 66GB 显存,QLoRA 却能用约 7GB 显存微调 7B、用单张 48GB 显卡微调 65B。本文拆解 QLoRA 的三大创新(NF4 量化、Double Quantization、Paged Optimizers),给出显存账本对比,并附一段可直接运行的生产级微调代码。

2026-09-09 09:48:16 296

原创 AI领域英文缩写知多少

AI领域英文缩写以简洁字母组合精准指代底层硬件到上层应用的关键技术。本文按算力芯片、存储内存、网络通信、模型架构、训练优化、推理部署及应用Agent七层链路系统梳理常用缩写,涵盖GPU、HBM、Transformer、LoRA、RAG等核心术语,助力高效理解AI技术栈。

2026-09-08 10:35:12 440

原创 OpenClaw 2.0:欠下的技术债,这次连本带利还清

OpenClaw v2026.8.1(16,000+PR)以此版本兑现“可托付”:会话由进程状态变为可迁移资源;UI退化为Gateway客户端;provider外置并配修复闭环;安全设计明确“不做什么”,以机械约束取代模型自律;记忆默认开启但可追溯、可定点删除。升级需先建可恢复备份,重负载Gateway建议先在staging验证。

2026-09-08 10:20:27 479

原创 Agent 做了这么多轮重构,企业到底该留下什么?

当模型、框架和 Runtime 还会继续变化,Agent 建设究竟应该留下什么?第一,通用智能要持续跟进,但真正值得长期沉淀的是企业自己的业务上下文。模型越强,这些上下文的价值越大。第二,消息服务已经是一条成熟的实时数据管道。下一步不只是把数据接通,而是让 Schema、语义、血缘和实时性随数据一起到达。第三,链路需要收拢,能力必须开放。企业需要一站式的服务为全链路负责,减少交接和重复建设,同时保留对外加工、开放存储、联合查询和对接多种 Agent 接入能力。

2026-09-08 10:16:55 545

原创 Kubernetes 里的 GPU 到底怎么分?Device Plugin、时间片切分与 MIG 完整实践

Kubernetes GPU分配:设备插件、时间片、MIG。摘要应简洁概括核心要点。</think>K8s中GPU通过扩展资源与Device Plugin实现分配,但整卡利用率低。切分方案有三:整卡简单浪费;时间片共享计算但显存无隔离;MIG提供硬件级隔离,适合生产多租户。调度需结合bin-packing与拓扑感知优化。

2026-09-07 14:03:15 256

原创 从 HPA 到 KEDA:Kubernetes 弹性伸缩的进阶实践

本文从 HPA 的扩缩容算法与抑制策略讲起,再到自定义指标与 Metrics API,最后引入事件驱动的 KEDA,把「应用层 HPA/KEDA → 指标层 Metrics API → 事件层 Scaler → 节点层 Cluster Autoscaler」四层协同的生产弹性体系完整串起来。

2026-09-07 13:58:28 368

原创 从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考

ReAct模式是Agent的本质抽象,Agent团队设计是关键,用户从第一性原理拆分ReAct三环节,指出工程发力点在行动和观察,分析了上下文即记忆的本质,然后重点论述了Agent团队协作机制,指出当前Leader-Worker架构不足,提出了七个关键机制改进,最后提到分级和人类组织类比。

2026-09-07 13:50:11 212

原创 01-vLLM-PagedAttention与连续批处理技术拆解

PagedAttention与Continuous Batching是vLLM双引擎:前者以分页机制管理KV Cache,消除碎片并支持前缀共享;后者迭代级调度填满GPU气泡,配合抢占策略提升吞吐。生产调优需聚焦显存利用率、批量参数、前缀缓存及FP8量化,使推理成本显著降低。

2026-09-05 10:33:47 406

原创 模型后训练视角:DeepSeek Harness 把企业进化做进了架构

DeepSeek Harness 是一个模型厂商对两个问题的工程回答:Agent 如何在运行时被约束,如何随时间变强。它的回答浓缩成三句话:1. 一致性靠结构保证,不靠纪律维持——日志即状态,一切皆派生。2. 护栏与进化共享同一套事件底座——每一次安全决策都是训练数据。3. 敏捷试验,谨慎固化——爆炸半径越大,门槛越高。

2026-09-05 10:22:51 235

原创 AI Infra 系列:一万张 GPU 怎么排班,调度器才是训练场的隐形老板

单机调优解决"一台机器怎么跑得快",集群调度解决"一万台机器怎么不浪费"。训练集群的调度器每天面对的问题:有的作业要 512 张卡,有的只要 4 张;有的必须整组一起上,有的晚 5 分钟也无所谓;GPU 放错机柜,性能能差 3-8 倍。这篇讲清楚从设备插件到 DRA 的调度演进、Gang 调度、拓扑感知、SLURM 与 K8s 的分工,以及万卡集群怎么容错、怎么用 AI 来运营。

2026-09-04 16:20:09 516

原创 Claude Fable 5.1 来了:Agent 暴涨、缓存降价,还有新的反蒸馏机制

目前Fable 5.1 是全面 GA(正式发布),Mythos 5.1 并没有全面开放。两者其实是同一个底层模型,Fable 5.1 面向普通用户和企业开放;Mythos 5.1 则使用更宽松的安全策略,目前主要通过 Project Glasswing 向经过审核的网络安全和生命科学机构开放。

2026-09-04 16:17:13 325

原创 AI Coding Agent 可信交付:从生成代码到证据闭环

内容围绕AI Coding Agent可信交付,从生成代码到证据闭环,强调了业务契约、受控改造、验证闭环L1-L5证据、可复核交付与知识回流。

2026-09-03 10:49:43 331

原创 Agent每次接新任务都像新人第一天入职?带你告别“一次性智能”

代码难以保存工程决策的演进理由,导致跨任务经验流失。ForgeMemory 通过知识对象与双向准入机制,将任务中的设计取舍、边界与诊断经验沉淀为长期知识,并在后续任务中按需注入、结合代码验证后持续更新,使工程判断真正传递至下一次开发。

2026-09-03 10:44:07 533

原创 Ceph配置RDMA和GPUDirect支持的具体技术方案

在 Ceph 上配置 RDMA 的核心作用是‌降低网络延迟、提升吞吐量,并显著减轻 CPU 负载‌,从而让分布式存储集群跑得更快、更稳。至于 GPUDirect,目前 Ceph 自身还没有正式支持,更多是结合 IBM Storage Scale 这类方案来实现 GPU 直接访问存储数据。

2026-09-02 10:19:09 866

原创 AI-Infra能力建设支持百台GPU规模算力服务

针对100台GPU集群的算力碎片、共享存储和潮汐调度挑战,从AI-Infra(AI-PaaS/LLM-OPS/AI-GATEWAY/LLM-WAF)的视角来看,确实需要在多个层面进行系统性的能力储备。将这些能力需求组织为四个核心层面,并结合你们提到的具体问题展开。

2026-09-02 10:02:50 311

原创 DeepSeek Harness 接入 Elastic APM:把 Agent 的成本、失败和行为变成可查数据

文章讲述通过OTLP旁路为DeepSeek Harness接入观测性,解决本地日志无法聚合的问题,实现按步成本拆分、失败定位、行为指标化,并说明插件配置要点。

2026-09-01 17:30:18 399

原创 CubeSandbox v0.7.0 发布:沙箱跨机流动,集群平滑演进

<think>我们只需要根据内容生成摘要,150字以内。需要概括主要特点:v0.7.0支持跨机暂停恢复、组件多版本共存、网络重构、控制面运维分离等。同时提及其他增强。注意字数。</think>CubeSandbox v0.7.0发布:实现沙箱跨机暂停恢复与组件多版本共存,升级不再使模板快照失效;重构网络子系统加速冷启动;拆分控制面与运维架构。同时补齐三语言SDK、新增S3块设备等,并修复多项稳定性问题。

2026-09-01 16:54:35 360

原创 评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)

<think>我需要根据给定的内容生成一个不超过150字的摘要。内容描述了一个评估体系,包含两层结构、黄金指标、Rubric、评估器、评估任务等概念,并以客服Agent为例进行说明。摘要需简洁,涵盖核心流程:黄金指标→Rubric→评估器→评估任务→结果分析,强调可量化、可解释、可复用的评估体系。</think>建立可量化、可解释、可复用的Agent评估体系:将“好不好”拆解为带权重的黄金指标,经AI辅助制定Rubric,配置评估器与评估任务,生成加权分数与证据,沉淀badcase用

2026-09-01 16:50:55 264

原创 9 个问题带你认识本体(Ontology)及其应用

<think>本体概念、与数据库/知识图谱的区别、在Agent时代的价值、建模方法与应用步骤。强调本体是业务地图,非万能药,应从最小可用模型起步,以业务效果验证。</think>本文以电信业为例,用通俗问答解释本体:它是AI理解企业业务概念、关系与规则的地图,区别于数据库的事实存储和知识图谱的事实层。文中介绍RDF、OWL等标准,展示最小电信本体及Agent应用流程,并给出建模步骤与选型判断,强调从最小可用本体起步,以业务效果验证。

2026-08-31 23:19:15 355

原创 数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)

数据接入是数据飞轮的起点:没有高质量的运行数据,观测、评估、实验都无从谈起。但“把数据接上来”这件事本身并不简单——Agent 不像传统微服务只有一种调用形态,它可能是开箱即用的通用 Agent,可能是基于框架研发的,可能是高代码自研的,甚至可能完全不想改一行代码。

2026-08-31 23:12:33 287

原创 AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环

<think>我们根据内容生成摘要,不超过150字。摘要要概括AgentLoop数据飞轮的核心:上线后持续调优,通过接入、观测、审计、数据集、评估、实验、经验库循环,有人类专家驱动和全自动两种模式,实验结果验证耗时成本降低。注意字数限制。</think>AgentLoop解决Agent上线后持续调优难题,构建“接入→观测→审计→数据集→评估→实验→经验库”数据飞轮。支持人类专家驱动与全自动两种模式,将Badcase沉淀为数据集、实验回测验证效果,经验库自动挖掘并反哺Agent。实操演

2026-08-31 23:10:41 357

Linux检查加固基线核查参考.pptx

Linux检查加固基线核查参考.pptx

2025-04-28

Artifactory文件

Artifactory文件

2025-04-25

H3C CAS 云计算管理平台 开局指导-E0785及之后版本-5W100-整本手册

内容概要:本文档《H3C CAS 云计算管理平台 开局指导-E0785及之后版本-5W100-整本手册》主要介绍了H3C CAS云计算管理平台的开局准备、规划、安装和配置。文档详细描述了工程开局前的环境、服务器和安装文件准备,涵盖网络、存储、主机池、集群、主机和虚拟机的规划与配置。此外,还提供了云资源管理、虚拟机模板管理、CVM备份、监控和告警等功能的配置指导,并附带了可靠性测试和常见问题解答。文档适用于E0785及之后版本的产品,旨在帮助用户顺利完成H3C CAS平台的部署与配置。 适合人群:具备一定云计算基础知识,从事H3C CAS云计算管理平台部署和维护的技术人员。 使用场景及目标:①为数据中心管理员提供详细的开局指导,确保H3C CAS平台的顺利部署;②帮助技术人员理解并掌握H3C CAS平台的网络、存储、主机和虚拟机配置;③指导用户进行云资源管理和监控,确保平台的稳定性和可靠性;④提供可靠性测试方法,确保平台在上线前经过充分验证。 阅读建议:此文档内容详尽,建议读者在实际部署前仔细阅读并参考相关章节,结合具体应用场景进行实践操作。重点理解网络规划、存储配置、主机和虚拟机的创建与管理等内容,确保所有配置符合最佳实践。同时,注意文档中的注意事项和警告信息,以避免潜在问题。

2025-04-22

Onestep-MySQL自动安装脚本

Onestep-MySQL自动安装脚本

2025-04-22

Onestep-ES自动安装脚本

Onestep-ES自动安装脚本

2025-04-22

【Linux系统管理】常用命令汇总:磁盘挂载、Docker操作、防火墙配置与服务管理

内容概要:本文档《Linux实用命令.txt》涵盖了Linux系统管理中常用的命令和操作,包括磁盘管理(如磁盘挂载、扩展逻辑卷)、Docker容器管理(启动、停止、清理日志)、防火墙配置(端口管理、IP白名单设置、端口转发)、Nginx服务配置、文件压缩与解压、内存释放、时间同步、ELK日志系统接入、YAPI服务重启、Jenkins构建记录清理、SFTP服务配置、SCSI控制器刷新、网络配置以及GitLab和Nexus3的相关操作。文档通过具体命令示例详细介绍了各个操作步骤,帮助管理员快速掌握Linux系统管理和维护技能。 适合人群:适合具有Linux基础的系统管理员和技术支持人员,尤其是那些需要进行日常服务器运维和管理工作的人员。 使用场景及目标:① 对于磁盘管理,能够熟练进行磁盘挂载、扩展和格式化;② Docker管理方面,掌握容器的启动、停止、日志清理等操作;③ 防火墙配置上,学会端口开放、关闭、IP白名单设置和端口转发;④ 掌握Nginx服务配置、文件压缩解压、内存释放等常用操作;⑤ 学习如何接入ELK日志系统、重启YAPI服务、清理Jenkins构建记录、配置SFTP服务、刷新SCSI控制器、修改IP地址以及GitLab和Nexus3的部署与管理。 阅读建议:由于文档涉及多个方面的Linux系统管理命令,建议读者在实际环境中逐步实践每个命令,结合官方文档和其他参考资料加深理解。对于复杂的操作(如防火墙配置、Docker管理等),建议先在一个测试环境中进行实验,确保熟悉后再应用于生产环境。

2025-04-22

Onestep-minio自动安装脚本

Onestep-minio自动安装脚本

2025-04-22

Onestep-JDK自动安装脚本

Onestep-JDK自动安装脚本

2025-04-22

H3C CAS云计算管理平台 安装指导-E0785系列-5W113-整本手册

内容概要:本文档是新华三技术有限公司发布的《H3C CAS云计算管理平台 安装指导-E0785系列-5W113-整本手册》,涵盖H3C CAS云计算管理平台的安装指导,包括产品简介、安装前准备、网络及存储规划、安装步骤、访问管理服务器、常见问题解答及附录。文档详细描述了CAS的组成、服务器类型、安装流程、网络及存储规划、安装后的配置方法,以及访问管理服务器的方法。此外,还提供了常见问题解答和附录内容,如制作U盘启动盘和配置飞腾服务器网络参数。 适合人群:具备一定IT基础的网络规划人员、现场技术支持与维护人员、负责网络配置和维护的网络管理员。 使用场景及目标:①帮助用户了解H3C CAS云计算管理平台的功能和应用场景;②指导用户完成CAS的安装和配置,确保安装过程顺利进行;③提供网络及存储规划的建议,确保系统的稳定性和高效性;④解决用户在安装和使用过程中可能遇到的问题。 其他说明:本手册内容详尽,旨在为用户提供全面的安装和配置指导,确保用户能够顺利完成H3C CAS云计算管理平台的部署和使用。文档强调了安装前的准备工作、网络及存储规划的重要性,并提供了详细的安装步骤和配置指南。同时,手册中包含了大量的图表和命令示例,便于用户理解和操作。此外,文档还提供了常见问题解答,帮助用户解决可能遇到的技术难题。

2025-04-22

2025面试经验-阿里云-交付架构师

内容概要:本文详细介绍了阿里云智能-泛企业交付架构师(政企业务)在面试过程中可能遇到的问题及应对方案。涵盖了技术能力与架构设计、项目管理与交付能力、行业经验与客情处理、技术预研与标准化以及行为面试与文化匹配五个方面。具体包括优化APP项目的部署架构,融合大模型与隐私计算保障医疗数据隐私,协调公共数据运营平台项目中的多方资源,解决信创场景下的技术难题,结合LangChain与知识图谱提升智能客服准确性,以及因技术方案超出客户预期而带来额外商机的经历。每个问题都按照STAR法则展开,即情境(Situation)、任务(Task)、行动(Action)和结果(Result),充分展示了候选人的专业能力和解决问题的实际经验。; 适合人群:具备一定云计算、架构设计及项目管理经验,有意应聘阿里云交付架构师职位的专业人士。; 使用场景及目标:①帮助求职者深入了解阿里云交付架构师岗位的面试流程和技术要求;②为准备类似职位面试的人士提供参考案例和答题思路;③指导候选人如何系统化展现自己的复杂架构设计能力、政企行业理解深度及阿里云生态融合力。; 阅读建议:此文档不仅提供了具体的面试问题及答案模板,还强调了技术细节和实际操作中的注意事项,因此在阅读时应重点关注解决方案的具体实施步骤和技术原理的阐述,同时注意文化匹配部分对于“客户第一”价值观的体现。

2025-04-16

2025面试经验-科大讯飞-系统架构师

内容概要:本文档涵盖多个技术主题,包括微服务与分布式架构的区别与联系、云原生与CI/CD的关系、MySQL的组成部分、Java GC排查方法、Java设计模式、Nacos集群模式的使用、以及高并发预约系统的架构设计。其中,微服务与分布式架构部分详细对比了两者的概念、设计理念、通信机制和数据管理策略,并探讨了两者之间的相互依存关系。云原生与CI/CD部分阐述了云原生如何通过基础设施弹性适配和容器化技术为CI/CD赋能,而CI/CD又如何助力云原生应用的持续集成与交付。MySQL部分介绍了其核心组件,如数据库服务器、存储引擎、SQL解析与优化器及客户端接口。Java设计模式部分列举了常见的设计模式及其应用场景。Nacos部分解释了单体与集群部署的区别及配置修改。高并发预约系统架构设计部分详细描述了系统的技术栈、架构分层、关键技术细节、性能优化、压测与监控、核心流程及容灾备份方案。 适合人群:具备一定编程基础和技术背景的研发人员、系统架构师、运维工程师。 使用场景及目标:①深入理解微服务与分布式架构的设计理念与技术特性,掌握两者在实际项目中的应用;②了解云原生与CI/CD的关系,掌握如何通过云原生技术优化CI/CD流程;③熟悉MySQL的内部结构与工作原理,提升数据库管理和优化能力;④掌握Java设计模式的应用场景与实现逻辑,提高代码设计与架构能力;⑤理解Nacos集群模式的配置与使用,提升服务发现与配置管理能力;⑥学习高并发预约系统的架构设计,掌握如何构建高性能、高可用的分布式系统。 阅读建议:文档内容较为全面,涉及多个技术领域,建议读者根据自身需求和技术背景选择感兴趣的部分进行重点学习。对于系统架构师和高级开发人员,可以重点关注微服务与分布式架构、云原生与CI/CD、以及高并发预约系统架构设计部分;对于数据库管理员,可以重点关注MySQL的组成部分;对于Java开发人员,可以重点关注Java设计模式部分。在学习过程中,结合实际项目经验和相关工具进行实践,有助于更好地理解和应用所学知识。

2025-04-09

2025面试经验-阿里云智能-技术服务专家

内容概要:本文主要介绍阿里云智能技术服务专家职位的相关信息。作为阿里云客户技术服务的第一负责人,该职位需要深入了解客户业务场景,与客户的架构、开发、运维团队合作,优化云上业务稳定性,包括云上监控、灾难演练、高可用架构改造等。同时,还需与阿里云各团队合作,解决客户问题,沉淀最佳实践及工具产品。职位要求包括3年以上大型互联网应用或集团型企业应用的经验,3年以上的大型项目管理和团队管理经验,以及优秀的沟通技巧、文档写作能力等。加分项包括阿里云技术认证、大规模应用开发或运维经验、英语能力。此外,文中还提及了计算机网络七层协议、Docker网络等技术知识,为面试提供了相关建议。 适合人群:具备3年以上泛娱乐、零售、金融、教育等行业大型互联网应用或集团型企业应用的解决方案、架构设计、监控方案、Devops、AIops、维护、高可用改造方案经验的人士;3年以上的大型项目管理和团队管理经验者;有责任心,能实践“客户第一”理念,并成就客户的人士;具有优秀沟通技巧、团队合作经验、敬业精神和学习能力的人士;具有较强抗压能力和执行力,并能接受一定频率出差的人士。 使用场景及目标:①深入理解客户业务场景,与客户团队合作优化云上业务稳定性;②与阿里云各团队合作,解决客户问题,沉淀最佳实践及工具产品;③追踪行业重点客户关键稳定性问题,协助客户治理并推动阿里云产品及服务的优化改进;④准备面试,掌握计算机网络七层协议、Docker网络等技术知识,提高面试成功率。 其他说明:文中详细介绍了计算机网络七层协议的功能、设备和应用,以及Docker网络的主要功能和网络类型分析,为面试提供了技术背景支持。建议面试者深入理解这些技术知识,以便更好地应对面试中的技术问题。

2025-04-09

2025面试经验-海康萤石-Java应用架构师

内容概要:本文详细介绍了海康萤石Java应用架构师职位的职责和要求,涵盖了高并发、分布式系统的设计与优化,以及对Java核心技术的深入理解。此外,文章还探讨了三种常见的消息中间件(RocketMQ、ActiveMQ、Kafka)的特点与区别,Redis分布式锁的实现方式及其优缺点,管理一千万台物联网设备的架构设计,包括设备接入、数据处理、存储、管理和安全保障等方面。最后,文章讲解了Spring框架中Starter的实现、解决对象循环引用的方法、网关按业务分流的配置,以及Java JVM的自动性能优化机制和WAF流量接入方式。 适合人群:具备多年Java开发经验,特别是有高并发系统设计、优化改进及开发经验的研发人员和架构师。 使用场景及目标:①理解高并发、分布式系统的设计与优化;②掌握Redis分布式锁的实现方式;③学习大规模物联网设备管理的架构设计;④实现Spring框架中的Starter并解决对象循环引用问题;⑤配置Spring Cloud Gateway按业务进行后端微服务分流;⑥了解Java JVM的自动性能优化机制;⑦掌握WAF流量的不同接入方式及其应用场景。 阅读建议:本文内容详实,涉及多个技术领域的知识点,建议读者根据自身需求重点阅读相关章节,并结合实际项目进行实践。对于架构师而言,应重点关注系统设计和优化部分;对于开发人员,建议深入理解Spring框架和JVM优化的内容。

2025-04-09

2025面试经验-京东零售-Java开发

内容概要:本文详细介绍了京东零售Java后端开发岗位的面试经验和要求,涵盖技术背景、ES深度分页解决方案、Synchronized实现原理及其优化、MySQL事务隔离级别、MySQL多版本并发控制(MVCC)、MySQL乐观锁、MySQL Undo日志与Binlog的区别、Redis大key处理、Java弱引用、Synchronized使用场景、RocketMQ保证消息不丢失的方法以及秒杀系统的设计要点。针对每个主题,文章不仅阐述了基本概念,还提供了具体的应用场景和技术实现细节。 适合人群:具备一定编程基础,尤其是Java后端开发经验的工程师,特别是准备面试或从事相关工作的研发人员。 使用场景及目标:①帮助读者理解并掌握京东零售Java后端开发岗位所需的技能和知识点;②为面试者提供全面的技术准备指南,包括但不限于搜索/推荐系统、高并发处理、数据库优化、消息队列等;③指导开发人员在实际项目中应用这些技术,提高系统的性能、可靠性和扩展性。 其他说明:本文内容丰富,涵盖了从基础知识到高级应用的多个方面,适合不同层次的技术人员学习参考。建议读者根据自身需求重点阅读感兴趣的部分,并结合实际工作中的问题进行深入研究和实践。

2025-04-09

【信息技术领域】系统试运行保障及应急预案:构建全面的信息系统应急响应机制与试运行保障体系为系统试运行

内容概要:本文档《模板-系统试运行保障及应急方案》详细阐述了系统试运行保障及应急预案,旨在确保系统在试运行期间的稳定性和可靠性,以及在突发事件发生时能够迅速、有效地应对。主要内容包括试运行保障方案、应急预案及其组织保障、应急处置流程、事件分级及响应机制、通信与物资保障、技术与人员保障、后期保障等方面。试运行保障方案明确了试运行的目的、内容、环境要求、人员组织计划及日常巡检与问题记录机制;应急预案则针对不同级别的信息系统突发事件制定了详细的应急响应措施,确保在突发事件发生时能够最大限度地减少损失和影响。此外,还强调了后期观察、业务和数据恢复保障、调查与评估及改进措施的重要性。 适用人群:适用于系统集成商、运维工程师、项目经理、信息安全管理专员等参与系统试运行和应急管理的专业人士。 使用场景及目标:①为系统试运行期间提供全面的保障措施,确保系统稳定运行;②针对不同级别的信息系统突发事件制定应急响应策略,确保快速恢复系统正常运作;③通过后期观察、业务和数据恢复保障等措施,确保系统长期稳定运行;④通过对突发事件的调查与评估,总结经验教训,持续改进应急预案。 其他说明:文档中提供了详细的应急处置流程和技术保障要求,强调了预防为主、快速响应、统一指挥、分级管理和健全机制的工作原则。同时,还提出了加强应急技术支持队伍建设、提高人员业务素质和技术水平的要求,确保在突发事件发生时能够高效应对。

2025-04-03

流程规范\研发规范\代码规范\前端\React编码规范

内容概要:本文档《React编码规范.docx》旨在定义统一的React编码风格,确保代码的一致性和可维护性。文档详细规定了React代码的基本原则、命名规则、引号使用、空格处理、属性命名、标签使用以及方法定义等方面的规范。基本原则包括每个文件只包含一个React组件,优先使用JSX语法和函数式组件。命名规则强调使用帕斯卡命名法进行文件名和组件引用的命名,并避免使用displayName命名组件。引号使用上,JSX和HTML属性使用双引号,而JS属性则使用单引号。空格方面,禁止在JSX花括号内添加空格。属性命名要求采用小驼峰命名法,避免使用数组索引作为key值。标签使用上,没有子组件的父组件应使用自闭合标签。方法定义方面,建议使用箭头函数访问本地变量,并在构造函数中绑定事件处理函数。 适合人群:熟悉JavaScript和React框架的前端开发人员,尤其是希望提高代码质量和一致性的团队成员。 使用场景及目标:①帮助开发人员编写符合行业标准的React代码;②确保团队内部代码风格统一,便于协作和维护;③减少因编码风格不一致带来的错误和复杂度。 阅读建议:此文档是React项目开发的基础指导文件,建议开发者在编写React应用时严格遵循这些规范,以确保代码的可读性和可维护性。同时,在实践中不断调整和优化编码习惯,逐步形成更加成熟和高效的开发流程。

2025-04-03

流程规范\研发规范\代码规范\前端\HTML编码规范

内容概要:本文档旨在规范HTML代码风格,确保HTML代码的一致性、易读性和可维护性。首先介绍了HTML5的DOCTYPE声明方式和字符编码设置,强调了字符编码声明的位置和无BOM的UTF-8编码的重要性。接着讲述了CSS和JavaScript的引入位置,建议CSS在head中引入,JavaScript放在页面末尾或采用异步加载,并提倡省略嵌入式资源的协议头和忽略type属性。文档还规定了title和favicon的设置方法,以及针对移动设备友好的viewport设置。此外,明确了缩进与换行的规则,要求使用2个空格作为缩进层级,每行不超过120个字符。对于命名规则,class和id必须全字母小写并以“-”分隔,id需保证页面唯一性,少用id选择器。标签方面,要求标签名和属性名均用小写字母,属性值用双引号包围,自定义属性加前缀。最后强调了语义化的HTML元素使用,为图片和多媒体提供了降级方案,如添加alt属性、区分下载需求的图片实现方式等。; 适合人群:前端开发人员,尤其是希望提升HTML代码质量的开发者。; 使用场景及目标:①帮助开发者编写符合规范的HTML代码,提高代码的可读性和可维护性;②确保页面在不同浏览器和设备上的兼容性和一致性;③优化页面加载速度和用户体验。; 其他说明:遵循这些编码规范不仅能使代码更加整洁美观,还能减少潜在的错误和技术债务,建议开发者在日常工作中严格遵守。

2025-04-03

流程规范\研发规范\代码规范\前端\Flutter编码规范

内容概要:本文档详细介绍了 Flutter 的编码规范,旨在帮助开发者编写更高效、易读和一致的代码。文档涵盖了代码风格(如标识符命名规则、大驼峰命名法用于类和枚举、小驼峰用于其他标识符)、排序(如导入语句的顺序)、注释(如使用///进行文档注释)、字符串处理(如使用模板字符串)、集合操作(如使用高阶方法转换序列)、参数使用(如命名参数默认值用=号)、变量初始化(如避免显式初始化为null)、类成员设计(如优先使用final字段)、构造函数(如使用初始化形式)以及异步编程(如优先使用async/await)。; 适合人群:具备一定编程基础,尤其是正在或即将从事 Flutter 开发的工程师。; 使用场景及目标:①确保团队内部代码风格统一,提高代码质量和协作效率;②帮助开发者快速掌握 Flutter 编程的最佳实践,减少常见错误;③通过规范化的代码提升应用性能和维护性。; 阅读建议:此文档提供了详细的编码规范指南,建议读者在实际开发过程中反复参照,并结合具体项目实践,逐步形成良好的编码习惯。同时,对于不熟悉的语法或概念,可以通过官方文档进一步学习。

2025-04-03

流程规范\研发规范\代码规范\前端\ESLINT规范

内容概要:本文档详细介绍了ESLint这一开源JavaScript代码检查工具,从其创立背景说起,强调了在多人协作开发环境下统一代码规范的重要性。文中列举了ESLint规则分类,包括可能导致错误、最佳实践、严格模式相关、变量定义相关、Node.js和CommonJS、风格指南以及ECMAScript 6等类别。同时,文档提供了具体的ESLint配置示例,涵盖parser、env、plugins、extends和rules等关键设置项。此外,还特别提到了前端项目中推荐的质量保障方式,即ESLint结合husky和Lint-staged使用,确保代码提交前经过严格的格式检查。最后,分别给出了Vue和React项目的ESLint配置模板,帮助开发者快速集成到各自项目中。 适合人群:有一定JavaScript编程经验,尤其是参与团队协作开发的前端工程师或全栈工程师。 使用场景及目标:①为团队建立统一的JavaScript代码规范,减少因个人编码习惯差异带来的沟通成本;②确保项目代码质量,避免潜在错误,提高代码可维护性和可读性;③掌握如何将ESLint集成到现有项目中,利用自动化工具提升开发效率。 其他说明:文档不仅提供了理论指导,还附带实际操作指南,如初始化配置、安装依赖包以及具体配置代码片段,方便读者直接应用于项目实践。

2025-04-03

流程规范\研发规范\代码规范\后端\附:专有名词解释

内容概要:本文档详细解释了软件开发尤其是Java开发中常用的专有名词。其中包括不同类型的对象如POJO、DO、PO、DTO、BO、Query、Form、VO、AO及其各自的作用范围和特点;介绍了CAS机制,一种提高多线程环境下性能的操作;阐释了GAV的概念,即Maven坐标用于唯一标识jar包;提及OOP,指面向对象编程;解释了AQS,这是许多同步类的基础;简述了ORM框架,像iBATIS和mybatis,它们实现了对象与数据库记录之间的映射;还提到了常见的错误如NPE和OOM。最后区分了一方库、二方库和三方库的概念,分别指代内部模块依赖、公司内部共享以及外部开源的库。; 适合人群:Java开发人员,尤其是对Java开发中常见名词概念需要进一步理解的人群。; 使用场景及目标:①帮助开发人员准确理解并正确使用这些术语;②为开发人员提供参考,确保团队内部交流的一致性和准确性。; 其他说明:这些名词解释不仅有助于提升代码质量,还能促进团队成员之间的沟通效率,减少因术语误解而产生的问题。

2025-04-03

AI网关技术方案(接入层、网关层、模型层)

内容概要:本文介绍了AI网关的技术方案,旨在构建一个面向企业级场景的统一大模型访问与治理平台。AI网关通过三层架构(接入层、网关层、模型层)实现统一接入、协议适配、身份鉴权、路由调度、成本控制和运维观测等核心功能,支持OpenAI-compatible接口、A2A协议及MCP工具集成,能够在不改变上层应用调用习惯的前提下,完成多模型厂商、自建模型和服务的统一纳管与调度。系统内部进一步划分为API层、权限与策略层、路由与执行层、运维管理层及基础设施层,依托PostgreSQL和Redis实现配置管理、状态存储与高性能运行支撑。文章还阐述了流量接入与模型接入两大典型场景,并详细描述了请求流转链路和关键表设计,涵盖模型配置、访问控制、策略管理与调用审计等方面。; 适合人群:具备一定系统架构和后端开发经验,从事AI平台建设、大模型服务治理或企业级中间件研发的技术人员;企业技术负责人、架构师及相关运维管理人员。; 使用场景及目标:①实现企业内多个业务系统对多模型的统一接入与权限隔离;②集中管理模型调用的成本、预算、限流与安全策略;③在不影响业务的情况下灵活替换底层模型 provider,提升系统可用性与弹性;④构建可观测、可审计、可追溯的AI服务治理体系; 阅读建议:此资源侧重于企业级AI网关的整体架构设计与治理能力落地,建议结合实际业务需求,重点关注各层级职责划分、请求处理流程以及数据库表结构设计,在实践中逐步搭建可控、可扩展的大模型服务平台。

2026-06-25

短视频平台调研报告.pptx

调研报告PPT制作,共15张幻灯片,涵盖以下内容: 章节 内容要点 封面 主流短视频平台差异化优势与发展路径调研报告 研究框架 六大研究模块概览 研究背景 调研目的、范围与平台选择 平台概览 五大平台DAU/MAU/定位/优势对比表 用户规模 DAU与MAU可视化对比分析 用户画像 各平台性别/年龄/城市分布特征 内容生态 内容类型、时长、特色对比 推荐机制 算法逻辑差异分析 商业化模式 变现方式与电商GMV对比 代表案例 东方甄选、辛巴家族、罗翔、完美日记等 差异化总结 核心竞争力与增长路径对比 成功经验 六大关键成功要素提炼 未来趋势 AI赋能、内容精品化、全域电商、私域精细化 策略建议 平台选择、内容策略、运营方法、商业化路径 结语 感谢聆听

2026-05-18

AI 编程进阶:构建零干预的代码生成自愈流水线

还在每天对着大模型生成的错误代码反复纠错?受够了 AI 编程时的“环境崩溃”与“逻辑幻觉”? 本次分享不讲虚无缥缈的 Prompt 提示词玄学,而是直接拆解一套真正在生产线落地的 AI Code Agent 闭环架构。我们将跳出“单向代码生成”的局限,探讨一种让机器自主感知、执行并纠错的工程化思路。 在本次分享中,我们将一起探讨: 上下文感知:如何通过代码静态扫描提前排雷,从根本上消除大模型的幻觉? 闭环自愈机制:如何搭建一个“运行-报错-截取-重试”的自治流水线,让机器自己看懂报错并修复缺陷? AI 的能力边界:直击大模型面对高耦合复杂代码时的“灾难现场”,这又将给我们带来怎样的架构演进启示? 来看看我们如何通过这套 Agent 流水线,用 3 分钟跑完人工半天的工作量,并达到 97.8% 的一次性通过率!用算力解放人力,让工程师聚焦更高价值的架构思考。

2026-05-19

OpenClaw与Agent Skills

OpenClaw:GitHub史上增速最快的开源项目,真正能做事的AI,是一款运行在您自己的设备上的个人AI助手,它可以通过你常用聊天软件回复你。

2026-03-11

⾦融领域⼤模型产品综合分析报告.pdf

内容概要:本报告对2024-2026年中国金融领域大模型产品进行综合分析,涵盖阿里云通义千问、百度文心一言、商汤日日新、蚂蚁金融大模型及BloombergGPT等主流产品。报告指出市场呈现“一超多强”格局,阿里云以33.2%份额领跑,百度、商汤紧随其后,应用场景从智能客服向投研、风控等核心业务延伸。标准化产品和MaaS模式成为主流,招投标数据显示应用类项目占比首次超过算力采购。技术趋势上,多模态、Agentic AI、国产化适配加速发展。 适合人群:金融机构决策者、科技厂商战略负责人、AI投资机构分析师。 使用场景及目标:①评估主流金融大模型的技术能力与市场定位;②制定金融机构AI战略部署路径;③识别投资方向与生态合作机会。 阅读建议:重点关注市场份额、技术能力雷达图与标杆案例对比,结合自身机构类型(如大行、券商、中小金融机构)参考相应的实施建议与竞争策略。

2026-03-04

阿⾥云通义千问⾦融⼤模型深度调研报告.pdf

综合分析报告包含: 执行摘要 - 市场格局、核心洞察、战略建议 第一章 - 金融大模型市场概览(规模、招投标、产品形态) 第二章 - 主要产品深度分析(5大产品详细对比) 第三章 - 用户体量与应用场景对比 第四章 - 竞争格局与优劣势分析 第五章 - 结论与建议(对金融机构、厂商、投资者的建议)

2026-03-04

基于昇腾MindSpeed-LLM的大模型训练&推理

基于昇腾MindSpeed-LLM的大模型训练&推理

2026-02-09

基于PyTorch-VLM的大模型训练&推理

基于PyTorch-VLM的大模型训练&推理

2026-02-09

新一代金融终端-FinceptTerminal.pptx

我们正处在一个由 AI 驱动的金融变革时代,传统的金融终端正在被颠覆。你是否好奇,下一代的金融终端是什么样子?AI 又将如何深度赋能我们的投资决策? 本课程将带你走进 Fincept Terminal 的世界,这不仅是一款工具,更是下一代金融智能终端的缩影。它将强大的 AI 能力与专业的金融分析融为一体,旨在重新定义我们与金融市场的交互方式。

2026-02-03

B2B-AI 2025部门分享分析报告

B2B-AI 2025部门分享分析报告

2026-01-22

人工智能基于云原生的AI Agent基础设施:金融领域大模型多模态应用加速落地方案设计

内容概要:本文系统阐述了AI云原生作为数智化时代AI Agent加速落地的最佳技术路径。AI云原生融合“AI+云原生”,以容器、微服务、Kubernetes等技术为基础,围绕大模型应用的算力调度、模型开发部署、多模态数据处理等需求重构基础设施架构,解决传统云计算在Token调用量激增、推理成本高、Agent安全执行等方面的挑战。文章详细介绍了AI云原生的技术框架,涵盖AI计算(异构GPU/CPU管理)、AI存储(分布式存储、Fluid/Alluxio缓存)、AI网络(RDMA、RoCE、InfiniBand低延迟通信)、AI容器(K8S编排与管理)以及AI作业(Kubeflow、Volcano等全生命周期管理),并提出通过GPU池化、弹性训练、安全可观测性等手段提升AI应用的效率、安全与成本控制。; 适合人群:具备一定云计算、AI开发或系统架构经验的技术人员,尤其是从事AI平台建设、大模型训练与推理、云原生技术落地的研发与运维人员;企业技术决策者亦可参考其战略方向。; 使用场景及目标:①构建支持大规模AI模型训练与推理的云原生基础设施;②实现AI应用的高效部署、弹性扩缩容与成本优化;③提升AI系统的安全性、可观测性与运维自动化水平;④探索金融等行业垂直领域的AI Agent落地解决方案; 阅读建议:此资源兼具战略视野与技术深度,建议结合Kubernetes、容器化、分布式系统等基础知识进行深入研读,并关注文中提及的开源项目(如Fluid、Kubeflow、Alluxio等)以辅助实践。

2025-11-10

容器编排基于Kubernetes的调度器架构与扩展机制研究:集群资源分配优化及异构算力调度实践

内容概要:本文深入讲解了Kubernetes集群调度机制及其扩展能力,重点介绍kube-scheduler的核心功能与调度流程,包括调度队列、过滤与打分、绑定等关键步骤。文章进一步对比了两种调度扩展方式:scheduler extender和scheduler framework,详细阐述其工作原理、配置方式与优缺点。并通过HAMi实例展示了如何基于extender实现异构算力(如GPU)的精细化调度,涵盖资源注册、过滤、打分、绑定全过程,体现调度器在真实场景中的可扩展性与工程实践。; 适合人群:具备Kubernetes基础知识,从事容器平台开发、运维或SRE工作1年以上的技术人员;对调度机制感兴趣的研发人员。; 使用场景及目标:①理解Kubernetes调度器的工作原理与核心流程;②掌握scheduler extender和scheduler framework的使用与选型依据;③学习如何实现GPU等特殊资源的自定义调度方案,提升资源利用率与调度灵活性。; 阅读建议:建议结合Kubernetes官方文档与源码对照阅读,重点关注调度框架的扩展点接口设计与HAMi中Filter、Bind、Allocate的协同逻辑,动手搭建实验环境验证扩展机制的实际效果。

2025-11-10

语言模型幻觉的根源剖析:从统计必然到评估体系的系统性困境

语言模型幻觉的根源剖析:从统计必然到评估体系的系统性困境

2025-10-20

这篇论文《Real-Time Detection of Hallucinated Entities in Long-Form Generation》提出了一种实时检测大语言模型在生成长文本时产生幻觉实

内容概要:本文提出了一种低成本、可扩展的实时检测长文本生成中幻觉实体的方法,聚焦于命名实体(如人名、日期、引用)级别的错误识别,而非完整的事实性判断。作者构建了一个自动化标注流程,利用具备网络搜索能力的前沿大模型对生成内容中的实体进行真实性验证,并生成带有支持或虚构标签的精细数据集。基于此数据,训练简单的线性探针即可高效识别幻觉实体,在多种700亿参数的大模型上实现了优于传统不确定性基线方法的性能(如Llama-3.3-70B上AUC达0.90),同时适用于短文本问答与数学推理等跨领域任务。研究还表明,一个模型上训练的探测器能有效泛化到其他模型,作者已公开数据集以促进复用。; 适合人群:从事自然语言处理、大模型安全与可靠性研究的研究人员及工程师,尤其是关注幻觉检测、模型校准和可信AI的技术人员。; 使用场景及目标:① 在医疗咨询、法律建议等高风险应用中实现实时监控,防止模型生成虚假信息;② 构建可干预系统,当检测到高幻觉风险时主动放弃回答以提升可靠性;③ 推动基于内部表征的轻量级检测方法,替代昂贵的外部验证流水线; 阅读建议:本研究强调了从实体级别切入进行细粒度标注的价值,建议读者重点关注其标注流程设计、探针训练策略以及跨模型泛化实验,同时注意其局限性,如标注噪声和仅覆盖部分幻觉类型,为后续改进提供方向。

2025-10-20

第八弹-Real-Time Detection of Hallucinated Entities in Long-Form Generatio-pro.html

第八弹-Real-Time Detection of Hallucinated Entities in Long-Form Generatio-pro.html

2025-10-20

第八弹-Why Language Models Hallucinate-pro

第八弹-Why Language Models Hallucinate-pro

2025-10-20

用嘴画图:AI 一句简介:还在为画图头疼吗? * 产品画流程图,排版半天; * 售前看到竞对一张好图,想拿过来,要一笔笔画; * 开发想要架构图,还得手动画 这次分享带你体验:一句话搞定架构图流程图

简介:还在为画图头疼吗? * 产品画流程图,排版半天; * 售前看到竞对一张好图,想拿过来,要一笔笔画; * 开发想要架构图,还得手动画。 这次分享带你体验:一句话让 AI 自动出图,流程图、架构图、时序图都能搞定。
从此,画图不再是负担,而是乐趣。

2025-09-16

【大模型微调】基于Qwen3-8B的人设定制化训练:金融领域Hithink角色构建与评测系统实现

内容概要:本文详细介绍了基于Qwen3-8B模型进行Hithink人设微调的完整流程,涵盖训练前的环境与模型选择、语料准备与强化、模型训练参数设置、训练过程监控、模型评测及优化方向。采用A100 40G单卡在Autodl云平台完成训练,使用Llama-Factory工具链进行微调,并通过人工评审方式对人设和功能表现进行评测。最终模型在人设测试中达到98.17%的通过率,在功能测试中通过率为86%。文章还总结了语料质量、多样性与评测方法对微调效果的关键影响。; 适合人群:具备一定大模型微调基础的研发人员、算法工程师,尤其是从事垂直领域人设定制或模型蒸馏相关工作的技术人员;适合工作1-3年并希望深入理解微调全流程的技术从业者。; 使用场景及目标:①掌握如何针对特定人设(如企业AI助手)构建高质量微调语料集;②学习在显存受限条件下合理配置训练参数(如梯度累积、学习率等);③了解人工评测与自动化评测的优劣对比,提升模型评估准确性。; 阅读建议:此文档强调语料质量和评测严谨性,建议读者结合实际项目参考其语料分类、扩写与测试集构建方法,并重点关注训练参数设置与问题分析部分,用于指导真实场景下的模型微调实践。

2025-09-16

【大模型微调】基于LoRA算法的LLaMA-Factory框架在法律领域中文语料上的SFT微调实践与参数优化指南

内容概要:本文详细介绍了如何使用LLaMA-Factory框架在本地对大模型进行微调,基于LoRA算法和DeepSeek-R1-Distill-Qwen-1.5B基座模型。内容涵盖环境搭建、模型加载、数据集准备与配置、模型训练参数设置、训练过程执行、模型导出及关键微调参数解析。通过可视化界面操作和命令行结合的方式,指导用户完成从环境部署到模型优化的全流程,并提供了参数调整建议与实际训练示例,帮助理解学习率、训练轮数、梯度裁剪等关键因素对训练效果的影响。; 适合人群:具备一定深度学习基础,熟悉Python与Linux操作,从事AI模型开发或微调工作的研究人员或工程师,尤其是有本地微调大模型需求的技术人员; 使用场景及目标:①在有限算力条件下高效微调大语言模型;②掌握LoRA等参数高效微调技术的实际应用;③通过可视化界面与配置文件实现定制化训练流程;④理解微调过程中各超参数的作用与调优策略; 阅读建议:建议读者结合实际操作逐步跟随文档执行,重点关注数据集格式配置、参数设置与模型导出流程,同时通过日志与损失变化分析训练效果,建议在调试时使用小样本验证流程正确性。

2025-09-16

国家政务服务平台统一身份认证平台实施方案

国家政务服务平台统一身份认证平台实施方案

2025-05-08

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除