自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

  • 博客(495)
  • 资源 (5)
  • 收藏
  • 关注

原创 那头黑色鲸鱼托着的洞洞板,DeepSeek Harness 到底在拼什么?

DeepSeek Harness 是一个开源智能体框架,采用插件化设计,核心思想是"一切皆插件,每次运行都可追溯"。它基于Cordis元框架,实现了副作用的可逆性,允许热插拔组件而不留痕迹。Harness不是模型,而是连接模型与真实世界的"线束",将AI决策转化为可执行操作。项目发布24小时内GitHub star近8万,社区插件已近300个。虽然目前对非开发者门槛较高,但其模块化设计为构建复杂AI应用提供了高度灵活性。

2026-08-14 16:16:18 47

原创 【XTAO框架】Agent 跑偏这件事,我忍了很久了

摘要: XTAO 是一个解决 Agent 执行偏差的开源框架,核心针对「Plan 跑偏后如何自我修正」的问题。它通过 G4C 模型(Goal、Context、Choice、Checkpoint、Correction)生成可动态调整的 Plan,并采用 TAO(Think-Action-Observation) 步骤级执行与 Replan 机制实现运行时纠偏。框架将错误判定与执行分离,支持 Step/Partial/Global 三级修正粒度,优先复用有效结果,避免无限循环。案例显示,XTAO 能有效定位如

2026-08-14 08:38:35 148

原创 【XIntent框架】Agent 听不懂人话?我给大模型加了「两道翻译」

文章摘要(148字) 大模型Agent常因自然语言的模糊性陷入理解困境,如指代不清、主观表达等问题。XIntent框架通过两阶段处理方案:先规范化输入(解决指代、省略等六类问题),再采用三层瀑布式意图识别平衡效率与准确率。核心创新包括:两阶段分工处理不同复杂度问题、显式约束大模型行为边界、语义化命名增强指代稳定性、动态澄清机制及长期记忆支持。该项目开源在GitHub,通过结构化处理使Agent更精准理解用户真实意图,同时控制推理成本。

2026-08-14 08:30:00 24

原创 在 Xinference 里接入 jina-reranker-v3.5,一个 listwise reranker 让我连改三版代码

Jina-Reranker-V3.5升级解析与Xinference接入实践 摘要: Jina-Reranker-V3.5作为0.6B参数的多语言listwise排序模型,在架构、训练数据和蒸馏策略上进行了三大升级:采用3L2G混合注意力机制降低计算复杂度;新增法律、医疗等垂直领域训练数据;通过三段式自蒸馏保持性能。评测显示其在BEIR等基准上超越同参数规模模型,甚至优于部分4B模型。然而,该版本改用原生JinaForRanking架构,导致无法直接通过标准CrossEncoder接口接入Xinference

2026-08-05 10:33:50 28

原创 在 Xinference 里跑通腾讯 R3-Skill:当你的 Agent 技能库大到没法塞进 Prompt

腾讯 IMA 和 Youtu Lab 提出的 R3 技能路由系统解决了 AI Agent 技能调用中的核心难题:如何在数十万技能库中精准检索与当前任务意图匹配且相互兼容的技能组合。与文档检索不同,技能检索需考虑技能间的动态兼容性(query-conditioned skill compatibility)。研究团队通过收集 LLM 的拒绝信号构建 R3-Skill 数据集,并开发了两阶段模型:R3-Embedding(粗排)和 R3-Rerank(精排)。该系统已在 Xinference 开源,支持类似 O

2026-08-04 17:32:02 30

原创 我把 Agent 的 Plan 与执行做成了「运行时对象」,它终于不会在半路上自己跑偏了

摘要: XTAO 是一个 Agent 规划与执行框架,通过 G4C(Goal、Context、Choice、Checkpoint、Correction)生成可执行的 Plan,并结合 TAO(Think-Action-Observation) 步骤级执行与 Replan 机制实现动态纠偏。其核心创新在于将 Plan 设计为有状态的运行时对象,支持检查点验证与多粒度修正(Step/Partial/Global Replan),避免传统 Agent 因早期错误导致后续步骤偏离的问题。通过 FailureTrac

2026-08-01 23:03:24 28

原创 用 Claude Agent SDK 搭一个多代理投研平台,我把踩过的坑全写进来了

文章摘要: 本文介绍了基于Claude Agent SDK开发的投研系统FinSight的设计经验。重点探讨了四个关键设计点: 采用SubAgent-as-tool架构,将财务分析、行业新闻、风险预警拆分为独立子代理,通过上下文隔离提升任务质量,实测性能提升90%但token消耗增加15倍; 会话管理实现fresh/resume/fork三种模式,支持连续追问和探索分支,需注意显式传入agents配置的坑点; 通过Hook机制解决无人值守时的治理问题,包括成本控制、敏感词过滤和审计追踪; 集成OpenTel

2026-08-01 09:56:39 28

原创 从 Loop 到 Graph AI Agent 工程范式演进

AI Agent设计范式:从循环工程到图工程的演进 文章探讨了AI Agent设计方法的演进历程。2023年以Prompt Engineering为主,2025年发展为Context Engineering,2026年Addy Osmani提出Loop Engineering概念,核心在于设计自动化循环系统而非单次Prompt。一个完整的循环包含触发器、任务和成功条件三个要素,通过独立验证器和状态持久化实现迭代优化。 当任务复杂度上升时,简单的循环结构难以应对。Peter Steinberger提出的"Ar

2026-07-27 21:47:33 170

原创 用 Claude Agent SDK 干掉 LangGraph 之后,我的金融研报 Agent 终于不崩了

这篇文章摘要如下: 金融研报自动生成项目FinScribe的技术实践:如何用Claude Agent SDK解决大模型上下文溢出问题 作者在开发金融研报自动生成项目时遇到大模型上下文管理的核心挑战:处理上市公司财务数据(单家公司三年三张表约需90万token)远超qwen3-max的256K上下文窗口。文章重点介绍了采用Claude Agent SDK的五级渐进式上下文压缩策略: Tool Result Budget:大文件自动转存磁盘,上下文只保留引用 Snip:过长输出截断处理 Microcompact

2026-07-24 17:30:38 42

原创 Agent 听不懂人话?我把这个问题拆成了两个模块来解决

这篇文章介绍了XIntent框架如何解决Agent在自然语言处理中的两个核心问题:用户输入规范化和意图识别。以下是摘要要点: 问题背景: Agent难以理解自然语言中的指代、省略和主观表达 用户输入不规范导致意图识别失准、参数漂移等问题 解决方案架构: 采用两阶段处理:pre-normalization(预处理)和deep-normalization(深度处理) 预处理解决即时可处理的指代、省略等问题 深度处理需要依赖上下文或工具返回的数据 技术实现: 将用户输入问题分为6大类(指代/缺失/表达/词义/主观

2026-07-22 23:16:03 35

原创 别再让每个请求都去最贵的模型了,聊聊 AI Agent 的模型路由

本文介绍了一个名为xrouter-llm的模型路由项目。该项目通过将教育测量学中的项目反应理论(IRT)应用于AI模型路由,实现了53.2%的成本降低和1.9%的完成率提升。文章首先分析了模型路由的经济价值,指出合理路由可节省75%的API成本。然后梳理了当前四种主流路由方案:静态规则、分类器、级联和语义路由。最后重点解析了xrouter-llm的创新点:将路由问题拆分为难度预测和能力评估两个维度,使用IRT框架建立prompt难度与模型能力的匹配关系,通过训练数据预测完成概率,从而选择最经济可行的模型。该

2026-07-16 14:00:00 40

原创 我和 TRAE AI聊了聊,它帮我为五迷老师们做了个城市漫游小程序!

独立开发者利用TRAE AI开发的"MaydayLand·五月天城市漫游"H5应用,为五月天粉丝打造了一个集城市角落打卡、同好社交和主题游戏于一体的移动端平台。该产品通过歌词角落地图、暗号打卡、Canvas生成专属卡片等功能,解决了五迷寻找同好据点的需求,并内置8款五月天主题小游戏和资讯自动更新系统。项目采用Flask+原生前端技术栈,在ModelScope平台部署,展现了AI辅助开发在实现复杂功能(如移动端游戏门户单文件架构)和解决部署问题上的高效性。(149字)

2026-07-07 21:13:56 496

原创 【AFAC2026金融智能-赛题四】我做了一个疯狂的决定,把Embedding和Reranker全删了

本文介绍了AFAC2026金融智能挑战赛赛道四的解题思路,核心是在500万token的严格限制下实现金融长文本的高效问答。作者通过四步流水线(规划、BM25检索、记忆压缩、LLM推理)优化流程,重点创新在于: 采用零API调用的纯BM25检索,配合多路查询、封面页加权和页面邻接扩展等策略 设计高效的检索算法,从问题中提取专有名词并构建多路查询组合 深入理解评分公式,平衡准确率和token消耗,最终在准确率提升的同时将token消耗从数百万降至百万级 这些创新使方案在严格限制下实现了性能突破,展示了在资源受限

2026-07-07 11:51:02 147

原创 【AFAC2026金融智能-赛题三】让AI自己当研究生,零人工干预跑完21轮实验

本文介绍了SparseAutoExp项目,这是一个完全自主的科研Agent框架,能够在零人工干预的情况下完成从文献分析到实验验证的完整科研闭环。该项目专为AFAC2026金融智能创新大赛设计,需在两小时内自主完成图节点分类和产品推荐两个机器学习任务。框架采用四阶段迭代闭环(文献解析→瓶颈诊断→代码设计→实验验证)和LangGraph多Agent架构,通过严格的工程约束确保可复现性。核心设计包括基于状态的决策机制和五种停止条件判断,模拟人类科研流程的同时避免了低效循环。项目展现了AI自主科研的潜力,在严格限制

2026-07-06 13:42:30 275

原创 【AFAC2026金融智能-赛题二】2亿像素的面条图,我切了1000刀拼回完美Markdown

摘要: AFAC2026金融智能创新大赛的「复杂金融文档还原挑战」任务是将高分辨率金融文档截图转换为结构化Markdown文本。面对2亿像素的“面条图”和严格的计算限制(禁用主流大模型,仅允许调用FinixDoc-VL API且模型需小于10M),作者提出四层流水线解决方案: 图像预处理:通过文本行投影检测在行间隙处智能切图,避免截断文字; API调度:5路并发轮询请求,结合内容哈希缓存与指数退避重试机制优化调用效率; 后处理:采用最长公共子串匹配去除文本重叠,并设计表格对齐算法修复跨块表格; 结果输出:按

2026-07-06 11:42:33 113

原创 【AFAC2026金融智能-赛题一】我用 LLM 扒光了 A 股游资的底裤

本文介绍了AFAC2026赛题一的解决方案,该赛题要求基于A股Level-2逐笔数据识别市场参与者类型(游资/量化/散户)及其交易意图(买入/卖出/T0交易)。作者设计了四层混合推理架构:1)特征工程层构建121维特征矩阵;2)建模推理层采用规则先验+机器学习模型;3)LLM增强层利用Qwen大模型进行低置信度样本判断;4)结果输出层生成资金识别和交易模式聚类结果。重点特征包括日线行为、股票结构、日期效应、盘口统计和分钟级交易模式,通过融合量化模型与大语言模型优势,实现对复杂市场行为的动态识别。

2026-07-05 23:17:05 156

原创 【AFAC金融智能创新大赛】我用 KTO 把 4B 模型的思维链压了 100 倍,还顺便申请了个专利

本文探讨了金融领域中小模型思维链(CoT)压缩的问题,提出了一个三步走的优化框架。首先通过系统提示词优化,将Qwen3-4B模型的思维链长度从9111 token压缩到72,准确率提升8倍至54.2%。随后采用KTO(Kahneman-Tversky Optimization)方法进行正向微调,利用四路大模型协同标注生成高质量训练数据,通过投票融合机制确保标签可靠性。实验结果表明,该方法在保证推理准确性的同时显著缩短思维链长度,解决了金融场景下模型推理效率与准确性之间的矛盾。该方法为轻量级模型在实时性要求高

2026-07-05 16:31:36 601

原创 我把 Agent 记忆系统的四层架构扒了一遍,发现 Mem0 做对了一件事

摘要: Mem0 提出了一种四层架构的 AI Agent 通用记忆系统,通过分层设计解决大上下文窗口下的记忆矛盾。核心包括: 工作记忆(10ms延迟):管理当前会话的上下文窗口,异步生成摘要避免阻塞主流程; 情景记忆(100ms延迟):以时间戳事件日志存储对话历史,结合滑动窗口和全局摘要优化检索; 语义记忆(200ms延迟):通过向量库/图谱长期存储结构化知识; 程序性记忆(500ms延迟):保存可复用的技能代码。 Mem0 的创新点在于分层延迟设计(10ms~500ms)与异步处理机制,其图记忆变体(Me

2026-07-04 16:28:11 416

原创 百度把 DeepSeek-OCR 往前推了一大步,一次能扫 40 页 PDF

百度开源项目Unlimited-OCR通过创新注意力机制R-SWA(参考滑动窗口注意力),解决了长文档OCR任务中KV Cache爆炸和生成速度下降的难题。该方法模拟人类抄写时的"选择性记忆"模式,仅保留视觉token前缀和最近128个输出token的窗口,使KV Cache恒定在428大小(相比全注意力缩小47倍)。实验表明,该方案在OmniDocBench v1.5上提升6.22个点,可单次处理40页文档,同时保持视觉信息完整性。系统采用DeepEncoder(16×压缩率)和MoE-LLM解码器(3B

2026-07-04 13:59:20 366

原创 本体论——AI 圈正在悄悄换底层操作系统

文章摘要: 本体论(Ontology)正成为企业级AI落地的关键技术,从哲学概念演变为工程化基础设施。传统知识图谱(ABox层)仅存储数据,而本体论(TBox层)赋予系统推理能力,实现开放世界假设下的自动逻辑推导。Palantir以本体论为核心构建企业知识操作系统,其AIP平台通过"Proposal工作流"实现AI驱动的业务闭环,结合三层架构(语义建模、关系定义、动态操作)解决权限控制与审计难题。国内厂商如用友、悦点科技等也在布局本体智能体。当前AI工程化需突破Prompt优化层面,通过本体论构建模型可理解

2026-07-02 14:43:26 459

原创 我把 Qwen 的「世界模型」塞进了 LlamaFactory,然后它教会了 AI 预知未来

摘要:Qwen-AgentWorld是一个创新的语言世界模型,能够预测智能体与环境交互后的精确状态变化。该模型通过三阶段训练(CPT、SFT、RL)覆盖7个智能体交互领域,包括终端操作、搜索引擎、API调用等文本领域,以及浏览器、Android和操作系统等GUI领域。其独特之处在于采用轮次级信息论损失掩码技术,有效过滤低信息量交互,专注于关键状态预测。尽管激活参数仅3B,该模型在环境模拟任务上超越了GPT-5.4的性能,且支持256K长上下文。目前已集成至LlamaFactory,可通过简单配置实现一键微调

2026-07-02 10:17:36 268

原创 我把 397B 的「Agentic 大脑」塞进了 Xinference,一键部署 Nex-N2

Nex-N2是一款基于Qwen3.5 MoE架构的多模态大模型,其创新性在于将"Agentic Thinking"深度融入模型架构,使模型能够自主判断推理深度(Adaptive Thinking)并保持跨任务一致的推理逻辑(Coherent Thinking)。该模型提供35B参数(激活3B)的Mini版和397B参数(激活17B)的Pro版,在终端操作、长链路任务等Agent场景表现优异,接近GPT-5.5水平。作者还介绍了如何通过Xinference框架一键部署Nex-N2,只需在llm_family.

2026-06-29 14:47:21 181

原创 我把一个 3B 模型塞进了 Xinference,然后它干掉了 DeepSeek V3.2

文章摘要:作者向XorbitsAI Inference提交了三个PR,将轻量级模型VibeThinker集成到系统中。该模型仅3B参数却在AIME26数学竞赛中以94.3分超越DeepSeek V3.2(94.2分),性能接近671B参数的大模型。主要工作包括:1)在模型注册表中添加VibeThinker的1.5B/3B版本配置;2)修复KV缓存读取的兼容性问题;3)创建模型卡片文档。特别修复了transformers版本兼容性导致的DynamicCache类型判断错误,确保系统能正确获取运行时的批处理和序

2026-06-29 11:33:12 318

原创 AI 工程的四次进化,从「怎么写 Prompt」到「怎么造一套让 AI 不翻车的系统」

文章摘要: 过去四年间,AI交互方式经历了从Prompt Engineering到Loop Engineering的演变,形成了四个递进层次的技术体系:Prompt Engineering解决任务表达问题;Context Engineering优化决策信息环境;Harness Engineering构建确定性约束系统;Loop Engineering实现自主持续运转。这反映了AI应用开发从单次指令到系统化运作的转变,工程师角色也从编写提示词转变为设计AI运作环境。每个新概念都针对前者的局限性而产生,共同构成

2026-06-25 20:34:48 247

原创 当 max_tokens=1 遇上 reasoning 模型:从 Xagent 一次“测试连接“按钮的失败说起

摘要 开源AI平台中的"测试连接"按钮设计存在漏洞,导致推理模型无法通过验证。传统模型测试使用max_tokens=1的低成本请求,但推理模型会将首个token用于reasoning_content思考过程,导致返回的content为空而报错。 Xagent项目通过两个PR修复该问题: 将测试连接的max_tokens从1增加到16,给足推理模型从思考过渡到回答的空间 在适配器层增加兜底逻辑:当模型因截断返回空content时,自动回退使用reasoning_content 修复方案特别注意工程细节:参数选

2026-06-18 10:49:48 186

原创 一台手机塞下 33 种语言的翻译器 —— 把腾讯混元 Hy-MT2 接进 Xinference

2026年翻译模型赛道新动态:腾讯混元开源多语言翻译模型Hy-MT2 腾讯混元在2026年5月底开源了Hy-MT2系列多语言翻译模型,包含1.8B、7B和30B-A3B三个版本,支持33种语言双向互译,包括5种民族语言/方言。该系列模型在指令遵循、量化压缩和性能表现上均有突破:1.8B模型经1.25-bit极端量化后仅440MB,适合移动端部署;7B和30B-A3B在"快思考"模式下超越DeepSeek-V4-Pro和Kimi K2.6。模型针对翻译场景优化了术语控制、风格转换等指令遵循能力,并配套发布评测

2026-06-16 16:38:30 127

原创 1.3B 参数、256K 上下文、能跑在 iPhone 上的多模态怪兽 —— MiniCPM-V 4.6 接入 Xinference 实录

参数量降一半,能力反而强一档。

2026-06-16 16:13:23 171

原创 给 Embedding 模型也加一块“游乐场“—— Xinference 是怎么把 vector 变成肉眼可见的体验的

Xinference PR #5022为Embedding模型开发了可视化调试工具,解决了其输出不易直观评估的痛点。该PR新增了EmbeddingInterface的Gradio界面,包含文本编码、多模态编码和相似度对比三大功能模块,支持参数透传、多模态输入和余弦相似度计算。通过REST端点与前端按钮的配合,用户可一键启动交互页面,无需编写代码即可完成模型效果对比、RAG召回率调试和多模态验证等任务。这一工具显著降低了Embedding模型的调试门槛,将原先需要编写脚本的复杂操作简化为可视化点击操作,提升了

2026-06-16 15:49:48 143

原创 把“4B 教师压成 1B 学生“的文本嵌入塞进 Xinference —— `jina-embeddings-v5` 接入实录

2026 年的检索增强(RAG)有一个尴尬的事实:**上层 LLM 一直在涨参数,最底下的 embedding 反而开始拼"减重"**

2026-06-16 15:33:32 312

原创 把一个能“思考、调工具、跑在你笔记本上“的 1B 模型塞进 Xinference —— MiniCPM5-1B 接入实录

这篇文章探讨了1B参数规模的小型大模型MiniCPM5-1B的技术突破及其在本地部署的实践方案。主要内容包括: 模型亮点:MiniCPM5-1B通过InfLLM v2架构、数据分级治理和训练流水线优化,在1B量级实现了超越同类模型的推理能力(AA-Index 17.9分),支持128K上下文和工具调用,INT4量化后仅占0.5GB。 部署方案:Xinference开源推理平台通过PR #5010集成该模型,提供多引擎(vLLM/SGLang/MLX等)和多格式(PyTorch/GGUF/MLX)支持,自动处

2026-06-16 15:00:47 390

原创 让 RAG 检索“挑出真正相关的“:从 Xagent 一次端到端 Rerank 集成,看搜索质量的最后一公里

本文探讨了RAG系统中向量检索存在的"假相关"问题及解决方案。通过分析Xagent的PR #612案例,文章阐述了Rerank(重排序)技术在RAG系统中的关键作用: 问题背景:向量检索常返回文字相似但语义无关的内容,因embedding模型只能反映统计相似度而非语义相关性。 解决方案:采用两阶段检索(召回+Rerank),先用向量召回升维候选集,再用Rerank模型精确排序。 实现要点: 模型管理支持多Provider(DashScope/Xinference) 知识库级别绑定Rerank模型 检索流程实

2026-06-16 14:02:54 188

原创 知识库能写入却搜不出?一个 Embedding 响应归一化的 Bug,揭开 RAG 系统的隐秘角落

本文探讨了Xagent项目RAG系统中一个典型Bug:文档写入成功但检索失败。问题根因在于写入和检索路径对Embedding模型返回值的处理方式不同,检索路径仅接受list类型,而实际返回值形态多样(包括OpenAI响应信封、numpy数组等)。修复方案通过统一归一化处理,增强共享工具的兼容性,并改进错误信息传递。文章总结了四个关键教训:避免逻辑重复、全面处理外部输入、保留错误信息和建立系统边界归一化层。最后推荐了Xagent作为生产级AI Agent平台的特点,包括多模型支持、工具生态和易部署性。该案例对

2026-06-16 13:39:33 213

原创 当 AI 应用“看不见“:从 Xagent 的一次无障碍修复,聊聊前端可访问性的那些坑

这篇文章通过Xagent项目中一个修复可访问性问题的PR,揭示了现代前端开发中的可访问性盲区。作者详细分析了PR#604的修复方案:1)将已有可见标题升级为DialogTitle组件;2)为无可见标题的组件添加仅屏幕阅读器可见的标题。文章提炼出四条可访问性设计原则:弹窗必须命名、优先复用可见标题、巧用sr-only文本、国际化要覆盖辅助技术文案。最后推荐了Xagent这个开源的AI Agent平台,强调其从细节体现的工程质量追求。全文2000余字,通过具体案例生动说明了可访问性作为数字产品基本底线的重要性。

2026-06-16 13:16:18 412

原创 【AI编程实战】让AI在凌晨三点替你干活:Claude Code Headless模式的正确打开方式

《AI代码审查革命:Claude Headless模式在CI/CD中的实践》 摘要: 本文探讨了Claude Code的Headless模式如何革新传统代码审查流程。文章指出,人工代码审查存在效率低下、质量参差不齐的问题,而Headless模式可在无人值守时自动完成代码审查。该系统支持三种输出格式(Text/JSON/Stream-JSON),通过--allowedTools和--max-turns参数确保安全执行。实践部分展示了GitHub Actions集成方案,包括Tag模式和全自动PR审查两种场景。

2026-06-16 11:46:22 628

原创 【智能体漫游】给AI装上“瑞士军刀“:我终于搞懂了Skill生态的设计哲学

AI助手工具生态面临的核心问题是缺乏标准化的"连接协议",导致工具间协作效率低下。本文提出Skill生态解决方案,通过渐进式披露两阶段加载(轻量XML描述→完整指令)、区分参考型与任务型Skill、沙盒隔离执行等设计,实现工具与Agent的高效协作。该架构采用分层解耦思维,底层由MCP协议实现工具标准化,中层Skill封装可复用工作单元,上层Agent负责任务调度,形成类似微服务的架构体系,最终达成"让AI管理AI"的自动化目标。

2026-06-12 10:00:26 37

原创 【AI编程实战】当Claude开始写代码编排代码:Workflow可能是今年最被低估的AI功能

本文介绍了Claude Code新推出的Workflow功能,它作为第三种编排原语,通过AI自动生成脚本实现任务编排,解决了传统子代理模式中的上下文爆炸、中断无缓存和编排逻辑难复用等问题。Workflow将控制流从prompt转移到脚本中,带来可重复性、并行规模和会话内可恢复三大收益,适用于流程稳定、需跨会话复用的大规模任务。与Dify/Coze的用户手动编排不同,Claude Code实现了"AI自动编排"。文章还分析了适用场景和当前局限,指出Workflow填补了AI编排体系中固化流程的空白。

2026-06-10 15:31:42 41

原创 【AI编程实战】揭秘 Claude Code 的“工具工厂“:15个原语工具,如何撬动无限复杂能力?

涌现(Emergence)= 原语工具 × LLM 推理 × 反馈循环

2026-06-01 17:12:53 57

原创 【智能体漫游】一站式 Sandbox 执行环境:Agent 从“嘴强王者“到“全能打工人“的蜕变

AI Agent 执行环境:从"嘴替"到"全能打工人"的关键升级 本文探讨了如何通过执行环境让AI Agent具备实际"动手"能力,突破仅能输出文字的限制。核心内容包括: 代码解释器 - 让AI在沙盒中执行Python/JS代码,实现真实计算而非仅提供公式 无头浏览器 - 赋予AI网页浏览能力,通过17种浏览器工具实现页面导航、点击、表单填写等操作 AIO-Sandbox架构 - 字节跳动的开源方案,整合代码、浏览器和文件系统,提供统一安全的执行环境 33种工具集 - 覆盖代码执行、文件操作和浏览器交互三大

2026-06-01 17:08:05 64

原创 【AI编程实战】MCP协议:AI的“USB-C“时刻正在到来

你还在为每个AI工具写定制化的API集成代码吗?如果你点头了,那今天这篇文章,可能要颠覆你对AI工具集成未来的认知。

2026-06-01 11:41:32 193

原创 【智能体漫游】为什么你的AI还在“单打独斗“?MCP协议正在掀起一场工具革命

MCP协议:解决AI工具开发的标准化困境 文章揭示了开发者面对不同AI平台需要重复开发适配器的痛点,介绍了MCP(多工具协作协议)如何通过标准化接口解决这一问题。核心内容包括: MCP的价值:避免重复开发,实现工具复用 技术对比:与Function Calling的区别在于分工不同 实践指南:演示使用FastMCP框架开发邮件发送工具 企业级安全:强调密钥管理、权限控制和审计日志的重要性 MCP通过统一的工具描述规范和调用机制,正在成为AI开发生态的主流标准,显著提升开发效率和系统安全性。

2026-06-01 11:22:49 63

SMP2020微博情绪分类技术评测数据集

SMP2020微博情绪分类技术评测数据集 本次技术评测使用的标注数据集由哈尔滨工业大学社会计算与信息检索研究中心提供,原始数据源于新浪微博,由微热点大数据研究院提供,数据集分为两部分。     第一部分为通用微博数据集,该数据集内的微博内容是随机获取到微博内容,不针对特定的话题,覆盖的范围较广。     第二部分为疫情微博数据集,该数据集内的微博内容是在疫情期间使用相关关键字筛选获得的疫情微博,其内容与新冠疫情相关。     因此,本次评测训练集包含上述两类数据:通用微博训练数据和疫情微博训练数据,相对应的,测试集也分为通用微博测试集和疫情微博测试集。参赛成员可以同时使用两种训练数据集来训练模型。     每条微博被标注为以下六个类别之一:neutral(无情绪)、happy(积极)、angry(愤怒)、sad(悲伤)、fear(恐惧)、surprise(惊奇)。     通用微博训练数据集包括27,768条微博,验证集包含2,000条微博,测试数据集包含5,000条微博。     疫情微博训练数据集包括8,606条微博,验证集包含2,000条微博,测试数据集包含3,000

2022-12-29

Spark机器学习回归模型数据集

为了阐述本章的一些概念,我们选择了bike sharing数据集做实验。这个数据集记录了bike sharing系统每小时自行车的出租次数。另外还包括日期、时间、天气、季节和节假日等相关信息。

2016-06-15

Spark机器学习文本处理数据集

为了说明概念,我们将使用一个非常有名的数据集,叫作20 Newsgroups;这个数据集一般用来做文本分类。这是一个由20个不同主题的新闻组消息组成的集合,有很多种不同的数据格式。对于我们的任务来说,可以使用按日期组织的数据集。

2016-06-20

Spark机器学习推荐模型数据集

我们将使用推荐引擎中使用的电影打分数据集,这个数据集主要分为三个部 分:第一个是电影打分的数据集(在u.data文件中), 第二个是用户数据(u.user),第三个是电影数据(u.item)。除此之外,我们从题材文件中获取了每个电影的题材(u.genre)。

2016-06-18

Spark机器学习分类模型的数据集

考虑到推荐模型中的 MovieLens 数据集和分类问题无关,本章将使用另外一个数据集。这个 数据集源自 Kaggle 比赛,由 StumbleUpon 提供。比赛的问题涉及网页中推荐的页面是短暂(短暂 存在,很快就不流行了)还是长久(长时间流行)。

2016-06-15

jblas-1.2.4-SNAPSHOT

里MLlib库需要依赖[jblas线性代数库](http://jblas.org/),如果大家编译jblas的jar包有问题,可以获取。把jar包加到lib文件夹后,记得在spark-env.sh添加配置

2016-06-26

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除