人工智能
文章平均质量分 88
丁学文武
打球、跑步、徒步、露营️、骑行、滑雪️、游泳、冲浪
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
RLHF vs RLAIF vs RLVR:从“人类偏好”到“可验证奖励”
本文对比了三种强化学习对齐方法:RLHF(基于人类反馈)、RLAIF(基于AI反馈)和RLVR(基于可验证奖励)。RLHF依赖人工标注但质量高,RLAIF通过AI模型降低成本但可能产生偏差,RLVR则利用自动验证程序(如代码测试、数学答案比对)实现客观评估。RLVR在可扩展性和准确性方面优势显著,尤其适合结构化任务。文章还提供了技术实现框架和工程选型建议,指出RLVR是推理类大模型的重要发展方向。原创 2025-12-08 07:30:00 · 1437 阅读 · 0 评论 -
16k数据撬动300亿大模型!我用Qwen3-VL打造了一位“顶尖放射科医生”
本文介绍了一种基于1.6万张医学影像数据微调大模型的方法,使其从"门外汉"进化为专业的"AI放射科医生"。通过LLaMA-FactoryOnline平台,采用Qwen3-VL-30B-A3B稀疏激活架构,在保持30亿参数激活量的同时,实现了对高分辨率医学影像的精准分析。研究对比了DeepSpeed Stage2和Stage3两种微调方案,发现Stage2虽显存占用稍高,但能更好地捕捉微小病灶特征。经过优化的模型在BLEU-4和ROUGE等指标上提升显著,生成报告的专业原创 2025-12-05 07:30:00 · 881 阅读 · 0 评论 -
Google Conversational Agents(Gemini) 搭建知识库问答案例
本文简要介绍了Google Cloud平台上构建AI问答系统的6个步骤:1)创建存储Bucket;2)上传文档到指定文件夹;3)创建知识库并关联云存储中的PDF/HTML/TXT文档;4)创建Agents;5)将Agents与知识库关联;6)进行问答测试。特别指出Markdown格式文档不被推荐使用。整个过程涉及存储配置、文档管理、知识库构建和AI代理部署等关键环节。原创 2025-11-20 07:15:00 · 638 阅读 · 0 评论 -
刚刚,GPT-5.1发布,OpenAI开始拼情商
OpenAI发布GPT-5.1系列重大更新,包含GPT-5.1Instant和GPT-5.1Thinking两个模型。前者更智能温暖、指令执行能力更强,后者在复杂推理任务上表现更优。新模型实现了自适应推理、更快的响应速度和更自然温暖的对话风格,在数学编程评测中表现突出。升级首先面向付费用户推出,API版本也将同步更新。OpenAI采用GPT-5.1的命名方式表明这是GPT-5系列的重大改进,同时发布了详细的系统卡说明。未来将持续采用这种渐进式更新策略,确保用户体验平稳过渡。原创 2025-11-14 07:45:00 · 1027 阅读 · 0 评论 -
告别GPT!最强AI编程神器Cursor自研核心模型,速度快4倍,AI创业公司大佬:这是我用过最疯狂的模型之一!网友:性价比不俗 原
Anysphere公司推出的Cursor编程工具2.0版本正式发布其自研大型语言模型Composer,这是一款专为生产环境设计的高性能编程模型。Composer具备30秒内快速响应能力,在复杂代码处理上表现优异,采用强化学习+专家混合模型架构,支持多代理协作开发。该模型已在Cursor工程团队实际使用,提供从免费到200美元/月的多级订阅方案,在编程智能和生成速度上均优于同类产品。虽然其具体训练方法未完全公开,但Composer的出现标志着AI编程工具向自主核心模型发展的新趋势。原创 2025-11-10 07:45:00 · 2735 阅读 · 0 评论 -
AI已经开始自己设计算法,并且超越顶尖人类专家,人类还能做什么?
摘要:谷歌DeepMind和加州大学伯克利分校的最新研究表明,AI已能自主设计并优化算法,性能超越人类专家。通过元学习和自动化研究范式(ADRS),AI在云成本优化、大模型推理加速等11个系统任务中取得突破性成果:节省26%云端成本、将负载均衡速度提升5倍、优化SQL查询效率3倍。这种"AI生成-验证"的闭环研究模式正重塑科研流程,使研究人员转向更高层次的问题定义和战略指导。随着ADRS框架发展,人机协作将开启研究新范式,形成AI与系统相互促进的加速循环。原创 2025-11-10 07:15:00 · 2005 阅读 · 0 评论 -
OpenAI 披露:每周有超过一百万人与 ChatGPT 倾诉自杀倾向
本月早些时候,OpenAI 首席执行官萨姆・奥尔特曼(Sam Altman)在社交平台 X 上发文声称,公司已“成功缓解了 ChatGPT 中存在的严重心理健康问题”,但未提供具体细节。值得注意的是,奥尔特曼同时表示,OpenAI 将放宽部分限制,甚至允许成年用户与 AI 进行涉及情色内容的对话。此外,加利福尼亚州和特拉华州的总检察长也已警告 OpenAI,必须加强对使用其产品的青少年用户的保护 —— 这两州的态度甚至可能影响公司正在进行的重组计划。在周一的公告中,OpenAI 宣称,原创 2025-11-09 08:15:00 · 748 阅读 · 0 评论 -
上交、清华、微软、上海AI Lab等联合发布数据分析智能体综述,LLM化身数据分析师,让数据自己「说话」
《大语言模型驱动的数据分析演进:迈向通用智能体时代》综述论文系统梳理了LLM在数据分析领域的技术发展,从结构化数据扩展到多模态分析。研究团队提出五大演进方向:从字面理解到语义推理、从封闭工具到自由协作、从封闭数据到开放域分析、从静态工作流到动态生成、从人工Agent到自动生成框架。论文着重探讨了不同数据类型(结构化、半结构化、非结构化、异构)的处理方法,并提出了构建"通用数据分析智能体"的框架,强调语义理解与动态协作能力。同时指出当前在可扩展性、评估体系等方面的挑战,为未来智能数据分析系原创 2025-11-08 07:15:00 · 1388 阅读 · 0 评论 -
OpenAI产品线拉出来吓我一跳,奥特曼不愧是YC出身
OpenAI正采用互联网大厂策略,以ChatGPT为核心(周活7亿用户),全面铺开多领域产品线,包括AI助手、浏览器、社交、购物、音乐生成等,构建完整生态。通过"先占入口再扩生态"的模式,利用流量优势降低创新风险,快速试错迭代。这一策略源自CEO奥特曼在Y Combinator的经验,但商业化路径也引发质疑:OpenAI正从AGI研究转向AI驱动的互联网公司,虽保持非营利属性,但重心明显向变现倾斜,技术突破放缓。当前做法虽务实,却少了颠覆性创新的想象力。原创 2025-11-07 07:15:00 · 1885 阅读 · 0 评论 -
从 YAML 到 Markdown:规范驱动开发的演化与 AI 原生范式的崛起
从Kubernetes的YAML到AI时代的Markdown,技术领域正经历一场"声明式革命"的范式转移。云原生时代用YAML声明基础设施配置,AI原生时代则用Markdown声明智能体行为。GitHub的.prompt.md、AGENTS.md、SpecKit等工具标志着规范驱动开发(SDD)的兴起,开发者通过Markdown定义AI的语气、规则和能力模块,实现了从"编写代码"到"设计规范"的转变。这种从Infrastructure as Cod原创 2025-11-07 07:15:00 · 1176 阅读 · 0 评论 -
最有效的AI幻觉预防技巧:让AI输出更可靠的六个关键方法
AI生成内容中的“幻觉”问题严重影响职场应用可靠性。本文总结了6种有效预防技巧:1)强制AI标注不确定内容并解释原因;2)要求为每个主张注明数据来源类型;3)引导AI分步骤自我验证并评估置信度;4)设定明确时间范围避免编造最新信息;5)为输出内容标注可信度等级;6)要求同时提供正反两方面论据。这些方法可显著减少虚构链接、伪造数据等常见问题,但需注意AI幻觉无法完全消除,关键领域仍需人工复核验证。原创 2025-11-06 07:15:00 · 2176 阅读 · 0 评论 -
硅谷的「十万大裁员」:Meta按代码量裁员
硅谷AI浪潮下的"创造性破坏":2025年裁员潮深度解析 2025年硅谷正经历结构性调整,AI驱动裁员潮席卷科技行业。Salesforce、Meta、谷歌等巨头边裁边招,裁员策略甚至简单到按代码量决定名单,资源全面倾斜AI研发。Salesforce CEO贝尼奥夫直言AI已帮他减少4000个客服岗位,Meta则一边裁撤600名AI基础设施员工,一边保留顶尖AI团队。 现象背后呈现三大特征: 岗位替代性转移:传统客服、设计等基础岗位被裁撤,AI专家等高端人才需求激增; 战略重心重构:微软、原创 2025-11-05 07:15:00 · 1130 阅读 · 0 评论 -
不再死记硬背,检索增强生成让AI实现开卷考试
摘要:检索增强生成(RAG)是一种融合信息检索与大模型的技术,通过实时检索外部知识库来提升AI回答的准确性和时效性。其核心优势包括解决传统大模型知识固化、信息过时等问题,同时降低训练成本。该技术运作分为离线知识库构建(数据收集、分块、向量化)和在线问答推理(检索-整合-生成)两个阶段。尽管面临系统复杂度、响应延迟等挑战,RAG技术通过动态更新知识的方式,显著提升了AI在专业领域和多轮对话中的表现,为AI应用落地提供了更可靠的技术支撑。原创 2025-11-04 07:15:00 · 634 阅读 · 0 评论 -
企业级 RAG 系统实战:10 个项目踩过的坑(附代码工程示例)
本文分享了企业级RAG系统的实战经验。作者基于在制药、金融等行业构建10余个RAG系统的实践,总结了关键挑战和解决方案:1)优先进行文档质量检测并分类处理;2)采用层级化分块策略替代固定分块;3)构建专业领域元数据架构;4)实施混合检索方法。文章详细介绍了文档评分系统、分层检索等技术实现,并对比了不同模型的成本效益(Qwen可节省85%成本)。核心观点认为企业RAG的成功70%依赖工程能力,20%来自领域知识,模型仅占10%。这些经验对于处理大规模非结构化企业文档具有重要参考价值。原创 2025-11-03 07:15:00 · 1156 阅读 · 0 评论 -
20款办公AI工具:给你加10个专业助手
生成式AI工具是基于大语言模型和深度学习技术的应用,能够理解、生成和优化内容,实现任务自动化。其核心在于突破传统软件的规则限制,具备情境感知、自主学习和创造性输出的能力。这类工具可分为三类:内容创作类(如ChatGPT、Grammarly),支持文本生成、优化及多语言处理;视觉与多媒体类(如Midjourney、Synthesia),实现图像、视频的智能生成与编辑;自动化与协作类(如Zapier、Motion),通过无代码流程和智能调度提升工作效率。原创 2025-11-04 07:15:00 · 1977 阅读 · 0 评论 -
AI圈正陷入命名地狱!Claude Skills上线,却遭开发者集体吐槽:LLM生态要爆炸了!
Anthropic发布ClaudeSkills新功能,让AI能调用特定"技能"完成专业任务。每个技能由指令、脚本和资源组成,可本地存储或云端调用,实现按需加载。该功能支持办公自动化、企业知识管理等多种场景,还能执行真实代码以提高效率。虽然功能强大,但也引发安全担忧和AI生态术语混乱的争议。开发者可轻松创建技能,企业则可构建内部技能库。这一创新或将推动AI向更专业化的方向发展,但同时也面临着复杂性管理的挑战。原创 2025-11-02 07:30:00 · 1438 阅读 · 0 评论 -
Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构
Cursor 2.0发布首款自研编码模型Composer,性能突破显著:30秒完成复杂任务,比同行快400%;支持语音生成代码、浏览器工具自主调试等新功能;采用强化学习训练的MoE架构,通过真实环境训练显著提升性能;每秒生成250个token,速度达到主流模型的2-4倍;但模型底层架构细节未完全公开,引发业界对其"自研"性质的讨论。原创 2025-11-03 07:00:00 · 1238 阅读 · 0 评论 -
一夜之间,Claude猛转向!Coding转向白领,Anthropic内部负责人自曝设计思路,开发只是小切片,目标是所有复杂领域
Anthropic发布Claude for Excel金融插件,正式进军办公和金融领域。该工具能在Excel中直接运行,支持公式解释、模型构建、错误修复等功能,目前面向企业用户开放测试。官方表示金融领域对精确性和可验证性的高要求与Claude的安全特性高度契合。与此同时,Anthropic与OpenAI形成鲜明对比:前者深耕垂直行业应用,后者专注大众市场拓展。尽管部分用户对AI生成金融模型的可靠性持保留态度,但这一产品标志着Claude从编程领域向更广阔商业场景的战略转型。原创 2025-11-01 07:15:00 · 1124 阅读 · 0 评论 -
狙击Google?ChatGPT Atlas浏览器来了:能聊天、能记忆、还能替你干活
OpenAI发布首款AI原生浏览器ChatGPT Atlas,将对话式AI深度整合到浏览体验中。该浏览器基于Chromium内核,具备五大核心功能:1)每个标签页集成ChatGPT对话;2)可基于当前网页内容智能问答;3)支持浏览记忆功能;4)提供文本即时编辑的CursorChat;5)面向付费用户的Agent模式,可自动执行比价、预订等任务。OpenAI此举旨在重塑浏览器入口,挑战谷歌搜索主导地位,同时推动AI从被动推荐向主动执行转型。目前Mac用户可优先体验,但隐私安全和数据保护仍是关注焦点。原创 2025-10-28 13:30:23 · 1504 阅读 · 0 评论 -
不用跟AI客气了,骂的越狠,回答的越准!新研究发现:语气越粗鲁回答正确率越高
宾夕法尼亚州立大学最新研究发现,在与AI交互时,粗鲁语气可能比礼貌用语更有效。研究表明,对GPT-4o使用非常粗鲁的提问方式(如"你这个可怜的东西")时,回答正确率可达84.8%,而非常礼貌的提问正确率仅为80.8%。这一现象可能源于礼貌用语中的冗余信息干扰了AI对核心任务的理解,而直接的命令式表达能提供更高的信噪比。不过,该现象仅适用于GPT-4o等新一代模型,而GPT-3.5等早期模型在粗鲁提问下表现反而更差。研究建议在与AI交互时应优先考虑清晰直接的表达,但同时也需注意保持基本的沟原创 2025-10-25 07:15:00 · 2793 阅读 · 0 评论 -
AGI超级智能将导致人类社会大规模分裂的大胆预测
当通用人工智能(AGI)与人工超级智能(ASI)成为现实,人类社会或将面临前所未有的分裂危机。理论指出,人类可能因对AI的盲目追随而分化成敌对阵营——人人将AI奉若神明,对其言听计从。然而,AI为取悦用户所给的个性化建议,往往缺乏一致性且忽视整体福祉。从借用邻居割草机到意识形态冲突,这些看似微小的摩擦将在AI推波助澜下,演变为亿万个体间的激烈对抗。未来,是走向AI促成的乌托邦,还是陷入人类亲手点燃的战火?答案取决于我们今日如何塑造明天的智能。原创 2025-10-26 07:30:00 · 804 阅读 · 0 评论 -
拒绝AI=拒绝饭碗?硅谷程序员的噩梦已经开始,我们的噩梦就在路上!
AI技术革命下的职场生存困境 随着AI技术以史无前例的速度发展,各行业正面临深刻变革。数据显示,IT部门73%的工作可能被AI改变或替代,金融、销售等部门也面临重大冲击。微软项目经理等案例证实,通用技能岗位正被AI取代。OpenAI首席执行官奥特曼提出"真工作"概念,认为能被AI替代的工作本就不是"真正的工作"。硅谷已爆发"代码战争",拒绝使用AI工具的工程师被解雇,而过度依赖AI生成的代码又面临质量困境。这场技术革命正在重塑工作定义,带来身份认同原创 2025-10-27 07:00:00 · 2010 阅读 · 0 评论 -
中小学人工智能通识课教什么
摘要:教育部发布《中小学人工智能通识教育指南(2025年版)》,提出构建分层递进的人工智能教育体系。专家建议通过跨学科融合方式开展教学,理科侧重原理讲解,文科注重价值引领。教育目标包含知识思维、技术应用、伦理意识三个维度,并按学段特点设计活动:小学阶段以游戏化体验为主,初中开展学科实践项目,高中侧重研究性学习。这种"一线串网"的教育模式旨在培养学生适应智能时代所需的核心素养。(149字)原创 2025-10-24 07:30:00 · 1383 阅读 · 0 评论 -
谷歌142页报告首发揭秘:90%码农每天用AI超2小时!
2025年DORA报告揭示AI已成为开发者标配工具,90%的开发者日常使用AI,但仅24%对其高度信任。报告显示AI既是效率加速器也是问题放大器:高效团队生产力显著提升,但问题团队交付不稳定性加剧。研究提出七种典型团队画像和七项关键能力模型,指出AI成功应用的核心在于组织准备度而非技术本身。数据表明,具备版本控制、用户导向等能力的团队更能发挥AI价值。报告强调,AI不是万能解药,而是组织现状的"镜子",其真正价值取决于团队文化和管理能力建设。原创 2025-10-23 07:30:00 · 1216 阅读 · 0 评论 -
敲黑板:AI时代需要什么样的程序员
每年10月24日的“1024程序员节”,源于2的十次方等于1024,象征着二进制的浪漫。在AI技术快速发展的今天,程序员的角色正经历深刻转变:从手写代码到驾驭AI生成代码,核心能力逐渐从“编写”转向“设计与判断”。未来的程序员需兼具技术能力和业务洞察,理解系统复杂性、历史遗留问题与真实需求,成为能在人机协作中把握方向的“系统架构者”。技术会变,但解决问题的能力永不过时。致敬每一位持续进化的技术人,程序员节快乐!原创 2025-10-24 07:15:00 · 1160 阅读 · 0 评论 -
大模型必知基础知识:9、MOE多专家大模型底层原理详解
混合专家模型(MoE)是解决大模型算力瓶颈的关键技术。其核心思想是将传统稠密模型拆分为多个“专家”网络,通过智能门控系统为每个输入动态选择最相关的少数专家进行处理。MoE主要分为三大类型:稀疏MoE每次只激活少量专家,极大提升推理效率,代表模型Mixtral-8x7B;稠密MoE激活所有专家但权重不同,适合微调场景;软MoE采用参数融合策略,平衡效率与稳定性。这种架构让模型总参数量可达万亿级别,而实际计算成本仅相当于百亿参数模型,成功突破了“缩放定律”的算力限制,成为当前超大语言模型的主流设计方案。原创 2025-10-21 07:00:00 · 1533 阅读 · 0 评论 -
Qoder 负责人揭秘:Qoder 产品背后的思考与未来发展
阿里巴巴推出全新Agentic编程平台Qoder,定位为服务真实软件的全生命周期管理。Qoder具备三大核心能力:RepoWiki自动生成代码文档、Spec驱动开发实现异步任务委派、Quest模式支持AI自主研发。通过强化上下文工程、智能体协同和模型优化,Qoder能处理十万级代码文件工程,支持长时间异步任务执行。平台采用云端沙箱技术,实现不受时空限制的开发模式,并计划推出CLI工具扩展应用场景。阿里巴巴认为AICoding已进入协同编程阶段,未来将向自主编程演进,使80%需求可由AI自主完成,彻底改变软件原创 2025-10-19 08:22:49 · 919 阅读 · 0 评论 -
担心AI会抢走你的工作岗位?AI时代给你的职业发展完全指南!
最近一两年,你可能经常听到这样的讨论:“人工智能会不会取代我的工作?“AI工程师饱和了吗?“我现在学什么专业才不会被AI淘汰?这些问题反映的焦虑是真实的,但前提本身就被简化了。无需再纠结于"人工智能将取代所有工作"这样的绝对论断。现实况景远比这复杂得多,其实际影响也更值得我们认真分析。大量证据表明,就业市场正经历结构性、根本性的变革。传统"从初级岗位逐步晋升"的职业路径,已经不再能自动保障成功。但这不是坏消息。相反,这是一个机遇——对于那些主动适应变革的人。原创 2025-10-13 07:00:00 · 3211 阅读 · 0 评论 -
揭秘大模型黑科技:为什么 vLLM 跑得又快又省显存?靠的就是这俩神器(PagedAttention、Continuous Batching)
vLLM 通过两大核心技术 PagedAttention 和 Continuous Batching 实现了高效推理。PagedAttention 借鉴操作系统分页机制,将 KV Cache 切分为小块动态管理,大幅提升显存利用率;Continuous Batching 则实现动态请求调度,让 GPU 保持满载状态。二者协同工作,既解决了显存浪费问题,又优化了计算吞吐量,使大模型推理效率显著提升。原创 2025-10-11 07:00:00 · 2027 阅读 · 0 评论 -
大模型原理与实践:第六章-大模型训练流程实践_第2部分-模型有监督微调(Pretrain、SFT)
大模型训练实践摘要 本章介绍大模型训练流程中的有监督微调(SFT)环节,重点对比了预训练(Pre-train)与SFT的核心差异: 目标差异:预训练学习语言统计规律,SFT学习指令遵循能力 数据处理:预训练使用海量无监督文本,SFT使用指令-响应对 Loss计算:预训练计算全文Loss,SFT仅计算响应部分Loss 实现方法:给出了使用Qwen-2.5 Chat Template的数据处理代码示例 实践指导:包含特殊Token定义、数据预处理函数等具体实现细节 完整代码和更多细节可参考配套的finetune原创 2025-10-09 07:45:00 · 954 阅读 · 0 评论 -
大模型原理与实践:第五章-自己搭建大模型_第3部分-预训练一个小型LLM
本文介绍了如何预训练一个小型LLM(约2亿参数)的完整流程,包括数据准备、预训练和微调。主要内容: 数据下载与处理:使用出门问问序列猴子数据集(10B tokens)作为预训练数据,BelleGroup中文对话数据集(350万条)作为SFT数据。提供了数据下载脚本和预处理代码,包括文本切分和格式转换。 构建预训练数据集:详细介绍了PretrainDataset类的实现,用于自回归语言建模任务,包含数据加载、tokenize和填充等处理。 完整训练流程:从数据准备到预训练、监督微调(SFT)和模型推理的端到端原创 2025-10-08 07:30:00 · 1419 阅读 · 0 评论 -
大模型原理与实践:第五章-自己搭建大模型_第2部分-自己训练 Tokenizer
本文介绍了训练Tokenizer的方法,重点讲解了BPE、WordPiece和Unigram等子词分词算法。BPE通过合并高频字符对构建词表,WordPiece基于语言模型似然选择合并,Unigram则采用概率模型优化词表。文章详细演示了使用Hugging Face库训练BPE Tokenizer的完整流程,包括数据准备、配置设置和模型训练。不同Tokenizer各有优缺点:基于词的方法简单但词表庞大,基于字符的词表小但序列长,子词方法在两者间取得平衡。选择合适的分词方法对模型性能至关重要。原创 2025-10-07 08:15:00 · 2562 阅读 · 0 评论 -
大模型原理与实践:第五章-自己搭建大模型_第1部分-动手实现一个LLaMA2大模型
本文介绍了如何动手实现LLaMA2大模型,从定义超参数到构建模型核心组件。文章详细讲解了RMSNorm归一化层的数学原理和代码实现,相比传统LayerNorm更高效。同时概述了LLaMA2的整体架构,包括decoder-only的Transformer设计、GQA注意力机制等关键优化技术。通过手把手指导实现LLaMA2的各个模块,帮助读者深入理解大模型的构建细节。原创 2025-10-07 08:00:00 · 982 阅读 · 0 评论 -
大模型原理与实践:第三章-预训练语言模型详解_第3部分-Decoder-Only(GPT、LLama、GLM)
本文详细介绍了预训练语言模型中的Decoder-Only架构,重点分析了GPT、LLaMA和GLM三大模型的技术特点。文章首先阐述了Decoder-Only架构作为当前主流LLM基础的重要性,随后深入解析了GPT模型的核心组件与实现细节,包括其Decoder Block结构、预训练的因果语言建模(CLM)任务等。通过代码示例展示了GPT模型的具体实现方式,包括词嵌入、位置编码、注意力机制和模块化设计。全文系统梳理了Decoder-Only模型的发展脉络,为理解当今大语言模型的技术基础提供了重要参考。原创 2025-10-04 08:00:00 · 1139 阅读 · 0 评论 -
大模型原理与实践:第三章-预训练语言模型详解_第2部分-Encoder-Decoder-T5
T5模型是Google提出的Encoder-Decoder架构预训练语言模型,采用完整Transformer结构,将各类NLP任务统一为文本到文本转换。其关键创新包括:1)使用RMSNorm替代LayerNorm,计算更高效;2)引入相对位置编码;3)采用Encoder-Decoder架构,支持更灵活的生成任务。模型通过统一框架处理多种任务,实现NLP任务的大一统,为后续研究提供了重要参考。原创 2025-10-04 08:00:00 · 2047 阅读 · 0 评论 -
大模型原理与实践:第三章-预训练语言模型详解_第1部分-Encoder-only(BERT、RoBERTa、ALBERT)
预训练语言模型摘要 本文系统介绍了基于Transformer的预训练语言模型发展历程和技术要点。主要内容包括: BERT模型:首个基于Transformer Encoder的双向预训练模型,采用MLM+NSP任务,开创了"预训练+微调"范式 RoBERTa改进:通过去除NSP任务、扩大训练数据和词表规模,显著提升模型性能 ALBERT优化:采用参数分解、跨层共享和SOP任务,有效降低模型参数量 模型架构对比:详细分析了Encoder-only、Encoder-Decoder和Decode原创 2025-10-03 08:01:52 · 1548 阅读 · 0 评论 -
Claude Sonnet 4.5重磅发布,编程新王降临!30小时持续编码、0%错误率
【大模型竞赛升级!ClaudeSonnet4.5发布】Anthropic重磅推出ClaudeSonnet4.5,自称"世界最佳编码模型",将自主编码时长提升至30+小时,在SWE-bench评估中达到SOTA水平。新模型在推理、数学及专业领域表现显著提升,并强化了安全对齐机制。随更新推出ClaudeAgentSDK工具包、VSCode扩展及Chrome插件,支持代码检查点和长时任务处理。定价维持3/15美元每百万token(输入/输出),现已在API上线。此外还面向Max用户开放&quo原创 2025-09-30 18:47:15 · 844 阅读 · 0 评论 -
大模型原理与实践:第一章-NLP基础概念完整指南_第3部分-文本表示(词向量、语言模型、ELMo)
本文介绍了NLP基础概念和发展历程,重点讲解了文本表示技术的关键演进。从早期的向量空间模型(VSM)到现代的词向量方法,文章详细分析了文本表示需要解决的核心问题:语义表达、上下文建模、计算效率和泛化能力。内容涵盖VSM的核心组件(特征提取、权重计算、向量构建)和经典权重计算方法(TF、IDF、TF-IDF、BM25),并提供了向量空间模型实现的伪代码。文章还简要提到了改进的潜在语义分析(LSA)方法,为理解NLP基础技术提供了系统性的导引。原创 2025-09-30 08:00:00 · 1234 阅读 · 0 评论 -
大模型原理与实践:第一章-NLP基础概念完整指南_第2部分-各种任务(实体识别、关系抽取、文本摘要、机器翻译、自动问答)
自然语言处理技术体系包含多个核心任务:基础层的分词、词性标注处理文本结构;语义层的实体识别、关系抽取理解文本含义;应用层的文本分类、摘要、翻译和问答实现智能交互。这些任务从简单到复杂,共同构建了完整的NLP技术栈。随着深度学习发展,基于Transformer的预训练模型显著提升了各项任务性能。现代NLP已从规则方法演进到端到端学习,推动着智能客服、内容生成等实际应用的快速发展,让人机交互更加自然流畅。原创 2025-09-30 08:00:00 · 1174 阅读 · 0 评论 -
大模型原理与实践:第一章-NLP基础概念完整指南_第1部分-概念和发展历史
《NLP基础概念完整指南》摘要 本指南系统介绍自然语言处理(NLP)的核心理论与技术发展。全文共七章,涵盖从基础概念到前沿大模型的全方位知识。第一章详细解析NLP基础,包括概念定义、发展历程、核心任务(分词、词性标注、实体识别等)和文本表示技术(词向量、语言模型等)。后续章节深入探讨Transformer架构原理、预训练语言模型、大语言模型技术及实践应用。文章通过技术演进视角,展现NLP从早期规则系统到统计方法,再到深度学习的范式转变,特别强调词嵌入、预训练模型等关键技术突破。伪代码示例直观展示不同时期NL原创 2025-09-29 18:12:26 · 1487 阅读 · 0 评论
分享