深度学习(DL)
文章平均质量分 93
深度学习(DL, Deep Learning)是机器学习(ML, Machine Learning)领域中一个新的研究方向,它被引入机器学习使其更接近于最初的目标——人工智能(AI, Artificial Intelligence)。
Sonhhxg_柒
Save your heart for someone who cares. #愿岁月清净 抬头遇见皆是柔情#
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【CSDN星图AI实战】Kimi-VL-A3B-Thinking 多模态模型实测与部署指南
本文介绍了在CSDN星图AI平台体验的多模态模型Kimi-VL-A3B-Thinking,这款开源混合专家(MoE)视觉语言模型仅2.8B激活参数却实现旗舰级性能。文章详细解析了模型的MoE架构、多模态能力矩阵、128K长上下文窗口和MoonViT高分辨率处理等核心特性,并提供了基于CSDN星图AI镜像的两步部署流程。通过可视化界面和代码调用两种交互方式,展示了模型在OCR、视觉理解等方面的优异表现。该模型以极致效率、多模态全能、深度推理等优势,为开发者提供了轻量化高性能的多模态AI解决方案。原创 2026-07-07 14:31:13 · 929 阅读 · 0 评论 -
【CSDN星图AI实战】Ostrakon-VL部署与使⽤全教程,FSRS场景多模态神器实测
Ostrakon‑VL 是 CSDN 星图 AI 面向食品服务与零售领域的开源多模态大模型。基于 Qwen3‑VL‑8B 微调,场景适配精准,性能优于大参数量通用模型,已在淘宝闪购大规模落地。依托星图 AI 镜像可快速部署,支持可视化与代码调用,轻量化、开源免费,是 FSRS 行业智能化的高效解决方案。原创 2026-07-07 14:31:34 · 1754 阅读 · 0 评论 -
【AI实战教程】Nanobot实战教程:基于vLLM部署的智能QQ聊天机器人
本文详细介绍了如何利用Nanobot和vLLM构建智能QQ聊天机器人。Nanobot作为超轻量级AI智能体(仅4000行代码),结合vLLM的高效推理能力,可实现快速响应和多功能对话。教程涵盖从环境准备(推荐16GB+显存GPU)、星图AI部署Qwen3-4B模型、QQ机器人注册,到Nanobot安装配置的全流程。最终实现的机器人支持本地部署、多轮对话和功能扩展,为个人AI助手提供实用解决方案。文末附有相关GitHub资源链接和问题反馈渠道。原创 2026-02-11 15:11:39 · 2439 阅读 · 0 评论 -
【LLM】RAG架构如何重塑大模型
RAG(检索增强生成)架构通过结合参数化存储(LLM内部知识)和非参数化存储(外部数据库)解决了大语言模型的局限性,如信息时效性差、幻觉问题等。该架构利用语义搜索从向量数据库中实时检索最新数据,增强LLM生成答案的准确性和时效性。研究显示,RAG能显著降低错误率,在医疗、法律等领域应用广泛,并支持动态更新而无需重新训练模型。随着技术进步,RAG正成为生成式AI系统的标配,为企业提供更可靠、合规的AI解决方案。原创 2025-09-18 19:15:00 · 2109 阅读 · 1 评论 -
【LLM】FastMCP v2 :让模型交互更智能
FastMCPv2:为大型语言模型打造的高效连接框架 FastMCPv2是一个创新的Python库,为大型语言模型(LLM)提供了标准化的外部连接方案。该框架通过"模型上下文协议"(MCP)实现,被形象地称为"AI的USB-C接口",使LLM能够安全便捷地访问各类公共资源、工具和提示服务器。 核心特性包括: 快速开发:通过简洁的API实现工具、资源和提示的快速部署 上下文感知:支持日志记录、进度报告和用户引导等交互功能 高级功能:包含LLM抽样、多服务器管理及完善的安原创 2025-09-04 19:15:00 · 2335 阅读 · 0 评论 -
【LLM】深入解析Transformer位置编码机制
本文系统解析了Transformer模型中的两种关键位置编码技术:正弦绝对位置编码和旋转位置嵌入(RoPE)。正弦编码通过多维正弦波组合为每个位置生成独特向量,利用波形频率差异实现位置区分,同时保留相对位置关系。RoPE则创新性地采用旋转矩阵对嵌入向量进行变换,将位置信息融入向量角度变化中。两种方法都实现了位置与语义信息的有效平衡,前者通过简单相加,后者通过几何变换。可视化分析表明,这两种编码方案都呈现位置信息集中在前维、语义信息保留在后维的特征分布模式。Rotary方法因其高效性已被Gemma、LLaMA原创 2025-09-03 19:15:00 · 942 阅读 · 0 评论 -
【LLM】使用 LoRA 对 Qwen/Qwen3-Embedding-0.6B 进行微调
本文介绍了如何使用LoRA和PEFT技术对Qwen3-Embedding-0.6B模型进行微调,以提升语义相似度检测能力。主要内容包括:1)安装必要依赖库;2)准备包含200组中文句对的训练数据集;3)加载基础模型并配置LoRA参数;4)定义嵌入提取和训练策略;5)实施微调过程;6)保存模型并对比测试。实验结果显示,微调后模型对相似句子的余弦相似度从0.83提升至0.96,验证了该方法的有效性。该方法特别适用于需要精准语义理解的应用场景。原创 2025-09-01 22:30:00 · 1267 阅读 · 0 评论 -
【LLM】利用强化学习来构建自我进化的RAG系统
本文介绍了融合检索增强生成(RAG)与强化学习(RL)的智能系统。传统RAG仅基于相似度检索文档,存在冗余和答案质量差的问题。通过引入RL,系统能根据答案质量和多样性反馈优化检索策略,实现以下提升:1)选择更相关的文档;2)提高信息多样性;3)动态调整排名策略。文中详细展示了系统构建过程,包括环境设置、策略网络设计和训练流程。虽然在小规模合成数据上效果有限,但在大规模多样化数据中,这种RL-RAG系统能显著超越传统方法,实现越用越智能的检索效果。原创 2025-08-29 19:30:00 · 1149 阅读 · 0 评论 -
【LLM】Transformer模型中的MoE层详解
本文介绍了Transformer中的混合专家(MoE)模型,重点分析了代码实现。MoE层通过门控网络将输入分配给多个专家网络(如128个FFN),每个token仅激活少量专家(如8个)。代码解析包括四个步骤: 1)输入通过门控层获得专家分数; 2)通过top-k和softmax选择活跃专家; 3)并行计算各专家输出; 4)加权汇总专家结果。这种稀疏激活机制能提升计算效率(如Mixtral8x7B模型仅激活部分参数),但需更多内存存储所有专家参数。原创 2025-08-28 19:30:00 · 1111 阅读 · 0 评论 -
【LLM】OpenAI开源GPT级模型,120B及20B参数GPT-OSS
OpenAI开源了GPT-OSS系列大语言模型,包含120B和20B参数两个版本,采用混合专家(MoE)架构,支持128k上下文长度和工具调用功能。模型在数学推理、编程、多语言理解等基准测试中表现优异,可本地部署运行:120B版需80GB显存,20B版需16GB显存。OpenAI提供了完整的软件工具链支持,包括Hugging Face集成、vLLM服务器和Ollama支持,并允许用户进行微调。这一开源举措使开发者能构建离线AI应用,同时保持GPT级性能和企业级安全性。原创 2025-08-11 21:15:00 · 2213 阅读 · 0 评论 -
【LLM】扩散模型与自回归模型:文本生成的未来对决
本文对比分析了自回归(AR)和扩散(DLM)两种语言模型。AR模型通过顺序预测下一个token实现文本生成,具有流畅性优势但存在错误传播问题;扩散模型则通过多步去噪过程并行生成文本,支持全局纠错但计算成本较高。文章详细阐述了两者的数学原理、架构设计和训练推理流程,并指出混合模型可能成为未来趋势,结合AR的流畅性和扩散的全局一致性优势。当前AR模型仍占主导地位,但扩散模型在多样性生成和细粒度控制方面展现出潜力,两者的融合或将催生更强大的下一代语言模型。原创 2025-08-07 21:00:00 · 992 阅读 · 0 评论 -
【LLM】揭秘AI黑箱,现代大模型的架构真相
文章深入剖析了现代大语言模型(LLM)的架构演进,以DeepseekV3为例,揭示了前沿AI模型的核心机制。虽然基础仍是矩阵运算,但现代LLM已发展出复杂架构:1)采用BPE分词和7168维嵌入空间处理文本;2)使用带因果掩码的多头注意力机制和旋转位置编码(RoPE)捕捉上下文关系;3)通过混合专家系统(MoE)实现条件计算,在保持推理效率的同时扩展模型容量;4)堆叠61层Transformer模块构建深层网络。现代LLM的成功不仅依赖架构创新,还需海量数据(14.8万亿词条)、强化学习和强大基础设施支持。原创 2025-08-04 19:00:00 · 1217 阅读 · 0 评论 -
【NLP】将 LangChain 与模型上下文协议 (MCP) 结合使用
MCP(模型上下文协议)是一种开源协议,旨在解决大型语言模型(LLM)与外部数据源的隔离问题。它采用客户端-服务器架构,标准化了AI代理与外部系统的连接方式,支持开发者构建可复用的模块化连接器。通过提供通用接口和预构建服务器,MCP实现了LLM与工具/数据源的安全、可扩展交互,使AI应用从孤立系统转变为深度集成的智能代理。示例展示了如何利用MCP连接数学计算工具与LangGraph代理,验证了其在实际应用中的可行性,为AI工具链提供了统一的数据交互范式。原创 2025-05-28 22:00:00 · 1703 阅读 · 0 评论 -
【LLM】什么是 MCP&ACP&ACA
想象一个统一的代理平台,其中 A2A 处理代理之间的交互,MCP 管理工具和数据的访问,ACP 风格的运行时插件可用于边缘或离线场景。然后是 ACP,它采用了完全不同的方法。不同的供应商推出各自风格的 A2A 或 MCP,最终导致一片混乱——就像早期的 Web 服务一样,如果没有大量的粘合代码,任何事物都无法与其他事物进行通信。与面向云的协议(例如 A2A)或上下文路由协议(例如 MCP)不同,ACP 旨在实现本地优先、实时代理编排,具有最小的网络开销以及在共享运行时内部署的代理之间的紧密集成。原创 2025-05-06 19:00:00 · 303 阅读 · 0 评论 -
【LLM】为什么最新的 LLM 采用 MoE(专家混合)架构
混合专家 (MoE) 架构是一种神经网络设计,通过为每个输入动态激活一组称为专家的专用网络子集来提高效率和性能。门控网络确定要激活哪些专家,从而实现稀疏激活并降低计算成本。MoE 架构由两个关键组件组成:门控网络和专家。让我们来分解一下:从本质上讲,MoE 架构就像一个高效的交通系统,根据实时条件和所需目的地将每辆车(或在本例中为数据)引导至最佳路线。每个任务都会被路由到最适合处理该特定任务的专家或子模型。这种动态路由可确保为每项任务使用最有能力的资源,从而提高模型的整体效率和有效性。原创 2025-01-13 17:26:44 · 1958 阅读 · 0 评论 -
【NLP】使用 PyTorch 从头构建自己的大型语言模型 (LLM)
如果我们在 n 维空间中绘制一个向量,看起来相似的物体(如狗和猫)将彼此靠近,而看起来不相似的物体(如学校和家庭)的嵌入向量将位于更远的地方。为此,我们将使用一种流行的标记器,称为 BPE 标记器,这是一种子词标记器,正在 GPT3 等模型中使用。:前馈网络使用深度神经网络来学习两个线性层(第一层有 d_model 节点,第二层有 d_ff 节点,根据注意力论文分配值)中嵌入向量的所有特征,并且将 ReLU 激活函数应用于第一线性层的输出,为嵌入值提供非线性,并应用 dropout 以进一步避免过度拟合。原创 2024-11-11 08:58:04 · 1903 阅读 · 0 评论 -
【NLP】2024 年十大 RAG 框架 Github
检索增强生成 (RAG) 已成为增强大型语言模型功能的强大技术。RAG 框架将基于检索的系统与生成模型的优势相结合,从而实现更准确、更情境化和更及时的响应。随着对复杂 AI 解决方案的需求不断增长,GitHub 上出现了许多开源 RAG 框架,每个框架都提供独特的功能和能力。RAG 框架有什么作用?RAG 工作流程(RAG) 是一种 AI 框架,它通过整合外部知识源来增强大型语言模型 (LLM) 的功能。原创 2024-11-08 14:26:55 · 2969 阅读 · 0 评论 -
【NLP】使用 SpaCy 通过 LLM 合成数据微调 NER 模型
现在,在这篇文章中,我们将更进一步,使用 SpaCy 训练各种 NER 模型,比较它们的性能,并检查它们在我们合成生成的数据集中识别实体的能力。中,我们探讨了如何使用 Qwen 生成合成数据,以自动化命名实体识别 (NER) 的注释过程。然后,我们将数据分成训练集 (80%) 和验证集 (20%),使我们能够在训练期间评估模型性能。对象对于训练 SpaCy 模型至关重要,因为它们封装了输入(原始文本)和预期输出(实体)。方法恢复训练,该方法初始化优化器。在这里,我们加载了 SpaCy 的预训练中文模型,原创 2024-11-08 09:59:18 · 1989 阅读 · 0 评论 -
【NLP】使用 SpaCy、ollama 创建用于命名实体识别的合成数据集
生成合成数据可以创建大型注释数据集,而无需耗时且昂贵的手动标记过程,从而可以快速训练用于各种 NER 应用程序的模型。示例充当“指令调整”的一种形式,向模型展示如何以特定方式响应,从而降低生成的输出中出现错误和不一致的可能性。在我们的案例中,使用多个输入文本示例与相应的 JSON 输出配对,向模型展示如何一致地识别和格式化城市名称。命名实体识别 (NER) 是自然语言处理 (NLP) 中的一项重要任务,用于自动识别和分类文本中的实体,例如人物、位置、组织等。接下来,我们创建一个查询 LLM 的系统提示。原创 2024-11-07 19:29:14 · 1948 阅读 · 0 评论 -
【AI】自回归 (AR) 模型使预测和深度学习变得简单
通过为问题选择正确的工具,无论是基本的 AR 模型还是更复杂的模型,从业者都可以做出更准确的预测,并从时间序列数据中发现更深入的见解。深度学习中的自回归是指应用深度神经网络对序列数据进行建模和预测,其中序列中的当前值取决于先前的值。总体而言,自回归模型是时间序列分析和 NLP 的基本概念,为理解、预测和生成序列数据提供了强大的工具。在接下来的部分中,我们将从 AR(p) 模型的基础知识和自回归系数的作用开始,更深入地研究自回归模型的机制。自回归建模的核心是 AR(p) 模型,其中“p”代表模型的阶数。原创 2023-11-10 11:22:51 · 8827 阅读 · 1 评论 -
【ML】Dropout:增强鲁棒性和泛化性
过度拟合的产生是由于神经网络固有的复杂性,神经网络具有学习训练数据中复杂关系的能力,包括噪声和异常值。Dropout 的集成学习性质丰富了模型捕获数据中不同模式和关系的能力,最终提高了训练和测试数据的性能。通过在单个网络中引入受控随机性和集成学习,dropout 解决了过度拟合的挑战,并有助于创建更强大和可靠的模型。在这里,我们将探讨在神经网络中使用 dropout 的一些困难,并提供有效解决这些复杂问题的见解。这些挑战提醒我们,在将 dropout 纳入我们的模型时,深思熟虑的实验和适应的重要性。原创 2023-08-22 16:57:59 · 973 阅读 · 1 评论 -
了解元学习——如何利用更少的数据提高效率
未来拥有令人兴奋的可能性,包括能够适应不断变化的环境并从日益有限的数据中学习的更强大的模型。元学习,或者说学会学习,是一种机器学习方法,专注于改进学习过程,而不仅仅是学习特定的任务或问题。元学习旨在开发算法或技术,使模型能够根据学习多个相关任务的先前经验,以最少的数据和计算快速适应和学习新任务。通过关注学习过程,元学习技术使模型能够从有限的数据中学习并快速适应新任务,展现出卓越的泛化能力。元学习范式中的多种技术包括模型无关元学习 (MAML)、基于度量的元学习和记忆增强神经网络等。有哪些不同的元学习技术?原创 2023-08-17 08:50:13 · 1004 阅读 · 1 评论 -
【AI】生成式人工智能用例和应用
随着时间的推移,生成器变得越来越好,可以创建更逼真的图像。初创公司 Jesper.ai 利用人工智能文字处理器将自动化提升到了新的水平,用这种革命性的工具取代了繁琐的写作任务,自动生成营销文案、职位描述等的全文。借助生成式人工智能,协作和生产力可以飙升至新的高度,从而腾出宝贵的时间来进行更具创造性和战略性的努力。除了生成新内容之外,文本生成人工智能工具还可以有效地执行许多其他与语言相关的任务,例如回答问题、完成不完整的文本、将文本分类为不同的类别、改写和改进内容以及就多个主题进行类似人类的讨论。原创 2023-08-10 13:52:53 · 2365 阅读 · 1 评论 -
【ML】结构化数据和非结构化数据的区别以及如何将非结构化数据转换为结构化数据
与以特定格式(例如表或数据库)组织的结构化数据不同,非结构化数据缺乏一致的结构或预定义的模式。然而,经过充分分析,它也可以提供有价值的见解,因为它将非结构化数据的灵活性与某些结构化数据组织结合起来。结构化数据以特定格式组织,例如表格或电子表格,而非结构化数据没有特定的形式或结构。结构化数据和非结构化数据之间的主要区别在于,结构化数据可以使用计算机算法轻松组织和分析。总体而言,结构化数据对于组织来说是宝贵的资源,因为它提供了可靠且一致的信息源,可用于制定数据驱动的决策。原创 2023-08-08 10:50:25 · 8444 阅读 · 0 评论 -
【DL】2023年你应该知道的 10 大深度学习算法
它们是训练有素的神经网络,可将数据从输入层复制到输出层。它们具有相同数量的输入和输出层,但可能有多个隐藏层,可用于构建语音识别、图像识别和机器翻译软件。无论您是初学者还是专业人士,这三大深度学习算法都将帮助您解决与深度学习相关的复杂问题:CNN 或卷积神经网络、LSTM 或长短期记忆网络和 RNN 或递归神经网络 (RNN)。是的,CNN 是一种深度学习算法,负责以网格模式的形式处理受动物视觉皮层启发的图像。深度学习算法几乎可以处理任何类型的数据,并且需要大量的计算能力和信息来解决复杂的问题。原创 2023-02-23 21:52:38 · 22954 阅读 · 4 评论 -
【DL】第 1 部分:神经网络和深度学习
以下是课程链接如果你想打入尖端人工智能领域,本课程将帮助你实现这一目标。深度学习工程师备受追捧,掌握深度学习会给你带来无数新的职业机会。深度学习也是一种新的“超级力量”,可以让您构建几年前还不可能构建的 AI 系统。在本课程中,您将学习深度学习的基础知识。完成本课程后,您将:了解推动深度学习的主要技术趋势能够构建、训练和应用完全连接的深度神经网络了解如何实现高效(矢量化)神经网络了解神经网络架构中的关键参数本课程还向您介绍深度学习的实际工作原理,而不是仅提供粗略或表面的描述。原创 2023-01-14 21:15:26 · 1375 阅读 · 14 评论 -
【关系抽取】基于Bert的信息抽取模型CasRel
文章目录 关系提取是一项自然语言处理 (NLP) 任务,旨在提取实体(例如,比尔盖茨和微软)之间的关系(例如,创始人)。例如,从句子 比尔盖茨创建了微软 中,我们可以提取关系三元组 (比尔盖茨, 创始人, 微软)。关系提取是自动知识图谱构建中的一项关键技术。通过关系抽取,我们可以累积抽取新的关系实体,扩展知识图谱,作为机器理解人类世界的一种方式,在问答、推荐系统和搜索引擎等下游应用很多。大部分的信息抽取任务,实际上就是从语句中抽取“三元组”的任务,具体描述如下:三元组指的是:主实体(subject)、实体间原创 2022-12-05 10:06:30 · 5463 阅读 · 7 评论 -
【关系抽取】TPLinker:单阶段联合抽取,并解决暴漏偏差
Pipeline(流水线)形式把关系抽取拆分为多个子任务。每个子任务都依赖前面的任务结果作为输入,该种工作形式存在着曝光偏差和误差传播的问题。Joint(联合)模式不同任务间共享编码层,通过编码层参数共享来实现实体抽取和关系抽取的信息交互。不同任务间没有相互输入依赖。One-Stage形式。exposure bias 曝光偏差 后序任务模型训练时,使用真实标签作为模型的输入。而后序任务在推理时则是重新开始推理。和前序任务缺少直接的关联性。联合抽取主要分为2种范式: TPLinker要解决什么问题? 基于结构原创 2022-12-04 09:46:48 · 1869 阅读 · 5 评论 -
适合新手的Pytorch的中文文档
PyTorch 是一个基于 Python 的科学计算包,主要定位两类人群:PyTorch windows 安装教程:两行代码搞定 PyTorch 安装 PyTorch Windows 安装教程:两行代码搞定 PyTorch 安装 | PyTorchPyTorch Mac 安装教程 PyTorch Mac 安装教程 | PyTorchPyTorch Linux 安装教程 PyTorch Linux 安装教程 | PyTorchTensors 类似于 NumPy 的 ndarrays ,同时 Tensors原创 2022-12-04 09:46:36 · 6336 阅读 · 6 评论 -
【DL with Pytorch】第 6 章 : 用循环神经网络分析数据序列
本章扩展了递归神经网络的概念。您将了解() 的学习过程以及它们如何存储记忆。本章将介绍() 网络架构,它使用短期和长期记忆来解决使用数据序列的数据问题。到本章结束时,您将牢牢掌握 RNN 以及如何解决() 数据问题。介绍在前面的章节中,解释了不同的网络架构——从可以同时解决分类和回归问题的传统 ANN,到主要用于通过执行对象分类、定位、检测和分割任务来解决计算机视觉问题的 CNN .在最后一章中,我们将探讨 RNN 的概念并解决时序数据问题。原创 2022-11-30 09:25:21 · 807 阅读 · 5 评论 -
【DL with Pytorch】第 5 章 :风格迁移
一种用于比较内容图像与目标图像在内容方面的差异(内容损失),另一种用于比较风格图像与目标图像在风格方面的差异(风格损失),其中是通过计算gram矩阵来实现的。每个层的输出用于比较输出图像和输入图像,目标是修改目标图像的参数,使它们类似于内容图像的内容和风格图像的风格,这可以通过优化三种不同的损失函数来实现(这将在本章中进一步解释)。在此步骤中,将处理基本的预处理,其中图像的大小必须相等(最好是用于训练预训练模型的图像大小),这也将是输出图像的大小。这是因为两幅图像的风格特征都不是精确的,而是近似值。原创 2022-11-30 09:24:45 · 885 阅读 · 5 评论 -
【DL with Pytorch】第 4 章 : 卷积神经网络
但是,通过向输入图像添加 1 的填充,输入的形状变为 34 x 34 x 3,这导致使用相同过滤器的输出为 32 x 32 x 1。随着网络层数的增加,过滤器将执行更复杂的操作,这些操作会利用先前检测到的特征——例如,通过使用边缘检测器的输入来检测人的轮廓。然而,重要的是要提到,在 PyTorch 中,与在许多其他框架中一样,您应该只定义要使用的过滤器数量,而不是过滤器的类型(例如,垂直边缘检测器)。最后,我们在上一步中创建的采样器用于确保每次迭代中使用的批次都是随机创建的,这有助于提高模型的性能。原创 2022-11-29 12:08:53 · 665 阅读 · 5 评论 -
【DL with Pytorch】第 3 章 :使用 DNN 的分类问题
但是,考虑到这一点,在训练神经网络时,一旦训练和测试了初始架构,就有多种方法可以确定需要改进的地方。这主要是因为为什么声明声明研究的主要目的应该是更好地了解银行将收到的钱,以及对可能拖欠付款的客户采取某些行动(例如例如,提出将债务分成较小的付款),以及对那些不会违约的人采取不同的行动(例如,提供福利作为对行为良好客户的奖励)。例如,一个遭受高偏差的模型在经过处理后,可能会提高其在训练数据上的性能,但不会提高验证数据的性能,这意味着该模型将开始遭受高方差的影响,并且需要另一组补救措施要采取。原创 2022-11-29 08:43:01 · 1029 阅读 · 7 评论 -
【DL with Pytorch】第 2 章 : 神经网络的构建块
它从感知器的定义开始,感知器是一个受人类神经元启发的单元,它将数据作为输入来对其执行转换。一般而言,构建神经网络可以在非常简单的层面上使用诸如 scikit-learn(不适合深度学习)之类的库来实现,它可以为您执行所有数学运算而没有太大的灵活性,或者在非常复杂的层面上实现通过从头开始对训练过程的每一步进行编码,或者使用更强大的框架,从而提供更大的灵活性。激活函数的主要目的是打破模型的线性,考虑到使用神经网络解决的大多数现实生活中的数据问题不是由一条线定义的,而是由一个复杂的函数定义的,这一点至关重要。原创 2022-11-29 08:42:44 · 787 阅读 · 7 评论 -
【DL with Pytorch】第 1 章 :深度学习与PyTorch简介
概述本章介绍了这两大主题:深度学习和PyTorch。在这里,您将能够探索深度学习的一些最流行的应用,了解 PyTorch 是什么,并使用 PyTorch 构建单层网络,这将是您将所学应用于现实生活的起点数据问题。到本章结束时,您将能够使用 PyTorch 的语法构建神经网络,这在后续章节中必不可少。深度学习是机器学习的一个子集,专注于使用神经网络解决复杂的数据问题。由于软件和硬件的进步使我们能够收集和处理大量数据(我们谈论的是数百万和数十亿的条目),它现在变得越来越流行。考虑到深度神经网络需要大量数据才能正原创 2022-11-28 11:07:56 · 982 阅读 · 8 评论 -
Pytorch深度学习实战(1)—— 使用LSTM 自动编码器进行时间序列异常检测
请注意,我们使用的批量大小为 1(我们的模型一次只能看到 1 个序列)。我们将构建一个 LSTM 自动编码器,在一组正常的心跳上对其进行训练,并将看不见的示例分类为正常或异常。我们取得了非常好的结果。虽然我们的时间序列数据是单变量的(我们只有 1 个特征),但代码应该适用于多变量数据集(多个特征),几乎不需要修改。在本教程中,您学习了如何使用 PyTorch 创建 LSTM 自动编码器,并使用它来检测 ECG 数据中的心跳异常。我们需要将我们的示例转换为张量,以便我们可以使用它们来训练我们的自动编码器。原创 2022-11-19 09:03:41 · 10569 阅读 · 17 评论 -
【DL】第 10 章: 元学习
在第 9 章,新兴的神经网络设计中,我们介绍了新的神经网络( NN ) 架构来解决现有深度学习( DL ) 算法的一些限制。我们讨论了用于处理结构化数据的图形神经网络,以图形表示。我们还介绍了记忆增强神经网络,它允许网络使用外部记忆。在本章中,我们将研究如何通过使 DL 算法能够使用更少的训练样本来学习更多信息来改进 DL 算法。让我们用一个例子来说明这个问题。想象一个人从未见过某种类型的物体,比如汽车(我知道——极不可能)。他们只需要看到一辆车就可以识别其他汽车。但 DL 算法并非如此。DNN 需要大量训原创 2022-10-09 08:59:51 · 2573 阅读 · 10 评论 -
【DL】第 11 章:自动驾驶汽车的深度学习
让我们想想自动驾驶汽车 ( AV )将如何发展 影响我们的生活。一方面,我们可以在旅途中做其他事情,而不是把注意力集中在驾驶上。满足这些旅行者的需求本身可能会催生一个完整的行业。但这只是一个额外的好处。如果我们在旅行期间可以更有效率或只是放松一下,那么我们很可能会开始更多地旅行,更不用说对自驾能力有限的人的好处了。让交通这样一种必不可少的基本商品变得更容易获得,有可能改变我们的生活。这只是对我们个人的影响——从交付服务到准时制造,自动驾驶汽车也可以对经济产生深远的影响。简而言之,让 AV 工作是一项非常高风原创 2022-10-09 09:00:07 · 1547 阅读 · 8 评论 -
【DL】第 9 章:新兴的神经网络设计
在本章中,我们将了解一些新兴的() 设计。它们尚未成熟,但具有未来潜力,因为它们试图解决现有 DL 算法的基本限制。如果有一天这些技术中的任何一种被证明是成功的并且对实际应用有用,那么我们可能会离通用人工智能更近一步。我们需要记住的一件事是结构化数据的性质。到目前为止,在本书中,我们一直专注于处理图像或文本——换句话说,就是非结构化数据。这不是巧合,因为 NN 在寻找像素或文本序列组合中的结构这一看似复杂的任务中表现出色。原创 2022-10-08 09:17:03 · 1393 阅读 · 10 评论 -
【DL】第 8 章:序列到序列模型和注意力
在第 6 章“理解循环网络”中,我们概述了几种类型的循环模型,具体取决于输入-输出组合。其中之一是或(),其中输入序列被转换为另一个不同的输出序列,不一定与输入具有相同的长度。机器翻译是最流行的 seq2seq 任务类型。输入序列是一种语言的句子的单词,输出序列是翻译成另一种语言的同一个句子的单词。比如我们可以翻译英文序列到德国。不仅输出句子的长度不同,而且输入和输出序列的元素之间没有直接对应关系。特别地,一个输出元素对应于两个输入元素的组合。使用单个神经网络实现的机器翻译称为神经 机器()。原创 2022-10-08 09:16:43 · 2749 阅读 · 12 评论
分享