自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

高丽大学人工智能硕士在读|专注大模型、RAG、OCR与AI工程实践

分享大模型评测、RAG知识库、OCR文档解析与本地模型部署实战,持续记录AI应用从方案设计到工程实现的经验。

  • 博客(215)
  • 收藏
  • 关注

原创 从 Chat Completions 到 Responses:DeepSeek 把 Agent 的路修好了

DeepSeek于2026年7月起在V4-Flash与V4-Pro中原生支持OpenAI Responses协议,实现Agent优先的多步推理、工具调用与流式语义事件输出,虽无服务端状态管理,但核心能力完备。此举大幅降低开发者构建复杂Agent系统的工程成本,减少协议转换层依赖,推动国产大模型向“代理式”接口对齐,标志着协议能力成为新一代AI基础设施的关键竞争点。

2026-09-13 15:53:51 361

原创 2B 模型也能吊打 4B?MiniCPM5-2B 本地部署全攻略,端侧 SOTA 真香!

清华开源的MiniCPM5-2B仅2.52亿参数,却在34项基准中平均得分53.9,超越多个4B模型,成为端侧SOTA。其原生支持131K上下文,代码、数学、工具调用与Agent任务表现突出,部署友好,兼容主流框架,仅需4-8GB显存。适合本地RAG、编程助手、自动化工作流等场景,是低成本高性能的理想选择。

2026-09-11 10:30:00 401

原创 NaviDC-OCR 冲到文档解析第一:1.2B 小模型凭什么赢过一众 OCR?附本地一键部署教程

NaviDC-OCR 是一款约 1.2B 参数的开源文档解析模型,在 OmniDocBench v1.6 上取得 96.87 分,并在 ICDAR 2026 Sci-ImageMiner Challenge 中排名第一。本文介绍它在拍照文档、复杂版面、表格和公式解析方面的核心优势,并通过 paddleocr-local 项目提供 Windows + NVIDIA 环境下一键部署教程。

2026-08-22 21:44:35 429

原创 # HPD-Parsing 太强了:3.06 倍吞吐新纪录,本地离线部署教程我也帮你整理好了

HPD-Parsing文档解析模型取得重大突破,在OmniDocBench v1.6上达到94.91分,吞吐量提升3.06倍至4752.1 tokens/s。该模型采用InternVL3.5-1B架构,在表格识别(TEDS 91.35)、公式识别(CDM 97.28)和复杂版面解析等方面表现优异。相比传统OCR,它能更好地处理PDF、扫描件、票据等复杂文档的结构化解析,支持表格、公式、图文混排等元素的准确识别。文章推荐使用paddleocr-local项目进行本地部署,提供完整可视化界面和交互功能,适合RA

2026-08-15 13:48:41 344

原创 OvisOCR2 太强了:0.8B 小模型拿下 OCR第一,本地离线部署教程我也帮你整理好了

OvisOCR2是一款0.8B级别的端到端文档解析模型,在OmniDocBenchv1.6和PureDocBench测试中表现优异。它能直接将文档图片转换为结构化的Markdown格式,支持文本、表格、公式和图片区域的识别,并恢复自然阅读顺序。该模型已集成到PaddleOCRLocal项目中,支持一键本地部署,适合PDF转Markdown、论文解析、表格抽取等场景。部署仅需NVIDIA显卡和Docker环境,运行显存占用约5GB。项目提供了完整的Web界面,方便上传PDF、预览结果和下载文件,特别适合敏感数

2026-07-27 03:06:55 694

原创 本地部署实测 ThinkingCap-Qwen3.6-27B:推理 token 砍掉快一半,质量却几乎没掉

摘要:ThinkingCap-Qwen3.6-27B是基于Qwen3.6-27B优化的高效大模型,通过微调显著减少50%-90%计算量和推理token,同时保持原版性能。该模型在数学、代码、推理等多项任务中表现突出,如GSM8K准确率提升至96.5且token减少74.1%,并维持安全性和通用性。特别适合本地部署、RAG等需要平衡效率与性能的场景,实现"少算但精准"的效果,是工程化落地的理想选择。

2026-07-13 16:33:56 593

原创 混元3、GLM5.2、GPT5.6sol 同台对打:谁才是真正能打的?

本文通过一道3D户型图设计题测试了混元3、GLM5.2和GPT5.6sol三组大模型的前端综合能力。题目要求生成120平方米两室两卫的Three.js平面图,并输出单个HTML文件。测试发现:混元3完成基础结构但视觉简陋;GLM5.2界面包装完整但空间表达模糊;GPT5.6sol表现最优,兼具功能完整性和产品交付感,空间布局合理且视觉层次清晰。结果表明当前大模型在前端开发能力上已出现明显分层,从基础功能实现到完整产品交付存在显著差距。这类融合空间规划与工程实现的任务,能更有效评估AI的综合开发能力。

2026-07-13 16:06:47 479

原创 Qwen3.6-27B-NVFP4 深度评测:英伟达官方量化,27B 长上下文本地部署新选择

英伟达官方量化模型Qwen3.6-27B-NVFP4为27B参数大语言模型提供本地部署新选择,通过ModelOpt量化技术将显存需求从55.6GB(BF16)压缩至约20-22GB,支持262K长上下文,适合单卡工作站运行。官方测试显示其精度与FP8版本差距在±0.5内,MMLU Pro等任务表现接近。社区实测性能存在分歧:部分场景NVFP4解码速度达200 token/s(FP8约112 token/s),但FP8在长文本预处理(prefill)和部分解码任务中仍具优势。需注意潜在问题:Black

2026-07-05 14:16:11 1647

原创 硅基流动递表港交所:Token 工厂的“高增长、高亏损“困局

北京硅基流动科技递交港股上市申请,定位为AI时代的“Token工厂”,提供异构算力与开源模型的词元服务。2025年其公有云MaaS业务收入占比53%,但毛利率为-119%,亏损3.45亿元;本地部署业务毛利率达82.5%,但客户集中度高。公司估值77亿元,押注国产算力通用中间层与“中立第三方”优势,但面临大厂竞争与成本压力。核心挑战在于提升算力利用率,在时间窗口内证明商业模式可持续性。

2026-07-05 13:51:28 551

原创 DeepSeek 又给大模型推理上强度了:DSpark 不是更快,是更会分配算力

摘要: DSpark通过创新性设计同时优化了大模型推理中的草稿生成质量与验证效率,突破传统Speculative Decoding的局限。其核心采用半自回归结构,在并行草稿后加入轻量级顺序模块,显著提升块内一致性;同时引入动态验证调度,结合置信度估计与系统负载,实现资源最优分配。实验表明,DSpark在数学、代码、对话等任务中均能提升接受长度,并在生产系统中将单用户生成速度提高60%~85%,且高并发下保持稳定。其关键在于将模型质量、概率校准与系统负载三者联动,重新定义了Speculative Decodi

2026-06-29 15:53:27 346

原创 本地大模型别再瞎装了!这个开源神器会自动帮你选模型

下载几十 GB 模型,结果显存不够、CPU 爆满?whichllm 用真实硬件和 Benchmark 帮你选模型,不再靠运气。

2026-06-28 20:41:16 500

原创 Unlimited-OCR 太狠了:长文档直接“无限解析”,本地一键部署我也帮你搞定了

Baidu最新推出的Unlimited-OCR模型突破了传统OCR的局限,专注于长文档理解与结构化输出。该模型通过整体解析文档(支持50页以上PDF),显著提升了表格合并、跨页语义对齐等能力,特别适合RAG、PDF转Markdown等场景。目前提供Transformers(稳定)和SGLang(高性能)两种部署方案,支持Windows/Docker/macOS一键运行(GitHub项目paddleocr-local)。需注意模型体积大、显存要求高,建议NVIDIA显卡用户优先选择Transformers后端

2026-06-26 10:00:00 1312

原创 “9B 小模型,干出 Claude Mythos 味道?我被这个开源怪物惊到了

想在自己电脑上体验“Claude 那种又聪明又会思考”的大模型?Qwythos‑9B 直接把门槛砍没了:它只用 9B 参数,却学了 5 亿条高级思维链,回答问题前会先认真“想一大圈”,算不准还会自己调用工具查资料、跑代码,最后给你一个有理有据的结论。更夸张的是,它能一次看下接近 100 万个 token的内容,整仓代码、几十篇文档丢进去都不怕。如果你是刚入门的大模型爱好者,只想要一句话评价——这是一个小白也能玩、但上限非常高的“本地版 Claude 风格神器”。

2026-06-24 13:03:25 3958 1

原创 Codex 史诗级bug在后台疯狂写盘,我的 SSD 差点被它磨穿

Codex 疯狂写盘的锅终于查到了:不是代码,不是系统,而是本地 SQLite 日志库。本文用亲测方式还原问题、定位 logs_2.sqlite 异常写入,并给出一条命令完成备份、拦截、清 WAL、验证的修复方案。

2026-06-23 13:06:03 8642 2

原创 长文档 OCR 新王者 Unlimited-OCR:3B 小模型打爆全场

Unlimited-OCR:端到端长文档OCR新范式 Unlimited-OCR提出了一种创新的3B参数小模型方案,通过R-SWA(参考滑动窗口注意力)和DeepEncoder视觉压缩,彻底解决长文档OCR的工程难题。该模型单次前向即可处理40+页PDF,在OmniDocBenchv1.6上达到93.92%的端到端理解准确率,显著降低跨页表格、公式等场景的错误率。其核心优势包括: 高效长序列处理:R-SWA结合局部窗口与全局参考路径,在近似线性复杂度下保持跨页一致性; 视觉压缩优化:DeepEncoder将

2026-06-23 10:56:55 608

原创 仅需4GB显存!这个12B本地Agent模型把代码能力卷疯了,开发者评论区炸了!

本文介绍了一款专为 coding + agentic work 打造的 12B 本地模型 Gemma4 v2,仅需约 4.5GB 显存即可运行,Agent 能力比官方 Gemma4 提升 3.5 倍,能写代码、调用工具、调试问题,并具备完整的 read→reason→act→verify Agent Loop,适合想做本地 coding agent、RAG+ 工具调用、CLI 自动化或替代在线 coding assistant 的开发者,可直接用 Ollama 三行命令部署。

2026-06-22 10:00:00 516

原创 还在花钱调API?这个平台直接让你0成本养虾到6月底

讯飞星辰MaaS平台现有限时免费AI模型服务(截至6月底),本文以Qwen3.6-35B-A3B模型为例,提供5分钟快速部署指南:登录平台→选择模型→获取API密钥→完成接口配置。演示了如何将clawx作为自定义供应商接入并验证对话功能。作者呼吁读者点赞转发支持,助力开发者低成本实现"AI养龙虾"等创新应用

2026-06-19 11:39:59 71

原创 RAG 性能暴涨 5.9 倍!微软新框架让 LLM 自主检索,无需训练直接部署

微软Copilot团队提出AgenticRAG框架,通过赋予LLM自主检索能力来解决传统RAG的局限性。该框架包含search、find、open、summarize四种工具,让LLM能自主决定检索策略,在复杂企业场景中实现精准信息获取。实验显示,在BRIGHT长文档测试中,该系统比最优嵌入模型提升21.8个百分点,召回率提高5.9倍,且无需微调即可部署。论文还总结了生产级设计的四条经验,为复杂信息检索任务提供了切实可行的解决方案。

2026-06-18 20:11:07 407

原创 跪了!PaddleOCR 本地部署终于不用再折腾了,这个项目直接一键起飞

想本地跑 PaddleOCR,却总被环境、依赖、模型和启动问题劝退?这个项目把复杂部署流程做成了一键启动,还自带 WebUI 和主流 OCR 模型,让文档识别、发票解析、合同抽取真正变得简单可用。想要私有化、本地化 OCR 的开发者,可以直接看这一篇

2026-06-17 15:50:00 606

原创 本地AI王炸:自动学习你电脑1万+文件,还能生成专业报告

DeepLocals是一款本地私有化智能知识库工具,能自动学习用户电脑中的文件(支持119种语言),并从文件中提取信息回答用户问题。最新版本新增微信知识库助手功能,支持在微信中直接提问;提供PDF保留版面的双语翻译;可同时检索本地文件和2500万在线文献库;支持导出Word、Markdown及生成思维导图。该工具适用于医生、律师、学生等各行业用户,帮助高效管理本地知识。软件可直接从官网下载使用。

2026-06-15 10:49:22 284

原创 PP-OCRv6 太强了:50种语言一套模型,本地离线部署我帮你整理好了

PP-OCRv6正式发布,在识别精度、检测精度和推理速度上全面提升,尤其针对复杂文档和工业场景(如电路板、数码管、喷码点阵等)进行了优化。新版本提供三档模型(Tiny/Small/Medium)覆盖不同算力需求,支持50种语言和跨平台部署。为便于本地部署和工程化接入,推荐使用开源项目paddleocr-local,提供可视化界面和完整OCR流程支持。该项目支持一键部署,适合快速验证、内网演示和二次开发。PP-OCRv6的升级使其在真实业务场景中的实用性显著增强。

2026-06-14 12:23:55 4098 1

原创 Codex 接入DeepSeek保姆级教程

Codex + DeepSeek 目前是国内最火的 AI 组合,但很多人卡在登录和网络配置上。本文用最简单的话术,手把手教你用 CC Switch 实现“零配置、零门槛”接入:无需复杂环境、无需科学上网、无需折腾官方登录,只需一键配置就能让 Codex 直接调用 DeepSeek 模型。Codex 不只会写代码,还能帮你写文档、写邮件、整理会议纪要、处理 Excel、批量重命名文件、写公众号文章等,日常办公也能丝滑提效。适合 0 代码基础的新手和普通职场人,读完就能用,用完就感觉效率翻倍

2026-06-12 06:43:15 2345 1

原创 PDF 转 Markdown 怎么选?我用126页论文实测出了 OpenDataLoader 的真实水平

本文通过对四种PDF转Markdown工具的实测分析,重点探讨了OpenDataLoader在工程实践中的独特价值。测试结果显示,虽然OpenDataLoader在综合效果上不如PaddleOCR-VL和MinerUVLM,但其在文字版PDF处理场景展现出三大核心优势:1)本地运行无需云API,保障隐私和稳定性;2)解析速度快(126页仅10秒),适合批量处理;3)正文抽取质量稳定,特别适合作为RAG知识库的基础解析层。文章指出,OpenDataLoader最适合处理可选中文字的文字版PDF,但在复杂表格和

2026-06-11 13:44:26 573

原创 谷歌发布 Gemini 3.5 Live Translate:实时语音翻译进入“近同传”时代

谷歌最新发布的 Gemini 3.5 Live Translate 将实时语音翻译从“逐句翻译”推进到“边听边译”的新阶段。该模型支持 70 多种语言,可自动识别语言类型,无需手动设置;通过连续处理语音流,将翻译延迟压缩到几秒级,更接近同声传译体验。与传统翻译相比,Gemini 3.5 Live Translate 在翻译过程中能尽量保留说话者的语调、节奏和音高,使翻译语音更自然,同时对噪声环境有更好的容忍度。谷歌已将此能力接入 Google AI Studio、Gemini Live API

2026-06-11 09:53:35 436

原创 DeepLocals v3.3.0 发布:打通知识库、微信与多模态文档处理的关键一步

DeepLocals是一款本地化智能知识库管理软件,支持55种文件格式上传与解析,实现本地数据学习与问答。最新版本v3.3.0聚焦三大核心:连接、解析能力与稳定体验。关键更新包括: 微信助手:支持微信端直接检索知识库,无缝融入高频场景。 多模态支持:新增音频转写、TeX等格式解析,强化多源数据整合。 内置PDF翻译:无需插件,快速生成双语PDF,提升易用性。 性能优化:万级文件加载速度显著提升,大知识库体验更流畅。 多模态问答:结合视觉模型,支持图片与文档联合分析。 输出增强:优化排版并支持多种格式

2026-06-09 10:35:30 383

原创 16GB 笔记本电脑也能跑原生多模态?实测 Gemma 4 12B,256K 上下文仅占 14.8GB

Google最新发布的Gemma4 12B是一款开源商用多模态AI模型,采用无编码器统一架构,能直接处理文字、图片和音频数据,显著降低显存占用和延迟。其12B参数规模在性能接近26B模型的同时,仅需16GB显存即可本地运行,成为性价比突出的"甜点级"选择。实测显示,该模型在Ollama平台运行25K上下文时仅占用14.8GB显存,支持256K超长文本处理,并能高效分析视频/音频内容。Apache 2.0许可和轻量化特性使其成为本地部署多模态应用的理想选择,普通16GB显存设备即可流畅运行

2026-06-06 10:00:00 507

原创 不是 OCR 不够强,而是你还缺一个“文档大脑”——MinerU-Popo 到底是什么?

MinerU-Popo是一款专注于OCR后处理的轻量级框架,其核心价值在于将页面级OCR识别结果重构为具有完整语义结构的文档树。该框架解决了跨页表格合并、断裂段落重组、标题层级还原、图文关联等关键结构性问题,而非单纯提升OCR识别精度。通过任务导向数据引擎、动态分块同步和文档语义增强等技术,其在保持处理效率(0.37Doc/s)的同时显著提升结构化指标(如TEDS从53.7提升至90.6)。特别适用于PDF解析、RAG知识库构建等需要保持文档逻辑完整性的场景,弥补了传统OCR"看得见但读不懂&qu

2026-06-06 10:00:00 840

原创 英伟达RTX Spark发布:AI PC的下一战,不是跑分,而是本地Agent

英伟达在2026年台北Computex上发布RTX Spark芯片,重新定义AIPC概念。该芯片集成Blackwell GPU与定制Grace CPU,具备1 petaflop AI性能,旨在将PC转变为可长期运行本地AI Agent的工作站。英伟达通过统一内存架构解决传统PC运行AI的瓶颈,推动PC从"执行应用"向"Agent自主任务"转型。此举标志着英伟达从数据中心向终端市场扩张,将面临与Intel、AMD等厂商的生态竞争。开发者需关注混合架构开发、工具接口设计等

2026-06-02 16:15:38 657

原创 Claude Opus 4.8来了:Anthropic为何能在同一天“模型升级 + 估值反超OpenAI”?

2026年5月28日,Anthropic发布Claude Opus 4.8模型并完成650亿美元融资,估值达9650亿美元。该版本强化了代码能力、长程任务管理和Agent工作流,重点提升复杂工程执行、多代理协作及减少幻觉的能力,标志着大模型竞争从"智能聊天"转向"企业生产力工具"。其估值飙升反映资本市场对AI编程Agent和企业级应用场景的认可,开发者需适应AI作为"工程同事"的新范式,掌握任务拆解、结果验证和多模型调度能力。行业竞争将聚焦编程Ag

2026-06-02 06:46:41 790

原创 DeepLocals 接入 Sciverse 学术文献库:让个人知识库真正连上科研级证据源

DeepLocals与Sciverse学术文献库深度整合,升级为"本地资料+学术文献+引用溯源"的研究型AI工作台。Sciverse是上海人工智能实验室打造的AI-Ready科学数据库,涵盖2500万篇结构化处理的学术文献。通过MinerU智能解析引擎,系统能精准识别论文中的公式、表格等复杂内容。用户可一键启用学术搜索,使AI回答同时参考本地知识库和权威文献证据,并支持原文追溯与下载。该方案特别适合科研选题、文献综述、专业问答等场景,实现从简单问答到基于证据的专业级AI辅助的跨越。

2026-06-01 10:00:00 392

原创 PaddleOCR-VL-1.6 太强了:96.3% 新纪录,本地部署教程我也帮你整理好了

PaddleOCR-VL-1.6正式发布,在OmniDocBenchv1.6上达到96.3%的精度,新增印章识别能力,全面提升文档解析性能。该版本不仅擅长文本识别,更强化了对表格、公式、图表等复杂元素的处理能力,特别适合PDF解析、票据识别等场景。文章推荐本地部署方案paddleocr-vl-local,提供完整的前端交互界面,便于快速搭建可用的文档解析系统。新版本在工程化落地方面表现突出,是处理复杂文档的理想选择。

2026-05-30 10:00:00 4227 2

原创 腾讯放大招!Hy-MT2-7B 开源,33 种语言翻译直接甩开商业 API?

腾讯开源Hy-MT2-7B多语种翻译模型,支持33种语言及5种民汉/方言互译。该7B版本在翻译质量、复杂句处理和部署成本间取得平衡,适合企业私有化部署。模型通过数据筛选和强化训练优化专业领域翻译能力,在FLORES-200测试中接近行业顶尖水平,并支持端侧部署。腾讯同步推出"Hy翻译"小程序,验证其产品化能力。该模型标志着AI翻译进入专业化时代,为多语种场景提供高性价比解决方案。

2026-05-24 10:00:00 485

原创 国产最强智能体模型?Qwen3.7-Max 这次真的不一样了

阿里云发布新一代大模型Qwen3.7-Max,标志着AI从对话助手向任务执行者的转型。该模型专注于智能体时代需求,在编程协作、办公自动化、长周期任务执行等方面表现突出。实测显示其能持续35小时自主完成复杂工程优化,并在3D建模等任务中展现出远超前代的专业能力。Qwen3.7-Max不仅保持了通用推理优势,更通过环境扩展训练实现了跨框架泛化能力,将AI应用场景从简单问答扩展到完整工作流执行。这一升级体现了大模型技术正从"回答问题"向"完成任务"的关键转变。

2026-05-24 10:00:00 795

原创 用 Codex 一键爆改视频:HyperFrames 把“写代码”变成“剪大片”

HeyGen推出的HyperFrames框架将HTML代码直接渲染为视频,并与Codex深度集成,实现“写代码即做视频”的自动化流程。用户可通过自然语言指令让AI生成HTML/GSAP结构,并一键渲染成MP4,适用于产品短片、数据可视化等场景。典型应用包括SaaS功能演示、博客转视频、动态数据报告等,支持模板化批量生产。通过Codex+HyperFrames组合,用户可从剪辑操作升级为内容自动化架构,显著提升视频制作效率。

2026-05-21 13:09:03 1801

原创 终于来了!让电脑里的上万个文件,变成你的专属 AI 知识库

DeepSeekMine V3.1.0是一款强大的AI文档处理工具,支持PDF、Word、Excel等文件格式的精准学习与语义检索。它能自动从本地文件中提取答案,生成图文报告并导出为Word文档。新版本新增多模态学习、专业模式切换(通用/法律/医学/科研)、多知识库联合查询等功能,支持1400万页文件处理,适用于医生、律师、科研人员等专业人士。此外,还优化了本地模型接入(如LM Studio)和文件管理能力,提供更高效的智能文档解决方案。

2026-05-19 16:51:09 442

原创 主流7个大模型测评,谁更懂代码和空间感知?

一些最新的研究也在讨论类似问题:传统 LLM 更擅长语言和代码模式,对 3D 空间关系的理解仍然薄弱,因此才会出现「物体重叠、布局自相矛盾」这类现象。:Living Room、Kitchen、Dining、Master Bedroom、Bedroom 2、Master Bath、Bathroom 2 布局合理。(几何一致性、动线合理性、物体不穿模)却很容易被忽略,尤其到了 3D 任务,很多模型会出现「代码能跑,但场景完全不符合常识」的情况。

2026-05-07 15:35:30 494

原创 DeepSeek 版 Claude Code 火了?我实测跑通 DeepSeek-TUI

DeepSeek-TUI是一个近期在中文技术圈爆火的开源项目,它是一个基于DeepSeek模型的终端编程助手工具。这个项目的走红颇具戏剧性:一位美国开发者通过DeepSeek生成中文推广文案,在中文社区成功引发关注。该工具支持终端操作、代码阅读、任务拆解等功能,提供了类似ClaudeCode的AI编程体验。文章详细介绍了安装配置过程、实际测试效果以及使用注意事项,指出其最大特点是能像真实项目助手一样进行任务分解和执行,而非简单的问答交互。虽然作为第三方工具仍存在一些小问题,但对于DeepSeek的重度用户来

2026-05-06 13:59:50 695

原创 Claude Code 接入 DeepSeek:Windows CMD 保姆级教程

本文介绍了在Windows CMD中配置ClaudeCode接入DeepSeek API的完整步骤。主要内容包括:1)安装ClaudeCode(需Node.js 18+和Git);2)配置DeepSeek环境变量(注意CMD需使用setx命令而非PowerShell的$env);3)进入项目启动ClaudeCode并验证接入状态;4)常见问题解决方案,如环境变量未生效、模型显示错误等;5)首次使用建议。文章特别强调CMD与PowerShell命令的区别,避免配置错误。成功配置后,用户可在终端使用Claude

2026-05-06 09:58:04 1228

原创 别再只会 ReAct 了!3 条进化路线让你的 Agent 智商暴涨

摘要:本文系统梳理了AI任务规划方法的演进路线。ReAct实现了边思考边调用工具,但缺乏全局规划;Plan-Then-Act先规划后执行,适合结构化任务;ToT通过多思路并行探索解决复杂推理;LATS则在真实环境中试错优化,适合交互式任务。建议开发者分阶段实施:先掌握ReAct基础,再叠加Plan-Then-Act规划层,最后针对复杂场景引入ToT/LATS。不同方法各有所长,需根据任务复杂度选择,循序渐进构建智能体系统。

2026-05-04 10:41:58 344

原创 这个 GPT Image 2 Skill 太能打了:从宋代夜市到国风海报,一套提示词直接把 AI 出图拉满

开源项目wuyoscar/gpt_image_2_skill将GPTImage2能力转化为可复用的技能库,实现AI生图从随机到可控的转变。该项目提供国风场景、字体海报、角色设计等实战案例,解决提示词不稳定、风格难固定等痛点,特别适合设计师、自媒体等内容创作者快速产出高质量视觉内容。其核心价值在于提供可套用的风格模板,让图像生成更稳定高效,降低工作门槛。项目案例涵盖多种流行风格,从专业设计到社交媒体传播,具有直接应用价值。

2026-04-30 15:49:17 615

YouTube评论情感分析项目84%正确率:基于BERT的实战复现与原理解析

数据集和代码

2025-10-25

二手交易网站(完整源码可运行).rar

内容概要 该平台基于 Django 框架,为校园中学生提供二手物品的高效发布与交易功能,涵盖用户注册登录、物品发布与搜索、购物车与订单管理等核心模块,帮助用户安全便捷地处理闲置物品。 适用人群 校园内所有有二手交易需求的师生,尤其是毕业季需快速处理闲置物品的留学生群体。 适用场所及目标 适用于高校或相关教育机构。目标是搭建一个安全可信、管理高效的校园二手交易生态,并通过数据可视化与后台统计来实现更精准的运营和维护。 其他说明 平台采用 MySQL 进行数据存储,Git 进行版本控制,前后端分层结构清晰,维护与扩展性较高,可进一步添加支付方式、物流管理等功能。

2025-02-01

「CIFAR-100 分类实战:从 ResNet 到 Wide-ResNet,一文分享我的开源代码与经验」

本项目代码资源完整公开,提供 Wide-ResNet 模型和 CIFAR-100 训练流程,帮助你深入理解模型调优和实验步骤。

2025-02-01

利用生成对抗网络(GAN)进行CIFAR-100图像生成:实验与结果分享

FID Score: 15.8565 Inception Score: 6.0625 ± 0.7847 Intra-FID: 51.2626 Training time:4 hours, 36 minutes, 36 seconds (single RTX3090 operation)

2025-02-01

某闯关类手游用户流失预测(数据集+代码+报告)

手游在当下的日常娱乐中占据着主导性地位,成为人们生活中放松身心的一种有效途径。近年来,各种类型的手游,尤其是闯关类的休闲手游,由于其对碎片化时间的利用取得了非常广泛的市场。然而在此类手游中,新用户流失是一个非常严峻的问题,有相当多的新用户在短暂尝试后会选择放弃,而如果能在用户还没有完全卸载游戏的时候针对流失可能性较大的用户施以干预(例如奖励道具、暖心短信),就可能挽回用户从而提升游戏的活跃度和公司的潜在收益,因此用户的流失预测成为一个重要且挑战性的问题。在毕业项目中我们将从真实游戏中非结构化的日志数据出发,构建用户流失预测模型,综合已有知识设计适合的算法解决实际问题。 二、作业说明 根据给出的实际数据(包括用户游玩历史,关卡特征等),预测测试集中的用户是否为流失用户(二分类); 方法不限,使用百度云进行评测,评价指标使用 AUC; 提交代码与实验报告,报告展示对数据的观察、分析、最后的解决方案以及不同尝试的对比等; 最终评分会参考达到的效果以及对所尝试方法的分析。

2024-07-07

基于回归分析的大学综合得分预测(数据集+代码+报告)

大学排名是一个非常重要同时也极富挑战性与争议性的问题,一所大学的综合实力涉及科研、师资、学生等方方面面。目前全球有上百家评估机构会评估大学的综合得分进行排序,而这些机构的打分也往往并不一致。在这些评分机构中,世界大学排名中心(Center for World University Rankings,缩写CWUR)以评估教育质量、校友就业、研究成果和引用,而非依赖于调查和大学所提交的数据著称,是非常有影响力的一个。 本任务中我们将根据 CWUR 所提供的世界各地知名大学各方面的排名(师资、科研等),一方面通过数据可视化的方式观察不同大学的特点,另一方面希望构建机器学习模型(线性回归)预测一所大学的综合得分。 二、作业说明 使用来自 Kaggle 的数据,构建「线性回归」模型,根据大学各项指标的排名预测综合得分。 基本要求: 按照 8:2 随机划分训练集测试集,用 RMSE 作为评价指标,得到测试集上线性回归模型的 RMSE 值; 对线性回归模型的系数进行分析。 扩展要求: 对数据进行观察与可视化,展示数据特点; 尝试其他的回归模型,对比效果; 尝试将离散的国家特征融入线性回归模型

2024-07-07

AAAI 会议论文聚类分析(数据集+代码+报告)

本次实验以AAAI 2014会议论文数据为基础,要求实现或调用无监督聚类算法,了解聚类方法。 任务介绍 每年国际上召开的大大小小学术会议不计其数,发表了非常多的论文。在计算机领域的一些大型学术会议上,一次就可以发表涉及各个方向的几百篇论文。按论文的主题、内容进行聚类,有助于人们高效地查找和获得所需要的论文。本案例数据来源于AAAI 2014上发表的约400篇文章,由UCI公开提供,提供包括标题、作者、关键词、摘要在内的信息,希望大家能根据这些信息,合理地构造特征向量来表示这些论文,并设计实现或调用聚类算法对论文进行聚类。最后也可以对聚类结果进行观察,看每一类都是什么样的论文,是否有一些主题。 基本要求: 将文本转化为向量,实现或调用无监督聚类算法,对论文聚类,例如10类(可使用已有工具包例如sklearn); 观察每一类中的论文,调整算法使结果较为合理; 无监督聚类没有标签,效果较难评价,因此没有硬性指标,跑通即可,主要让大家了解和感受聚类算法,比较简单。 扩展要求: 对文本向量进行降维,并将聚类结果可视化成散点图。 注:group和topic也不能完全算是标签

2024-07-07

基于集成学习的 Amazon 用户评论质量预测 (数据集+代码+报告)

主观题 (15分) 一、案例简介¶ 随着电商平台的兴起,以及疫情的持续影响,线上购物在我们的日常生活中扮演着越来越重要的角色。在进行线上商品挑选时,评论往往是我们十分关注的一个方面。然而目前电商网站的评论质量参差不齐,甚至有水军刷好评或者恶意差评的情况出现,严重影响了顾客的购物体验。因此,对于评论质量的预测成为电商平台越来越关注的话题,如果能自动对评论质量进行评估,就能根据预测结果避免展现低质量的评论。本案例中我们将基于集成学习的方法对 Amazon 现实场景中的评论质量进行预测。 二、作业说明 本案例中需要大家完成两种集成学习算法的实现(Bagging、AdaBoost.M1),其中基分类器要求使用 SVM 和决策树两种,因此,一共需要对比四组结果(AUC 作为评价指标): Bagging + SVM Bagging + 决策树 AdaBoost.M1 + SVM AdaBoost.M1 + 决策树 注意集成学习的核心算法需要手动进行实现,基分类器可以调库。 基本要求 根据数据格式设计特征的表示 汇报不同组合下得到的 AUC 结合不同集成学习算法的特点分析结果

2024-07-07

基于决策树的英雄联盟游戏胜负预测(数据+代码+报告包含)

英雄联盟(League of Legends,LoL)是一个多人在线竞技游戏,由拳头游戏(Riot Games)公司出品。在游戏中,每位玩家控制一位有独特技能的英雄,红蓝两支队伍各有五位玩家进行对战,目标是摧毁对方的基地水晶。水晶有多座防御塔保护,通常需要先摧毁一些防御塔再摧毁水晶。玩家所控制的英雄起初非常弱,需要不断击杀小兵、野怪和对方英雄来获得金币、经验。经验可以提升英雄等级和技能等级,金币可以用来购买装备提升攻击、防御等属性。对战过程中一般没有己方单位在附近的地点是没有视野的,即无法看到对面单位,双方可以通过使用守卫来监视某个地点,洞察对面走向、制定战术。 本数据集来自Kaggle,包含了9879场钻一到大师段位的单双排对局,对局双方几乎是同一水平。每条数据是前10分钟的对局情况,每支队伍有19个特征,红蓝双方共38个特征。这些特征包括英雄击杀、死亡,金钱、经验、等级情况等等。一局游戏一般会持续30至40分钟,但是实际前10分钟的局面很大程度上影响了之后胜负的走向。作为最成功的电子竞技游戏之一,对局数据、选手数据的量化与研究具有重要意义

2024-07-07

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除