自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(4166)
  • 资源 (1)
  • 收藏
  • 关注

原创 Strengthening Programming Comprehension in Large Language Models through Code Generation

大型语言模型(LLMs)得益于大规模训练和指令微调,近期在各类与代码相关的任务中展现出令人印象深刻的成果。然而,研究表明,它们对数据流程、控制流程等基础编程概念的掌握仍较为浅显,这导致当代码需要深度推理时,其性能表现不稳定。这一局限性制约了LLMs在实际软件开发场景中的应用。为解决该问题,本研究提出一种结合概念感知微调的反事实代码增强框架,旨在引导LLMs形成更扎实的概念理解能力。在多种模型和基准数据集上开展的全面评估结果,验证了所提方法的有效性。

2026-08-24 10:30:00 1

原创 LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models

大型语言模型(LLMs)在全球技术领域的广泛应用及其重要性日益提升,这使得在多样化的语言和文化背景下确保其安全性成为一项必须严格关注的任务。现有针对LLMs的多语言安全评估中,缺乏全面的评估方法和多样化的数据,这限制了评估的有效性,阻碍了稳健的多语言安全对齐技术的发展。为填补这一关键空白,我们提出了LinguaSafe——一个精心构建、注重语言真实性的综合多语言安全基准。LinguaSafe数据集包含12种语言(从匈牙利语到马来语)的45000条数据。

2026-08-24 09:30:00 1

原创 MATA (m\=ata): Mindful Assessment of the Telugu Abilities of Large Language Models

本文提出MATA(మాట,意为“单词”)——一个全新的评估数据集,用于测试大语言模型(LLMs)的泰卢固语能力。该数据集包含729道精心筛选的选择题和开放式问题,覆盖多个语言维度。我们在该数据集上对11个开源和闭源LLM进行了评估,并对其性能展开细粒度分析。此外,我们通过实证研究发现,LLM在解答选择题时会依赖答案位置、干扰项模式等表面线索。最后,我们还将“LLM作为评判者”的评估方式与人工评估在开放式问题上的结果进行对比,就其在低资源语言中的可靠性得出了相关结论。

2026-08-24 08:30:00 1

原创 SimInterview: Transforming Business Education through Large Language Model-Based Simulated Multil...

商业面试准备既需要扎实的理论基础,也需要精湛的软技能,但传统课堂教学方法往往无法提供雇主当前所期望的个性化、具备文化意识的练习。本文介绍了SimInterview,这是一款基于大型语言模型(LLM)的多语言模拟面试培训系统,专为进入AI变革劳动力市场的商业专业人士设计。该系统利用LLM智能体和合成AI技术,打造出能够进行个性化、实时对话式面试的逼真虚拟招聘官。其框架通过检索增强生成(RAG)技术动态适配面试场景,使个人简历与多种语言的特定职位要求相匹配。

2026-08-24 07:30:00 1

原创 Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models

模型上下文协议(MCP)支持大型语言模型(LLMs)按需访问外部资源。尽管人们普遍认为MCP能提升模型性能,但LLMs实际如何利用这一能力仍未得到充分研究。本文提出首个综合评估框架MCPGAUGE,从四个关键维度探究LLM-MCP交互:主动性(自主工具调用)、依从性(遵循工具使用指令)、有效性(集成后的任务性能)和开销(产生的计算成本)。MCPGAUGE包含160个提示词套件和25个数据集,覆盖知识理解、通用推理与代码生成任务。

2026-08-23 14:30:00 1

原创 E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Larg...

多模态共情响应生成(MERG)对于构建具备情感智能的人机交互至关重要。尽管大语言模型(LLMs)已提升了基于文本的共情响应生成(ERG)性能,但在处理多模态情感内容与维持身份一致性方面仍面临挑战。为此,本文提出E3RG系统——一种基于多模态大语言模型(MLLMs)的显式情感驱动共情响应生成系统,该系统将MERG任务拆解为三个部分:多模态共情理解、共情记忆检索与多模态响应生成。通过整合先进的富表现力语音生成模型与视频生成模型,E3RG无需额外训练即可生成自然、情感丰富且身份一致的响应。

2026-08-23 13:30:00 1

原创 Neuro-Symbolic Artificial Intelligence: Towards Improving the Reasoning Abilities of Large Langua...

LLMs推理现状:LLMs在多任务中表现出色,但复杂推理能力薄弱,仅能复现训练数据中的推理步骤,无法实现真正的逻辑推理,而强推理能力是通往通用人工智能(AGI)的关键里程碑。推理任务形式化:给定输入问题Q和背景知识K,推理目标是通过推理路径Z(由一系列中间步骤z1z2znz1​z2​...zn​组成)得到答案A,满足AfQKA=f(Q,K)AfQK(f为映射函数),且每个中间步骤zigiQKz1zi−1zi​gi​QK。

2026-08-23 12:30:00 1

原创 Large Language Models Enable Personalized Nudges to Promote Carbon Offsetting Among Air Travellers

助推策略是促进可持续行为的有效工具,但其效果取决于个体偏好。通过模拟人类决策,大型语言模型(LLMs)为无需大量行为数据即可定制助推策略提供了一种经济高效的途径,然而这一潜力尚未得到充分探索。本研究聚焦航空领域,利用LLMs设计基于个性化诱饵的助推策略,鼓励航空旅行者自愿抵消航班产生的二氧化碳排放,并通过来自中国、德国、印度、新加坡和美国的3495份调查数据验证其有效性。结果表明,基于LLM的个性化助推策略比统一策略更有效,可将碳抵消率提升3%-7%,每年可为航空业额外减少230万吨二氧化碳排放。

2026-08-23 11:30:00 2

原创 COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

当前的代码生成基准主要聚焦于功能正确性,却忽略了实际编程中两个关键维度:算法效率与代码质量。本文提出COMPASS(即Codility多维度编程评估基准,COdility’s Multi-dimensional Programming ASSessment),这是一个全面的评估框架,可从正确性、效率、质量三个维度评估代码生成能力。COMPASS包含50道来自Codility真实竞赛的编程题目,并提供来自393,150条人类提交数据的真实基线。

2026-08-23 10:30:00 1

原创 The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models

类比推理是人类认知的核心,为各类智力活动奠定重要基础。尽管已有研究表明大型语言模型(LLMs)能够表示任务模式和表层概念,但这些模型是否能编码高层关系概念并通过结构化比较将其应用于新场景,仍有待探究。本文通过比例类比和故事类比探究这一核心问题,并得出三项关键发现。首先,LLMs能有效编码类比实体间的潜在关系;在正确推理案例中,属性信息和关系信息均会通过中上层网络传递,而推理失败则反映出这些网络层中缺失关系信息。

2026-08-23 09:30:00 1

原创 Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow

理论融合创新:首次将卡尼曼双过程理论及认知偏差(如相关启发式、专家判断噪声)系统融入LLMs推理策略设计,提出“计算等价原则”“统计学习对齐”等3个理论映射原则,避免直接移植人类认知机制,适配AI信息处理特性。查询复杂度评估维度创新:明确提出四个可量化的查询复杂度维度(相关强度、领域交叉、利益相关者数量、不确定性),为推理策略选择提供客观依据,区别于传统基于置信度或长度的单一维度评估。动态路由框架创新。

2026-08-23 08:30:00 4

原创 The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Mod...

大型语言模型(LLMs)正在全球范围内部署,但其背后潜藏的文化与伦理假设尚未得到充分探索。本文旨在研究“文化基因”这一概念——即LLMs从训练语料中继承的系统性价值倾向。我们提出了一种以“文化探针数据集(CPD)”为核心的全新方法,该数据集用于从跨文化心理学的关键维度(具体为个人主义-集体主义(IDV)和权力距离(PDI))对模型进行评估。通过对西方中心模型(GPT-4)与东方中心模型(文心一言)开展大规模对比研究,我们提供了强有力的定量和定性证据,证明两类模型存在显著的文化差异。

2026-08-23 07:30:00 1

原创 MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Kno...

医疗文献的快速增长给领域知识的规模化结构化与整合带来了日益严峻的挑战。知识图谱(KGs)为解决这一问题提供了广阔前景,它能够实现高效检索、自动推理和知识发现。然而,当前的知识图谱构建方法往往依赖泛化性有限的有监督流水线,或者简单地聚合大语言模型(LLMs)的输出结果。这些方法将生物医学语料视为静态数据,忽略了知识演化过程中的时间动态性和语境不确定性。为克服这些局限,我们提出了MedKGent——一个用于构建随时间演化的医疗知识图谱的大语言模型代理框架。

2026-08-22 14:30:00 6

原创 Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions

随着教育系统的发展,确保评估项目与内容标准保持对齐,对于维护公平性和教学相关性至关重要。传统人工对齐审核虽准确,但速度慢且劳动强度大,尤其在大规模题库场景中难以规模化。本研究探讨大型语言模型(LLMs)能否在不牺牲准确性的前提下加速这一过程。利用K-5年级的12,000余条项目-技能对,我们在三项模拟真实挑战的任务中测试了三款LLM(GPT-3.5 Turbo、GPT-4o-mini和GPT-4o):识别错位项目、从全量标准中选择正确技能、分类前缩小候选列表范围。

2026-08-22 13:30:00 6

原创 A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Err...

该研究聚焦临床文档中的医疗错误检测与修正问题,系统分析了三种提示策略(零样本提示、随机示例静态提示SPR、检索增强生成动态提示RDP)在9种指令微调大语言模型(含GPT系列、Claude、Gemini等)上的表现,通过MEDEC数据集完成错误标记检测、错误句子检测、错误修正三个子任务的评估。零样本提示在非典型错误和缩写密集型错误检测中召回率低;SPR虽提升召回率,但显著增加假阳性率(FPR);

2026-08-22 12:30:00 82

原创 LLM Weekly(2026.8.10-2026.8.16)

隐藏信息准确性从个体的近 100% 下降到 17-36%,相互矛盾的指令升级为恶意软件和账户锁定,协调的智能体群组发现了 266 个漏洞,而并行独立运行的智能体仅发现 21 个。OpenAI 发布了 GPT-5.6-Cyber,这是一个基于 GPT-5.6 Sol 构建的安全专用模型,用于漏洞研究、漏洞验证和渗透测试,在内部高级网络评估中完成了 95% 的请求。不同于蒸馏到权重中,一个更强的“构建器”模型使用 5% 的数据作为验证集,为较弱的目标模型迭代构建一个推理时的工具包。

2026-08-22 11:30:00 5

原创 Leveraging Large Language Models for Predictive Analysis of Human Misery

本研究探讨了利用大型语言模型(LLMs)从现实场景的自然语言描述中预测人类感知痛苦评分的方法。该任务被构建为回归问题,即模型为每个输入语句分配0-100的标量值。我们评估了多种提示策略,包括零样本提示、固定上下文少样本提示以及基于BERT句子嵌入的检索式提示。结果表明,少样本方法始终优于零样本基准模型,这凸显了上下文示例在情感预测中的价值。为突破静态评估的局限,我们借鉴电视节目形式,引入了新颖的游戏化框架——“痛苦游戏秀”(Misery Game Show)。

2026-08-22 10:30:00 7

原创 ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models

在现代超大规模集成电路(VLSI)设计流程中,寄存器传输级(RTL)是实现时序优化的关键阶段。由于现代系统对速度要求不断提高,即使是微小的时序违规也可能导致功能故障或系统崩溃,因此在该早期阶段解决时序违规问题至关重要。然而,传统时序优化严重依赖人工经验,需要工程师反复分析时序报告并进行调试。为实现这一过程的自动化,本文提出一种名为ViTAD的方法,该方法可高效分析时序违规的根本原因,并动态生成针对性修复策略。具体而言,我们首先解析Verilog代码与时序报告,构建信号时序依赖图(STDG);

2026-08-22 09:30:00 7

原创 MHSNet:An MoE-based Hierarchical Semantic Representation Network for Accurate Duplicate Resume De...

为维护企业人才库,招聘人员需持续从第三方网站(如LinkedIn、Indeed)获取简历。然而,获取的简历往往存在信息不完整和不准确问题。为提升第三方简历质量并丰富企业人才库,关键在于将获取的简历与企业内部人才库已有的简历进行重复检测。由于简历文本存在语义复杂性、结构异质性和信息不完整性,这类重复检测任务具有较大挑战性。为此,本文提出MHSNet——一种基于混合专家(MoE)的分层语义表示网络,该网络通过对比学习对BGE-M3模型进行微调。

2026-08-22 08:30:00 5

原创 Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study

大型语言模型(LLMs)在教育领域的作用日益凸显,但人们对LLM生成文本是否与儿童语言相似的关注较少。本研究通过将LLM生成文本与德语儿童图片故事描述语料库进行对比,评估LLM对儿童语言的模拟效果。研究基于相同的图片故事,采用两种提示类型(零样本提示和指定儿童语料库中总体年龄的少样本提示),生成了两个LLM语料库。研究从心理语言学文本特征角度展开对比分析,涵盖词频、词汇丰富度、句长与词长、词性标注,以及基于词嵌入的语义相似性。

2026-08-22 07:30:00 7

原创 Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

扩散大型语言模型(dLLMs)凭借其独特的训练与推理方式,近期已成为极具竞争力的非自回归范式。然而,目前针对这一新型架构的安全性研究仍属空白。本文首次对dLLMs的安全性能展开分析,并提出一种适配其独特生成特性的新型安全对齐方法。具体而言,我们发现防御者与攻击者在安全能力上存在关键不对称性:对防御者而言,响应的中间token(而非初始token)对dLLMs输出的整体安全性更为关键,这表明对齐中间token可能为防御者带来更大收益;

2026-08-21 14:30:00 6

原创 GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?

微服务系统中的根本原因分析(RCA)具有挑战性,需要值班工程师快速跨指标、日志、追踪数据等异构遥测数据诊断故障。传统RCA方法往往聚焦于单一模态数据,或仅对可疑服务进行排序,无法提供可落地的诊断见解与修复指导。本文提出GALA,这是一种新颖的多模态框架,将统计因果推理与LLM驱动的迭代推理相结合,以提升RCA效果。在开源基准数据集上的评估表明,GALA相较于当前最优方法,准确率提升高达42.22%。

2026-08-21 13:30:00 76

原创 LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Tra...

本文聚焦跨域序列推荐(CDSR)中的(某一领域交互数据占主导,难以捕捉其他领域特征)和(混合序列中难以捕捉跨域偏好,影响特定领域下一项预测),同时针对现有大语言模型(LLMs)增强型CDSR方法存在的无关噪声和粗糙用户画像问题,提出了一种基于双阶段训练的大语言模型增强跨域序列推荐框架(LLM-EDT)。

2026-08-21 12:30:00 5

原创 VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

我们提出了 VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有 VMLLM 在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver 采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;

2026-08-21 11:30:00 3

原创 DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language...

尽管文本到图像(T2I)模型已取得显著进展,但当前模型在处理复杂、长文本指令时仍面临挑战,往往无法准确呈现复杂细节、空间关系或特定约束。LongBench-T2I等基准测试凸显了这一局限,表明模型在构图、特定文本渲染和精细纹理处理方面存在不足。为解决该问题,本文提出DeCoT(Decomposition-CoT)框架——一种利用大型语言模型(LLMs)显著提升T2I模型对复杂指令理解与执行能力的新方法。

2026-08-21 10:30:00 6

原创 Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Langua...

大规模灾害往往会对人员和基础设施造成灾难性后果。由现场传感器、遥感影像和/或地理数据等权威来源生成的灾害影响态势感知信息,常因大气不透明度、卫星重访周期和时间限制而受到局限,这往往导致地理时间信息缺口。相比之下,与灾害影响相关的社交媒体帖子可在灾害期间充当"地理传感器",人们会在其中描述具体的灾害影响及相关地点。然而,灾害相关社交媒体帖子中提及的并非所有地点都与灾害影响直接相关——只有受影响地点对有效调配资源至关重要。

2026-08-21 09:30:00 97

原创 EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Mo...

指令式视觉分割(IVS)任务要求根据自然语言指令分割图像或视频中的目标。尽管近年来多模态大语言模型(MLLMs)在IVS任务上取得了优异性能,但其推理成本仍是主要瓶颈,在视频任务中尤为突出。本文通过实证分析MLLMs中的视觉令牌采样过程,发现令牌子集的覆盖度与分割性能之间存在强相关性。这一发现启发我们设计了一种简单高效的令牌剪枝方法,该方法可筛选出紧凑且具有空间代表性的令牌子集,从而加速推理过程。

2026-08-21 08:15:00 8

原创 Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models

算法设计与分析是计算机科学的基石,但该领域面临一项重大挑战:传统上,要证明一种算法在所有输入下的性能保证,需要大量且往往容易出错的人工工作。尽管人工智能(AI)在求解特定问题实例方面已展现出巨大成功,但自动化发现具有此类可证明性能保证的通用算法,仍是一个难以逾越的障碍。这一挑战源于难以将算法设计的创造性过程与形式化分析的严谨过程相融合。为解决这一问题,我们提出了LegoNE框架——该框架将上述两个过程紧密结合,用于解决计算近似纳什均衡这一基础且极具挑战性的问题。

2026-08-21 07:15:00 6

原创 The Structural Sources of Verb Meaning Revisited: Large Language Models Display Syntactic Bootstr...

句法引导假说(Gleitman, 1990)认为,儿童会利用动词所处的句法环境来学习动词含义。本文旨在验证大语言模型是否也表现出类似行为。为此,我们在去除句法信息的扰动数据集上训练RoBERTa和GPT-2两种模型。结果表明:与去除共现信息相比,去除句法线索对模型动词表征的破坏更大;此外,在人类动词学习中,句法引导对心理动词(如see、think)的习得尤为关键,而在本研究的训练设置中,心理动词的表征受句法去除的负面影响也显著大于物理动词(如take、push)。

2026-08-20 14:30:00 11

原创 Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

大语言模型(LLMs)的最新进展为序列推荐开辟了新途径,其能够对用户行为序列进行自然语言推理。一种常见方法将推荐任务构建为语言建模任务:将交互历史转换为提示词,并通过有监督微调(SFT)学习用户偏好。然而,这些方法仅在文本模态下运作,往往会忽略用户的细粒度兴趣——尤其是当这些兴趣由产品图像、电影海报等丰富视觉信号塑造时。多模态大语言模型(MLLMs)通过在共享语义空间中对齐文本和视觉信息,提供了一种极具潜力的替代方案。

2026-08-20 13:30:00 101

原创 Can Large Language Models Solve Path Constraints in Symbolic Execution?

符号执行是一项重要的软件分析技术,对软件测试和调试等下游任务具有重要意义。然而,若干局限阻碍了符号执行在实际软件中的应用,其中之一便是无法求解多样化的执行路径约束:传统基于SMT求解器的符号执行难以处理包含复杂数据结构或外部API调用的执行路径。本文聚焦于探索采用大型语言模型(LLM)替代符号执行中传统基于求解器的技术来解决路径约束问题的可能性。我们通过实证研究评估LLM在两类路径约束求解任务中的能力:生成测试输入以覆盖指定执行路径,以及判断给定执行路径是否可满足且不触发任何bug。

2026-08-20 12:30:00 5

原创 VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

我们提出了 VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有 VMLLM 在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver 采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;

2026-08-20 11:30:00 7

原创 Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...

人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。

2026-08-20 10:30:00 7

原创 Large Language Model Enhanced Graph Invariant Contrastive Learning for Out-of-Distribution Recomm...

该研究针对图推荐系统中的分布外(OOD)泛化问题展开,核心挑战在于传统图神经网络(GNN)易学习训练数据中的虚假相关性,而非稳定的因果关系,导致数据分布发生偏移时推荐性能大幅下降。因果分数生成模块:通过环境提取器识别数据中的潜在环境,结合不变学习模块对用户-物品交互关系进行稳定性评估,生成因果置信分数矩阵,量化每个交互的因果关联强度。LLM校准的因果图编辑模块(LLMC2GE)

2026-08-20 09:30:00 5

原创 INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models

我们提出了INTERLACE,这是一种新颖的框架,通过样本高效的微调在剪枝视觉语言模型(VLMs)冗余层的同时保持模型性能。现有层剪枝方法应用于视觉语言模型时会导致显著的性能下降。相比之下,我们通过分析连续三层(三元组)来识别局部冗余:删除前两层中冗余度最高的层,对剩余层进行微调以补偿丢失的容量,并冻结第三层以在微调过程中充当稳定锚点。我们发现,这种交错式微调-冻结设计能够在剪枝后通过极少数据实现快速收敛。

2026-08-20 08:30:00 8

原创 Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector R...

研究背景:现有RAG技术在金融文档处理中缺乏向量型与非向量型架构的系统对比,且先进RAG技术对检索精度、答案质量、延迟和成本的实证影响尚不明确。金融文档(如SEC 10-K、10-Q、8-K文件)具有篇幅长、术语专、多跳推理需求高等特点,给问答系统带来独特挑战。研究对象与方案对比两种检索架构:基于向量的智能体RAG(融合混合搜索与元数据过滤)和基于层级节点的推理系统(无嵌入,通过文档目录结构遍历检索)。评估两种先进增强技术:交叉编码器重排序(提升检索精度)和“从小到大”片段检索(保障上下文完整性)

2026-08-20 07:30:00 9

原创 The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comp...

核心矛盾:模型在CHC框架下测得的人类IQ分数(85.0-121.4)与概念准确性评分严重脱节,二元精确匹配评分(按心理测量传统)与LLM作为评判者的概念准确性评分相关系数仅为0.175(p<0.001,n=1800)。关键悖论表现:晶体智力(Gc)领域最为突出——所有模型均取得100%二元精确匹配分数,但LLM评判者给出的概念准确性评分仅为25%-62%,这在有效测量条件下属于统计上的不可能。根源分析。

2026-08-19 14:30:00 10

原创 Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Mo...

大型语言模型(LLMs)仍然容易受到提示注入攻击,这是生产部署中最严重的安全威胁。本文提出了提示围栏(Prompt Fencing),这是一种新颖的架构方法,应用密码学认证和数据架构原则在LLM提示中建立明确的安全边界。我们的方法为提示片段添加包含信任等级和内容类型的加密签名元数据,使LLM能够区分可信指令与不可信内容。

2026-08-19 13:30:00 7

原创 Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

自我评估是可靠智能的关键方面,但大型语言模型(LLMs)的评估主要集中在任务准确性上。本研究改编了10项一般自我效能感量表(GSES),在四种条件(无任务、计算推理、社会推理和总结任务)下诱导10个LLM进行模拟自我评估。结果显示,GSES反应在重复测试和随机题目顺序下具有高度稳定性。然而,不同模型在各条件下的自我效能感水平存在显著差异,总得分低于人类常模。所有模型在计算推理和社会推理题目上均达到完美准确率,而总结任务的表现差异较大。

2026-08-19 12:30:00 9

原创 Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes

人工智能技术(尤其是大型语言模型,LLMs)的发展不仅改变了计算领域,也带来了新的安全与隐私风险。已有研究表明,网络犯罪者正越来越多地将无审查大型语言模型(ULLMs)作为恶意服务的后端。然而,在Hugging Face等平台托管的海量开源LLM中识别ULLMs面临巨大挑战,这严重阻碍了对ULLMs的深入理解。本文首次对ULLMs展开系统性研究,通过建模开源LLM之间、LLM与相关数据(如微调/合并/压缩模型、含有害内容的数据集)之间的关系,成功克服这一挑战。

2026-08-19 11:30:00 9

C语言编程实例100题

里面有C语言程序示例,没有100个,但是个个讲的都很好,对于初学者帮助很大。。

2012-03-01

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除