UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Cri...
本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(Adversarial Rewards and Critical State Identification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。关键状态识别机制。原创 2026-10-09 08:00:00 · 3 阅读 · 0 评论 -
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
本文提出了一种名为Unified Reward & Policy Optimization(URPO,统一奖励与策略优化)的新型框架,旨在解决传统大型语言模型(LLMs)对齐流程中存在的复杂性、资源密集性和性能天花板问题。传统的强化学习从人类反馈中学习(RLHF)流程通常将策略模型(“玩家”)与单独训练的奖励模型(“裁判”)分离,奖励模型在强化学习阶段参数固定,导致静态奖励信号限制模型性能。统一模型与训练阶段:让单个模型同时承担“玩家”(指令遵循)和“裁判”(奖励建模)角色,在单一训练阶段完成优化;原创 2026-10-09 07:00:00 · 3 阅读 · 0 评论 -
SiLQ: Simple Large Language Model Quantization-Aware Training
本文提出了一种名为的简单大语言模型量化感知训练方法,旨在解决大语言模型(LLMs)量化过程中精度损失、训练成本高及与专用推理加速器兼容性的问题。核心目标:通过量化降低LLMs的推理延迟、模型大小和能耗,同时最小化精度损失,并确保与专用推理加速器兼容。方法流程在模型中添加量化操作,使用直通估计器(straight through estimator)计算训练时的梯度;通过校准初始化量化器步长,再使用LSQ(Learned Step Size Quantization)进一步优化;原创 2026-10-07 07:30:00 · 111 阅读 · 0 评论 -
Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled V...
本文针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在液冷与空冷的8×NVIDIA H100 GPU系统上的性能与能效进行了基准测试。研究通过GPU Burn、Weights & Biases、IPMItool等工具收集热学、功率及计算数据,对比了两种冷却系统的表现。结果显示:液冷系统能将GPU温度稳定在41–50°C,而空冷系统温度波动在54–72°C;原创 2026-10-07 06:30:00 · 86 阅读 · 0 评论 -
Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabili...
本文针对大型语言模型(LLMs)在基于威胁的操纵下的表现进行了系统性研究,从脆弱性和性能提升机会的双重视角展开分析。研究选取了Claude、GPT-4、Gemini三个主流LLM,在10个任务领域(涵盖政策评估、司法推理、医疗伦理等)和6种威胁条件(如权威压力、角色责任、时间限制等)下,收集了3390条实验响应。研究通过构建新的威胁分类法和多指标评估框架(包含11个评估维度,如分析深度、确定性、领域适配性等),量化了威胁操纵的负面影响(如脆弱性)和正面效应(如性能提升)。原创 2026-10-06 23:30:00 · 7 阅读 · 0 评论 -
LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language ...
本文提出了一种名为LLMxCPG的新型框架,旨在解决现有基于深度学习的软件漏洞检测方法在准确性、鲁棒性和对复杂代码库分析能力上的局限性。基于CPG的切片构建:利用静态应用安全测试工具Joern及其CPGQL查询语言提取潜在漏洞执行路径,通过反向切片技术构建仅包含漏洞相关核心代码的切片,将代码量减少67.84%至90.93%,同时保留关键上下文。双模型架构:包含LLMxCPG-Q(生成CPGQL查询以提取漏洞路径)和LLMxCPG-D(对切片进行分类以判断是否存在漏洞),均基于现有LLM微调。性能表现。原创 2026-10-06 22:30:00 · 8 阅读 · 0 评论 -
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the cont...
自动语音识别(ASR)在人机交互中扮演着关键角色,是众多应用的接口。传统上,ASR性能通过词错误率(WER)评估,该指标量化生成转录文本中的插入、删除和替换错误数量。然而,随着大型且强大的大型语言模型(LLM)越来越多地被用作各类应用的核心处理组件,ASR不同类型错误在下游任务中的重要性值得进一步探索。本文分析了LLM纠正ASR引入错误的能力,并提出了一种新的度量方法,用于评估LLM驱动应用中的ASR性能。原创 2026-10-06 20:30:00 · 7 阅读 · 0 评论 -
Exploring Gender Bias in Large Language Models: An In-depth Dive into the German Language
近年来,学界提出了多种评估大型语言模型(LLMs)中性别偏见的方法。一个核心挑战在于,最初为英语开发的偏见测量方法在应用于其他语言时的可迁移性。本研究旨在通过提出五个用于评估LLMs性别偏见的德语数据集,为这一研究方向做出贡献。这些数据集基于已确立的性别偏见概念构建,并可通过多种方法使用。对八个多语言LLM模型的评估结果揭示了德语中性别偏见的独特挑战,包括男性职业术语的模糊解读,以及看似中性的名词对性别感知的影响。本研究有助于理解跨语言背景下LLMs中的性别偏见,并强调了定制化评估框架的必要性。原创 2026-10-06 21:30:00 · 7 阅读 · 0 评论 -
Exploring Large Language Models for Analyzing and Improving Method Names in Scientific Code
本文聚焦于大型语言模型(LLMs)在分析和改进科学代码中方法名的应用,通过对4个主流LLMs(Google Gemini、Alibaba Qwen 2.5 Coder 32B、Meta LLaMa 3.3 70B、DeepSeek-R1 70B)的评估,探索其在科学代码方法名优化中的有效性。LLMs能否有效识别和分类方法名的语法模式(如词性标注);LLMs提出的方法名改进建议是否符合软件工程最佳实践。原创 2026-10-06 19:30:00 · 6 阅读 · 0 评论 -
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlig...
随着视频内容的指数级增长,个性化视频高亮已成为一项关键任务,因为用户偏好具有高度的变异性和复杂性。然而,现有的视频数据集往往缺乏个性化,它们依赖于孤立的视频或简单的文本查询,无法捕捉用户行为的复杂性。在本研究中,我们提出了HIPPO-VIDEO——一个用于个性化视频高亮的新型数据集。该数据集通过基于大语言模型(LLM)的用户模拟器生成真实的观看历史,以反映多样化的用户偏好。该数据集包含2040组(观看历史,显著性分数)对,覆盖170个语义类别下的20400个视频。原创 2026-10-06 18:30:00 · 10 阅读 · 0 评论 -
eX-NIDS: A Framework for Explainable Network Intrusion Detection Leveraging Large Language Models
研究背景:现有基于深度学习的网络入侵检测系统(NIDS)虽性能优异,但缺乏可解释性,传统可解释AI技术(如SHAP)存在依赖机器学习知识、仅关注统计异常、缺乏上下文信息等局限;大型语言模型(LLMs)在网络安全领域的可解释性应用尚未充分探索,且直接使用易出现幻觉(生成不实信息)和误解释。核心框架。原创 2026-10-06 17:30:00 · 6 阅读 · 0 评论 -
Distilled Large Language Model in Confidential Computing Environment for System-on-Chip Design
研究背景:LLMs在SoC设计等计算机辅助设计(CAD)任务中应用广泛,但涉及的敏感数据(如RTL设计、电路规格)存在泄露风险。可信执行环境(TEEs)为保护数据和模型提供了可能,但现有TEE(如Intel SGX)难以高效支持资源密集型的LLMs。实验设计。原创 2026-10-06 16:30:00 · 6 阅读 · 0 评论 -
Advancing Visual Large Language Model for Multi-granular Versatile Perception
本文针对计算机视觉中的感知任务,提出了一个名为的统一框架。感知任务可按两个维度分为四类:预测类型(边界框/掩码)和指令类型(基于词/基于句子)。现有研究多仅覆盖部分任务组合,限制了通用性。MVP-LM通过整合多粒度解码器、Chain-of-Thought(CoT)启发的数据集统一策略和查询增强策略,实现了在单一架构中处理全景分割、目标检测、视觉定位、指代表达式分割等多类任务。实验表明,MVP-LM在词级和句子级感知任务的多个基准测试中表现优异,验证了其有效性。原创 2026-10-06 15:30:00 · 6 阅读 · 0 评论 -
Do Large Language Models Have a Planning Theory of Mind? Evidence from MindGames: a Multi-Step Pe...
本文聚焦大语言模型(LLMs)是否具备“规划心智理论”(Planning Theory of Mind, PToM),即通过推断他人信念和需求来动态规划行动、干预其心智状态以达成目标的能力。研究团队设计了名为MINDGAMES的多轮说服任务,要求参与者(人类或LLM)通过选择性披露信息,说服目标 agent 选择自己偏好的方案。REVEALED 条件:参与者已知目标的偏好和信息状态,仅需预测信息披露的效果;HIDDEN 条件:参与者需通过互动对话推断目标的偏好和信息状态,进行多步骤反事实规划。原创 2026-10-06 14:30:00 · 8 阅读 · 0 评论 -
Efficient Compositional Multi-tasking for On-device Large Language Models
本文聚焦于设备端大型语言模型(LLMs)的高效组合多任务处理问题。现有基于适配器(如LoRA)的模型合并方法仅能处理单个测试样本对应单一任务的场景,而实际应用中常需同时执行多个任务(如生成翻译后的摘要需同时完成翻译和摘要任务)。为此,本文提出:1)一个包含4个实用组合任务的基准测试集(如“摘要+翻译”“回复+语气调整”等),每个任务结合一个主任务(如摘要生成)和一个辅助任务(如翻译);原创 2026-10-06 13:30:00 · 6 阅读 · 0 评论 -
Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction
大型语言模型(LLMs)的快速发展为辅助机器人的灵活、通用知识驱动人机交互(HRI)系统创造了令人兴奋的潜力。现有HRI系统在解读和遵循用户指令、生成动作及解决机器人任务方面已取得显著进展。然而,在协作任务中对用户的双向、多模态、上下文感知支持仍是一个未解决的挑战。本文提出了一种基于注视和语音的辅助机器人交互界面,该界面能够通过多视觉输入感知工作环境,并为动态中的用户提供任务支持。我们的系统采用模块化设计,可迁移至不同任务和机器人;由于基于语言的交互状态表示和快速机载感知模块,其具备实时处理能力。原创 2026-10-06 12:30:00 · 9 阅读 · 0 评论 -
Chinchunmei at SemEval-2025 Task 11: Boosting the Large Language Model‘s Capability of Emotion Pe...
本文是针对SemEval-2025 Task 11(“基于文本的情感检测鸿沟填补”)的研究成果,该任务涉及28种语言的情感识别,包含两个赛道:多标签分类(Track A)和情感强度预测(Track B),涵盖愤怒、恐惧、喜悦、悲伤、惊讶、厌恶六种情感。基于样本的对比学习(Contrastive Reasoning Calibration, CRC):通过比较两个样本生成更可靠的预测;基于生成的对比学习(DPO、SimPO):训练模型区分正确与错误的生成结果,优化预测。原创 2026-10-06 11:30:00 · 9 阅读 · 0 评论 -
MUR: Momentum Uncertainty guided Reasoning for Large Language Models
大型语言模型(LLMs)在推理密集型任务上已取得令人瞩目的性能,但优化其推理效率仍是一个亟待解决的挑战。尽管测试时缩放(TTS)方法提高了推理质量,但往往会导致“过度思考”——在冗余计算上浪费token。本文研究如何在无需额外训练的情况下,高效且自适应地引导LLM的测试时缩放。受物理学中“动量”概念的启发,我们提出了动量不确定性引导推理(MUR),通过跟踪和聚合随时间变化的逐步不确定性,为关键推理步骤动态分配思考预算。为支持灵活的推理时控制,我们引入了γ-control机制,通过单一超参数调整推理预算。原创 2026-10-06 10:30:00 · 9 阅读 · 0 评论 -
The Prompt Makes the Person(a): A Systematic Evaluation of Sociodemographic Persona Prompting for...
本文系统评估了大型语言模型(LLMs)中社会人口统计学角色提示(sociodemographic persona prompting)的效果,重点探究不同提示策略对模型模拟15个交叉人口群体(如种族、性别交叉)的影响。角色采用格式:直接式(如“You are a…”)、第三人称式(如“Think of a…”)、采访式(如问答对话);人口统计学启动策略。原创 2026-10-06 09:30:00 · 8 阅读 · 0 评论 -
Compositional Coordination for Multi-Robot Teams with Large Language Models
本文提出了一种名为的新型框架,旨在利用大语言模型(LLMs)简化和泛化多机器人协调流程。传统的多机器人协调依赖专家手动将自然语言任务描述转化为数学模型、算法和可执行代码,存在耗时、非专家难以使用、对任务需求变化适应性差等问题。任务分析(Mission Analysis):将自然语言任务描述解析为行为树(behavior trees),明确任务分解、依赖关系、机器人分配、约束条件等;代码生成(Code Generation)原创 2026-10-06 08:30:00 · 139 阅读 · 0 评论 -
MD-LLM-1: A Large Language Model for Molecular Dynamics
分子动力学(MD)是建模分子系统的强大方法,但在许多具有生物学意义的大分子系统的空间和时间尺度上,其计算成本仍然很高。为了探索深度学习在解决这一问题上的潜力,我们引入了分子动力学大型语言模型(MD-LLM)框架,以说明如何利用大型语言模型(LLMs)学习蛋白质动态并发现训练中未见过的状态。通过将这一方法的首个实现(MD-LLM-1,通过微调Mistral 7B获得)应用于T4溶菌酶和Mad2蛋白系统,我们发现,在单一构象状态上训练能够实现对其他构象状态的预测。原创 2026-10-06 07:30:00 · 9 阅读 · 0 评论 -
Measuring and Analyzing Intelligence via Contextual Uncertainty in Large Language Models using In...
本文聚焦大型语言模型(LLMs)的内在信息处理机制,提出了一种基于信息论的任务无关方法,通过量化“认知轮廓”(Cognitive Profile)分析模型的智能特征。核心思路是利用“熵衰减曲线”(Entropy Decay Curve)追踪模型的归一化预测不确定性随上下文长度的变化,并引入“信息增益跨度”(IGS)指数总结曲线特征。模型规模显著影响认知轮廓:大模型(如Llama 3.3)的熵衰减曲线下降更剧烈,能从“发散思考”快速过渡到“精确推理”;小模型的曲线更平缓,长上下文下不确定性仍较高。原创 2026-10-06 06:30:00 · 85 阅读 · 0 评论 -
Understanding Large Language Models‘ Ability on Interdisciplinary Research
近年来,大型语言模型(LLMs)的进展揭示了它们在复杂领域中执行多步骤、逻辑驱动推理的惊人能力,使它们成为科学发现中的强大工具和合作者,同时挑战了“灵感驱动的构思是人类独有的”这一长期观点。然而,缺乏一个专门的基准来评估LLMs在跨学科研究(IDR)场景中提出思想的能力,这严重阻碍了对其优势和局限性的充分理解。为填补这一空白,我们引入了IDRBench——一个开创性的基准,包含专家标注的数据集和一套专门设计的任务,用于评估LLMs从不同科学领域中为跨学科研究提出有价值研究思想的能力。原创 2026-10-05 23:30:00 · 6 阅读 · 0 评论 -
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are A...
大型语言模型(LLMs)已通过多种问题类型进行评估,例如选择题、判断题和长短简答题。本研究探讨了一个尚未被研究的问题:不同问题类型对LLM在推理任务上的准确性有何影响?我们通过定量推理和演绎推理任务,研究了5个LLM在三种不同问题类型上的表现。评估指标包括推理步骤的准确性和最终答案的选择准确性。主要发现:(1)不同问题类型下,LLM的表现存在显著差异;(2)推理准确性与最终答案选择准确性不一定相关;(3)选项数量和用词选择会影响LLM的表现。原创 2026-10-05 22:30:00 · 7 阅读 · 0 评论 -
Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Larg...
本文聚焦多模态大型语言模型(MLLMs)中的“物体幻觉”问题(即模型生成图像中不存在的物体等事实错误输出),深入探究了模型先验知识在中间层对视觉信息的抑制机制。研究发现,中间层的视觉事实知识与原始输入和纯文本输入的概率分布差异(通过JS散度量化)具有相似的演化趋势。动态目标层选择:通过计算中间层原始输入与纯文本输入的JS散度,选择散度最大的中间层作为目标层(该层含最丰富的视觉事实知识);视觉事实知识解码。原创 2026-10-05 21:30:00 · 7 阅读 · 0 评论 -
Applying the Chinese Wall Reverse Engineering Technique to Large Language Model Code Editing
本文聚焦代码大语言模型(Code LLM)的版权争议与性能提升问题。核心背景是:主流商业代码大语言模型(如GPT-4、Gemini 2.5 Pro等)的训练数据不公开,可能包含受版权保护的开源代码,存在侵权风险;而部分注重数据合规性的模型(如Comma、Starcoder2)因训练数据有限,性能较弱,缺乏竞争力。原创 2026-10-05 20:30:00 · 6 阅读 · 0 评论 -
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
本文全面评估了大型语言模型(LLMs)在多个数据集、任务和提示配置下的隐喻理解能力。尽管隐喻处理在自然语言处理(NLP)领域已受到广泛关注,但以往研究局限于单一数据集评估和特定任务设置,且常通过词汇替换构建人工数据。为解决这些局限,我们利用多样化的公开数据集(含推理和隐喻标注)开展了大量实验,重点关注自然语言推理(NLI)和问答(QA)任务。结果表明,LLMs的表现更多受词汇重叠、句子长度等特征影响,而非隐喻内容。原创 2026-10-05 19:30:00 · 6 阅读 · 0 评论 -
StackTrans: From Large Language Model to Large Pushdown Automata Model
本文针对Transformer架构在捕获乔姆斯基层级(如正则表达式、确定性上下文无关文法)方面的固有局限,提出了一种名为STACKTRANS的新型模型。该模型受下推自动机(使用栈高效处理确定性上下文无关文法)启发,在Transformer层间引入隐藏状态栈,通过可微分的栈操作(推入、弹出、无操作)实现端到端训练,同时保持与现有框架(如flash-attention)的兼容性。原创 2026-10-05 18:30:00 · 6 阅读 · 0 评论 -
A Novel Self-Evolution Framework for Large Language Models
大型语言模型(LLMs)的能力在一定程度上受限于预训练,因此一些研究者通过后训练对其进行优化。现有的后训练策略(如基于记忆的检索或偏好优化)虽能提升用户对齐,但无法增强模型的领域认知。为填补这一空白,我们提出了一种新颖的双阶段自进化(DPSE)框架,可联合优化用户偏好适应和特定领域能力。DPSE引入了审查模块,用于提取多维交互信号并估计满意度分数,通过主题感知和偏好驱动策略指导结构化数据扩展。这些扩展后的数据集支持两阶段微调流程:先进行监督领域接地,再进行频率感知的偏好优化。原创 2026-10-05 17:30:00 · 4 阅读 · 0 评论 -
ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
本文介绍了一个大规模中文医疗数据集ChiMed 2.0,旨在推动中文医疗领域大语言模型(LLM)的研究与应用。该数据集扩展了此前的ChiMed工作,整合了来自中文医疗在线平台的真实数据和LLM生成的数据,涵盖传统中医经典文献和现代通用医疗数据,总规模达2.044亿汉字。具体而言,ChiMed 2.0包含三部分核心数据:16.48万篇预训练文档、35.16万对有监督微调(SFT)问答对、4.17万条人类反馈强化学习(RLHF)偏好数据元组。原创 2026-10-05 16:30:00 · 6 阅读 · 0 评论 -
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
本文提出了SimdBench,这是首个专门用于评估大型语言模型(LLMs)生成SIMD intrinsic代码能力的基准测试。SIMD(单指令多数据)指令通过并行处理多个数据项加速性能关键任务,而SIMD intrinsic是编译器提供的内置函数,允许程序员在高级语言中显式调用SIMD指令,平衡编码效率与高性能。现有代码生成基准主要关注标量代码,缺乏对SIMD intrinsic代码的评估。原创 2026-10-05 15:30:00 · 7 阅读 · 0 评论 -
What Level of Automation is “Good Enough“? A Benchmark of Large Language Models for Meta-Analysis...
本文聚焦于大型语言模型(LLMs)在元分析数据提取中的实际表现评估,旨在解决从随机对照试验(RCTs)全文中自动提取数据用于元分析的挑战。研究选取了Gemini-2.0-flash、Grok-3、GPT-4o-mini三个LLM,在高血压、糖尿病、骨科三个医学领域,针对统计结果、偏倚风险评估和研究层面特征三类任务,测试了基础提示、自我反思提示、模型集成、定制提示四种提示策略,以探究如何提升提取质量。研究发现,所有模型均表现出高精度,但召回率较低(存在关键信息遗漏);原创 2026-10-05 06:30:00 · 5 阅读 · 0 评论 -
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language M...
本文聚焦大型语言模型(LLMs)的跨语言对齐能力评估,提出了一种基于神经元状态的新框架,并通过实验验证了其有效性。研究背景:现有跨语言对齐评估方法多依赖句子嵌入,但神经模型的表示空间存在非光滑性(如各向异性),尤其影响低资源语言的语义对齐评估。核心方法:受神经科学中“相似信息激活重叠神经元区域”的启发,NeuronXA通过量化神经元对多语言平行语料的激活一致性来评估跨语言对齐。具体包括:神经元状态检测(激活状态为二进制0/1,激活值为绝对强度);原创 2026-10-04 16:30:00 · 7 阅读 · 0 评论 -
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
多模态大型语言模型(MLLMs)在基于图像的回归任务中展现出潜力,但当前方法存在关键局限性。近期方法通过预设输出词汇和通用任务级提示(如“你会如何评价这张图像?”)微调MLLMs,假设这能模拟人类评分行为。我们的分析表明,这些方法并不优于仅用图像的训练方式:使用预设词汇和通用提示的模型与仅用图像的模型性能相当,未能利用文本输入的语义理解能力。我们提出基于Transformer分类的回归(RvTC),用灵活的分箱策略替代词汇约束的分类。原创 2026-10-04 15:30:00 · 8 阅读 · 0 评论 -
FCRF: Flexible Constructivism Reflection for Long-Horizon Robotic Task Planning with Large Langua...
本文针对家用机器人在复杂长时程任务执行中存在的误差累积问题,提出了一种基于大语言模型(LLMs)的灵活建构主义反思框架(Flexible Constructivism Reflection Framework, FCRF)。该框架借鉴人类认知适应机制,采用“导师-执行者(Mentor-Actor)”架构,解决现有LLM自反思方法中反思机制僵化、无法根据任务难度调整强度的局限。执行者(Actor):基于ReAct框架生成行动序列,负责任务规划执行;导师(Mentor)原创 2026-10-04 06:30:00 · 5 阅读 · 0 评论 -
Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Volta...
研究背景:大型语言模型(LLMs)在自然语言处理和知识储备上的优势使其逐渐被引入电力系统,但现有研究中LLMs多用于辅助任务(如模拟设置、预测等),在调度策略生成中仅起支持作用,依赖优化算法或强化学习代理。核心问题:探索LLMs能否独立生成电力系统调度策略,针对配电网电压控制这一典型的“经验驱动”场景(实际中模型和数据精度有限,调度策略常依赖专家经验)展开研究。提出方法:构建了基于LLMs的经验驱动电压控制方案,包含四个核心模块:经验存储。原创 2026-10-03 23:30:00 · 7 阅读 · 0 评论 -
Rethinking Memorization Measures and their Implications in Large Language Models
本文围绕大语言模型(LLMs)中的记忆(memorization)现象展开研究,核心探讨了三个问题:最优语言学习中是否能避免记忆、记忆带来的隐私威胁是否被夸大、不同记忆度量方法的差异及影响。记忆度量方法的重新审视:分析了现有基于回忆的(recollection-based)和反事实的(counterfactual)记忆度量方法,并提出新的情境记忆(contextual memorization)度量。原创 2026-10-03 22:30:00 · 6 阅读 · 0 评论 -
Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil...
随着大型语言模型(LLMs)越来越多地融入现实世界应用,可扩展且严谨的安全评估变得至关重要。本文介绍了艾马拉AI(Aymara AI),这是一个用于生成和管理定制化、基于政策的安全评估的程序化平台。艾马拉AI将自然语言安全政策转化为对抗性提示,并使用经人类判断验证的AI评分器对模型响应进行评分。我们通过“艾马拉大语言模型风险与责任矩阵”展示了其能力,该矩阵在10个真实世界安全领域对20个商用LLM进行了评估。结果显示,模型表现差异显著,安全得分均值范围为86.2%至52.4%。原创 2026-10-03 21:30:00 · 7 阅读 · 0 评论 -
Large Language Models as Medical Codes Selectors: a benchmark using the International Classificat...
本文研究了大型语言模型(LLMs)在自动分配国际初级保健分类(ICPC-2)编码中的潜力,通过结合领域特定搜索引擎的输出,评估其在医疗编码任务中的性能。背景:医疗编码对医疗数据结构化、研究、质量监控和政策制定至关重要,但人工编码耗时且易出错,自动化需求迫切。方法。原创 2026-10-03 20:30:00 · 4 阅读 · 0 评论 -
A Hybrid Framework for Subject Analysis: Integrating Embedding-Based Regression Models with Large...
本文聚焦图书馆管理系统中的主题分析任务,提出了一种融合基于嵌入的机器学习(ML)模型与大型语言模型(LLMs)的混合框架,用于预测图书的国会图书馆主题标题(LCSH)。传统机器学习模型在多标签分类中难以处理未见过的案例,而LLMs虽在分类和摘要任务中应用广泛,但在主题分析中存在过度生成和“幻觉”(生成非标准术语)的问题。利用ML模型预测LCSH标签的最佳数量,指导LLM生成,避免过度或不足生成;对LLM生成的术语进行后处理,用实际LCSH术语替换“幻觉”术语,减少错误。原创 2026-10-03 19:30:00 · 7 阅读 · 0 评论
分享