自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(4298)
  • 资源 (1)
  • 收藏
  • 关注

原创 A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

科学大语言模型(Sci-LLMs)正改变科学研究中知识的表示、整合与应用方式,但其发展受限于科学数据的复杂特性。本综述以“数据为中心”,提出一个全面的整合分析框架,将Sci-LLMs的发展重构为模型与其底层数据基质的协同进化过程。首先,我们构建了科学数据的统一分类体系与科学知识的层级模型,重点强调科学语料区别于通用自然语言处理数据集的三大核心挑战:多模态、跨尺度与领域特异性。

2026-09-16 10:30:00 7

原创 AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language M...

多模态大型语言模型(MLLMs)的发展推动了视觉问答(VQA)领域取得重大进展,使其从单图像视觉问答(SVQA)逐步演进至多图像视觉问答(MVQA)。然而,MVQA中图像数量的增加不可避免地引入了大量与问答无关的视觉冗余,这对模型的准确率和效率均产生了负面影响。为解决这一问题,现有方法在控制压缩视觉令牌数量方面缺乏灵活性,且往往会产生离散的视觉片段,阻碍了MLLMs对图像的整体理解。在本文中,我们提出一种简洁且通用的自适应视觉锚定策略,该策略可无缝集成到现有MLLMs中,通过自适应压缩显著提升模型准确率。

2026-09-16 09:30:00 9

原创 A Retail-Corpus for Aspect-Based Sentiment Analysis with Large Language Models

基于方面的情感分析(ABSA)通过将情感与特定方面相关联,增强了情感检测能力,相比传统情感分析能提供更深入的洞察。本研究构建了一个包含10,814条多语言客户评论的手动标注数据集,这些评论均针对实体零售店,标注涵盖8个方面类别及其对应情感。利用该数据集,研究人员评估了GPT-4与LLaMA-3在基于方面的情感分析任务中的性能,为新引入的数据集建立了基准。结果显示,两个模型的准确率均超过85%,且在所有相关指标上,GPT-4的整体表现均优于LLaMA-3。

2026-09-16 08:30:00 76

原创 MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models

问答(QA)是人类理解一段音乐音频的自然方式。然而,对于机器而言,获取一个涵盖音乐各方面信息的大规模数据集至关重要,却也颇具挑战性,因为此类公开可用的音乐数据十分稀缺。本文介绍了MQAD,这是一个基于百万歌曲数据集(MSD)构建的音乐问答数据集,包含27万首歌曲,涵盖丰富的音乐特征——包括节拍、和弦、调式、结构、乐器和流派——并包含近300万条不同的问题和描述。MQAD的独特之处在于其提供了和弦、乐段等详细的时变音乐信息,能够支持对歌曲中音乐内在结构的探索。

2026-09-16 07:30:00 93

原创 DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language...

推理大型语言模型(RLLMs),如OpenAI-O3和DeepSeek-R1,近年来通过执行结构化多步推理展现出卓越能力。然而,近期研究发现,RLLMs常存在“过度思考”问题——即便面对简单问题,也会生成不必要的冗长推理链,导致token消耗过多和计算效率低下。有趣的是,我们观察到,当以批量模式处理多个问题时,由于隐式的资源竞争,RLLMs会通过动态压缩简单问题的推理步骤,表现出更高效的资源利用行为。

2026-09-15 10:30:00 7

原创 Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning

联邦微调能够实现保护隐私的大型语言模型(LLM)适配,但高昂的内存成本限制了资源受限设备的参与。本文提出FEDPRUNER——一种创新的联邦微调范式,通过智能层剪枝解决这一问题。FEDPRUNER可灵活剪枝全局模型,根据设备内存约束生成个性化子模型。该范式采用宏-微协同剪枝框架:宏观层面,基于功能驱动的层编排机制对层进行分组;微观层面,基于重要性感知的层选择策略在组内剪枝,以构建设备专属子模型。此外,本文还提出一种细粒度变体,可独立剪枝多头注意力(MHA)和前馈网络(FFN)组件,从而精准保留关键结构元素。

2026-09-15 09:30:00 8

原创 Large Language Model-Based Automatic Formulation for Stochastic Optimization Models

本文首次对大型语言模型(LLMs,具体为ChatGPT)从自然语言描述中自动构建和求解随机优化问题的性能展开系统性整合研究。研究聚焦三大核心类别——联合机会约束模型、个体机会约束模型和两阶段随机线性规划(SLP-2),设计了多种提示策略,通过思维链和模块化推理引导ChatGPT完成结构化任务。本文提出了一种新的软评分指标,用于评估生成模型的结构质量和部分正确性,以解决传统标准准确性和基于执行的准确性评估方法的局限性。

2026-09-15 08:30:00 327

原创 Quantifying Language Disparities in Multilingual Large Language Models

大型多语言评估中报告的结果往往具有碎片化特征,且受目标语言、实验设置差异、模型选择等因素干扰。本文提出一套框架,可分离这些混淆变量,并引入三个可解释的指标——性能实现比(performance realisation ratio)、性能实现比的变异系数(its coefficient of variation)与语言潜力(language potential),从而更精细、更深入地量化(i)模型间与(ii)语言间的实际性能差异。

2026-09-15 07:30:00 95

原创 SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

语音到语音(S2S)大型语言模型(LLMs)是实现自然人机交互的基础,可支持端到端的语音对话系统。然而,对这类模型的评估仍是一项核心挑战。本文提出SageLM,这是一款用于全面评估S2S大型语言模型的端到端、多维度且可解释的语音大型语言模型。首先,与忽略声学特征的级联式方法不同,SageLM能同时评估语义和声学两个维度。其次,该模型利用基于推理依据的监督方式来增强可解释性,并指导模型学习,与基于规则的强化学习方法相比,其评估结果与预期评估目标的一致性更优。

2026-09-14 12:30:00 13

原创 Understanding Subword Compositionality of Large Language Models

大型语言模型(LLMs)以子词序列作为输入,这要求它们能有效地将子词表示组合成有意义的词级表示。在本文中,我们开展了一系列全面的实验,以探究LLMs如何组合子词信息,研究重点聚焦于三个关键方面:结构相似性、语义可分解性和形式保留。对实验结果的分析表明,5个LLM家族可被划分为三个不同的组别,这种分组可能反映了它们在底层组合策略上的差异。具体而言,我们观察到:(1)在各层中,子词组合表示与原词表示之间的结构相似性演化呈现出三种不同模式;(2)逐层探测模型对语义可分解性的敏感性时,所有模型均表现出优异性能;

2026-09-14 11:30:00 72

原创 Interleaving Large Language Models for Compiler Testing

翻译基于大语言模型交织的编译器测试方法倪云博,香港中文大学(香港)李少华∗,香港中文大学(香港)摘要:利用人工智能模型(尤其是大语言模型,LLMs)测试编译器已展现出巨大潜力。然而,现有方法面临两大关键问题:用于测试编译器的生成程序往往过于简单,且基于LLMs的大规模测试计算成本高昂。本文提出一种新颖的编译器测试框架,将测试过程解耦为两个独立阶段——离线阶段与在线阶段。在离线阶段,我们利用LLMs生成一组“小而功能丰富”的代码片段;

2026-09-14 10:30:00 234

原创 Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios

将自然语言翻译为手语是一项极具复杂性且尚未充分探索的任务。尽管人们对无障碍与包容性的关注度不断提升,但手语翻译系统的稳健发展仍受限于平行语料的稀缺——这类语料需实现自然语言与手语数据的对齐。现有方法在这种数据稀缺的环境中往往难以泛化,因为少量可用数据集通常局限于特定领域、缺乏标准化,或无法完整捕捉手语丰富的语言特性。

2026-09-14 09:30:00 7

原创 How Quantization Shapes Bias in Large Language Models

本研究对量化如何影响模型偏见进行了全面评估,尤其关注其对特定人口统计子群体的影响。我们聚焦权重与激活量化策略,分析其在多种偏见类型(包括刻板印象、毒性、情感倾向与公平性)中的作用。研究采用概率型与生成文本型两类指标,结合9个基准测试,对不同架构家族与推理能力的模型展开评估。结果表明,量化对偏见的影响具有复杂性:尽管量化可降低模型毒性,且对情感倾向无显著影响,但在生成任务中(尤其是激进压缩场景下),它往往会轻微加剧刻板印象与不公平性。这些趋势在不同人口统计类别与模型类型中大体一致,但其影响程度取决于具体设置。

2026-09-14 08:30:00 127

原创 Named Entity Recognition of Historical Text via Large Language Model

大型语言模型(LLMs)已在各类自然语言处理任务和领域中展现出卓越的通用性,命名实体识别(NER)便是其中一项任务。该任务需识别并分类文本中的专有名词,如人物、组织、地点、日期及其他特定实体。命名实体识别在从非结构化文本数据中提取信息方面发挥着关键作用,可支持从非结构化文本中检索信息等下游应用。传统上,命名实体识别通过监督式机器学习方法实现,这类方法需要大量带标注的训练数据。然而,历史文本带来了独特的挑战:由于人工标注需高昂成本且对专业知识要求高,相关标注数据集往往稀缺甚至不存在。

2026-09-14 07:30:00 122

原创 LongReasonArena: A Long Reasoning Benchmark for Large Language Models

现有针对大语言模型(LLMs)的长上下文基准测试,主要侧重于评估模型对长输入的理解能力,却忽视了对其长推理能力的评估。为填补这一空白,我们提出了LONGREASONARENA——一个专门用于评估大语言模型长推理能力的基准测试集。该基准测试集中的任务要求模型通过执行多步骤算法来解决问题,这些算法体现了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可任意调整,对于最具挑战性的任务,推理长度甚至能达到100万tokens。

2026-09-13 12:30:00 13

原创 Addressing Tokenization Inconsistency in Steganography and Watermarking Based on Large Language M...

大型语言模型(LLMs)显著提升了文本生成的能力与效率。一方面,它们改善了基于文本的隐写术质量;另一方面,也凸显了水印技术作为防范恶意滥用手段的重要性。本研究聚焦隐写术和水印技术中发送方与接收方之间的分词不一致(TI)问题——该问题会破坏系统鲁棒性。研究发现,导致TI的“问题token”具有两大关键特征:低频性(Infrequency)和暂时性(Temporariness)。基于这些发现,我们提出两种针对性解决方案以消除TI:适用于隐写术的“逐步验证法”和适用于水印技术的“事后回滚法”。

2026-09-13 11:30:00 126

原创 Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models

将回复基于外部知识,是缓解大型语言模型(LLMs)幻觉现象的有效策略。然而,当前LLMs难以在无缝整合知识的同时,兼顾人类天然具备的“忠实性”与“表达性”——现有输出要么缺乏外部知识支撑(损害忠实性),要么过于冗余、生硬(牺牲表达性)。为打破这一权衡,本文提出协同解码(CoDe):一种动态融合“含外部知识”与“不含外部知识”输出概率的新方法。该融合过程由分布差异和模型置信度引导,能够从模型内部参数中选择性激活相关且可靠的表达。

2026-09-13 10:30:00 10

原创 Integrating gender inclusivity into large language models via instruction tuning

想象一种语言,它包含阳性、阴性和中性三种语法性别,但受历史和政治传统影响,阳性形式常被主要用于指代男性、女性及混合性别群体。这正是当代波兰语及其他部分斯拉夫语族、罗曼语族语言的现实情况。这种不公平语言体系带来的一个社会后果是:基于标准文本训练的大型语言模型(LLMs)会继承并强化这种阳性偏见,生成性别失衡的输出。本研究通过“包容性波兰语指令集(IPIS)”对LLMs进行微调,以解决这一问题。IPIS是一组由人类编写的指令集,包含波兰语性别包容性校对指令和波兰语↔英语性别敏感翻译指令。

2026-09-13 09:30:00 10

原创 Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-D...

大型语言模型(LLMs)在自然语言处理方面展现出令人印象深刻的能力,但在需要深度推理和外部知识整合的知识密集型任务中,仍难以表现出色。尽管检索增强生成(RAG)和思维链(CoT)等方法已被提出,用于为LLMs补充外部知识,但这些方法仍受限于LLMs的内部偏差,这往往会导致错误答案的产生。在本文中,我们提出了一种新颖的因果提示框架——条件前门提示(CFD-Prompting)。该框架能够在外部知识的条件下,实现查询与答案之间因果效应的无偏估计,同时减轻内部偏差。

2026-09-13 08:30:00 9

原创 TULIP: Adapting Open-Source Large Language Models for Underrepresented Languages and Specialized ...

近年来,随着大型语言模型(LLM)的日益普及,其在金融领域的应用潜力巨大。尽管大型专有模型表现卓越(通过API以“黑箱”方案形式提供),但可本地部署的小型模型在适应性和隐私保护方面具备独特优势。尤其在金融这类对敏感信息管理和领域知识应用要求极高的场景中,提升小型模型的能力至关重要,对于代表性不足的语言而言更是如此。本研究提出TULIP模型系列,通过对Llama 3.1 8B和Qwen 2.5 7B模型进行领域与语言适配,重点面向土耳其语金融应用场景。

2026-09-13 07:30:00 72

原创 Emotion Omni: Enabling Empathetic Speech Response Generation through Large Language Models

随着语音大语言模型(speech LLMs)的发展,用户如今可通过语音直接与助手交互。然而,大多数现有模型仅将响应内容转化为语音,并未充分理解用户查询中所蕴含的丰富情感及副语言线索。在许多情况下,同一句话因情感表达不同,可能传递出截然不同的含义。此外,情感理解对于提升人机交互中的用户体验至关重要。目前,大多数具备共情能力的语音大语言模型都依赖海量数据集进行训练,这种方法不仅需要大量数据,还需消耗巨额计算资源。

2026-09-12 12:30:00 11

原创 LLM Weekly(2026.8.24-2026.8.30)

最终得到的单一模型,在专家验证的 text-to-SQL 任务上达到 91.37%,每个任务成本约 0.035 美元,相比使用 scaffold 的开源流程高出 8–22 个百分点,同时以远低于 GPT-5.6 Sol Ultra 的成本取得更好表现。由 DeepMind 前成员创办的伦敦实验室 Inherent 表示,其名为 Faraday 的智能体在复现已发表论文结果方面,比 Anthropic 和 OpenAI 的前沿模型表现更准确,而其底层仅采用一个基于 Qwen 3.6 的 270 亿参数模型。

2026-09-12 12:30:00 15

原创 Investigating Advanced Reasoning of Large Language Models via Black-Box Interaction

现有任务在交互式未知环境中评估大型语言模型(LLMs)推理能力方面存在不足。这一缺陷导致演绎、归纳和溯因推理的评估相互孤立,忽略了人类探索现实世界所必需的整合推理过程。为解决这一挑战,我们提出了一种全新的评估范式——黑箱交互。黑箱由一个隐藏函数定义,该函数可将特定输入集合映射到输出。LLMs需在给定的探索轮次内与黑箱交互,并基于观察到的输入-输出对进行推理,以揭示黑箱背后的隐藏函数。基于这一思路,我们构建了ORACLE基准,该基准包含6类黑箱任务和96个黑箱,并对19个主流LLMs进行了基准测试。

2026-09-12 11:30:00 12

原创 LLM Weekly(2026.8.31-2026.9.6)

Mercor 与 SkyRL 使用 1,928 个来自咨询、投行和法律领域的专家任务,对 Qwen3.5–397B-A17B 进行了后训练,使其在 APEX-Agents 上的 Pass@1 从 16.11% 提升至 27.29%,相对提升 70%。一位研究者在单张 RTX 5090 上,从零训练了一个八层 Transformer,仅耗时 1.5 小时,在 ARC-AGI-1 公共评测中取得 44%,在 ARC-AGI-2 上取得 7%。消融实验显示,真正发挥主要作用的是持久化知识层,而不仅仅是技能本身。

2026-09-12 11:30:00 12

原创 Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Corr...

提升大型语言模型(LLMs)的数学推理能力需要高质量的训练数据,然而传统方法在可扩展性、成本和数据可靠性方面面临严峻挑战。为解决这些局限,我们提出一种新颖的程序辅助合成框架,该框架能系统性地生成高质量数学语料,并确保其具备多样性、复杂性与正确性。此框架整合数学知识体系与特定领域工具,生成可执行程序;随后将这些程序转化为自然语言“问题-解答”对,并通过双边验证机制进行筛选——该机制一方面验证解答与程序输出的一致性以确保正确性,另一方面保障程序与问题的匹配性。

2026-09-12 10:30:00 11

原创 Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices

基于混合专家(MoE)架构的大型语言模型(LLMs)的联邦微调面临巨大挑战,这源于其庞大的计算需求与参与者的资源限制。现有研究尝试通过模型量化、计算卸载或专家剪枝来填补这一空白,但由于不切实际的系统假设以及未充分考虑MoE的特有属性,这些方法无法达到理想性能。本文提出Flux系统,该系统旨在实现基于MoE的LLMs在资源受限参与者(如消费级GPU)上的联邦微调,以最小化模型达到目标精度所需的时间。Flux引入三项关键创新:(1)基于量化的本地分析,以极低开销估算专家激活情况;

2026-09-12 09:30:00 82

原创 Less Is More? Examining Fairness in Pruned Large Language Models for Summarising Opinions

通过训练后剪枝实现的模型压缩,为在不显著影响模型性能的前提下降低模型规模与计算需求提供了可行路径。然而,剪枝对大语言模型(LLM)生成摘要公平性的影响尚未被探索——尤其在观点摘要任务中,有偏输出可能会影响公众认知。本文对观点摘要任务展开全面实证分析,在3个开源LLM上,结合4类公平性指标,考察了3种主流剪枝方法与不同校准集的作用。系统性分析表明,剪枝方法对公平性的影响显著大于校准集。

2026-09-12 08:30:00 9

原创 Neural Algorithmic Reasoners informed Large Language Model for Multi-Agent Path Finding

大语言模型(LLM)的发展与应用表明,基础模型可用于解决各类复杂任务。然而,其在多智能体路径规划(MAPF)任务中的表现却不尽如人意,目前针对该领域的研究也较为有限。MAPF是一项复杂任务,既需要路径规划能力,也要求多智能体具备协同配合能力。为提升LLM在MAPF任务中的性能,本文提出一种名为LLM-NAR的新型框架,该框架利用神经算法推理器(NAR)为LLM处理MAPF任务提供支持。LLM-NAR包含三个核心组件:用于MAPF任务的LLM、基于预训练图神经网络(GNN)的NAR以及交叉注意力机制。

2026-09-12 07:30:00 159

原创 Scaling Laws for Task-Stratified Knowledge in Post-Training Quantized Large Language Models

大语言模型(LLMs)因其规模庞大而面临严峻的部署挑战,训练后量化(PTQ)已成为一种切实可行的压缩方案。然而,目前人们对PTQ如何精确影响LLMs各类知识能力的全面理解仍有待完善,且现有量化模型缩放定律往往忽略了关键的PTQ特定参数和任务特异性敏感性。为填补这些空白,本文通过大量实证研究建立了任务分层的缩放定律。我们将LLMs的知识能力拆解为知识记忆与知识运用能力,并构建了一个整合模型大小、有效位宽、校准集大小和组大小的统一量化框架。

2026-09-11 12:30:00 84

原创 Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs

检索性能如何随预训练计算量(FLOPs)缩放?我们对参数规模从1.25亿到70亿的大语言模型(LLM)进行了检索性能基准测试,这些模型的预训练数据集规模覆盖10亿到2万亿以上tokens。研究发现,零样本BEIR任务的检索性能可预测地随LLM模型规模、训练时长和估算的FLOPs提升而缩放。我们还表明,在各类检索任务中,上下文学习(In-Context Learning,ICL)分数与检索分数呈强相关。最后,我们强调了这一发现对基于LLM的检索模型开发的启示意义。

2026-09-11 11:30:00 142

原创 Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models

该研究聚焦大型语言模型(LLMs)在放射肿瘤学事件根本原因分析(RCA)中的应用,旨在评估其推理能力及对患者安全工作的支持潜力。

2026-09-11 10:30:00 13

原创 Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large L...

背景:认知评估需要标准化数据作为评估个体表现的重要基准。因此,基于新型图像刺激开发新的认知测试面临挑战,原因是缺乏可随时获取的标准化数据。传统数据收集方法成本高、耗时长且更新频率低,限制了其实际应用价值。生成式多模态大型语言模型(MLLMs)的最新进展为从现有认知测试图像中生成合成标准化数据提供了新方法。方法:本研究探究了使用多模态大型语言模型(具体为GPT-4o和GPT-4o-mini)为成熟的基于图像的认知评估(如“偷饼干”图片描述任务)合成标准化文本响应的可行性。

2026-09-11 09:30:00 9

原创 Political Ideology Shifts in Large Language Models

大型语言模型(LLMs)正日益应用于政治敏感场景,这引发了人们对其可能编码、放大或被引导至特定意识形态的担忧。本研究以政治指南针测试(PCT)为标准化工具,探究“采用合成角色”对不同模型家族、7个参数规模(7B-70B+)LLM意识形态表达的影响。分析揭示了四个一致模式:(1)更大规模的模型展现出更广泛且更极化的隐性意识形态覆盖;(2)模型对显性意识形态提示的敏感度随规模增大而提升;(3)模型对“右翼威权主义”提示的响应强度高于“左翼自由派”提示;

2026-09-11 08:30:00 8

原创 MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models

混合专家(MoE)模型通过实现大规模参数规模的同时保持计算效率,推动了大语言模型(LLM)和视觉语言模型(VLM)的规模扩展。然而,MoE模型在推理阶段引入了若干挑战,包括专家间负载不均衡以及额外的路由计算开销。为应对这些挑战并充分发挥MoE的优势,对硬件加速技术进行系统评估至关重要。本文提出MoE-Inference-Bench,这是一项全面的研究,用于评估MoE模型在不同场景下的性能。我们分析了批处理大小、序列长度以及FFN维度、专家数量等关键MoE超参数对吞吐量的影响。

2026-09-11 07:30:00 11

原创 Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets

大型语言模型(LLMs)最初为自然语言处理(NLP)而开发,如今已展现出跨模态、跨领域的泛化潜力。凭借上下文学习(ICL)能力,LLMs无需对下游任务进行显式微调,即可处理结构化输入并执行预测任务。本研究通过实证方法,探究了LLMs在小规模结构化数据集上针对分类、回归和聚类任务的函数近似能力。

2026-09-10 10:30:00 67

原创 CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large ...

大语言模型(LLMs)的可信生成面临参数记忆与外部语境间知识冲突的挑战。现有专门用于处理冲突的对比解码方法往往缺乏适应性,在低冲突场景下可能导致性能下降。本文提出COCOA(置信度与语境感知自适应解码),这是一种新颖的令牌级算法,用于实现合理的冲突解决并提升生成内容的可信度。COCOA通过利用置信度感知指标(熵差和语境峰值)以及参数分布与语境分布之间的广义散度(Rényi散度)来解决知识冲突。关键在于,即便在低冲突场景下,COCOA仍能保持优异性能。

2026-09-10 09:30:00 10

原创 SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models

自动综述生成已成为科学文献处理领域的一项关键任务。尽管大型语言模型(LLMs)在生成综述文本方面展现出潜力,但由于缺乏标准化的评估数据集,严重阻碍了对其与人类撰写综述的性能进行严谨评估。在本研究中,我们提出了SurveyGen——一个大规模数据集,包含超过4200篇来自不同科学领域的人类撰写综述,以及242143条引用参考文献,同时还包含这些综述和被引论文的大量质量相关元数据。

2026-09-10 08:30:00 108

原创 CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics

我们提出了一个全新的基准CMPhysBench,旨在评估大型语言模型(LLMs)在凝聚态物理领域的能力。该基准包含520多道精心挑选的研究生水平题目,涵盖凝聚态物理的代表性子领域与基础理论框架,如磁学、超导、强关联系统等。为确保能深入考察模型对解题过程的理解,我们仅聚焦于计算题,要求模型独立生成完整的解题方案。同时,借助表达式的树形表示,我们引入了可扩展表达式编辑距离(SEED)评分机制,该机制能提供细粒度(非二进制)的部分分数,更精准地评估预测结果与真实结果之间的相似度。

2026-09-10 07:30:00 9

原创 Adaptive Content Restriction for Large Language Models via Suffix Optimization

大型语言模型(LLMs)在多种应用中取得了显著成功。然而,由于其输出空间广阔,实施内容限制仍是一项重大挑战。内容限制的一个方面是通过模型对齐方法(如监督微调,SFT)防止LLMs生成有害内容。然而,内容限制的需求可能因用户群体而异,随时间快速变化,且并不总是与“有害性”的通用定义一致。由于高昂的计算、数据和存储需求,为每个特定场景应用SFT并不现实。基于这一需求,我们提出了一项新任务——自适应内容限制(AdaCoRe),其核心是轻量级策略(无需模型微调的方法),以阻止已部署的LLMs为特定场景生成受限术语。

2026-09-09 12:30:00 12

原创 Unraveling the cognitive patterns of Large Language Models through module communities

大型语言模型(LLMs)凭借从科学发现、医疗诊断到聊天机器人等各类应用,在科学、工程和社会领域取得重大进展,重塑了我们的世界。尽管LLMs应用广泛且实用性强,但其底层机制仍隐藏在数十亿参数和复杂结构中,导致其内部架构与认知过程难以理解。为填补这一空白,我们借鉴生物学中理解认知涌现的方法,开发了一个基于网络的框架,将认知技能、LLM架构与数据集关联起来,为基础模型分析带来范式转变。

2026-09-09 11:30:00 11

C语言编程实例100题

里面有C语言程序示例,没有100个,但是个个讲的都很好,对于初学者帮助很大。。

2012-03-01

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除