UnknownBody
AI博士,最近一直follow大模型相关论文,每日会更新学术界论文的进展。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
指令遵循是大语言模型(LLMs)的核心能力。现有研究主要评估模型对用户指令的遵循程度,却往往忽视了指令中包含冲突约束的场景——这在复杂提示中十分常见。LLMs在该类场景下的表现尚未得到充分探究。为填补这一空白,我们提出ConInstruct基准数据集,专门用于评估LLMs检测和解决用户指令中冲突的能力。利用该数据集,我们评估了LLMs的冲突检测性能,并分析了它们的冲突解决行为。实验结果揭示了两个关键发现:(1)多数闭源LLMs展现出强劲的冲突检测能力,而开源模型中仅DeepSeek-R1表现相当。原创 2026-08-07 10:30:00 · 14 阅读 · 0 评论 -
DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
本文聚焦大型语言模型(LLMs)的推导能力(Derivation Capability, DC)概念定义:正式定义“推导关系(DR)”为输入域变化(T)与输出域变化(R)的映射规则,推导能力(DC)则是LLMs遵循DR,在输入发生特定变化时对输出进行相应调整的能力。评估框架(DEVAL):提出系统化评估框架DEVAL,通过“规则形式化(将任务规则转化为DR)→数据集构建(基于DR生成测试数据)→模型评估(量化输出是否符合DR)”三步流程,解决传统评估无法衡量“变化一致性”的缺陷。模型评估结果。原创 2026-08-05 09:30:00 · 8 阅读 · 0 评论 -
From Phonemes to Meaning: Evaluating Large Language Models on Tamil
大型语言模型(LLMs)在高资源语言的各类任务中展现出强大的泛化能力;然而,它们在泰米尔语等低资源、形态丰富语言中的语言能力尚未得到充分探索。现有多语言基准大多依赖翻译后的英语数据集,无法捕捉目标语言的语言和文化细微差异。为填补这一空白,我们引入ILAKKANAM——首个泰米尔语专属语言评估基准,该基准基于斯里兰卡1-13年级泰米尔语学科考试题目手动筛选构建,包含820道问题。每道题目由经过训练的语言学家标注为5个语言类别和1个事实知识类别,覆盖全年级以确保广泛的语言覆盖度。原创 2026-08-04 12:30:00 · 13 阅读 · 0 评论 -
2025_NIPS_EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refu
大型语言模型(LLMs)经常拒绝响应伪恶意指令:这类输入查询语义无害,但由于保守的安全对齐策略而触发不必要的LLM拒绝,严重影响用户体验。收集此类指令对于评估和缓解过度拒绝问题至关重要,但现有的指令构建方法(如人工创建或指令重写)要么缺乏可扩展性,要么无法生成足够多样化且有效的拒绝触发提示词。为解决这些局限性,我们提出EVOREFUSE——一种提示词优化方法,能够生成多样化的伪恶意指令,在不同LLM中持续引发高置信度的拒绝响应。原创 2026-02-14 09:30:00 · 49 阅读 · 0 评论 -
Evaluating Large Language Models on Non-Code Software Engineering Tasks
一、主要内容研究背景与目标大型语言模型(LLMs)在代码理解和生成任务中表现突出,但在非代码软件工程(SE)任务(如需求分析、问题分类、工作量估算等)中的效果尚未被充分探索。本文旨在建立首个全面的评估基准,系统分析LLMs在非代码SE任务中的表现。SELU基准的构建提出“软件工程语言理解”(SELU)基准,包含17个非代码任务,覆盖分类、回归、命名实体识别(NER)和掩码语言建模(MLM),数据来源包括代码仓库、问题跟踪系统和开发者论坛等。原创 2026-01-30 11:30:00 · 60 阅读 · 0 评论 -
Evaluating Large Language Models for Phishing Detection, Self-Consistency, Faithfulness, and Explain
本文聚焦于评估大型语言模型(LLMs)在钓鱼检测任务中的表现,重点关注模型的分类准确性、自一致性、忠实性及可解释性。研究背景为钓鱼攻击持续演化,传统检测方法难以应对,而LLMs在特定领域分类任务中展现潜力,但需同时保证预测准确性与解释的可靠性。研究中,作者使用Nazario(钓鱼邮件)和Enron(正常邮件)数据集,对BERT、Llama-2-7B、Llama-3-8B、Wizard-7B等模型进行微调,采用三种方法:二进制序列分类、对比学习(CL)和直接偏好优化(DPO)。原创 2026-02-02 07:30:00 · 46 阅读 · 0 评论 -
Evaluating LLM Agent Collusion in Double Auctions
本文聚焦大型语言模型(LLM)代理在连续双重拍卖(CDA)市场中的合谋行为,通过控制实验系统分析了影响卖家合谋的关键因素,旨在为LLM代理在经济场景中的部署提供伦理和经济层面的参考。研究背景:随着LLM代理在电商、金融等领域的普及,其在市场交互中可能出现的合谋行为(如抑制竞争、操纵价格)对市场效率和公平性构成潜在威胁。现有研究多关注强化学习算法的合谋,而LLM的自然语言交互能力可能带来更复杂的合谋风险。研究问题卖家代理间的自然语言沟通是否会增强合谋倾向?不同LLM模型的合谋倾向是否存在差异?原创 2026-01-29 09:30:00 · 152 阅读 · 0 评论 -
2025_NIPS_EFFIBENCH-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code
现有代码生成基准主要评估功能正确性,对代码效率的关注有限,且通常局限于Python等单一语言。为填补这一空白,我们提出EFFIBENCH-X——首个用于衡量LLM生成代码效率的多语言基准。EFFIBENCH-X支持Python、C++、Java、JavaScript、Ruby和Golang,包含竞赛编程任务及人类专家解决方案作为效率基线。在EFFIBENCH-X上对最先进LLM的评估表明,尽管模型能生成功能正确的代码,但在效率上始终不如人类专家。原创 2026-01-23 12:30:00 · 54 阅读 · 0 评论 -
2025_NIPS_EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Proble
我们推出 EvaLearn,这是一款开创性的基准测试,旨在评估大型语言模型(LLMs)在高难度任务中的学习能力和效率——这是模型潜力中至关重要但尚未被充分探索的一个方面。EvaLearn 包含 648 个高难度问题,涵盖 6 类任务,组织成 182 个序列,每个序列对应一类任务。与大多数现有基准测试采用的并行评估方式不同,EvaLearn 要求模型依次解决问题,使其能够利用从之前解答中获得的经验。EvaLearn 提供了 5 个全面的自动化指标来评估模型,量化其学习能力和效率。原创 2026-01-22 12:30:00 · 47 阅读 · 0 评论 -
2025_NIPS_PARROT: A Benchmark for Evaluating LLMs in Cross-System SQL Translation
大语言模型(LLMs)在文本到SQL(Text-to-SQL)任务中已展现出日益显著的有效性。然而,另一项密切相关的任务——跨系统SQL翻译(又称SQL到SQL翻译),即将为一个数据库系统(如MySQL)编写的查询转换为适用于另一个系统(如ClickHouse)的等效查询,具有极高的实际意义,但尚未得到充分探索。现有SQL基准测试并不适合用于SQL到SQL翻译的评估,原因在于:(1)它们仅聚焦于有限的数据库系统(通常仅为SQLite);原创 2026-01-08 10:30:00 · 80 阅读 · 0 评论 -
Reliable Annotations with Less Effort: Evaluating LLM-Human Collaboration in Search Clarifications
本文聚焦于复杂、多维度的搜索澄清任务标注,探讨大语言模型(LLMs)与人类协作(Human-in-the-Loop, HITL)的有效性,旨在以更少的人力成本获得可靠标注。研究背景:传统信息检索(IR)评估依赖人类标注,成本高、难扩展。LLMs在简单标注任务中表现接近人类,但在主观、细粒度、高风险任务(如搜索澄清)中存在局限性(不一致、校准差、对提示敏感)。研究对象。原创 2025-12-31 07:30:00 · 49 阅读 · 0 评论 -
Evaluation of Clinical Trials Reporting Quality using Large Language Models
研究背景与目标临床试验报告质量(尤其随机对照试验RCT)影响临床决策,CONSORT是当前应用最广的报告标准,但部分医学领域报告质量仍不足。目标:测试通用领域和生物医学领域的大型生成语言模型,结合不同提示方法(含思维链CoT),依据CONSORT标准评估临床试验摘要报告质量。核心工作步骤构建语料库:创建CONSORT-QA语料库,源自两项分别针对COVID-19干预和儿童青少年抑郁症预防RCT的CONSORT-abstract标准评估研究,含139篇摘要及专家标注。原创 2025-11-06 08:30:00 · 218 阅读 · 0 评论 -
DON’T PASS@k: A BAYESIAN FRAMEWORK FOR LARGE LANGUAGE MODEL EVALUATION
现有评估方法的局限性Pass@k 是LLM推理性能评估的常用指标,但在试验样本有限、计算资源受限的场景下,易产生不稳定、误导性的排名,且难以量化不确定性。平均准确率(avg@N)虽能缓解部分问题,但计算成本高,无法统一处理分级评估结果,也缺乏判断性能差异显著性的原则性规则。贝叶斯评估框架核心设计分类结果建模:将评估结果视为分类变量(如正确、部分正确、格式错误等),而非仅0/1二元结果,通过 Dirichlet 先验分布建模,可处理任意加权评分规则。后验估计与不确定性量化。原创 2025-11-04 08:30:00 · 206 阅读 · 0 评论 -
TOWARD A UNIFIED FRAMEWORK FOR DATA-EFFICIENT EVALUATION OF LARGE LANGUAGE MODELS
对大型语言模型(LLMs)进行全面基准测试评估是其发展的基石,但该过程往往在计算和财务层面难以实现。尽管项目反应理论(IRT)通过分离模型能力与题目难度,为数据高效评估提供了可行路径,但现有基于IRT的方法仍存在显著局限。这些方法通常仅适用于二元正确性指标,无法原生处理生成任务中使用的连续分数,且仅针对单一基准运行,忽略了不同指标或基准间关联等宝贵的结构知识。为克服这些挑战,我们提出LEGO-IRT——一个用于数据高效LLM评估的统一且灵活的框架。LEGO-IRT的创新设计原生支持二元和连续两种评估指标。原创 2025-11-01 08:30:00 · 195 阅读 · 0 评论 -
What am I missing here?: Evaluating Large Language Models for Masked Sentence Prediction
基于Transformer的模型主要依赖“下一个token预测”(NTP)任务,该任务根据前文语境预测序列中的下一个token。然而,NTP对单token预测的侧重,往往限制了模型的前瞻规划能力与长程连贯性维持能力,这引发了一个疑问:LLMs在结构化文档中对长语境(如完整句子)的预测能力究竟如何?尽管NTP能提升文本的局部流畅性,却未明确激励模型确保跨句子边界的全局连贯性——而这种连贯性是文本重构或论述类任务的核心能力。原创 2025-10-23 09:30:00 · 137 阅读 · 0 评论 -
MME-EMOTION: A HOLISTIC EVALUATION BENCHMARK FOR EMOTIONAL INTELLIGENCE IN MULTIMODAL LARGE LANGUAGE
情感计算作为交叉学科,致力于弥合人类情商与机器能力的差距,在教育、医疗、人机交互等领域应用广泛。随着多模态大型语言模型(MLLMs)的兴起,研究重心从情感识别转向情感状态背后线索的可解释性,但当前情感基准存在场景覆盖不足、评估协议不一致等问题,无法清晰衡量MLLMs在真实场景中的情感泛化能力、情感识别准确性及情感触发因素识别能力。近年来,多模态大型语言模型(MLLMs)的进步推动了情感计算领域的变革性发展,使模型能够展现出新兴的情商。原创 2025-10-22 08:30:00 · 138 阅读 · 0 评论 -
Democratizing Diplomacy: A Harness for Evaluating Any Large Language Model on Full-Press Diplomacy
我们提出了首个评估框架,该框架能让任何现成的本地大型语言模型(LLMs)在无需微调或专门训练的情况下,参与完整的“全面外交”游戏。此前的研究工作由于“外交”游戏状态的高复杂度和高信息密度,且比赛结果方差较大,使得“外交”游戏的研究门槛极高,只有前沿大型语言模型或经过微调的模型才能参与。在本研究中,我们通过数据驱动的迭代方式优化了文本形式的游戏状态表示,使得一个240亿参数的模型无需任何微调就能可靠地完成整个游戏。原创 2025-10-20 08:30:00 · 137 阅读 · 0 评论 -
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
在多模态大型语言模型(MLLMs)飞速发展的背景下,其输出的安全问题已引起广泛关注。尽管目前已提出众多数据集,但随着多模态大型语言模型的不断进步,这些数据集可能会逐渐过时,并且还容易受到数据污染问题的影响。为解决这些问题,我们提出了SDEval,这是首个用于多模态大型语言模型安全动态评估的框架,能够可控地调整安全基准的分布与复杂度。具体而言,SDEval主要采用文本动态、图像动态和文本-图像动态三种动态策略,从原始基准中生成新样本。原创 2025-09-18 08:30:00 · 249 阅读 · 0 评论 -
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Model
评估范式创新:首次将教育领域的认知诊断模型(CDM)引入金融LLMs评估,从“单一分数评估”转向“知识-技能级诊断”,实现可解释、技能感知的评估,为模型优化提供精准方向;数据集设计创新:以CPA考试为核心构建数据集,覆盖70个核心金融概念,通过专家双阶段标注保证质量,解决现有数据集“覆盖窄、质量参差”问题;技术方法创新:采用非负矩阵共因子分解结合CDM,同时建模“问题-技能”“模型-技能”“技能-概念”三大关系,通过联合优化目标函数提升评估准确性,且在实验中显著优于传统CDM方法;实验规模与洞察创新。原创 2025-09-03 10:30:00 · 214 阅读 · 0 评论 -
Economic Evaluation of LLMs
本文针对大型语言模型(LLMs)评估中帕累托前沿方法无法比较不同优缺点模型(如低成本高误差模型与高成本高精度模型)的问题,提出了LLM经济评估框架。该框架基于具体应用场景的经济约束(以美元量化),将LLM的性能权衡转化为单一数值,这些约束包括:错误成本(一次错误的经济损失)、增量延迟成本(单位延迟的经济损失)、放弃查询成本(不响应查询的经济损失)。当错误成本超过0.01美元时,推理模型的准确率-成本权衡优于非推理模型;原创 2025-08-14 09:30:00 · 224 阅读 · 0 评论 -
Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
本文聚焦于韩语(一种黏着语)的句尾特征,旨在评估大型语言模型(LLMs)对韩语句尾的理解能力。研究背景:LLMs在英语等字母语言中表现优异,但在低资源黏着语(如韩语)中因形态复杂(句尾变化影响句意)存在不足。韩语中,动词词干可结合不同句尾表达陈述、感知、感叹等多种含义,句尾的细微变化会显著改变句意。KoSEnd数据集构建包含3000个句子,分“简单”(语言学习者语料)、“中等”(新闻语料)、“困难”(学术论文摘要)三个难度等级。原创 2025-08-12 08:30:00 · 194 阅读 · 0 评论 -
MultiFinBen: A Multilingual, Multimodal, and Difficulty-Aware Benchmark for Financial LLM Evaluation
本文介绍了首个面向金融领域大型语言模型(LLMs)的多语言、多模态、难度感知基准——,旨在解决现有金融基准单语、单模态、任务简单化等局限性。该基准覆盖文本、视觉(图表、OCR文档)、音频(财报电话会议)三种模态,支持英语、中文、日语、西班牙语、希腊语五种语言,包含单语、双语、多语三种语言场景,涉及信息抽取、文本分析、问答、文本生成等7类金融任务,并按难度分为简单、中等、困难三级。研究团队引入了多个创新数据集:如(首个多语言金融问答数据集,需对混合语言输入进行复杂推理)、原创 2025-07-09 08:30:00 · 192 阅读 · 0 评论 -
FABLE: A Novel Data-Flow Analysis Benchmark on Procedural Text for Large Language Model Evaluation
FABLE基准介绍:FABLE是首个针对大语言模型(LLMs)在程序文本中数据流推理能力的评估基准,改编自软件工程中的8种经典数据流分析方法(如到达定义、活跃变量分析、污染分析等),并将其应用于烹饪食谱、旅行路线和自动化计划三个真实世界领域。数据集构建从三个领域收集数据并处理为结构化表示,包括步骤依赖图和实体流图。包含2400个问答对,每个领域-分析组合有100个示例,覆盖不同复杂度和自动化水平的程序文本。实验评估。原创 2025-06-16 09:30:00 · 183 阅读 · 0 评论 -
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
大型语言模型(LLMs)和视觉语言模型(VLMs,统称LMs)已革新了自然语言处理(NLP)和计算机视觉(CV)领域,在多个领域展现出显著潜力。然而,其在情感分析(即情绪分析和情感检测)中的能力仍未被充分探索。这一空白主要归因于缺乏全面的评估基准,以及情感分析任务本身的复杂性。本文引入MMAFFBen,首个用于多语言多模态情感分析的大规模开源基准。MMAFFBen涵盖35种语言的文本、图像和视频模态,包含四项关键情感分析任务:情感极性、情感强度、情绪分类和情绪强度。原创 2025-06-08 09:30:00 · 199 阅读 · 0 评论 -
LITRANSPROQA: An LLM-based LITerary TRANSlation Evaluation Metric with PROfessional Question
本文聚焦于文学翻译评估领域,针对现有评估指标过度关注机械准确性、忽视艺术性表达及文化真实性的问题,提出了一种基于大语言模型(LLM)的新型评估框架。该框架通过整合专业文学译者和研究者的见解,设计了一套针对文学翻译核心要素(如文学手法、文化理解、语气等)的问答体系,无需参考译文即可评估翻译质量。原创 2025-06-01 09:30:00 · 214 阅读 · 0 评论 -
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
原创 2025-05-14 08:30:00 · 193 阅读 · 0 评论 -
TALE: A Tool-Augmented Framework for Reference-Free Evaluation of Large Language Models
随着大语言模型(LLMs)越来越多地融入现实世界的自主应用中,依靠静态的、预先标注的参考来进行评估在成本、可扩展性和完整性方面面临重大挑战。我们提出了工具增强的大语言模型评估(TALE)框架,用于在没有预定标准答案的情况下评估大语言模型的输出。与传统的与固定参考进行比较或仅依赖大语言模型作为评判者的知识的评估指标不同,TALE采用了具有工具访问能力的智能体,该智能体主动检索和合成外部证据。它通过迭代生成网络查询、收集信息、总结结果,并通过反思优化后续搜索。原创 2025-04-23 09:30:00 · 693 阅读 · 0 评论 -
When LLM Therapists Become Salespeople: Evaluating Large Language Models for Ethical Motivational
大语言模型(LLMs)已在心理健康领域得到积极应用。近期研究显示,LLMs在应用心理治疗,尤其是动机性访谈(MI)方面具有潜力。然而,目前缺乏关于语言模型如何理解MI伦理的研究。鉴于恶意行为者可能利用语言模型将MI用于不道德目的的风险,评估它们区分道德和不道德MI实践的能力至关重要。因此,本研究通过多项实验探究LLMs在MI中的伦理意识。我们的研究结果表明,LLMs在MI方面具有中等到较强的知识水平。然而,它们的伦理标准与MI精神并不一致,因为它们会生成不道德的回应,并且在检测不道德回应方面表现不佳。原创 2025-04-19 09:30:00 · 180 阅读 · 0 评论 -
BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models
在本研究中,我们引入了BEATS,这是一个用于评估大语言模型(LLMs)中的偏见、伦理、公平性和真实性的全新框架。基于BEATS框架,我们提出了一个针对LLMs的偏见基准,该基准通过29个不同的指标来衡量模型性能。这些指标涵盖广泛的特征,包括人口统计学、认知和社会偏见,以及伦理推理、群体公平性的度量和与真实性相关的错误信息风险。这些指标能够定量评估LLM生成的响应在多大程度上可能延续社会偏见,进而强化或扩大系统性不平等。原创 2025-04-16 08:30:00 · 237 阅读 · 0 评论 -
Measuring AI Ability to Complete Long Tasks
本文提出了一种量化AI系统能力的新指标——50%任务完成时间跨度(50%-task-completion time horizon),即人类完成AI模型以50%成功率完成的任务所需的平均时间。当前前沿模型的50%时间跨度约为50分钟。自2019年以来,AI的时间跨度每七个月翻倍,2024年增速可能加快。性能提升主要得益于逻辑推理、工具使用能力和错误适应能力的增强。若趋势持续,未来五年内AI可能完成人类需一个月的软件任务。尽管AI基准测试进展迅速,其现实意义仍不明确。50%任务完成时间跨度。原创 2025-03-31 10:44:02 · 266 阅读 · 0 评论 -
Evaluating Large Language Models Against Human Annotators in Latent Content Analysis
在快速数字通信时代,每天都会产生大量文本数据,这就需要高效的潜在内容分析方法来提取有意义的信息。大语言模型(LLMs)为实现这一过程的自动化提供了可能,但目前缺乏在多个维度上将其性能与人类标注者进行全面比较的评估。本研究评估了包括OpenAI的GPT-4、Gemini、Llama和Mixtral等7种前沿大语言模型在分析情感、政治倾向、情感强度和讽刺检测方面相对于人类标注者的可靠性、一致性和质量。原创 2025-03-30 08:30:00 · 137 阅读 · 0 评论 -
ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
有效评估多跳工具使用能力对于分析大语言模型(LLMs)的理解、推理和函数调用能力至关重要。然而,由于缺乏可靠的评估数据集,这方面的进展受到了阻碍。为了解决这一问题,我们提出了ToolHop,这是一个包含995个用户查询和3912个相关工具的数据集,专门用于严格评估多跳工具使用能力。ToolHop通过一种新颖的查询驱动数据构建方法,包括工具创建、文档细化和代码生成,确保了多样化的查询、有意义的相互依赖关系、本地可执行的工具、详细的反馈以及可验证的答案。原创 2025-03-28 09:30:00 · 245 阅读 · 0 评论 -
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
随着大语言模型(LLMs)在电子商务等领域的应用日益广泛,特定领域的概念评估基准对于评估其领域能力至关重要。在复杂的电子商务应用中,现有的大语言模型可能会生成与事实不符的信息。因此,有必要构建一个电子商务概念基准。现有基准面临两个主要挑战:(1)处理任务的异构性和多样性;(2)区分电子商务领域内的通用性和特殊性。为了解决这些问题,我们提出了ChineseEcomQA,这是一个可扩展的问答基准,专注于基础电子商务概念。原创 2025-03-18 09:30:00 · 187 阅读 · 0 评论 -
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
基于大语言模型(LLMs)的智能体系统在超越传统自然语言处理任务的现实应用中取得了巨大进展。本文提出了一种新的由大语言模型驱动的多智能体系统(LLM-MAS)基准测试平台Collab-Overcooked,它基于广受欢迎的Overcooked-AI游戏构建,在交互式环境中设置了更具实用性和挑战性的任务。Collab-Overcooked从两个全新的角度扩展了现有基准。第一,它提供了一个支持多种任务和目标的多智能体框架,并鼓励通过自然语言通信进行协作。原创 2025-03-19 08:30:00 · 282 阅读 · 0 评论 -
RE-EVALUATING OPEN-ENDED EVALUATION OF LARGE LANGUAGE MODELS
传统的评估方式主要聚焦于针对特定技能对候选对象进行排名。而诸如大语言模型(LLMs)这样的现代通用模型,显然超越了这种范式。开放式评估系统应运而生,在该系统中,候选模型会依据用户提交的提示进行比较,成为了一种流行的解决方案。尽管开放式评估系统有诸多优点,但我们发现,当前基于Elo的评分系统由于对冗余信息敏感,可能会受到数据中有意或无意偏差的影响,甚至会强化这些偏差。为了解决这个问题,我们将评估视为一个三方博弈,并引入了新的博弈论解决方案,以确保对冗余信息具有鲁棒性。原创 2025-03-09 08:30:00 · 233 阅读 · 0 评论 -
INCLUDE: EVALUATING MULTILINGUAL LANGUAGE UNDERSTANDING WITH REGIONAL KNOWLEDGE
语言之间的大型语言模型(LLM)的性能差异阻碍了它们在许多地区的有效部署,抑制了生成性人工智能工具在许多社区的潜在经济和社会价值。然而,由于缺乏英语以外语言的高质量评估资源,许多语言的功能性LLM(即多语言LLM)的发展受到了瓶颈。此外,目前多语言基准构建的做法往往翻译英语资源,忽视了使用多语言系统的环境的区域和文化知识。在这项工作中,我们构建了一个由197243对来自当地考试来源的QA对组成的评估套件,以衡量多语言LLM在各种地区背景下的能力。原创 2024-12-31 10:15:00 · 244 阅读 · 0 评论 -
Performance Evaluation of Lightweight Open-source Large Language Models in Pediatric Consultations
背景大语言模型 (LLM) 已在医学中展示了潜在的应用,但数据隐私和计算负担限制了它们在医疗机构中的部署。LLM的开源和轻量级版本作为潜在的解决方案出现,但它们的性能,特别是在儿科环境中的性能仍未得到充分探索。我们的目的是评估轻量级LLM在回应儿科患者咨询方面的表现。方法在这项横断面研究中,从2022年12月1日至2023年10月30日期间,从公共在线医疗论坛中随机抽取了250个患者咨询问题,其中25个儿科科室各有10个问题。原创 2024-12-25 10:15:00 · 275 阅读 · 0 评论 -
Evaluating Language Models as Synthetic Data Generators
鉴于在语言模型(LM)训练后越来越多地使用合成数据,LM生成高质量数据的能力几乎与直接解决问题的能力一样重要。虽然之前的工作侧重于开发有效的数据生成方法,但它们缺乏对不同LM作为统一环境中的数据生成器的系统比较。为了解决这一差距,我们提出了AGORABENCH,这是一个基准,提供了标准化的设置和指标来评估LM的数据生成能力。通过使用6个LM合成126万个训练实例并训练99个学生模型,我们发现了关于LM数据生成能力的关键见解。首先,我们观察到LMs表现出明显的优势。原创 2024-12-10 16:52:30 · 579 阅读 · 0 评论 -
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
大型预训练的代码生成模型,如OpenAI Codex,可以生成语法和功能正确的代码,使程序员的编码更加高效,我们对通用人工智能的追求更加紧密。本文介绍了CodeGeeX,这是一个具有130亿个参数的多语言模型,用于代码生成。截至2022年6月,CodeGeeX已对23种编程语言的8500亿个代币进行了预训练。我们广泛的实验表明,CodeGeeX在HumanEval-X上的代码生成和翻译任务上都优于类似规模的多语言代码模型。原创 2024-11-28 09:00:00 · 266 阅读 · 0 评论 -
Evaluation of Bias Towards Medical Professionals in Large Language Models
社会基于性别、种族和民族对医疗专业人员持有固有的偏见。本研究旨在评估大型语言模型 (LLM) 在住院医师选择方面是否表现出对医疗专业人员的偏见。**方法:**创建虚构的候选人简历以控制包括性别和种族在内的身份因素,同时保持一致的资格。三个 LLM(GPT-4、Claude-3haiku 和 Mistral-Large)使用标准化提示进行测试,以评估和排名特定住院医师计划的简历。通过直接更改性别和种族信息来测试显式偏见,而通过隐藏种族和性别更改候选人的姓名来测试隐性偏见。原创 2024-11-20 10:30:00 · 172 阅读 · 0 评论
分享