Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and

发布时间:2026/10/3 8:42:32
Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and
今天分享的论文是《Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges》原文链接[2502.12378] Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges这篇论文很有意思作者从语用学的角度出发去衡量评估LLM算是一个创新的思路。理解语用学——在上下文中使用语言—— 对于开发能够解释细微语言使用的 NLP 系 统至关重要。尽管包括大型语言模型在内 的语言技术有了新的发展但评估它们处 理语用现象(如隐含和指称)的能力仍然具 有挑战性。为了提高模型的实用能力有 必要了解当前的评估趋势并确定现有的限 制。在这个调查中本文提供了一个综合 的资源评估自然语言处理中的语用能力 根据他们处理的语用现象对数据集进行分 类。本文分析任务设计、数据收集方法、 评估方法以及它们与现实世界应用的相关 性。通过在现代语言模型的背景下检查这 些资源本文强调了现有基准中出现的趋 势、挑战和差距。本文的调查旨在阐明实 用评估的前景并指导更全面和更有针对 性的基准的开发最终促成更细致入微和 上下文感知的 NLP 模型。传统的自然语言处理(NLP)模型虽然 能够胜任句法分析和语义分析却难以处理超 出单词字面定义的含义。这种差距就是语用学 变得至关重要的地方。早期的方法如基于规 则的系统使用显式编码的规则来表示知识 并将输入与知识库匹配以生成响应(Bajwa and Choudhary,2006 Grosan et al.,2011). 后 来统计模型应用概率论来预测语言行为 (Johnson,2009)而深度学习用基于变压器 的 模 型 像 BERT(Devlin et al.,2019) 和 GPT(Brown et al.,2020)通过支持上下文相 关文本的生成来转换 NLP。然而他们在理解语 用学方面的表现仍然有限(Hu et al.,2023 Sileoet al.,2022Park et al.,2024b). 最近大型语言模型(LLM)的出现增强了评 估其类人交流能力的需要特别是对于需要复 杂 的 语 用 推 理 (Hu et al.,2023 Ruis et al.,2023Yerukola et al.,2024).随着 LLM 越来越多地应用于现实世界验证其理解和生 成上下文适当且语用准确的响应的能力对于确 保有效且值得信任的人机交互至关重要。尽管 LLM 的最新进展显示了其在生成连贯且符合语 境的语篇方面的能力但其语用能力仍未得到 充 分 的 评 估 (Hu et al.,2023 Kwon et al.,2023Chang et al.,2024).重要的问题出现了:已经开发了什么资源来 评估 NLP 模型的实用能力更重要的是本文如何利用语用学来指导LLM的发 展形成一个全面的语用学评估框架并进一 步推进语言学中的语用学研究为了回答这些 问题本文对 NLP 中用于评估语用学的资源进 行了全面的调查 2 本文介绍了语用学和 3 本文 回顾了这些语用现象是如何在各种 NLP 任务中 被评估的。在4 本文总结了以前的工作如 何建立一个实用的数据集。 在5 本文提出了 当前研究中使用的度量和评估技术。在6 强调差距并为未来的研究提供建议。图 1:语用现象的分类图 2:任务类型的分类局限性本文在调查中发现了以下局限性。调查来源。 本文的调查主要包括自然语言处理领域的文 献因为调查的范围是回顾自然语言处理模型 中评估语用学的资源。因此本文没有过多地 寻找语言学研究的资源。这可能会导致潜在资 源或启发性评价方法的遗漏而这些资源或方 法可能会给当前的数据收集过程和评价带来深 刻见解。本文主张在未来的调查中审查语用语 言的资源 语言学中的理解。 NLP 任务。本文的调查是为 NLP 中的适用性 任务量身定制的。因此诸如语篇建模等内在 的语用任务没有被讨论。然而它们仍然值得 研究特别是在获得对当前评估的见解方面。 多语制。本文调查的范围仅限于只用英语出 版的文学作品。尽管本文努力包括解决多种语 言的作品(虽然是用英语写的)但可以想象的 是用其他语言创建的语用数据集没有被包括 在内。这种语言约束可能会限制一种特定语言 所特有的各种语用现象和方法的包容性。 多模态。虽然本文的论文涵盖了一些超出基 于文本的特征的数据点例如图像字幕任务 (例如Tsvilodub and Franke,2023)大部 分数据都是基于文本的。这一差距也在本文的 6.1。由于本文主要关注 NLP 场馆一些资源 可能不包括在内。因此本文鼓励今后的工作 探索跨不同模式的务实评估。做个总结这项调查提供了一个全面的现有资源的评估自 然语言处理中的语用理解概述。通过根据数据 集的目标语用现象对数据集进行分类用数据 收集方法分析其任务设计以及如何用模型对 其进行评估本文强调了该领域的当前趋势和 挑战。本文的发现强调了对更细致和更丰富的 评估基准的需求特别是随着 LLM 的不断发 展。本文希望为研究人员和实践者提供一个有 价值的指导促进自然语言处理中的语用推 理促进系统更像人类的交流和跨学科的合 作。附录为了编写这份调查本文对最近关于评估自然 语言处理中语用学的文献进行了全面的回顾 特别关注数据集。本文通过主要查看 2024 年 12 月 31 日在 ACL 选集上发表的论文使用关 键词“实用主义”和“数据集”,专注于确定 解决这些方面的作品 1。 这被选为主要来源因为它是*CL 社区的主 要出版平台包含了 NLP 模型中最相关的语用 学评估工作。在初步搜索之后本文应用了额 外的过滤标准来优化选择。具体来说本文关 注的是- 引入了专门为评估自然语言处理中的语 用现象而设计的数据集- 讨论了评估语言模型的语用能力的方法 或者- 在与语用学相关的任务中提供 NLP 模型的 经验评估。此外本文进行了手动定性检查以确保包含由于术语变化而可能未被捕获的相关作品 本文还根据本文在该领域的专业知识从 ACL 选集的其他来源收录了一些最近的文章。这导致了当前版本的 58 篇论文的最后部分。