FACTS基准测试套件:全新评估大型语言模型的事实准确性
在人工智能快速发展的今天,语言模型的准确性成为了技术进步的关键指标。近日,FACTS基准测试套件正式发布,旨在系统性地评估大型语言模型的事实准确性。这一新行业基准由FACTS团队与Kaggle联合开发,扩展了早期的事实基础研究,提出了一个多维度框架,帮助评估语言模型在不同场景下生成准确响应的能力。
FACTS基准测试套件基于原有的FACTSGroundingBenchmark,增加了三个新基准:参数化(Parametric)、搜索(Search)和多模态(Multimodal)。这些基准测试结合更新后的GroundingBenchmarkv2,能够从四个维度评估模型的事实性,反映现实世界中常见的模型使用场景。总共3513个精选示例分为公共和私有评估集,Kaggle负责管理私有数据集,并通过公开排行榜发布评估结果。
在参数化基准测试中,模型被要求仅凭内部知识回答基于事实的问题,类似于常见的知识问答。这一部分主要考察模型在没有外部工具支持下的表现。而搜索基准测试则关注模型是否能够通过标准的Web搜索工具准确检索并整合信息,通常需要多步检索才能完成单个查询。多模态基准测试则检验模型在回答与图像相关的问题时的事实准确性,要求结合背景知识进行合理的视觉解读。
初步结果显示,Gemini3Pro以68.8%的总体FACTS评分位居首位,其参数化和搜索事实性均显著优于前代模型。然而,所有评估模型的总体准确率均未突破70%,多模态事实性仍然是各模型普遍面临的挑战。