C
发布于 2026/09/03 · 阅读 3

前沿大语言模型在现实事实核查上的分歧研究

  • #LLM
  • #事实核查
  • #模型评价
  • #Hacker News
  • #lenz.io
前沿大语言模型在现实事实核查上的分歧研究

前沿大语言模型在现实事实核查上的分歧研究

1. 前沿模型的分歧频率

在67%的声明中(672/1000,95%置信区间:64-70%),前沿模型小组未能达成一致——至少有一个模型与多数判决不同,或者根本没有形成严格多数。具体分析:对于每个声明,我们查看五个前沿模型的判决,并询问:是否至少有3个模型选择了相同答案(严格多数)?如果是,其余模型中有多少持异议?如果没有出现明确多数——判决分散在三个或四个不同的类别中——则该声明归入“模型分裂,无多数”行。这些声明大多不太可能出现在任何带有黄金标签的训练语料中——没有标准的答案键可供模式匹配,没有基准排行榜可供锚定。我们下文引用“多数”和“对多数的异议”。前沿模型的多数并非真实情况。多数判决有时是错误的;单个异议模型有时是正确的。我们使用多数作为衡量分歧的结构性参考点,而非正确性的替代。

前沿模型判决模式声明数量占语料比例
全部5个一致(一致同意)32833%(30-36%)
1/5 持异议22422%(20-25%)
2/5 持异议31632%(29-35%)
模型分裂,无多数(如2-2-1或2-1-1-1)13213%(11-15%)
≥1个模型持异议(包括分裂)67267%(64-70%)
≥2个模型持异议(包括分裂)44845%(42-48%)

小组一致性:Krippendorff's α(序数)= 0.639(n=1000个声明,5个评分者)。这表明有显著但有限的一致性:模型的判决是有结构的而非随机,但不够一致,不能将小组视为一个可互换的单一评判者。序数α是针对有序分类尺度(真/基本真/误导/假)的标准Krippendorff变体。参见§7.5统计分析以了解度量选择。

模型误差下限

对于每个声明,四个判决类别中恰好有一个是正确的答案。如果我们假设小组最受欢迎的类别是正确的——最仁慈的假设——则选择错误判决的模型的最小数量为:

  • 在67%的声明中≥1个模型错误(任何非一致同意的面板)
  • 在45%的声明中≥2个错误(3-2、3-1-1或无多数分裂)
  • 在13%的声明中≥3个错误(没有类别达到多数,因此最多只能有2个正确)

放宽“最受欢迎的是正确的”这一假设只会增加这些计数,绝不会减少。实际错误率很可能更高:即使在所有五个模型都一致的33%的案例中,也可能且很可能包含共同的盲点。

2. 实质性分歧与细微差别分歧

在34%的声明中(343/1000,95%置信区间:31-37%),至少有两个前沿模型选择的判决在我们的4类别分类中相差2个或更多级别——这超出了校准范围。并非所有分歧都相等。“真”与“基本真”的分歧是置信校准的偏移。“真”与“假”的分歧是关于答案的实质性分歧。我们通过每个声明上5个判决的最大成对级别距离来衡量,其中判决按顺序排列为真(0)→基本真(1)→误导(2)→假(3)。

距离解读声明数量占比
0完全一致(所有5个选择相同类别)32833%(30-36%)
1仅细微差别(如真↔基本真)32933%(30-36%)
2实质性(真↔误导,或基本真↔假)13213%(11-15%)
3两极(真↔假)21121%(19-24%)
≥2个级别差(实质性或两极)34334%(31-37%)

注意事项:级别距离将真/基本真/误导/假视为序数量表;等距解释是一种简化。2级差距仍可能反映分类标准模糊、时间框架差异或对“误导”的不同解释。我们将其报告为粗略的“实质性vs细微差别”指标,而非误差幅度的度量。

3. 模型间一致性

最高的同侪一致性:Gemini 3 Pro × Gemini 3 Pro + Search(75%)——不奇怪,因为它们共享基础模型。最低的:Claude Opus 4.7 × Gemini 3 Pro、Claude Opus 4.7 × Gemini 3 Pro + Search 和 Gemini 3 Pro × Sonar Pro(53%)——三对并列最低。

每对前沿模型在语料库中所有声明上选择相同判决标签的频率:

GPT-5.4Claude Opus 4.7Gemini 3 ProGemini 3 Pro + SearchSonar Pro
GPT-5.465%(62-68%)65%(62-68%)60%(57-63%)60%(57-63%)
Claude Opus 4.765%(62-68%)53%(50-56%)53%(50-56%)58%(55-61%)
Gemini 3 Pro65%(62-68%)53%(50-56%)75%(72-77%)53%(50-56%)
Gemini 3 Pro + Search60%(57-63%)53%(50-56%)75%(72-77%)58%(55-61%)
Sonar Pro60%(57-63%)58%(55-61%)53%(50-56%)58%(55-61%)

4. 每个模型的行为

从两个角度观察同一五个模型:每个模型如何分配其判决(4.1),以及每个模型的判决与其余四个模型的严格多数匹配的频率(4.2)。

4.1 判决分布

一些模型将判决集中在真/假两极;其他模型则更广泛地分布在中间两个类别。这反映了模型级别的决策先验与具体声明的相互作用——在没有真实情况的情况下,我们无法将两者分开。下表显示了每个模型分配给每个类别的声明比例,单元格下方为95% Wilson置信区间。

模型基本真误导
GPT-5.442%(39-45%)16%(14-19%)12%(10-14%)30%(28-33%)
Claude Opus 4.738%(35-41%)26%(23-29%)19%(17-22%)17%(15-20%)
Gemini 3 Pro54%(51-57%)3%(2-4%)3%(2-4%)40%(37-43%)
Gemini 3 Pro + Search52%(49-55%)4%(3-5%)9%(7-11%)35%(32-38%)
Sonar Pro35%(32-38%)23%(21-26%)16%(14-18%)26%(23-28%)

4.2 与小组其他成员的一致性

在五个模型中,与同行多数的一致性范围从69%到81%。这是该语料库中的同侪对齐,而非正确性——这里没有模型被视为真实情况,每行的合格n不同。对于每个模型,其判决与另外四个模型的严格多数(≥3/4)匹配的频率?仅当另外四个模型中存在≥3/4多数时,声明才合格。

模型与同行多数的一致性合格n不合格层级
GPT-5.481%(78-84%)650350参数型
Claude Opus 4.770%(67-74%)691309参数型
Gemini 3 Pro77%(74-80%)683317参数型
Gemini 3 Pro + Search76%(73-79%)693307检索增强
Sonar Pro69%(66-73%)675325检索增强

5. 详细结果

5.1 按领域的前沿模型分歧

每行分母:该领域的声明数量(声明列)。

领域声明数任何分歧实质性(≥2个级别)无多数
金融7567%(55-76%)39%(28-50%)20%(13-30%)
通用17968%(60-74%)40%(33-48%)12%(8-17%)
健康17171%(64-78%)29%(23-36%)12%(8-17%)
历史13153%(44-61%)24%(17-32%)13%(8-20%)
法律4877%(63-87%)40%(27-54%)19%(10-32%)
政治16870%(62-76%)38%(31-46%)8%(5-13%)
科学15168%(60-75%)36%(29-44%)21%(15-28%)
技术7769%(58-78%)31%(22-42%)8%(4-16%)

5.2 按判决的小组一致性

当小组确实落在中间类别时,几乎从未达成一致。“基本真”和“误导”多数达到一致同意的概率至多5%,而“真”和“假”多数则为43-47%。与此一致的是,针对不同真实世界语料库(17,856个PolitiFact声明,使用单家族Llama-3消融实验,Schwab等人2025)的研究发现,细微差别的标签正是事实核查判决模型集中错误的地方——来自不同方法论设置的相关观察(单家族消融,而非前沿模型小组)。

分母:在该判决上具有严格≥3/5前沿多数声明的数量。揭示小组最/最不自信的判决区域。

多数判决合格n一致同意(5/5)仅多数(3-4/5)
43847%(42-51%)53%(49-58%)
基本真760%(0-5%)100%(95-100%)
误导745%(2-13%)95%(87-98%)
28043%(37-49%)57%(51-63%)

从另一个方向看——在所有5个前沿模型达成相同判决的328个声明中,各判决的分布:

一致判决声明数量占一致同意比例
20462%(57-67%)
基本真00%(0-1%)
误导41%(0-3%)
12037%(32-42%)

6. 数据

1,000个声明——提交给事实核查平台的最新真实用户请求,通过了排除部分下列出的所有资格筛选。这些声明均不早于2026年2月15日。除非另有说明,本页上的每个指标均使用此集合作为分母;使用不同分母的表格(例如在某个判决上具有严格≥3/5前沿多数的声明)会内联说明。

来源

这些声明提交给Lenz,一个事实核查平台。我们选择此语料库是因为它代表了有机的真实世界事实核查请求,而非策划的基准项目。Lenz对每个声明的判决未用于此分析——本文仅测量前沿模型的分歧,而非Lenz与前沿模型。

声明标准化

CSV中的atomic_claim字段不是用户的原始提交。它是Lenz框架步骤的输出,该步骤去除情绪化语言和偏见,并将输入提炼为单个中性、可测试的命题,并锚定到提交日期。前沿模型是针对框架化声明进行评分的,而非原始文本。例如,如果用户输入“加拿大当局因引用圣经而将基督徒投入监狱!!!”则针对命题“截至2026年4月4日,加拿大当局因基督教信仰而将公开引用圣经的个人监禁”进行评分。

排除项

语料库排除了:

  • 提交用户标记为私有的声明
  • 来自平台员工、内部账户或代理/API提交的声明(仅真实用户网页提交出现在语料库中)
  • 编辑状态为待审核或隐藏的声明——无论是在编辑审查后取消发布,还是在提交时由Lenz的PII筛选步骤自动标记(包含非公开个人的个人信息)
  • 近似重复声明——使用atomic_claim的OpenAI text-embedding-3-small嵌入(1536维)余弦距离≤0.2的对合并为单个规范行。当命题与时间相关时,较新的声明成为规范声明;否则,Lenz上浏览次数最多的现有声明获胜。语料库中仅出现规范声明。
  • 至少有一个前沿模型未能产生可解析判决的声明,即使一次重试后也是如此。这些残留错误大多来自Gemini的接地搜索API,偶尔返回格式错误的响应;其余是罕见的Anthropic拒绝。仅包含所有五个模型都成功的声明。
  • 超过180天的声明(收获时应用的时效窗口)

7. 方法论

7.1 模型选择

五个前沿模型,覆盖两个能力层面:

  • 参数型(仅训练):GPT-5.4(OpenAI)、Claude Opus 4.7(Anthropic)、Gemini 3 Pro(Google)
  • 检索增强型:Gemini 3 Pro + Search(Google)、Sonar Pro(Perplexity)

7.2 提示

每个声明都附带与提交日期匹配的“截至YYYY-MM-DD”锚点,要求模型从四个判决中选择一个:

分类以下声明(截至<date>):"<atomic claim>"
精确输出一个标签:True, Mostly True, Misleading, 或 False。无解释,无修饰语。

逐字提示模板版本:usr_v2。不提供“弃权”选项(强制选择使比较在模型间对称)。不可解析的输出不会被重新分类到判决类别中;任何解析错误的声明从完整声明队列中排除。

7.3 LLM调用配置

所有五个模型接收相同的系统占位符(.)和相同的用户提示模板(usr_v2)。未使用结构化输出模式、工具调用模式、种子、top-p或logit-bias控制。收割机在支持的模型上请求确定性解码(temperature=0.0);GPT-5.4和Claude Opus 4.7在未明确设置温度的情况下调用,因为它们的提供商适配器拒绝自定义温度设置。GPT-5.4、Claude Opus 4.7和Sonar Pro的输出长度限制为16个token;Gemini 3 Pro和Gemini 3 Pro + Search使用1024个token限制(在收割机开发期间,较低的限制导致提供商端错误)。Gemini 3 Pro + Search启用了Google搜索接地;Sonar Pro通过Perplexity的搜索支持API被视为检索增强。可解析的输出在标准化后必须恰好等于四个标签之一。

7.4 评分

无LLM评分器。

3 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。