前沿大语言模型在现实事实核查上的分歧研究
- #LLM
- #事实核查
- #模型评价
- #Hacker News
- #lenz.io
前沿大语言模型在现实事实核查上的分歧研究
1. 前沿模型的分歧频率
在67%的声明中(672/1000,95%置信区间:64-70%),前沿模型小组未能达成一致——至少有一个模型与多数判决不同,或者根本没有形成严格多数。具体分析:对于每个声明,我们查看五个前沿模型的判决,并询问:是否至少有3个模型选择了相同答案(严格多数)?如果是,其余模型中有多少持异议?如果没有出现明确多数——判决分散在三个或四个不同的类别中——则该声明归入“模型分裂,无多数”行。这些声明大多不太可能出现在任何带有黄金标签的训练语料中——没有标准的答案键可供模式匹配,没有基准排行榜可供锚定。我们下文引用“多数”和“对多数的异议”。前沿模型的多数并非真实情况。多数判决有时是错误的;单个异议模型有时是正确的。我们使用多数作为衡量分歧的结构性参考点,而非正确性的替代。
| 前沿模型判决模式 | 声明数量 | 占语料比例 |
|---|---|---|
| 全部5个一致(一致同意) | 328 | 33%(30-36%) |
| 1/5 持异议 | 224 | 22%(20-25%) |
| 2/5 持异议 | 316 | 32%(29-35%) |
| 模型分裂,无多数(如2-2-1或2-1-1-1) | 132 | 13%(11-15%) |
| ≥1个模型持异议(包括分裂) | 672 | 67%(64-70%) |
| ≥2个模型持异议(包括分裂) | 448 | 45%(42-48%) |
小组一致性:Krippendorff's α(序数)= 0.639(n=1000个声明,5个评分者)。这表明有显著但有限的一致性:模型的判决是有结构的而非随机,但不够一致,不能将小组视为一个可互换的单一评判者。序数α是针对有序分类尺度(真/基本真/误导/假)的标准Krippendorff变体。参见§7.5统计分析以了解度量选择。
模型误差下限
对于每个声明,四个判决类别中恰好有一个是正确的答案。如果我们假设小组最受欢迎的类别是正确的——最仁慈的假设——则选择错误判决的模型的最小数量为:
- 在67%的声明中≥1个模型错误(任何非一致同意的面板)
- 在45%的声明中≥2个错误(3-2、3-1-1或无多数分裂)
- 在13%的声明中≥3个错误(没有类别达到多数,因此最多只能有2个正确)
放宽“最受欢迎的是正确的”这一假设只会增加这些计数,绝不会减少。实际错误率很可能更高:即使在所有五个模型都一致的33%的案例中,也可能且很可能包含共同的盲点。
2. 实质性分歧与细微差别分歧
在34%的声明中(343/1000,95%置信区间:31-37%),至少有两个前沿模型选择的判决在我们的4类别分类中相差2个或更多级别——这超出了校准范围。并非所有分歧都相等。“真”与“基本真”的分歧是置信校准的偏移。“真”与“假”的分歧是关于答案的实质性分歧。我们通过每个声明上5个判决的最大成对级别距离来衡量,其中判决按顺序排列为真(0)→基本真(1)→误导(2)→假(3)。
| 距离 | 解读 | 声明数量 | 占比 |
|---|---|---|---|
| 0 | 完全一致(所有5个选择相同类别) | 328 | 33%(30-36%) |
| 1 | 仅细微差别(如真↔基本真) | 329 | 33%(30-36%) |
| 2 | 实质性(真↔误导,或基本真↔假) | 132 | 13%(11-15%) |
| 3 | 两极(真↔假) | 211 | 21%(19-24%) |
| ≥2个级别差(实质性或两极) | 343 | 34%(31-37%) |
注意事项:级别距离将真/基本真/误导/假视为序数量表;等距解释是一种简化。2级差距仍可能反映分类标准模糊、时间框架差异或对“误导”的不同解释。我们将其报告为粗略的“实质性vs细微差别”指标,而非误差幅度的度量。
3. 模型间一致性
最高的同侪一致性:Gemini 3 Pro × Gemini 3 Pro + Search(75%)——不奇怪,因为它们共享基础模型。最低的:Claude Opus 4.7 × Gemini 3 Pro、Claude Opus 4.7 × Gemini 3 Pro + Search 和 Gemini 3 Pro × Sonar Pro(53%)——三对并列最低。
每对前沿模型在语料库中所有声明上选择相同判决标签的频率:
| GPT-5.4 | Claude Opus 4.7 | Gemini 3 Pro | Gemini 3 Pro + Search | Sonar Pro | |
|---|---|---|---|---|---|
| GPT-5.4 | — | 65%(62-68%) | 65%(62-68%) | 60%(57-63%) | 60%(57-63%) |
| Claude Opus 4.7 | 65%(62-68%) | — | 53%(50-56%) | 53%(50-56%) | 58%(55-61%) |
| Gemini 3 Pro | 65%(62-68%) | 53%(50-56%) | — | 75%(72-77%) | 53%(50-56%) |
| Gemini 3 Pro + Search | 60%(57-63%) | 53%(50-56%) | 75%(72-77%) | — | 58%(55-61%) |
| Sonar Pro | 60%(57-63%) | 58%(55-61%) | 53%(50-56%) | 58%(55-61%) | — |
4. 每个模型的行为
从两个角度观察同一五个模型:每个模型如何分配其判决(4.1),以及每个模型的判决与其余四个模型的严格多数匹配的频率(4.2)。
4.1 判决分布
一些模型将判决集中在真/假两极;其他模型则更广泛地分布在中间两个类别。这反映了模型级别的决策先验与具体声明的相互作用——在没有真实情况的情况下,我们无法将两者分开。下表显示了每个模型分配给每个类别的声明比例,单元格下方为95% Wilson置信区间。
| 模型 | 真 | 基本真 | 误导 | 假 |
|---|---|---|---|---|
| GPT-5.4 | 42%(39-45%) | 16%(14-19%) | 12%(10-14%) | 30%(28-33%) |
| Claude Opus 4.7 | 38%(35-41%) | 26%(23-29%) | 19%(17-22%) | 17%(15-20%) |
| Gemini 3 Pro | 54%(51-57%) | 3%(2-4%) | 3%(2-4%) | 40%(37-43%) |
| Gemini 3 Pro + Search | 52%(49-55%) | 4%(3-5%) | 9%(7-11%) | 35%(32-38%) |
| Sonar Pro | 35%(32-38%) | 23%(21-26%) | 16%(14-18%) | 26%(23-28%) |
4.2 与小组其他成员的一致性
在五个模型中,与同行多数的一致性范围从69%到81%。这是该语料库中的同侪对齐,而非正确性——这里没有模型被视为真实情况,每行的合格n不同。对于每个模型,其判决与另外四个模型的严格多数(≥3/4)匹配的频率?仅当另外四个模型中存在≥3/4多数时,声明才合格。
| 模型 | 与同行多数的一致性 | 合格n | 不合格 | 层级 |
|---|---|---|---|---|
| GPT-5.4 | 81%(78-84%) | 650 | 350 | 参数型 |
| Claude Opus 4.7 | 70%(67-74%) | 691 | 309 | 参数型 |
| Gemini 3 Pro | 77%(74-80%) | 683 | 317 | 参数型 |
| Gemini 3 Pro + Search | 76%(73-79%) | 693 | 307 | 检索增强 |
| Sonar Pro | 69%(66-73%) | 675 | 325 | 检索增强 |
5. 详细结果
5.1 按领域的前沿模型分歧
每行分母:该领域的声明数量(声明列)。
| 领域 | 声明数 | 任何分歧 | 实质性(≥2个级别) | 无多数 |
|---|---|---|---|---|
| 金融 | 75 | 67%(55-76%) | 39%(28-50%) | 20%(13-30%) |
| 通用 | 179 | 68%(60-74%) | 40%(33-48%) | 12%(8-17%) |
| 健康 | 171 | 71%(64-78%) | 29%(23-36%) | 12%(8-17%) |
| 历史 | 131 | 53%(44-61%) | 24%(17-32%) | 13%(8-20%) |
| 法律 | 48 | 77%(63-87%) | 40%(27-54%) | 19%(10-32%) |
| 政治 | 168 | 70%(62-76%) | 38%(31-46%) | 8%(5-13%) |
| 科学 | 151 | 68%(60-75%) | 36%(29-44%) | 21%(15-28%) |
| 技术 | 77 | 69%(58-78%) | 31%(22-42%) | 8%(4-16%) |
5.2 按判决的小组一致性
当小组确实落在中间类别时,几乎从未达成一致。“基本真”和“误导”多数达到一致同意的概率至多5%,而“真”和“假”多数则为43-47%。与此一致的是,针对不同真实世界语料库(17,856个PolitiFact声明,使用单家族Llama-3消融实验,Schwab等人2025)的研究发现,细微差别的标签正是事实核查判决模型集中错误的地方——来自不同方法论设置的相关观察(单家族消融,而非前沿模型小组)。
分母:在该判决上具有严格≥3/5前沿多数声明的数量。揭示小组最/最不自信的判决区域。
| 多数判决 | 合格n | 一致同意(5/5) | 仅多数(3-4/5) |
|---|---|---|---|
| 真 | 438 | 47%(42-51%) | 53%(49-58%) |
| 基本真 | 76 | 0%(0-5%) | 100%(95-100%) |
| 误导 | 74 | 5%(2-13%) | 95%(87-98%) |
| 假 | 280 | 43%(37-49%) | 57%(51-63%) |
从另一个方向看——在所有5个前沿模型达成相同判决的328个声明中,各判决的分布:
| 一致判决 | 声明数量 | 占一致同意比例 |
|---|---|---|
| 真 | 204 | 62%(57-67%) |
| 基本真 | 0 | 0%(0-1%) |
| 误导 | 4 | 1%(0-3%) |
| 假 | 120 | 37%(32-42%) |
6. 数据
1,000个声明——提交给事实核查平台的最新真实用户请求,通过了排除部分下列出的所有资格筛选。这些声明均不早于2026年2月15日。除非另有说明,本页上的每个指标均使用此集合作为分母;使用不同分母的表格(例如在某个判决上具有严格≥3/5前沿多数的声明)会内联说明。
来源
这些声明提交给Lenz,一个事实核查平台。我们选择此语料库是因为它代表了有机的真实世界事实核查请求,而非策划的基准项目。Lenz对每个声明的判决未用于此分析——本文仅测量前沿模型的分歧,而非Lenz与前沿模型。
声明标准化
CSV中的atomic_claim字段不是用户的原始提交。它是Lenz框架步骤的输出,该步骤去除情绪化语言和偏见,并将输入提炼为单个中性、可测试的命题,并锚定到提交日期。前沿模型是针对框架化声明进行评分的,而非原始文本。例如,如果用户输入“加拿大当局因引用圣经而将基督徒投入监狱!!!”则针对命题“截至2026年4月4日,加拿大当局因基督教信仰而将公开引用圣经的个人监禁”进行评分。
排除项
语料库排除了:
- 提交用户标记为私有的声明
- 来自平台员工、内部账户或代理/API提交的声明(仅真实用户网页提交出现在语料库中)
- 编辑状态为待审核或隐藏的声明——无论是在编辑审查后取消发布,还是在提交时由Lenz的PII筛选步骤自动标记(包含非公开个人的个人信息)
- 近似重复声明——使用atomic_claim的OpenAI text-embedding-3-small嵌入(1536维)余弦距离≤0.2的对合并为单个规范行。当命题与时间相关时,较新的声明成为规范声明;否则,Lenz上浏览次数最多的现有声明获胜。语料库中仅出现规范声明。
- 至少有一个前沿模型未能产生可解析判决的声明,即使一次重试后也是如此。这些残留错误大多来自Gemini的接地搜索API,偶尔返回格式错误的响应;其余是罕见的Anthropic拒绝。仅包含所有五个模型都成功的声明。
- 超过180天的声明(收获时应用的时效窗口)
7. 方法论
7.1 模型选择
五个前沿模型,覆盖两个能力层面:
- 参数型(仅训练):GPT-5.4(OpenAI)、Claude Opus 4.7(Anthropic)、Gemini 3 Pro(Google)
- 检索增强型:Gemini 3 Pro + Search(Google)、Sonar Pro(Perplexity)
7.2 提示
每个声明都附带与提交日期匹配的“截至YYYY-MM-DD”锚点,要求模型从四个判决中选择一个:
分类以下声明(截至<date>):"<atomic claim>"
精确输出一个标签:True, Mostly True, Misleading, 或 False。无解释,无修饰语。
逐字提示模板版本:usr_v2。不提供“弃权”选项(强制选择使比较在模型间对称)。不可解析的输出不会被重新分类到判决类别中;任何解析错误的声明从完整声明队列中排除。
7.3 LLM调用配置
所有五个模型接收相同的系统占位符(.)和相同的用户提示模板(usr_v2)。未使用结构化输出模式、工具调用模式、种子、top-p或logit-bias控制。收割机在支持的模型上请求确定性解码(temperature=0.0);GPT-5.4和Claude Opus 4.7在未明确设置温度的情况下调用,因为它们的提供商适配器拒绝自定义温度设置。GPT-5.4、Claude Opus 4.7和Sonar Pro的输出长度限制为16个token;Gemini 3 Pro和Gemini 3 Pro + Search使用1024个token限制(在收割机开发期间,较低的限制导致提供商端错误)。Gemini 3 Pro + Search启用了Google搜索接地;Sonar Pro通过Perplexity的搜索支持API被视为检索增强。可解析的输出在标准化后必须恰好等于四个标签之一。
7.4 评分
无LLM评分器。
评论