跳到正文
Google DeepMind·· 2025-12-09精选AI 评分65

Google DeepMind 推出 FACTS 基准测试套件,系统性评估大语言模型事实准确性

FACTS Benchmark Suite: Systematically evaluating the factuality of large language models

AI 导读

Google DeepMind 联合 Kaggle 发布 FACTS 基准测试套件,包含参数基准、搜索基准、多模态基准和更新的 Grounding v2 四个子基准,共 3513 个样例。

推荐理由

Gemini 3 Pro 在搜索和参数基准上较 2.5 Pro 错误率大幅下降,但多模态基准仍是短板,读者可据此判断当前模型在事实性任务上的真实差距。

来源:Google DeepMind · deepmind.google