Google DeepMind·· 2025-12-09精选AI 评分65
Google DeepMind 推出 FACTS 基准测试套件,系统性评估大语言模型事实准确性
FACTS Benchmark Suite: Systematically evaluating the factuality of large language models
AI 导读
Google DeepMind 联合 Kaggle 发布 FACTS 基准测试套件,包含参数基准、搜索基准、多模态基准和更新的 Grounding v2 四个子基准,共 3513 个样例。
推荐理由
Gemini 3 Pro 在搜索和参数基准上较 2.5 Pro 错误率大幅下降,但多模态基准仍是短板,读者可据此判断当前模型在事实性任务上的真实差距。
来源:Google DeepMind · deepmind.google