跳到正文

内容形态

评测基准 最新动态

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

24 条精选近 30 天 6 条共收录 51 条

更新

精选归档 · 第 2 页

2月13日周五第 21–24 条
  1. Google DeepMind72

    Gemini 3 Deep Think:推进科学研究与工程推理

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,专注科学、研究与工程领域的高难度推理任务。新版在 Humanity's Last Exam 达 48.4%(无工具)、ARC-AGI-2 达 84.6%、Codeforces 达 3455 Elo、CMT-Benchmark 达 50.5%,并在数学、物理和化学奥林匹克书面部分达到金牌水平。

    推荐理由:原文给出了多个权威基准测试的明确分数和 API 开放入口,读者可以据此评估 Gemini 3 Deep Think 的实际能力水平。

12月9日周二
  1. Google DeepMind65

    Google DeepMind 推出 FACTS 基准测试套件,系统性评估大语言模型事实准确性

    Google DeepMind 联合 Kaggle 发布 FACTS 基准测试套件,包含参数基准、搜索基准、多模态基准和更新的 Grounding v2 四个子基准,共 3513 个样例。

    推荐理由:Gemini 3 Pro 在搜索和参数基准上较 2.5 Pro 错误率大幅下降,但多模态基准仍是短板,读者可据此判断当前模型在事实性任务上的真实差距。

11月17日周一
  1. Google DeepMind77

    WeatherNext 2:Google 最先进的天气预报模型

    Google DeepMind 发布 WeatherNext 2,预测速度提升 8 倍,分辨率达 1 小时级别。该模型基于 Functional Generative Network 架构,可从单点输入生成数百种天气情景,在 99.9% 的变量和预测时长上超越前代模型。

    推荐理由:WeatherNext 2 在精度和效率上显著提升,已在多个 Google 产品中落地,开发者可通过多个平台获取数据和定制推理能力。

11月11日周二
  1. Google DeepMind66

    Google DeepMind 研究:教 AI 像我们一样看世界

    Google DeepMind 在 Nature 发表论文,分析了视觉 AI 模型与人类在组织视觉世界知识上的系统性差异,并提出一种三步对齐方法:先用 SigLIP-SO400M 加小 adapter 生成百万量级的 AligNet 数据集,再用于微调其他模型。

    推荐理由:论文给出了完整的三步对齐方法(SigLIP-SO400M → AligNet → student)和在认知任务及标准 AI 任务上的量化提升,读者可提取一个可迁移的多步骤对齐范式。