跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

25 条精选近 30 天 5 条共收录 66 条

更新

精选归档 · 第 2 页

12月17日周三第 21–25 条
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3 Flash:速度优先的前沿智能模型

    Google DeepMind 发布 Gemini 3 Flash,这是 Gemini 3 模型家族的轻量版,保留 Pro 级推理能力的同时优化了延迟和成本。在 GPQA Diamond 达到 90.4%,SWE-bench Verified 得分 78% 超越 Gemini 3 Pro,速度是 Gemini 2.5 Pro 的 3 倍,token 消耗减少 30%。

    推荐理由:原文展示了 Gemini 3 Flash 在 GPQA Diamond、SWE-bench Verified 等 benchmarks 上的具体性能数据,以及 3 倍速度提升和 token 减少 30% 的量化指标,读者可以据此评估其对现有开发流程的实际影响。

11月19日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3 Pro 预览版

    Google DeepMind 发布 Gemini 3 Pro,声称是其最智能的模型。Gemini 3 Pro 在 LMArena 达到 1501 Elo,在 GPQA Diamond 取得 91.9%,在 Humanity's Last Exam 取得 37.5%(无工具使用)。

    推荐理由:原文给出了具体基准分数和功能变化,读者可以据此评估 Gemini 3 Pro 在推理、编码和多模态任务上的能力定位。

11月13日周四
  1. Google DeepMind62

    Google DeepMind 推出 SIMA 2:在虚拟 3D 世界中推理、学习和交互的 AI 智能体

    Google DeepMind 发布 SIMA 2,集成 Gemini 模型作为核心推理引擎,使智能体从指令跟随进化为可推理、可对话、可自我改进的交互式游戏伴侣,在未训练过的游戏(如 ASKA、MineDojo)中表现出接近人类的泛化能力。

    推荐理由:SIMA 2 展示了将 Gemini 推理引擎与具身智能体结合的路径,包括自我改进和跨游戏泛化能力,为后续研究提供了可验证的方向。

4月14日周一
  1. OpenAI News61

    OpenAI 在 API 中推出 GPT-4.1

    OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有提升,并首次发布 nano 型号,即日起面向全球开发者开放。

    推荐理由:原文给出了三个主要改进方向和 nano 模型首发信息,读者可据此判断它与前代版本的差异。