Google DeepMind 发布 Gemini Robotics ER 2:集成视频理解、任务编排与多机器人协作的具身推理模型
Google DeepMind 发布 Gemini Robotics ER 2,这是一款面向机器人的具身推理模型,可通过视频流实现任务进度追踪与自我修正,支持多机器人协作完成复杂工作流。
推荐理由:原文给出了视频理解、任务编排和多机器人协作三个能力维度及对应基准数字,读者可据此评估该模型与现有具身智能方案的差异。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
36 条精选近 30 天 17 条共收录 142 条
Google DeepMind 发布 Gemini Robotics ER 2,这是一款面向机器人的具身推理模型,可通过视频流实现任务进度追踪与自我修正,支持多机器人协作完成复杂工作流。
推荐理由:原文给出了视频理解、任务编排和多机器人协作三个能力维度及对应基准数字,读者可据此评估该模型与现有具身智能方案的差异。
Google DeepMind 推出三款新 Flash 模型:Gemini 3.6 Flash 在 Artificial Analysis Index 上比 3.5 Flash 减少 17% 的 output token 使用量。
推荐理由:三款模型分别针对效率、速度和网络安全做了差异化定位,读者可据此判断哪款适合当前的 agent 工作流。
Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。
推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。
Google DeepMind 发布 AI Control Roadmap,采用“防御深度”方法将 AI 智能体视为潜在内部威胁进行建模,依托 MITRE ATT&CK 框架分解攻击战术,通过监督 AI 系统实时监测、阻止有害行为。
推荐理由:原文给出了将 AI 对齐问题转化为系统安全工程的完整框架和真实数据,读者可以据此理解如何从威胁建模到实时响应构建多层防护。
Google 发布 Gemini for Science,包含三个实验工具:Hypothesis Generation 由 Co-Scientist 构建,通过多智能体「创意竞赛」生成和评估假说。
推荐理由:原文给出了三个实验工具的具体能力(多智能体假说生成、并行测试数千种代码变体、文献结构化分析)和开放入口,读者可以据此判断它们如何改变现有科研工作流。
Google DeepMind 宣布与新加坡政府建立国家级 AI 合作伙伴关系,涵盖医疗与生命科学、教育、基础科研及气候可持续发展等领域。首批项目包括探索 AI 协同临床诊疗、与 SG Enable 合作开发面向视障运动员的 Gemma 驱动跑步助手、向教育工作者提供 Gemini for Education,以及通过 Co-Scientist 工具培训本地科研人员等。
推荐理由:原文给出了具体合作领域、经济预测和首批项目细节,读者可据此判断 Google DeepMind 在东南亚 AI 布局的实际落地方向。
Google DeepMind 展示 Co-Scientist 在肝纤维化药物重新定位任务中的表现。
推荐理由:原文给出了具体案例数据,读者可以据此判断 AI 药物发现的能力边界和实际价值。
Gemini 3.5 Flash 正式发布,这是 Google 最新模型系列,主打前沿智能与 action 能力的结合。它在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,输出 token 速度是其他前沿模型的 4 倍,现已向全球用户开放。
推荐理由:原文给出了 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准分数以及 4 倍速度提升,读者可据此判断 Gemini 3.5 Flash 在 agentic 任务上的能力对比。
Google DeepMind 在 Nature 发表 Co-Scientist 研究并正式向科研人员开放试用。
推荐理由:Co-Scientist 展示了多智能体如何在科研假设生成中形成迭代循环,读者可借鉴其“生成—辩论—进化”架构来思考如何将 AI 引入自己的研究流程。
OpenAI 发布 GPT-5.4,定位为其最强大且高效的前沿模型,专为专业工作设计,具备前沿的编码、计算机使用、工具搜索能力和 1M-token 上下文窗口。
推荐理由:原文给出了具体能力变化(编码、计算机使用、工具搜索、1M-token 上下文),读者可以据此判断它对专业工作流的影响。
Google DeepMind 发布 Gemini 3 Flash,这是 Gemini 3 模型家族的轻量版,保留 Pro 级推理能力的同时优化了延迟和成本。在 GPQA Diamond 达到 90.4%,SWE-bench Verified 得分 78% 超越 Gemini 3 Pro,速度是 Gemini 2.5 Pro 的 3 倍,token 消耗减少 30%。
推荐理由:原文展示了 Gemini 3 Flash 在 GPQA Diamond、SWE-bench Verified 等 benchmarks 上的具体性能数据,以及 3 倍速度提升和 token 减少 30% 的量化指标,读者可以据此评估其对现有开发流程的实际影响。
Google DeepMind 发布更新后的 Gemini 2.5 Flash Native Audio,用于实时语音智能体。
推荐理由:原文给出了三个维度的量化改进和实时语音翻译的具体能力边界,读者可据此评估这些提升在实际场景中的可用性。
Google DeepMind 宣布支持白宫 Genesis 任务,将与美国能源部合作,面向其全部 17 个国家实验室提供前沿 AI 模型和智能体工具,即日起开放 AI co-scientist(基于 Gemini 的多智能体科学协作系统)。
推荐理由:文章详细说明了 Google DeepMind 将向美国能源部 17 个国家实验室提供的具体 AI 工具及其已验证的能力(如将假设开发从数年压缩至数天),读者可据此了解此次国家级合作的具体范围和技术深度。
Google DeepMind 发布 Gemini 3 Pro,称其在 Terminal-Bench 2.0 得分 54.2%,并在编码、Agent 工作流和 zero-shot 任务上超越 2.5 Pro。
推荐理由:正文给出了 Terminal-Bench 2.0 得分 54.2%、百万 token 上下文窗口和预览定价,读者可以据此评估它相比 2.5 Pro 的实际提升。
Google DeepMind 发布 Gemini 3 Pro,声称是其最智能的模型。Gemini 3 Pro 在 LMArena 达到 1501 Elo,在 GPQA Diamond 取得 91.9%,在 Humanity's Last Exam 取得 37.5%(无工具使用)。
推荐理由:原文给出了具体基准分数和功能变化,读者可以据此评估 Gemini 3 Pro 在推理、编码和多模态任务上的能力定位。
Google DeepMind 发布 SIMA 2,集成 Gemini 模型作为核心推理引擎,使智能体从指令跟随进化为可推理、可对话、可自我改进的交互式游戏伴侣,在未训练过的游戏(如 ASKA、MineDojo)中表现出接近人类的泛化能力。
推荐理由:SIMA 2 展示了将 Gemini 推理引擎与具身智能体结合的路径,包括自我改进和跨游戏泛化能力,为后续研究提供了可验证的方向。