跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

62 条精选近 30 天 7 条共收录 105 条

更新

精选归档 · 第 2 页

6月25日周四第 21–40 条
  1. Google DeepMind66

    Gemini 3.5 Flash 新增内置计算机使用能力

    Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。

    推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。

6月16日周二
  1. Google DeepMind64

    Google DeepMind 发布 AI Control Roadmap:用防御深度框架保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,采用“防御深度”方法将 AI 智能体视为潜在内部威胁进行建模,依托 MITRE ATT&CK 框架分解攻击战术,通过监督 AI 系统实时监测、阻止有害行为。

    推荐理由:原文给出了将 AI 对齐问题转化为系统安全工程的完整框架和真实数据,读者可以据此理解如何从威胁建模到实时响应构建多层防护。

6月11日周四
6月9日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款用于实时语音到语音翻译的音频模型,支持 70+ 语言,可自动检测语言并生成保留说话者语调、节奏和音高的自然翻译语音。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  2. Google DeepMind75

    Google DeepMind 发布 Gemma 4 12B:统一架构的无编码器多模态模型

    Google DeepMind 发布了 Gemma 4 12B,这是一款 12B 参数的统一无编码器多模态模型,支持本地运行于 16GB 显存的笔记本电脑。

    推荐理由:Gemma 4 12B 首次在中等规模模型中加入原生音频支持,展示了 encoder-free 架构在端侧推理上的可行性,读者可据此评估本地 Agent 开发的新选项。

6月8日周一
  1. Google DeepMind66

    Google DeepMind 在塞拉利昂开展 AI 数学学习 RCT

    Google DeepMind 与 Fab AI 等机构合作,在塞拉利昂开展了一项为期 8 周的预注册 RCT,评估 Gemini 驱动的 Guided Learning 对学生数学成绩的影响。

    推荐理由:原文给出了 RCT 量化数据(+0.258 标准差、1.2-1.7 年学习进度)和行为变化(技能导向提问从 68% 升至 90%),可帮助读者评估 AI 在真实课堂中的实际效用。

5月18日周一
  1. Google DeepMind66

    Google 推出 Gemini Omni:能理解任意输入并生成视频的多模态模型

    Gemini Omni Flash 是 Google DeepMind 发布的首个能处理任意模态输入并生成高质量视频的模型,支持图像、音频、视频、文本组合输入。

    推荐理由:模型的核心能力(任意模态输入生成视频、自然语言编辑)和具体开放时间线已给出,读者可据此判断它对自己工作流的影响。

5月17日周日
  1. Google DeepMind69

    Google 发布 Gemini for Science:面向科学发现新时代的 AI 实验与工具

    Google 发布 Gemini for Science,包含三个实验工具:Hypothesis Generation 由 Co-Scientist 构建,通过多智能体「创意竞赛」生成和评估假说。

    推荐理由:原文给出了三个实验工具的具体能力(多智能体假说生成、并行测试数千种代码变体、文献结构化分析)和开放入口,读者可以据此判断它们如何改变现有科研工作流。

  2. Google DeepMind70

    Google DeepMind 扩展内容溯源与验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud

    Google DeepMind 扩展内容透明度和验证工具,SynthID 水印技术已对超过 1000 亿张图片和视频、6 万年音频添加水印。Gemini 应用中的 SynthID 验证已使用 5000 万次,并扩展至 Search 和 Chrome。

    推荐理由:原文给出了具体的数据规模和合作伙伴,读者可以据此判断 AI 内容溯源和验证工具的可用性变化。

5月16日周六
  1. Google DeepMind66

    Google DeepMind 与新加坡政府达成国家级 AI 合作,覆盖医疗、教育、科研与气候领域

    Google DeepMind 宣布与新加坡政府建立国家级 AI 合作伙伴关系,涵盖医疗与生命科学、教育、基础科研及气候可持续发展等领域。首批项目包括探索 AI 协同临床诊疗、与 SG Enable 合作开发面向视障运动员的 Gemma 驱动跑步助手、向教育工作者提供 Gemini for Education,以及通过 Co-Scientist 工具培训本地科研人员等。

    推荐理由:原文给出了具体合作领域、经济预测和首批项目细节,读者可据此判断 Google DeepMind 在东南亚 AI 布局的实际落地方向。

  2. Google DeepMind60

    Google DeepMind WeatherNext 如何帮助美国国家飓风中心提前五天预测飓风 Melissa 登陆牙买加

    Google DeepMind 的 AI 气象模型 WeatherNext 在 2025 年 10 月的飓风 Melissa 事件中,提前五天以 80% 置信度预测该风暴将在牙买加以五级强度登陆,三天前升至接近 100%。

    推荐理由:文章详细记录了 WeatherNext 在真实飓风事件中的预测路径和强度双重准确率,以及给牙买加社区带来的提前撤离窗口,读者可据此评估该模型在极端天气预报中的实际可用性。

  3. Google DeepMind79

    Gemini 3.5 Flash 正式发布,主打前沿智能与极速 agentic 推理

    Gemini 3.5 Flash 正式发布,这是 Google 最新模型系列,主打前沿智能与 action 能力的结合。它在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,输出 token 速度是其他前沿模型的 4 倍,现已向全球用户开放。

    推荐理由:原文给出了 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准分数以及 4 倍速度提升,读者可据此判断 Gemini 3.5 Flash 在 agentic 任务上的能力对比。

5月12日周二
4月30日周四
  1. Google DeepMind64

    Google DeepMind 发布 AI 协同诊疗研究计划,评估多场景临床辅助能力

    Google DeepMind 发布 AI 协同诊疗(AI co-clinician)研究计划,旨在探索 AI 在临床权威监督下辅助患者护理的能力。在 98 个初级护理查询的盲评中,系统实现 97 例零关键错误;在 RxQA 药物问答基准上,开放式问题的表现超越前沿模型;与哈佛、斯坦福合作的模拟研究中,140 项评估维度里有 68 项达到或超过初级护理医生水平。

    推荐理由:系统已在临床证据合成和药物问答两个基准上给出了具体对比数字,读者可以据此判断 AI 辅助临床决策当前的进展边界。

4月22日周三
  1. Google DeepMind62

    Google DeepMind 推出 Decoupled DiLoCo:实现低带宽、高弹性的跨数据中心分布式训练

    Google DeepMind 发布 Decoupled DiLoCo,将大规模训练任务拆分到独立的计算岛屿中,岛屿之间以异步数据流通信,单个芯片故障不会中断其他岛屿的训练。

    推荐理由:原文给出了具体的训练规模(12B 参数)、带宽条件(2-5 Gbps)和关键结论(比传统方法快 20 倍以上),读者可据此评估该方法是否适用于自己的跨地域训练场景。

4月16日周四
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.1 Flash TTS,引入 audio tags 实现细粒度语音控制

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准上取得 Elo 1,211 分,位列“最具吸引力象限”。

    推荐理由:原文给出了基准分数(Elo 1,211)和 audio tags 等具体能力变化,读者可以据此判断该模型在同类产品中的相对位置和适用场景。

4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人大模型的重大升级版本。新模型在空间推理和多视角理解方面有显著提升,新增仪表读取(instrument reading)能力,可解读压力表、液位计和数字读数等工业仪表,并通过 agentic vision 结合视觉推理与代码执行实现高精度读数。

    推荐理由:原文给出了仪表读取、多视角推理和安全约束等具体能力提升细节,读者可以据此评估该模型在具身智能任务中的实际可用性。

4月3日周五
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4:逐字节打造最强大开源模型

    Google DeepMind 发布 Gemma 4 系列开源模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,基于 Gemini 3 的研究和技术,在 Arena AI 文本排行榜上 31B 模型位列开源模型第三、26B 排名第六,可超越参数量 20 倍的模型。

    推荐理由:Gemma 4 提供了从移动端到高端 GPU 的多尺寸选择,并采用 Apache 2.0 许可,开发者可据此评估其对现有部署方案的影响。

3月29日周日
  1. Google DeepMind74

    Google DeepMind:为 AI 时代重新设计鼠标指针

    Google DeepMind 发布 AI 驱动的智能指针实验项目,由 Gemini 提供支持。指针不再只追踪位置,还能理解用户指向的内容及其语义,从而用自然语言完成复杂操作。该功能现已集成进 Chrome 并即将登陆 Googlebook,用户可通过 Google AI Studio 体验 demo。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。