Gemini 3.5 Flash 新增内置计算机使用能力
Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。
推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。
公司与模型
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
62 条精选近 30 天 7 条共收录 105 条
Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。
推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。
Google DeepMind 发布 AI Control Roadmap,采用“防御深度”方法将 AI 智能体视为潜在内部威胁进行建模,依托 MITRE ATT&CK 框架分解攻击战术,通过监督 AI 系统实时监测、阻止有害行为。
推荐理由:原文给出了将 AI 对齐问题转化为系统安全工程的完整框架和真实数据,读者可以据此理解如何从威胁建模到实时响应构建多层防护。
Google DeepMind 发布实验性开源模型 DiffusionGemma,探索基于扩散的文本生成方法。
推荐理由:原文给出了性能数字、硬件需求和支持工具链,读者可以判断它是否适合自己的本地推理场景。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款用于实时语音到语音翻译的音频模型,支持 70+ 语言,可自动检测语言并生成保留说话者语调、节奏和音高的自然翻译语音。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 发布了 Gemma 4 12B,这是一款 12B 参数的统一无编码器多模态模型,支持本地运行于 16GB 显存的笔记本电脑。
推荐理由:Gemma 4 12B 首次在中等规模模型中加入原生音频支持,展示了 encoder-free 架构在端侧推理上的可行性,读者可据此评估本地 Agent 开发的新选项。
Google DeepMind 与 Fab AI 等机构合作,在塞拉利昂开展了一项为期 8 周的预注册 RCT,评估 Gemini 驱动的 Guided Learning 对学生数学成绩的影响。
推荐理由:原文给出了 RCT 量化数据(+0.258 标准差、1.2-1.7 年学习进度)和行为变化(技能导向提问从 68% 升至 90%),可帮助读者评估 AI 在真实课堂中的实际效用。
Gemini Omni Flash 是 Google DeepMind 发布的首个能处理任意模态输入并生成高质量视频的模型,支持图像、音频、视频、文本组合输入。
推荐理由:模型的核心能力(任意模态输入生成视频、自然语言编辑)和具体开放时间线已给出,读者可据此判断它对自己工作流的影响。
Google 发布 Gemini for Science,包含三个实验工具:Hypothesis Generation 由 Co-Scientist 构建,通过多智能体「创意竞赛」生成和评估假说。
推荐理由:原文给出了三个实验工具的具体能力(多智能体假说生成、并行测试数千种代码变体、文献结构化分析)和开放入口,读者可以据此判断它们如何改变现有科研工作流。
Google DeepMind 扩展内容透明度和验证工具,SynthID 水印技术已对超过 1000 亿张图片和视频、6 万年音频添加水印。Gemini 应用中的 SynthID 验证已使用 5000 万次,并扩展至 Search 和 Chrome。
推荐理由:原文给出了具体的数据规模和合作伙伴,读者可以据此判断 AI 内容溯源和验证工具的可用性变化。
Google DeepMind 宣布与新加坡政府建立国家级 AI 合作伙伴关系,涵盖医疗与生命科学、教育、基础科研及气候可持续发展等领域。首批项目包括探索 AI 协同临床诊疗、与 SG Enable 合作开发面向视障运动员的 Gemma 驱动跑步助手、向教育工作者提供 Gemini for Education,以及通过 Co-Scientist 工具培训本地科研人员等。
推荐理由:原文给出了具体合作领域、经济预测和首批项目细节,读者可据此判断 Google DeepMind 在东南亚 AI 布局的实际落地方向。
Google DeepMind 展示 Co-Scientist 在肝纤维化药物重新定位任务中的表现。
推荐理由:原文给出了具体案例数据,读者可以据此判断 AI 药物发现的能力边界和实际价值。
Google DeepMind 的 AI 气象模型 WeatherNext 在 2025 年 10 月的飓风 Melissa 事件中,提前五天以 80% 置信度预测该风暴将在牙买加以五级强度登陆,三天前升至接近 100%。
推荐理由:文章详细记录了 WeatherNext 在真实飓风事件中的预测路径和强度双重准确率,以及给牙买加社区带来的提前撤离窗口,读者可据此评估该模型在极端天气预报中的实际可用性。
Gemini 3.5 Flash 正式发布,这是 Google 最新模型系列,主打前沿智能与 action 能力的结合。它在 Terminal-Bench 2.1 达 76.2%、GDPval-AA 达 1656 Elo、MCP Atlas 达 83.6%,输出 token 速度是其他前沿模型的 4 倍,现已向全球用户开放。
推荐理由:原文给出了 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准分数以及 4 倍速度提升,读者可据此判断 Gemini 3.5 Flash 在 agentic 任务上的能力对比。
Google DeepMind 在 Nature 发表 Co-Scientist 研究并正式向科研人员开放试用。
推荐理由:Co-Scientist 展示了多智能体如何在科研假设生成中形成迭代循环,读者可借鉴其“生成—辩论—进化”架构来思考如何将 AI 引入自己的研究流程。
Google DeepMind 发布 AI 协同诊疗(AI co-clinician)研究计划,旨在探索 AI 在临床权威监督下辅助患者护理的能力。在 98 个初级护理查询的盲评中,系统实现 97 例零关键错误;在 RxQA 药物问答基准上,开放式问题的表现超越前沿模型;与哈佛、斯坦福合作的模拟研究中,140 项评估维度里有 68 项达到或超过初级护理医生水平。
推荐理由:系统已在临床证据合成和药物问答两个基准上给出了具体对比数字,读者可以据此判断 AI 辅助临床决策当前的进展边界。
Google DeepMind 发布 Decoupled DiLoCo,将大规模训练任务拆分到独立的计算岛屿中,岛屿之间以异步数据流通信,单个芯片故障不会中断其他岛屿的训练。
推荐理由:原文给出了具体的训练规模(12B 参数)、带宽条件(2-5 Gbps)和关键结论(比传统方法快 20 倍以上),读者可据此评估该方法是否适用于自己的跨地域训练场景。
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准上取得 Elo 1,211 分,位列“最具吸引力象限”。
推荐理由:原文给出了基准分数(Elo 1,211)和 audio tags 等具体能力变化,读者可以据此判断该模型在同类产品中的相对位置和适用场景。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人大模型的重大升级版本。新模型在空间推理和多视角理解方面有显著提升,新增仪表读取(instrument reading)能力,可解读压力表、液位计和数字读数等工业仪表,并通过 agentic vision 结合视觉推理与代码执行实现高精度读数。
推荐理由:原文给出了仪表读取、多视角推理和安全约束等具体能力提升细节,读者可以据此评估该模型在具身智能任务中的实际可用性。
Google DeepMind 发布 Gemma 4 系列开源模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,基于 Gemini 3 的研究和技术,在 Arena AI 文本排行榜上 31B 模型位列开源模型第三、26B 排名第六,可超越参数量 20 倍的模型。
推荐理由:Gemma 4 提供了从移动端到高端 GPU 的多尺寸选择,并采用 Apache 2.0 许可,开发者可据此评估其对现有部署方案的影响。
Google DeepMind 发布 AI 驱动的智能指针实验项目,由 Gemini 提供支持。指针不再只追踪位置,还能理解用户指向的内容及其语义,从而用自然语言完成复杂操作。该功能现已集成进 Chrome 并即将登陆 Googlebook,用户可通过 Google AI Studio 体验 demo。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。