Google DeepMind 推出 SL2T 手语转文字模型
Google DeepMind 于 2026 年 8 月 12 日发布 SL2T 手语转文字翻译模型,在 FLEURS-ASL 基准上取得零样本 70 BLEURT 的成绩。
推荐理由:该模型首次将手语AI从实验室带入消费级产品,用户可直接在手机任何输入场景下手语转文字。
内容形态
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
41 条精选近 30 天 16 条共收录 191 条
Google DeepMind 于 2026 年 8 月 12 日发布 SL2T 手语转文字翻译模型,在 FLEURS-ASL 基准上取得零样本 70 BLEURT 的成绩。
推荐理由:该模型首次将手语AI从实验室带入消费级产品,用户可直接在手机任何输入场景下手语转文字。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。
推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Flow Music 中可用。新版在四个方面实现提升:音乐性更自然、旋律结构更丰富;歌词质量更高、提示词遵循和结构感知更强;人声更具表现力和情感细腻度,发音更清晰;支持更便捷地控制输出速度和时长。
推荐理由:原文给出了四个维度的具体提升点,读者可以据此了解当前音乐生成模型的能力边界和可用入口。
Google DeepMind 发布 Gemini Robotics 2,包含三个模型:Gemini Robotics 2(高级 VLA 模型,支持全身控制和高级灵巧操作)、Gemini Robotics ER 2(具身推理模型,可处理多步骤任务和人类交互)、Gemini Robotics On-Device 2(端侧优化模型,几小时内适配新机器人形态)。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 发布图像模型 Nano Banana 2 Lite 和视频模型 Gemini Omni Flash。
推荐理由:原文给出了具体性能数字(4 秒延迟、$0.034/1K 图)和可用入口,读者可据此判断如何接入新模型。
Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。
推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。
Gemini Omni Flash 是 Google DeepMind 发布的首个能处理任意模态输入并生成高质量视频的模型,支持图像、音频、视频、文本组合输入。
推荐理由:模型的核心能力(任意模态输入生成视频、自然语言编辑)和具体开放时间线已给出,读者可据此判断它对自己工作流的影响。
Google 发布 Gemini for Science,包含三个实验工具:Hypothesis Generation 由 Co-Scientist 构建,通过多智能体「创意竞赛」生成和评估假说。
推荐理由:原文给出了三个实验工具的具体能力(多智能体假说生成、并行测试数千种代码变体、文献结构化分析)和开放入口,读者可以据此判断它们如何改变现有科研工作流。
Google DeepMind 扩展内容透明度和验证工具,SynthID 水印技术已对超过 1000 亿张图片和视频、6 万年音频添加水印。Gemini 应用中的 SynthID 验证已使用 5000 万次,并扩展至 Search 和 Chrome。
推荐理由:原文给出了具体的数据规模和合作伙伴,读者可以据此判断 AI 内容溯源和验证工具的可用性变化。
Google DeepMind 在 Nature 发表 Co-Scientist 研究并正式向科研人员开放试用。
推荐理由:Co-Scientist 展示了多智能体如何在科研假设生成中形成迭代循环,读者可借鉴其“生成—辩论—进化”架构来思考如何将 AI 引入自己的研究流程。
OpenAI 推出 ChatGPT 广告的 beta 版自助 Ads Manager,支持 CPC 竞价和增强的测量工具,强调保护用户隐私并将对话与广告分离。
推荐理由:原文给出了 beta 版自助广告管理器、CPC 竞价和隐私保护三个具体变化,读者可以据此判断它对广告商的价值。
Google DeepMind 发布 AI 驱动的智能指针实验项目,由 Gemini 提供支持。指针不再只追踪位置,还能理解用户指向的内容及其语义,从而用自然语言完成复杂操作。该功能现已集成进 Chrome 并即将登陆 Googlebook,用户可通过 Google AI Studio 体验 demo。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 推出 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI Audio MultiChallenge 上得分 36.1%(开启 thinking)。
推荐理由:原文给出了具体 benchmark 数据和多产品可用入口,读者可以据此了解 Gemini 3.1 Flash Live 在音频/语音任务上的能力边界和实际落地场景。
Google DeepMind 发布 Lyria 3 Pro,这是其高级音乐生成模型,支持生成长达 3 分钟的曲目,并能理解音乐结构(intro、verse、chorus、bridge)。
推荐理由:原文给出了能力变化(3分钟长曲目、结构感知)和多个产品落地入口,读者可以据此判断它对音乐创作工作流的影响。
Google DeepMind 宣布在 Gemini app 推出 Lyria 3 音乐生成模型,用户输入文本描述或上传照片即可在数秒内生成 30 秒定制音轨(含自动生成歌词),支持英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语,面向 18 岁以上用户开放 Beta 测试。所有曲目均嵌入 SynthID 水印以标识 AI 生成内容。
推荐理由:Lyria 3 以 30 秒音乐生成为切入点展示多模态能力进展,且 SynthID 水印和合规设计在文中都有具体说明。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,专注科学、研究与工程领域的高难度推理任务。新版在 Humanity's Last Exam 达 48.4%(无工具)、ARC-AGI-2 达 84.6%、Codeforces 达 3455 Elo、CMT-Benchmark 达 50.5%,并在数学、物理和化学奥林匹克书面部分达到金牌水平。
推荐理由:原文给出了多个权威基准测试的明确分数和 API 开放入口,读者可以据此评估 Gemini 3 Deep Think 的实际能力水平。
Google DeepMind 发布更新后的 Gemini 2.5 Flash Native Audio,用于实时语音智能体。
推荐理由:原文给出了三个维度的量化改进和实时语音翻译的具体能力边界,读者可据此评估这些提升在实际场景中的可用性。
Google 在 Gemini 应用中上线 AI 图像验证功能,用户上传图像并询问"这是由 Google AI 创建的吗?"即可检测 SynthID 数字水印,判断图像是否由 Google AI 生成或编辑。
推荐理由:Google 将 SynthID 水印验证能力直接集成到 Gemini 对话中,用户只需上传图像并提问即可判断是否由 Google AI 生成,降低了普通用户识别 AI 生成内容的门槛。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,支持 2K/4K 分辨率、最多十四张输入融合、改进的文字渲染及图像本地化,并集成 SynthID 数字水印。
推荐理由:该模型将 Gemini 3 Pro 的能力扩展到图像生成领域,并原生支持与 Google Search 的 grounding 融合,可输出数据驱动的可视化内容。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成和编辑模型,基于 Gemini 3 Pro 增强了推理和世界知识。
推荐理由:原文列出了具体能力升级(推理增强、文本渲染、图像融合数量、分辨率等)和多端上线时间,读者可据此评估与现有图像生成工具的差距。