跳到正文

内容形态

产品更新 最新动态

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

41 条精选近 30 天 16 条共收录 191 条

更新

精选归档 · 第 2 页

8月12日周三第 21–40 条
8月4日周二
  1. Microsoft Research82

    Microsoft Research 开源 Orchard 框架:统一环境服务支撑智能体训练与评测

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。

    推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。

7月30日周四
  1. Google DeepMind65

    Google DeepMind 在 Flow Music 中推出 Lyria 3.5,在音乐性、歌词、人声和创作控制方面实现进步

    Google DeepMind 发布最新音乐生成模型 Lyria 3.5,现已在 Flow Music 中可用。新版在四个方面实现提升:音乐性更自然、旋律结构更丰富;歌词质量更高、提示词遵循和结构感知更强;人声更具表现力和情感细腻度,发音更清晰;支持更便捷地控制输出速度和时长。

    推荐理由:原文给出了四个维度的具体提升点,读者可以据此了解当前音乐生成模型的能力边界和可用入口。

7月28日周二
  1. Google DeepMind72

    Gemini Robotics 2 为机器人带来全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,包含三个模型:Gemini Robotics 2(高级 VLA 模型,支持全身控制和高级灵巧操作)、Gemini Robotics ER 2(具身推理模型,可处理多步骤任务和人类交互)、Gemini Robotics On-Device 2(端侧优化模型,几小时内适配新机器人形态)。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

7月1日周三
6月25日周四
  1. Google DeepMind66

    Gemini 3.5 Flash 新增内置计算机使用能力

    Google DeepMind 宣布 Gemini 3.5 Flash 现已内置 computer use 能力,支持开发者构建可在浏览器、移动端和桌面环境中看屏、推理并执行动作的智能体。

    推荐理由:Gemini 3.5 Flash 现已内置 computer use 能力,开发者可直接用它构建跨平台智能体,并获得可选的企业级安全防护层。

5月18日周一
  1. Google DeepMind66

    Google 推出 Gemini Omni:能理解任意输入并生成视频的多模态模型

    Gemini Omni Flash 是 Google DeepMind 发布的首个能处理任意模态输入并生成高质量视频的模型,支持图像、音频、视频、文本组合输入。

    推荐理由:模型的核心能力(任意模态输入生成视频、自然语言编辑)和具体开放时间线已给出,读者可据此判断它对自己工作流的影响。

5月17日周日
  1. Google DeepMind69

    Google 发布 Gemini for Science:面向科学发现新时代的 AI 实验与工具

    Google 发布 Gemini for Science,包含三个实验工具:Hypothesis Generation 由 Co-Scientist 构建,通过多智能体「创意竞赛」生成和评估假说。

    推荐理由:原文给出了三个实验工具的具体能力(多智能体假说生成、并行测试数千种代码变体、文献结构化分析)和开放入口,读者可以据此判断它们如何改变现有科研工作流。

  2. Google DeepMind70

    Google DeepMind 扩展内容溯源与验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud

    Google DeepMind 扩展内容透明度和验证工具,SynthID 水印技术已对超过 1000 亿张图片和视频、6 万年音频添加水印。Gemini 应用中的 SynthID 验证已使用 5000 万次,并扩展至 Search 和 Chrome。

    推荐理由:原文给出了具体的数据规模和合作伙伴,读者可以据此判断 AI 内容溯源和验证工具的可用性变化。

5月12日周二
5月5日周二
  1. OpenAI News63

    OpenAI 推出 ChatGPT 广告自助购买新方式

    OpenAI 推出 ChatGPT 广告的 beta 版自助 Ads Manager,支持 CPC 竞价和增强的测量工具,强调保护用户隐私并将对话与广告分离。

    推荐理由:原文给出了 beta 版自助广告管理器、CPC 竞价和隐私保护三个具体变化,读者可以据此判断它对广告商的价值。

3月29日周日
  1. Google DeepMind74

    Google DeepMind:为 AI 时代重新设计鼠标指针

    Google DeepMind 发布 AI 驱动的智能指针实验项目,由 Gemini 提供支持。指针不再只追踪位置,还能理解用户指向的内容及其语义,从而用自然语言完成复杂操作。该功能现已集成进 Chrome 并即将登陆 Googlebook,用户可通过 Google AI Studio 体验 demo。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

3月26日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash Live 音频模型,提升实时对话的自然度和可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI Audio MultiChallenge 上得分 36.1%(开启 thinking)。

    推荐理由:原文给出了具体 benchmark 数据和多产品可用入口,读者可以据此了解 Gemini 3.1 Flash Live 在音频/语音任务上的能力边界和实际落地场景。

  2. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro,可生成长达 3 分钟的结构化音乐

    Google DeepMind 发布 Lyria 3 Pro,这是其高级音乐生成模型,支持生成长达 3 分钟的曲目,并能理解音乐结构(intro、verse、chorus、bridge)。

    推荐理由:原文给出了能力变化(3分钟长曲目、结构感知)和多个产品落地入口,读者可以据此判断它对音乐创作工作流的影响。

2月19日周四
  1. Google DeepMind76

    Gemini app 上线 Lyria 3 音乐生成功能,支持文本或图片生成 30 秒音轨

    Google DeepMind 宣布在 Gemini app 推出 Lyria 3 音乐生成模型,用户输入文本描述或上传照片即可在数秒内生成 30 秒定制音轨(含自动生成歌词),支持英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语,面向 18 岁以上用户开放 Beta 测试。所有曲目均嵌入 SynthID 水印以标识 AI 生成内容。

    推荐理由:Lyria 3 以 30 秒音乐生成为切入点展示多模态能力进展,且 SynthID 水印和合规设计在文中都有具体说明。

2月13日周五
  1. Google DeepMind72

    Gemini 3 Deep Think:推进科学研究与工程推理

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,专注科学、研究与工程领域的高难度推理任务。新版在 Humanity's Last Exam 达 48.4%(无工具)、ARC-AGI-2 达 84.6%、Codeforces 达 3455 Elo、CMT-Benchmark 达 50.5%,并在数学、物理和化学奥林匹克书面部分达到金牌水平。

    推荐理由:原文给出了多个权威基准测试的明确分数和 API 开放入口,读者可以据此评估 Gemini 3 Deep Think 的实际能力水平。

12月13日周六
11月20日周四
  1. Google DeepMind65

    Google DeepMind 如何在 Gemini 应用中推出 AI 图像验证功能

    Google 在 Gemini 应用中上线 AI 图像验证功能,用户上传图像并询问"这是由 Google AI 创建的吗?"即可检测 SynthID 数字水印,判断图像是否由 Google AI 生成或编辑。

    推荐理由:Google 将 SynthID 水印验证能力直接集成到 Gemini 对话中,用户只需上传图像并提问即可判断是否由 Google AI 生成,降低了普通用户识别 AI 生成内容的门槛。

  2. Google DeepMind69

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,支持 2K/4K 分辨率、最多十四张输入融合、改进的文字渲染及图像本地化,并集成 SynthID 数字水印。

    推荐理由:该模型将 Gemini 3 Pro 的能力扩展到图像生成领域,并原生支持与 Google Search 的 grounding 融合,可输出数据驱动的可视化内容。