跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

40 条精选近 30 天 5 条共收录 68 条

更新

精选归档 · 第 2 页

4月16日周四第 21–40 条
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.1 Flash TTS,引入 audio tags 实现细粒度语音控制

    Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准上取得 Elo 1,211 分,位列“最具吸引力象限”。

    推荐理由:原文给出了基准分数(Elo 1,211)和 audio tags 等具体能力变化,读者可以据此判断该模型在同类产品中的相对位置和适用场景。

4月13日周一
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人大模型的重大升级版本。新模型在空间推理和多视角理解方面有显著提升,新增仪表读取(instrument reading)能力,可解读压力表、液位计和数字读数等工业仪表,并通过 agentic vision 结合视觉推理与代码执行实现高精度读数。

    推荐理由:原文给出了仪表读取、多视角推理和安全约束等具体能力提升细节,读者可以据此评估该模型在具身智能任务中的实际可用性。

4月3日周五
  1. Google DeepMind75

    Google DeepMind 发布 Gemma 4:逐字节打造最强大开源模型

    Google DeepMind 发布 Gemma 4 系列开源模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,基于 Gemini 3 的研究和技术,在 Arena AI 文本排行榜上 31B 模型位列开源模型第三、26B 排名第六,可超越参数量 20 倍的模型。

    推荐理由:Gemma 4 提供了从移动端到高端 GPU 的多尺寸选择,并采用 Apache 2.0 许可,开发者可据此评估其对现有部署方案的影响。

3月29日周日
  1. Google DeepMind74

    Google DeepMind:为 AI 时代重新设计鼠标指针

    Google DeepMind 发布 AI 驱动的智能指针实验项目,由 Gemini 提供支持。指针不再只追踪位置,还能理解用户指向的内容及其语义,从而用自然语言完成复杂操作。该功能现已集成进 Chrome 并即将登陆 Googlebook,用户可通过 Google AI Studio 体验 demo。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

3月26日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.1 Flash Live 音频模型,提升实时对话的自然度和可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI Audio MultiChallenge 上得分 36.1%(开启 thinking)。

    推荐理由:原文给出了具体 benchmark 数据和多产品可用入口,读者可以据此了解 Gemini 3.1 Flash Live 在音频/语音任务上的能力边界和实际落地场景。

  2. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro,可生成长达 3 分钟的结构化音乐

    Google DeepMind 发布 Lyria 3 Pro,这是其高级音乐生成模型,支持生成长达 3 分钟的曲目,并能理解音乐结构(intro、verse、chorus、bridge)。

    推荐理由:原文给出了能力变化(3分钟长曲目、结构感知)和多个产品落地入口,读者可以据此判断它对音乐创作工作流的影响。

3月4日周三
2月27日周五
  1. Google DeepMind77

    Google DeepMind 发布 Nano Banana 2:结合 Pro 能力与 Flash 速度的图像生成模型

    Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Pro 版的高级世界知识和生成质量与 Flash 级别的高速推理结合。

    推荐理由:读者可以了解 Nano Banana 2 在速度与能力之间实现的具体平衡,以及它与 Pro 版的定位差异,便于在实际工作中选择合适的工具。

2月19日周四
  1. Google DeepMind76

    Gemini app 上线 Lyria 3 音乐生成功能,支持文本或图片生成 30 秒音轨

    Google DeepMind 宣布在 Gemini app 推出 Lyria 3 音乐生成模型,用户输入文本描述或上传照片即可在数秒内生成 30 秒定制音轨(含自动生成歌词),支持英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语,面向 18 岁以上用户开放 Beta 测试。所有曲目均嵌入 SynthID 水印以标识 AI 生成内容。

    推荐理由:Lyria 3 以 30 秒音乐生成为切入点展示多模态能力进展,且 SynthID 水印和合规设计在文中都有具体说明。

2月13日周五
  1. Google DeepMind72

    Gemini 3 Deep Think:推进科学研究与工程推理

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,专注科学、研究与工程领域的高难度推理任务。新版在 Humanity's Last Exam 达 48.4%(无工具)、ARC-AGI-2 达 84.6%、Codeforces 达 3455 Elo、CMT-Benchmark 达 50.5%,并在数学、物理和化学奥林匹克书面部分达到金牌水平。

    推荐理由:原文给出了多个权威基准测试的明确分数和 API 开放入口,读者可以据此评估 Gemini 3 Deep Think 的实际能力水平。

2月10日周二
  1. Google DeepMind79

    Gemini Deep Think 在数学与跨学科研究中取得多项 Level 2 级进展

    Google DeepMind 发表了关于 Gemini Deep Think 模式的两篇论文(编号 Feng26 和 LeeSeo26),展示了其在纯数学、物理学和计算机科学多个子领域的专业研究能力。

    推荐理由:展示了 AI 从竞赛级题目到可发表级数学研究的具体进展,并提出了社区可参考的 AI 辅助数学研究分类体系,适合了解 AI for Science 实际边界的读者。

1月16日周五
12月17日周三
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3 Flash:速度优先的前沿智能模型

    Google DeepMind 发布 Gemini 3 Flash,这是 Gemini 3 模型家族的轻量版,保留 Pro 级推理能力的同时优化了延迟和成本。在 GPQA Diamond 达到 90.4%,SWE-bench Verified 得分 78% 超越 Gemini 3 Pro,速度是 Gemini 2.5 Pro 的 3 倍,token 消耗减少 30%。

    推荐理由:原文展示了 Gemini 3 Flash 在 GPQA Diamond、SWE-bench Verified 等 benchmarks 上的具体性能数据,以及 3 倍速度提升和 token 减少 30% 的量化指标,读者可以据此评估其对现有开发流程的实际影响。

12月9日周二
  1. Google DeepMind65

    Google DeepMind 推出 FACTS 基准测试套件,系统性评估大语言模型事实准确性

    Google DeepMind 联合 Kaggle 发布 FACTS 基准测试套件,包含参数基准、搜索基准、多模态基准和更新的 Grounding v2 四个子基准,共 3513 个样例。

    推荐理由:Gemini 3 Pro 在搜索和参数基准上较 2.5 Pro 错误率大幅下降,但多模态基准仍是短板,读者可据此判断当前模型在事实性任务上的真实差距。

11月25日周二
  1. Google DeepMind66

    Google DeepMind 利用 AlphaFold 揭示心脏病关键蛋白质 apoB100 结构

    Google DeepMind 与密苏里大学合作,借助 AlphaFold 生成apoB100的原子级结构预测,再与冷冻电镜图像数据交叉验证,最终解析出apoB100——即"坏胆固醇"(LDL)分子支架——的结构。apoB100包裹LDL颗粒形成笼状外壳,并有一条 ribbon 状腰带维持颗粒在血液中的完整性。这一结构解析为高胆固醇和动脉粥样硬化性心血管疾病的精准诊断与靶向治疗开辟了新途径。

    推荐理由:AlphaFold 在这篇研究中实际参与了蛋白结构的预测与验证,这一具体应用路径为读者提供了可参考的 AI 辅助科研方法。

11月20日周四
  1. Google DeepMind65

    Google DeepMind 如何在 Gemini 应用中推出 AI 图像验证功能

    Google 在 Gemini 应用中上线 AI 图像验证功能,用户上传图像并询问"这是由 Google AI 创建的吗?"即可检测 SynthID 数字水印,判断图像是否由 Google AI 生成或编辑。

    推荐理由:Google 将 SynthID 水印验证能力直接集成到 Gemini 对话中,用户只需上传图像并提问即可判断是否由 Google AI 生成,降低了普通用户识别 AI 生成内容的门槛。

  2. Google DeepMind69

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成模型

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,支持 2K/4K 分辨率、最多十四张输入融合、改进的文字渲染及图像本地化,并集成 SynthID 数字水印。

    推荐理由:该模型将 Gemini 3 Pro 的能力扩展到图像生成领域,并原生支持与 Google Search 的 grounding 融合,可输出数据驱动的可视化内容。

11月19日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3 Pro 预览版

    Google DeepMind 发布 Gemini 3 Pro,声称是其最智能的模型。Gemini 3 Pro 在 LMArena 达到 1501 Elo,在 GPQA Diamond 取得 91.9%,在 Humanity's Last Exam 取得 37.5%(无工具使用)。

    推荐理由:原文给出了具体基准分数和功能变化,读者可以据此评估 Gemini 3 Pro 在推理、编码和多模态任务上的能力定位。