跳到正文
10月3日周六
  1. The Verge · AI52

    OpenAI Dots 体验:定位企业用户,但安全检查频繁触发

    OpenAI 的智能体 Dots 主打企业场景,用户通过聊天窗口下达指令,智能体在虚拟机中操控 Blender、GIMP 等桌面应用完成工作。记者实测发现,在预约服务、网购等涉及安全检查的场景下 Dots 频繁受阻,需要人工接管;而在处理本地任务(如剪辑视频、更新网站)时表现出色。

10月2日周五
  1. AWS Machine Learning Blog61

    Amazon Quick 推出 Live Data in Apps,让 AI 构建的应用支持实时查询 QuickSight 数据集

    Amazon Quick 推出 Live Data in Apps 功能,使 AI 构建的 Quick Apps 可以实时查询 QuickSight 数据集,而不是依赖构建时的静态快照。用户可以用自然语言描述需求,AI agent 自动生成 SQL 并在发布后每次打开时重新执行,同时继承行级和列级安全规则,确保每个用户只能看到自己有权限访问的数据。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

10月1日周四
9月30日周三
  1. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    SynthID Bio 是 Google DeepMind 将水印技术从数字媒体扩展到合成生物学的新工具,能在不影响蛋白质功能的前提下向氨基酸序列和 3D 结构嵌入不可察觉的签名。

    推荐理由:SynthID Bio 是 AI 水印技术首次扩展到生物领域,提供了可验证 AI 生成蛋白质来源的可行方案,对生物安全筛查有直接影响。

  2. NVIDIA Blog62

    NVIDIA 与 CoreWeave 合作推出 Vera Rubin NVL72 系统及 CoreWeave Forge 平台

    CoreWeave 在旧金山峰会上宣布 NVIDIA Vera Rubin NVL72 系统正式上线,Cognition(Devin 的开发团队)成为首个生产用户,在 SWE-2 推理工作负载中实现相比 GB200 NVL72 高达 4.8 倍的 token 吞吐量提升。

    推荐理由:原文给出了具体性能数据(4.8x token throughput、3x faster sandbox startup、1.7x Terminal-Bench 提升),读者可据此判断 Vera Rubin 和 CoreWeave Forge 的实际能力变化。

  3. AWS Machine Learning Blog63

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,主打低成本的近 Astra 推理能力

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,据 OpenAI 介绍它在编码、计算机操作和专业工作场景中提供接近 Astra 的推理能力。

    推荐理由:原文给出了性能对比数字(DeepSWE v1.1 成本降为五分之一、超越 GPT-6 Sol 6.4 个百分点)和 Codex 的集成路径,读者可以据此判断它是否值得替换现有 Agent 工作流。

9月29日周二
  1. Microsoft Research60

    Microsoft Research 发布 Quine:面向生物学复杂性的 AI 研究系统

    Microsoft Research 发布 Quine,这是一个结合生物世界模型与交互式工具链的 AI 研究系统,旨在连接科学工具、文献、湿实验和科研人员。与 Broad Institute 合作,团队将 Quine 用于胰腺导管腺癌(PDAC)细胞状态转换研究,基于预测优先排序数千种化合物并完成湿实验验证,最高排名化合物产生了最大预期转录变化,整个筛选到验证流程仅耗时一个周末。

    推荐理由:Quine 给出了具体的能力定位和胰腺癌化合物筛选的实验验证结果,读者可据此评估它在加速生物学发现上的实际潜力。

  2. OpenAI News27

    OpenAI DevDay 2026 回顾

    OpenAI DevDay 2026 展示超过 20 项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。GPT-6 Astra 作为新一代模型亮相,Codex 带来编码能力增强,安全与 API 相关功能同步升级。整场活动面向开发者群体,提供从模型到工具链的完整生态更新。

9月28日周一
  1. Simon Willison33

    Simon Willison 发布 Bluesky reply bot checker:检测平台自动回复机器人工具

    Bluesky reply bot checker 工具可分析任意账号近期发帖行为,检测打字速度异常、几秒内快速回复、仅回复高粉丝用户而无原创内容、带问号的诱导性回复等机器人特征,并展示每项判断依据。Simon Willison 表示自己在 Twitter 常被大量自动回复淹没,Bluesky 虽有可用 API 但机器人问题开始蔓延,故用 Opus 5.5 编写该工具供用户自主验证。

9月25日周五
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.8 Live 实时虚拟形象功能

    Google DeepMind 发布 Gemini 3.8 Live 的 Live Avatar 功能,将实时视频生成与语音对话深度融合,支持精确唇形同步、自然表情和流畅话轮转换,可同时处理视觉与音频输入。该功能通过异步工具调用在后台执行复杂任务并保持对话连贯,支持 97 种语言的实时切换,SynthID 水印嵌入音视频输出以保障内容可溯源性,即日起面向 Gemini Enterprise 开放。

    推荐理由:原文披露了实时视觉对话、异步工具调用、97语言无缝切换等具体能力差异,以及 SynthID 水印的安全设计,读者可据此评估该功能对现有企业服务的补充方向。

9月24日周四
9月23日周三
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文字转语音模型,前者支持用自然语言提示从零创建语音并逐行控制表演,后者针对高容量场景优化。两个模型在 Hume AI 语音设计基准中分别排名第一和第二,支持超过 100 种语言,并内置 SynthID 水印和同意验证等安全机制。

    推荐理由:两个模型在语音设计基准和综合质量指数中均排名第一,可作为当前文本转语音领域的前沿参考。

  2. Simon Willison22

    llm-anthropic 0.29

    llm-anthropic 0.29 是 Simon Willison 为 llm CLI 工具添加 Anthropic Claude 模型支持的 Python 插件最新版本。Simon Willison 于 9 月 22 日发布月度简报,当月 llm 相关更新 635 次,anthropic 相关 343 次。

9月22日周二
  1. NVIDIA Blog68

    NVIDIA 发布 Isaac ROS 5.0,推进智能体驱动的开源机器人开发

    NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速机器人工具包。5.0 版本新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入智能体工作流,使开发者和 AI 智能体能够协同构建机器人应用。

    推荐理由:新版引入 agentic 工作流,读者可以判断这将如何改变机器人应用的开发流程和交付速度。

9月17日周四
9月8日周二
  1. Google DeepMind76

    Google DeepMind 发布 AlphaGenome Atlas:覆盖人类基因组全部 90 亿个单核苷酸变异的预测图谱

    Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组全部约 90 亿个单核苷酸变异的分子效应预测,总数据量达 1 PB(约为 AlphaFold 数据库的 30 倍)。

    推荐理由:Google DeepMind 一次性公开了全部 90 亿个单核苷酸变异的分子效应预测,并配套 AVI 评分系统,研究者可据此快速评估候选变异的潜在影响。

9月5日周六
  1. GitHub Blog · AI & ML76

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 发布 Project HydraFusion 研究预览,通过运行时编排选择多模型协同完成任务,支持 Single(单模型直接解决)、Cascade(级联升级)和 Critique(批评修订)三种执行模式。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

8月21日周五
  1. Microsoft Research62

    Microsoft Research 发布 Skala 1.1:深度学习 DFT 精度提升,已集成至 CP2K 等主流计算化学软件

    Microsoft Research 发布深度学习交换-相关泛函 Skala 1.1,相比初版训练数据量提升 2.5 倍,在 GMTKN55 基准的 55 个类别中斩获 32 个第一,精度超越最顶级的全局杂化泛函,同时保持 meta-GGA 的计算成本。

    推荐理由:Skala 1.1 已在 GMTKN55 的 55 个类别中斩获 32 个第一,数据规模和多样性大幅提升,同时集成至 CP2K、Psi4、FHI-aims、ORCA、VASP 等主流软件,读者可据此判断深度学习 DFT 在计算化学工作流中的实际可用性。

8月4日周二
  1. Microsoft Research82

    Microsoft Research 开源 Orchard 框架:统一环境服务支撑智能体训练与评测

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。

    推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。