跳到正文
8月13日周四
  1. Microsoft Research62

    微软发布 MindTopo:揭示 VLM 拓扑推理能力的基准

    微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。

    推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。

8月12日周三
  1. Microsoft Research69

    CARE-X:借助辅助监督、奖励对齐学习和工具增强测量实现临床实用放射学 VLM

    微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。

    推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。

8月10日周一
8月7日周五
8月6日周四
8月5日周三
8月4日周二
  1. Microsoft Research82

    Microsoft Research 开源 Orchard 框架:统一环境服务支撑智能体训练与评测

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。

    推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。

8月3日周一
7月31日周五
7月30日周四
7月29日周三
7月26日周日
7月22日周三
7月21日周二
7月17日周五
  1. OpenAI News27

    OpenAI 如何让 ChatGPT 对青少年更安全

    OpenAI 为青少年提供安全的 AI 访问,推出年龄适当的保护措施、学习工具和家长控制功能。ChatGPT 已针对 13-17 岁青少年进行安全定制,并与外部专家合作确保保护措施的有效性。这些功能旨在让青少年在获得 AI 学习辅助的同时,接触的内容受到合理限制。

7月16日周四
7月15日周三
7月14日周二
7月10日周五
  1. OpenAI News17

    ChatGPT 入门指南

    OpenAI 发布 ChatGPT 入门指南,介绍如何开启首次对话,涵盖写作、脑暴和问题解决等基础用例。指南面向新用户,无版本或功能特定信息。

7月9日周四
  1. OpenAI News19

    GPT-5.5 生物漏洞赏金计划

    OpenAI 宣布推出生物医学 AI 专项漏洞赏金计划 GPT-5.5 Bio Bug Bounty,邀请安全研究人员挖掘模型在生物医学场景中的潜在安全问题。该计划旨在提升模型安全性,鼓励白帽黑客参与发现并报告漏洞。计划具体奖金结构与参与方式尚未披露。

7月8日周三
7月7日周二
  1. Berkeley AI Research44

    在近乎免费的智能时代,数据系统如何为智能体、为管理智能体、由智能体构建

    GPT-4级别能力成本从2023年的$30/百万token降至<$1,每年推理价格下降9x至900x,AI智能体正成为数据系统的主导工作负载。为智能体设计的数据系统需支持每用户请求产生的数千条SQL查询,通过多查询优化和近似查询提升效率;同时数据系统还需承担管理智能体状态、处理智能体协调和容错的职责。 (95字,2句)

7月1日周三
  1. Berkeley AI Research33

    BAIR 2026 届博士毕业生 Showcase

    Berkeley AI Research(BAIR)庆祝 2026 届 PhD 毕业生,研究方向涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 等领域。毕业生去向包括学术界的 UCLA 助理教授、Princeton 博士后,以及产业界的 OpenAI、Physical Intelligence、Mistral AI 等研究岗位。