跳到正文
8月26日周三
8月25日周二
8月21日周五
  1. Microsoft Research62

    Microsoft Research 发布 Skala 1.1:深度学习 DFT 精度提升,已集成至 CP2K 等主流计算化学软件

    Microsoft Research 发布深度学习交换-相关泛函 Skala 1.1,相比初版训练数据量提升 2.5 倍,在 GMTKN55 基准的 55 个类别中斩获 32 个第一,精度超越最顶级的全局杂化泛函,同时保持 meta-GGA 的计算成本。

    推荐理由:Skala 1.1 已在 GMTKN55 的 55 个类别中斩获 32 个第一,数据规模和多样性大幅提升,同时集成至 CP2K、Psi4、FHI-aims、ORCA、VASP 等主流软件,读者可据此判断深度学习 DFT 在计算化学工作流中的实际可用性。

8月20日周四
  1. OpenAI News32

    OpenAI 推出 Intelligence Age 博客,探讨 AI 如何变革性重塑权力、治理、经济和个人自由

    OpenAI 推出 Intelligence Age 博客,聚焦 AI 对权力、治理、经济和个人自由的变革性影响。该博客将深入探讨 AI 如何系统地重塑社会各个层面,为公众和研究者提供前瞻性洞见。作为 OpenAI 的全新沟通平台,Intelligence Age 旨在促进对 AI 发展的深层思考和开放讨论。

8月19日周三
8月18日周二
8月17日周一
  1. OpenAI News34

    OpenAI 如何加强网络安全防御

    OpenAI正在加强其AI安全防御体系,应对AI技术对攻击者和防御者双方带来的变革。安全团队可采取的关键措施包括:识别AI驱动的攻击模式、加强模型访问控制、建立AI安全事件响应机制。随着AI能力增强,传统安全边界正在重新定义,组织需同步升级防御策略以应对新型威胁。

8月13日周四
  1. Microsoft Research62

    微软发布 MindTopo:揭示 VLM 拓扑推理能力的基准

    微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。

    推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。

8月12日周三
  1. Microsoft Research69

    CARE-X:借助辅助监督、奖励对齐学习和工具增强测量实现临床实用放射学 VLM

    微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。

    推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。

8月10日周一
8月7日周五
8月6日周四
8月5日周三
8月4日周二
  1. Microsoft Research82

    Microsoft Research 开源 Orchard 框架:统一环境服务支撑智能体训练与评测

    Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。

    推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。

8月3日周一
7月31日周五
7月30日周四
7月29日周三
7月26日周日
7月22日周三
7月21日周二
7月17日周五
  1. OpenAI News27

    OpenAI 如何让 ChatGPT 对青少年更安全

    OpenAI 为青少年提供安全的 AI 访问,推出年龄适当的保护措施、学习工具和家长控制功能。ChatGPT 已针对 13-17 岁青少年进行安全定制,并与外部专家合作确保保护措施的有效性。这些功能旨在让青少年在获得 AI 学习辅助的同时,接触的内容受到合理限制。

7月16日周四