跳到正文
  1. Ars Technica · AI79

    Ataraxos AI 以 15:1 击败史上最强 Stratego 选手,训练成本仅数千美元

    来自 Carnegie Mellon、MIT、NYU 和 Stanford 的研究团队开发的 AI 系统 Ataraxos,在 Stratego 游戏中以 15 胜 1 负 4 平击败了可能是史上最强的选手 Pim Niemeijer,训练仅用了 16 块 GPU 和几千美元。

    推荐理由:研究披露了Ataraxos如何用远低于DeepMind的预算解决 Stratego 这一隐藏信息博弈难题,展示了不完美信息游戏的新求解路径。

  1. Simon Willison78

    Anthropic Frontier Red Team 报告:大模型在二进制漏洞利用任务上的能力评估

    Anthropic Frontier Red Team 在 100 个二进制漏洞利用任务上测试了多个模型,发现 GLM-5.3 在 4% 的任务中实现了完整控制流劫持,Claude Mythos Preview 为 6%;而更早的模型如 Claude Opus 4.6 和 GLM-5.2 在任何任务中都未成功,表明一个有意义的能力阈值已被跨越。

    推荐理由:研究给出了具体的能力阈值数字和对比基准,读者可以据此理解当前大模型在网络安全任务上的实际进展。

  1. Microsoft Research70

    Microsoft Research 发布 RetroChimera:用于小分子逆合成预测的集成模型

    Microsoft Research 在 Nature 发表论文并开源 RetroChimera,一个用于逆合成预测的集成框架。该模型结合了基于 Transformer 的 R-SMILES 2 和基于图神经网络的 NeuralLoc,通过学习排序策略整合两者的排名预测。

    推荐理由:文章描述了 RetroChimera 如何将两种互补模型(R-SMILES 2 和 NeuralLoc)通过学习排序策略组合,并在多步合成路线盲测中取得显著优势,读者可了解这一集成思路在化学逆合成预测中的实际效果。

  1. Microsoft Research62

    微软发布 MindTopo:揭示 VLM 拓扑推理能力的基准

    微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。

    推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。

  1. Microsoft Research69

    CARE-X:借助辅助监督、奖励对齐学习和工具增强测量实现临床实用放射学 VLM

    微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。

    推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。

已经到底了