跳到正文
10月3日周六
10月2日周五
  1. Ars Technica · AI79

    Ataraxos AI 以 15:1 击败史上最强 Stratego 选手,训练成本仅数千美元

    来自 Carnegie Mellon、MIT、NYU 和 Stanford 的研究团队开发的 AI 系统 Ataraxos,在 Stratego 游戏中以 15 胜 1 负 4 平击败了可能是史上最强的选手 Pim Niemeijer,训练仅用了 16 块 GPU 和几千美元。

    推荐理由:研究披露了Ataraxos如何用远低于DeepMind的预算解决 Stratego 这一隐藏信息博弈难题,展示了不完美信息游戏的新求解路径。

9月30日周三
  1. Simon Willison78

    Anthropic Frontier Red Team 报告:大模型在二进制漏洞利用任务上的能力评估

    Anthropic Frontier Red Team 在 100 个二进制漏洞利用任务上测试了多个模型,发现 GLM-5.3 在 4% 的任务中实现了完整控制流劫持,Claude Mythos Preview 为 6%;而更早的模型如 Claude Opus 4.6 和 GLM-5.2 在任何任务中都未成功,表明一个有意义的能力阈值已被跨越。

    推荐理由:研究给出了具体的能力阈值数字和对比基准,读者可以据此理解当前大模型在网络安全任务上的实际进展。

9月23日周三
  1. OpenAI News31

    OpenAI 发布 MentalHealthBench

    OpenAI 推出 MentalHealthBench,这是一款专家参与开发的基准测试,用于在真实心理健康对话场景中评估 AI 响应的有用性和安全性。基准涵盖多个心理健康主题,帮助开发者衡量 AI 心理支持能力的可靠性。该测试旨在推动 AI 在心理健康领域的安全应用。

8月13日周四
  1. Microsoft Research62

    微软发布 MindTopo:揭示 VLM 拓扑推理能力的基准

    微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。

    推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。

3月13日周五
  1. Berkeley AI Research56

    BAIR 发布 SPEX/ProxySPEX:大规模识别 LLM 交互作用的算法框架

    BAIR 团队发布 SPEX 及其改进版 ProxySPEX 算法,旨在高效识别 LLM 等复杂 ML 系统中的关键交互作用。该框架利用交互作用的稀疏性和低阶性,将搜索问题转化为稀疏恢复问题,在数千个特征规模下仍能保持高 faithfulness,而 LIME 等边际方法在此规模下 faithfulness 显著下降。

1月10日周六
  1. Berkeley AI Research40

    信息驱动的成像系统设计

    Berkeley AI Research 在 NeurIPS 2025 发表论文,提出基于信息内容的成像系统直接评估与优化框架,利用互信息量化测量区分物体的能力,无需重建算法即可预测系统性能。该方法在颜色摄影、射电天文学、无透镜成像和显微镜四个领域验证了信息估计值与下游任务准确率的一致性,可匹配端到端方法但所需内存与算力更少且无需任务专属解码器设计。

4月10日周四