跳到正文
10月3日周六
  1. The Decoder37

    DeepMind 研究人员提出"人工共生智能"作为技术奇点的替代方案

    DeepMind 研究人员提出"人工共生智能"概念,认为智能是社会现象而非个体特质,应构建人与机器共生的生态系统,而非追求单一超级智能。论文引用 DeepSeek-R1 和 QwQ-32B 等推理模型的研究,表明强化学习训练会自发产生多视角内部辩论行为。研究将 AI 智能体重新定义为可分解组合的临时集合体,预测未来交互界面将从聊天转向网络图可视化,呼吁建立协调人与众多智能体协作的制度框架。

10月2日周五
  1. Ars Technica · AI79

    Ataraxos AI 以 15:1 击败史上最强 Stratego 选手,训练成本仅数千美元

    来自 Carnegie Mellon、MIT、NYU 和 Stanford 的研究团队开发的 AI 系统 Ataraxos,在 Stratego 游戏中以 15 胜 1 负 4 平击败了可能是史上最强的选手 Pim Niemeijer,训练仅用了 16 块 GPU 和几千美元。

    推荐理由:研究披露了Ataraxos如何用远低于DeepMind的预算解决 Stratego 这一隐藏信息博弈难题,展示了不完美信息游戏的新求解路径。

9月30日周三
  1. Simon Willison78

    Anthropic Frontier Red Team 报告:大模型在二进制漏洞利用任务上的能力评估

    Anthropic Frontier Red Team 在 100 个二进制漏洞利用任务上测试了多个模型,发现 GLM-5.3 在 4% 的任务中实现了完整控制流劫持,Claude Mythos Preview 为 6%;而更早的模型如 Claude Opus 4.6 和 GLM-5.2 在任何任务中都未成功,表明一个有意义的能力阈值已被跨越。

    推荐理由:研究给出了具体的能力阈值数字和对比基准,读者可以据此理解当前大模型在网络安全任务上的实际进展。

9月21日周一
  1. Microsoft Research70

    Microsoft Research 发布 RetroChimera:用于小分子逆合成预测的集成模型

    Microsoft Research 在 Nature 发表论文并开源 RetroChimera,一个用于逆合成预测的集成框架。该模型结合了基于 Transformer 的 R-SMILES 2 和基于图神经网络的 NeuralLoc,通过学习排序策略整合两者的排名预测。

    推荐理由:文章描述了 RetroChimera 如何将两种互补模型(R-SMILES 2 和 NeuralLoc)通过学习排序策略组合,并在多步合成路线盲测中取得显著优势,读者可了解这一集成思路在化学逆合成预测中的实际效果。

8月13日周四
  1. Microsoft Research62

    微软发布 MindTopo:揭示 VLM 拓扑推理能力的基准

    微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。

    推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。

8月12日周三
  1. Microsoft Research69

    CARE-X:借助辅助监督、奖励对齐学习和工具增强测量实现临床实用放射学 VLM

    微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。

    推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。

7月26日周日
4月20日周一
  1. Berkeley AI Research58

    GRASP:面向长时域世界模型规划的梯度松弛随机规划器

    Berkeley AI Research 提出 GRASP,一种基于梯度松弛的随机规划器,旨在解决现代世界模型进行长时域规划时的脆弱性问题。GRASP 将轨迹提升到虚拟状态空间并行优化,同时向状态迭代中加入高斯噪声以促进探索,并通过阻止状态梯度但保留动作梯度来规避深度学习模型的对抗鲁棒性问题。

3月13日周五
  1. Berkeley AI Research56

    BAIR 发布 SPEX/ProxySPEX:大规模识别 LLM 交互作用的算法框架

    BAIR 团队发布 SPEX 及其改进版 ProxySPEX 算法,旨在高效识别 LLM 等复杂 ML 系统中的关键交互作用。该框架利用交互作用的稀疏性和低阶性,将搜索问题转化为稀疏恢复问题,在数千个特征规模下仍能保持高 faithfulness,而 LIME 等边际方法在此规模下 faithfulness 显著下降。

1月10日周六
  1. Berkeley AI Research40

    信息驱动的成像系统设计

    Berkeley AI Research 在 NeurIPS 2025 发表论文,提出基于信息内容的成像系统直接评估与优化框架,利用互信息量化测量区分物体的能力,无需重建算法即可预测系统性能。该方法在颜色摄影、射电天文学、无透镜成像和显微镜四个领域验证了信息估计值与下游任务准确率的一致性,可匹配端到端方法但所需内存与算力更少且无需任务专属解码器设计。