跳到正文
9月30日周三
  1. Simon Willison78

    Anthropic Frontier Red Team 报告:大模型在二进制漏洞利用任务上的能力评估

    Anthropic Frontier Red Team 在 100 个二进制漏洞利用任务上测试了多个模型,发现 GLM-5.3 在 4% 的任务中实现了完整控制流劫持,Claude Mythos Preview 为 6%;而更早的模型如 Claude Opus 4.6 和 GLM-5.2 在任何任务中都未成功,表明一个有意义的能力阈值已被跨越。

    推荐理由:研究给出了具体的能力阈值数字和对比基准,读者可以据此理解当前大模型在网络安全任务上的实际进展。

9月23日周三
  1. OpenAI News31

    OpenAI 发布 MentalHealthBench

    OpenAI 推出 MentalHealthBench,这是一款专家参与开发的基准测试,用于在真实心理健康对话场景中评估 AI 响应的有用性和安全性。基准涵盖多个心理健康主题,帮助开发者衡量 AI 心理支持能力的可靠性。该测试旨在推动 AI 在心理健康领域的安全应用。

7月15日周三
3月10日周一