Amazon Bedrock AgentCore 如何为 Claude Desktop 添加安全的 Web Search
Claude Desktop on Amazon Bedrock 通过 AgentCore Gateway 集成 Web Search,弥补模型训练知识截止日期的局限性,Web Search 是基于覆盖数百亿文档的 Amazon 网络索引的完全托管、MCP 兼容搜索能力。
Claude Desktop on Amazon Bedrock 通过 AgentCore Gateway 集成 Web Search,弥补模型训练知识截止日期的局限性,Web Search 是基于覆盖数百亿文档的 Amazon 网络索引的完全托管、MCP 兼容搜索能力。
Microsoft Research 发布 Quine,这是一个结合生物世界模型与交互式工具链的 AI 研究系统,旨在连接科学工具、文献、湿实验和科研人员。与 Broad Institute 合作,团队将 Quine 用于胰腺导管腺癌(PDAC)细胞状态转换研究,基于预测优先排序数千种化合物并完成湿实验验证,最高排名化合物产生了最大预期转录变化,整个筛选到验证流程仅耗时一个周末。
推荐理由:Quine 给出了具体的能力定位和胰腺癌化合物筛选的实验验证结果,读者可据此评估它在加速生物学发现上的实际潜力。
Microsoft Research Asia – Singapore 于2025年7月24日开业,是微软在东南亚首个研究实验室,建立在20多年合作基础上。该实验室聚焦四个支柱:下一代AI模型和智能体系统、领域特定AI、AI原生研究实践及生态系统与人才培养,已在医疗AI领域与新加坡医疗机构开展多模态和智能体AI合作研究。其研究方向与新加坡国家AI战略2.0对齐,EDB和IMDA均为重要合作伙伴。
GitHub Copilot app 推出 canvases 功能,允许用户通过自然语言描述生成自定义界面(如 kanban board、issue triage board、release checklist 等),创建后 agent 和用户都能实时更新界面内容。
三年过去,LLM 的主流交互界面仍是 chat,文章认为 chat 在用户已知具体任务时往往是错误的 UI,推荐用可自定义的 canvas 取而代之。GitHub Copilot 的 canvas 是运行在应用内的全栈小应用,可与 agent 双向通信,能调用第三方 API、执行本地代码,甚至自动化整个开发工作流。
Microsoft Research 在 Nature 发表论文并开源 RetroChimera,一个用于逆合成预测的集成框架。该模型结合了基于 Transformer 的 R-SMILES 2 和基于图神经网络的 NeuralLoc,通过学习排序策略整合两者的排名预测。
推荐理由:文章描述了 RetroChimera 如何将两种互补模型(R-SMILES 2 和 NeuralLoc)通过学习排序策略组合,并在多步合成路线盲测中取得显著优势,读者可了解这一集成思路在化学逆合成预测中的实际效果。
GitHub Copilot agent runtime 从 TypeScript/Node.js 迁移至纯 Rust,作者记录了历时约 14.5 周、完成 128 个 pull request、最终交付 832,378 行生产 Rust 代码的全过程。
推荐理由:作者作为主要执行人记录了超过 80 万行 TypeScript 迁移至 Rust 的完整过程,包含具体策略、工具调用数据和团队协作方法,读者可据此评估大规模 AI 辅助代码迁移的实际可行路径。
GitHub 日本/韩国营销团队利用 GitHub Copilot 和 GitHub Actions,将原本需要数天的活动搭建流程压缩为从单个 GitHub Issue 自动触发。
GitHub Copilot 应用新增 diff、terminal 和 browser 三个内置面板,用户可在单一应用内完成代码审查、运行和预览,无需切换窗口。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排选择多模型协同完成任务,支持 Single(单模型直接解决)、Cascade(级联升级)和 Critique(批评修订)三种执行模式。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Microsoft Research 开源了 GigaPath-Flash 和 GigaTIME-Flash,这是 GigaPath 和 GigaTIME 的蒸馏高效版本。
推荐理由:GigaPath-Flash 在保持 97% 性能的同时将计算量降低约 50 倍,使大规模病理研究从不可行变为可操作。
Microsoft Research 发布深度学习交换-相关泛函 Skala 1.1,相比初版训练数据量提升 2.5 倍,在 GMTKN55 基准的 55 个类别中斩获 32 个第一,精度超越最顶级的全局杂化泛函,同时保持 meta-GGA 的计算成本。
推荐理由:Skala 1.1 已在 GMTKN55 的 55 个类别中斩获 32 个第一,数据规模和多样性大幅提升,同时集成至 CP2K、Psi4、FHI-aims、ORCA、VASP 等主流软件,读者可据此判断深度学习 DFT 在计算化学工作流中的实际可用性。
微软推出 MindTopo 拓扑推理基准,测试多模态大模型对连通性、分离、秩序、围合和绳结等拓扑关系的理解能力。评测涵盖静态推理和交互式规划两类任务,测试范围包括迷宫连通性判断、绳结真伪识别、围栏内动物定位等场景。结果显示,当前模型在静态识别上表现较好,但在需要跨多步操作保持拓扑一致性的规划任务中显著落后,且错误多发生在规划阶段而非感知阶段,表现为忽视动作后果、丢失任务目标或违反环境物理约束。
推荐理由:微软发布拓扑推理基准 MindTopo,测试发现当前多模态模型在静态识别上表现尚可,但在需要保持拓扑关系的多步规划任务中表现明显下滑,揭示了感知与行动之间的一致性缺口。
微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。
推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。
推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。
GPT-5.6 现已成为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork 等应用。GPT-5.6 为这些工具提供更强的 AI 能力,帮助用户实现更快、更高质量的工作输出。