使用 Amazon QuickSight 和 Adjudicated Query 模式进行大规模租赁合规检查
AWS 推出 Adjudicated Query 设计模式,将自然语言合规问题路由至确定性规则引擎,模型仅负责翻译问题和叙述结果,不执行合规判定,从而实现可证明的完整性——每次扫描都生成收据,确保 compliant + in-breach + ambiguous + unreadable 精确覆盖总记录数。
AWS 推出 Adjudicated Query 设计模式,将自然语言合规问题路由至确定性规则引擎,模型仅负责翻译问题和叙述结果,不执行合规判定,从而实现可证明的完整性——每次扫描都生成收据,确保 compliant + in-breach + ambiguous + unreadable 精确覆盖总记录数。
Claude Desktop on Amazon Bedrock 通过 AgentCore Gateway 集成 Web Search,弥补模型训练知识截止日期的局限性,Web Search 是基于覆盖数百亿文档的 Amazon 网络索引的完全托管、MCP 兼容搜索能力。
GitHub指出AI正在重塑开发者工作流程,建议强化三项核心技能:学会定义问题并协调多个AI智能体协作;不盲目信任AI首个答案,用第二模型或自身判断进行验证;利用AI处理实现工作,腾出时间专注于需求理解、权衡评估和技术决策。GitHub Copilot已内置Rubber Duck智能体,用第二模型批判性检查计划、代码和测试。
AWS 发布基于 Amazon Bedrock AgentCore 的四智能体模式,将基础设施代码开发周期从每应用 3-4 周压缩至分钟级,助企业在固定财年内完成 300+ 应用的迁移。
Amazon Quick 推出 Live Data in Apps 功能,使 AI 构建的 Quick Apps 可以实时查询 QuickSight 数据集,而不是依赖构建时的静态快照。用户可以用自然语言描述需求,AI agent 自动生成 SQL 并在发布后每次打开时重新执行,同时继承行级和列级安全规则,确保每个用户只能看到自己有权限访问的数据。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA NeMo Agent Toolkit(NAT)通过 MemoryEditor 插件接口(add_items() / search() / remove_items())集成 Amazon S3 Vectors 作为自定义记忆后端,在 Amazon EKS 上完成多智能体投资研究场景验证。
Amazon Bedrock AgentCore 支持构建环境智能体(ambient agents),区别于传统的聊天式 AI 交互,环境智能体通过监听事件流(如 S3 文件上传、定时任务)自动触发任务执行,并在需要时调用 ask_human 工具暂停等待人工审批。
推荐理由:文章给出了完整的环境智能体架构设计和代码实现,读者可以据此将 AWS 事件驱动基础设施与 AI 智能体结合,实现文档处理等场景的自动化。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 限制扩展至 1M,支持复杂长周期工作流。模型已赋能 Google 内部编码和知识工作,在 CWE-bench v1 漏洞修复中达 68%、Vals Finance Agent v2 多步金融研究中领先、视频理解基准 LVBench 达 91.7%。
推荐理由:模型在复杂工作流中的具体表现有数字支撑(1M token 输出、CWE-bench 68%、2.7x 加速等),便于读者判断其对实际工作的价值。
CoreWeave 在旧金山峰会上宣布 NVIDIA Vera Rubin NVL72 系统正式上线,Cognition(Devin 的开发团队)成为首个生产用户,在 SWE-2 推理工作负载中实现相比 GB200 NVL72 高达 4.8 倍的 token 吞吐量提升。
推荐理由:原文给出了具体性能数据(4.8x token throughput、3x faster sandbox startup、1.7x Terminal-Bench 提升),读者可据此判断 Vera Rubin 和 CoreWeave Forge 的实际能力变化。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,据 OpenAI 介绍它在编码、计算机操作和专业工作场景中提供接近 Astra 的推理能力。
推荐理由:原文给出了性能对比数字(DeepSWE v1.1 成本降为五分之一、超越 GPT-6 Sol 6.4 个百分点)和 Codex 的集成路径,读者可以据此判断它是否值得替换现有 Agent 工作流。
OpenAI 推出 dots,这是一款主动型 AI 助手,能够在复杂项目和日常任务中持续工作。dots 旨在帮助用户在工作时保持对任务的掌控感。与传统的被动式助手不同,dots 可主动推进工作流程,适用于需要跨时间段持续处理的多步骤任务。
GitHub Copilot app 推出 canvases 功能,允许用户通过自然语言描述生成自定义界面(如 kanban board、issue triage board、release checklist 等),创建后 agent 和用户都能实时更新界面内容。
三年过去,LLM 的主流交互界面仍是 chat,文章认为 chat 在用户已知具体任务时往往是错误的 UI,推荐用可自定义的 canvas 取而代之。GitHub Copilot 的 canvas 是运行在应用内的全栈小应用,可与 agent 双向通信,能调用第三方 API、执行本地代码,甚至自动化整个开发工作流。
GitHub Security Lab 发布了 Fuzzing Taskflow,一个基于 LLM Agent 的自动化模糊测试管道,专为 C/C++ 项目设计。
推荐理由:原文展示了将传统需要安全专家手动完成的多步骤模糊测试工作流交给 LLM Agent 执行的完整方案,读者可以了解如何将专家经验转化为可复用的自动化管道。
Google DeepMind 发布 Gemini 3.8 Live 的 Live Avatar 功能,将实时视频生成与语音对话深度融合,支持精确唇形同步、自然表情和流畅话轮转换,可同时处理视觉与音频输入。该功能通过异步工具调用在后台执行复杂任务并保持对话连贯,支持 97 种语言的实时切换,SynthID 水印嵌入音视频输出以保障内容可溯源性,即日起面向 Gemini Enterprise 开放。
推荐理由:原文披露了实时视觉对话、异步工具调用、97语言无缝切换等具体能力差异,以及 SynthID 水印的安全设计,读者可据此评估该功能对现有企业服务的补充方向。
NVIDIA AI Day Singapore 于 9 月 22-23 日在新加坡莱佛士城会议中心举办,NVIDIA 及合作伙伴展示了覆盖东南亚地区的 AI 突破进展。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速机器人工具包。5.0 版本新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并引入智能体工作流,使开发者和 AI 智能体能够协同构建机器人应用。
推荐理由:新版引入 agentic 工作流,读者可以判断这将如何改变机器人应用的开发流程和交付速度。
NVIDIA 发布 OpenShell 开源安全运行时,为 AI 智能体提供沙箱执行环境并在智能体外部执行策略控制。Cisco DefenseClaw 和 JFrog 作为 Open Secure AI Alliance 合作伙伴,分别提供治理层和技能扫描验证集成。
GitHub Copilot agent runtime 从 TypeScript/Node.js 迁移至纯 Rust,作者记录了历时约 14.5 周、完成 128 个 pull request、最终交付 832,378 行生产 Rust 代码的全过程。
推荐理由:作者作为主要执行人记录了超过 80 万行 TypeScript 迁移至 Rust 的完整过程,包含具体策略、工具调用数据和团队协作方法,读者可据此评估大规模 AI 辅助代码迁移的实际可行路径。
OpenAI 推出 AI 广告体验,包括 Sponsored Agents、营销工具以及与 HubSpot 和 Shopify 的集成,帮助广告主探索新的 AI 驱动广告形式。
Fyxer 基于 OpenAI 模型、知识蒸馏、记忆功能和真实用户反馈构建 AI 行政助理,实现邮箱整理和用户风格一致的邮件起草。核心技术栈包括 OpenAI 模型、fine-tuning 和 memory,辅以持续的用户反馈循环优化输出质量。该方案体现了 AI 助手通过个性化定制提升用户信任度的可行路径。
GitHub 日本/韩国营销团队利用 GitHub Copilot 和 GitHub Actions,将原本需要数天的活动搭建流程压缩为从单个 GitHub Issue 自动触发。
GPT‑6 Astra 提升了 Devin 的代码测试与验证能力,帮助智能体更好地展示其生成代码的正确性。目标是让软件工程师减少代码审查工作量,将更多时间投入产品交付。Cognition 正通过让 AI 智能体自主验证输出来提升软件工程质量。
GitHub Copilot 应用新增 diff、terminal 和 browser 三个内置面板,用户可在单一应用内完成代码审查、运行和预览,无需切换窗口。
OpenAI 宣布在 ChatGPT Work 中推出 Data agent,支持用户用自然语言连接公司数据、发现洞察并构建交互式仪表板。该功能现已向 ChatGPT Work 用户开放。
MIT 研究者使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。GPT-5.6 Sol 与 Codex 的结合展示了 AI 智能体在科学研究自动化中的应用潜力。
OpenAI 内部编码智能体正在重塑 AI 研究方式。早期数据显示,智能体已被用于加速研究流程,涵盖代码编写、实验迭代和任务复杂度提升等多个环节。OpenAI 公布了其内部研究加速的初步数据与观察。
Basis、Clay 与 Exa Labs 三家 AI 原生公司使用 AI 智能体改进入职、账户管理和开发者集成等核心工作流。OpenAI 分享了这些企业的实践案例,为企业领导者提供可借鉴的 AI 落地思路。
OpenAI 研究显示企业正在从 AI 辅助转向 AI 执行,ChatGPT 和 Codex 成为主要工具。前沿企业正在采用 AI 智能体技术,拉开与竞争对手的差距。研究揭示了企业 AI 采用的不同阶段和路径差异。
Zapier企业营销团队使用ChatGPT Work减少销售线索漏斗流失、构建营销活动资产并实现报告自动化。ChatGPT Work帮助团队在营销流程的关键环节提升效率,降低潜在客户流失。
Microsoft Research 发布开源框架 Orchard,核心是 Kubernetes 原生的 Orchard Env 环境服务,为智能体提供可复用的隔离组件,支持从数据蒸馏、强化学习 rollout 到评测的全流程,无需为每类任务重建底层设施。
推荐理由:原文给出了三个场景的具体训练数据量、参数规模和性能数字,读者可以直接评估它在各自任务上的可用性。
OpenAI 推出企业 AI 智能体平台 Presence,支持语音和聊天两种交互模式。该平台已在企业场景中验证,可用于客户服务和内部工作流程的智能体部署。
Cars24 通过 OpenAI 驱动的语音和聊天智能体,每月处理超过 100 万分钟对话,挽回 12% 的流失线索。平台还将 agentic workflow 推广至公司各团队。
企业通过测量有用工作/美元指标来管理 AI 投资,专注于提高效率并扩展高价值工作流程。OpenAI 建议企业在 AI 智能体时代重新评估投资框架,以更准确地衡量 AI 投入的实际产出。
OpenAI 推出 ChatGPT Work,这是一款可在多个应用和文件中执行操作、能持续数小时跟进项目并将目标转化为完整成果的智能体。
GPT-4级别能力成本从2023年的$30/百万token降至<$1,每年推理价格下降9x至900x,AI智能体正成为数据系统的主导工作负载。为智能体设计的数据系统需支持每用户请求产生的数千条SQL查询,通过多查询优化和近似查询提升效率;同时数据系统还需承担管理智能体状态、处理智能体协调和容错的职责。 (95字,2句)
Travelers 与 OpenAI 合作推出 AI 驱动的理赔助手,面向全国客户提供服务。该助手可引导客户完成理赔流程、提供全天候支持,并在理赔高峰期自动扩展运营能力。
OpenAI 发布的《Next Era of Knowledge Work》报告揭示,Codex 正通过 AI 驱动的研究、数据分析、工作流自动化和内容创作四大能力重塑生产力。Codex 已从单纯面向开发者的代码工具演变为覆盖知识工作全链条的通用效率平台。报告数据显示,采用 Codex 的团队在信息检索、报告撰写和数据处理等任务上实现显著提效。
Endava 借助 OpenAI Codex 构建 agentic organization,将需求分析周期从数周缩短至数小时,显著加速软件交付。Codex 作为 AI 编程工具,使 Endava 团队能够快速处理需求文档并生成代码,替代传统人工审查流程。这一实践展示了 AI 智能体在实际企业开发中的规模化应用潜力。
OpenAI 与 Thrive、Crete 合作,利用 Codex 构建了具备自我改进能力的税务 AI 智能体,实现税务申报自动化,提高处理准确性。 该系统显著加速了税务工作流程,为财税领域的 AI 应用提供了可参考的实践案例。