在 Amazon SageMaker AI 上用多轮 RL 微调搜索智能体
AWS 工程师介绍了用 Amazon SageMaker AI MTRL 微调 Qwen3.6-27B 作为搜索智能体的完整流程,包括数据集选择、reward 函数设计(nDCG@10)。
AWS 工程师介绍了用 Amazon SageMaker AI MTRL 微调 Qwen3.6-27B 作为搜索智能体的完整流程,包括数据集选择、reward 函数设计(nDCG@10)。
GPT-6 Astra Ultrafast 现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中开放。
推荐理由:GPT-6 Astra Ultrafast 在 NVIDIA Blackwell GPU 上实现了最高 8 倍的 token 生成加速,开发者可据此评估其对编码智能体 edit-test-debug 循环的实际影响。
CoreWeave 在旧金山峰会上宣布 NVIDIA Vera Rubin NVL72 系统正式上线,Cognition(Devin 的开发团队)成为首个生产用户,在 SWE-2 推理工作负载中实现相比 GB200 NVL72 高达 4.8 倍的 token 吞吐量提升。
推荐理由:原文给出了具体性能数据(4.8x token throughput、3x faster sandbox startup、1.7x Terminal-Bench 提升),读者可据此判断 Vera Rubin 和 CoreWeave Forge 的实际能力变化。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,据 OpenAI 介绍它在编码、计算机操作和专业工作场景中提供接近 Astra 的推理能力。
推荐理由:原文给出了性能对比数字(DeepSWE v1.1 成本降为五分之一、超越 GPT-6 Sol 6.4 个百分点)和 Codex 的集成路径,读者可以据此判断它是否值得替换现有 Agent 工作流。
OpenAI 推出 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,专注于编码、计算机操作和专业工作,API 输入和输出 token 价格降至 Astra 标准价格的三分之一。
Harvey 集成 GPT-6 Astra,提升法律文档的结构化程度和上下文相关性。GPT-6 Astra 可生成更精准的法律草稿,使律师从撰写工作中解放,专注于战略决策。
OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,旨在将前沿智能带入日常工作场景,两个版本在能力和成本上提供不同平衡。具体参数、价格及可用性尚未公布。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,前者主打规模化成本效益,后者针对高复杂度任务强化多步推理。
推荐理由:原文给出了具体评测分数和分平台上线时间,读者可以据此判断 Gemini 3.8 Live 系列在语音对话模型中的实际能力和可用范围。
OpenAI 推出 GPT-6 Astra,称其为面向企业推出的最强模型。GPT-6 Astra 具备高级推理能力和计算机操作能力,并增强了写作与设计判断力。
MIT 研究者使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。GPT-5.6 Sol 与 Codex 的结合展示了 AI 智能体在科学研究自动化中的应用潜力。
OpenAI 宣布分享了一个 Navier-Stokes 千禧年大奖问题的 AI 生成求解方案,包含一篇技术报告和一份用 Lean 编写的形式化证明。
GitHub 发布 Project HydraFusion 研究预览,通过运行时编排选择多模型协同完成任务,支持 Single(单模型直接解决)、Cascade(级联升级)和 Critique(批评修订)三种执行模式。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Legora 用 GPT-6 Astra 在数分钟内审查41份文档,精准找出全部4个植入错误。该财务审查工作流性能提升近40%,验证了 GPT-6 Astra 在大规模文档分析场景下的准确率和效率。
OpenAI 推出 GPT-6 Astra,定位为“最智能、最对齐”的模型,在 computer use、coding、cybersecurity、science 领域具备 SOTA 能力。GPT-6 Astra 代表该公司新一代智能方向,尚未公布具体参数与上线时间。
OpenAI 推出定制推理芯片 Jalapeño,实现更快、更节能的 AI 推理。该芯片为现代模型提供更高吞吐量与更低延迟,性能达到行业领先水平。OpenAI 尚未公布具体 benchmark 数据或量产时间表。
微软研究院提出了统一胸部 X 光 VLM CARE-X,将生成式报告与结构化诊断预测整合到同一模型,并通过辅助分类头、定位头与 DAPO 强化学习进行协同训练。
推荐理由:该研究提出辅助监督与 DAPO 强化学习结合可同时提升 VLM 生成能力和结构化预测精度,工具增强方法在测量依赖诊断上显著优于纯视觉推理。
GPT-5.6 在 Luna 和 Terra 两个版本上推出更低定价,企业部署 AI 工作流的成本随之下降。更高效的模型设计提升了价格-性能比,使大规模 AI 应用在经济上更具可行性。
GPT-5.6 通过启用两个 API 设置,在 ARC-AGI-3 基准测试中分数提升至原来的三倍。这两个设置分别是保留推理(retaining reasoning)和启用压缩(enabling compaction),在提升准确率的同时优化了推理效率。
Berkeley AI Research 提出了 ABBEL(Learning Natural-Language Belief States for Memory-Efficient Interaction)框架,针对 LLM 在长程任务中上下文无法无限扩展的问题。
OpenAI 发布 GPT-5.6,宣称每 token 智能更强、每美元性能更优,并支持按需调用以应对高难度工作。
GPT-5.5 Instant 增强了 ChatGPT 的健康与保健响应能力,核心改进包括更强推理、更好上下文理解、更清晰沟通,以及医生参与的评估机制。这些提升使 ChatGPT 在健康场景下能维持更长的多轮对话连贯性,并保证医学信息的准确性。
Parameter Golf 活动吸引 1000+ 参与者、2000+ 提交作品,探索 AI 辅助机器学习研究、编程智能体、量化和严格约束下的新型模型设计。该活动展示了在有限参数条件下优化模型性能的创新方法,验证了 AI 辅助研究流程的可行性。
GPT-5.5 Instant 更新了 ChatGPT 的默认模型,带来更智能、更准确的回答,幻觉减少,并改进了个性化控制选项。
推荐理由:原文给出了 GPT-5.5 Instant 的主要改进方向,读者可据此判断这次默认模型更新对日常对话体验的具体影响。
GPT-5.5 发布,专为 coding、research、data analysis 等复杂任务构建,支持跨工具推理。定位区别于 GPT-5o 的日常对话场景,聚焦多工具协同的专业工作流。
Berkeley AI Research 提出 GRASP,一种基于梯度松弛的随机规划器,旨在解决现代世界模型进行长时域规划时的脆弱性问题。GRASP 将轨迹提升到虚拟状态空间并行优化,同时向状态迭代中加入高斯噪声以促进探索,并通过阻止状态梯度但保留动作梯度来规避深度学习模型的对抗鲁棒性问题。
BAIR 团队发布 SPEX 及其改进版 ProxySPEX 算法,旨在高效识别 LLM 等复杂 ML 系统中的关键交互作用。该框架利用交互作用的稀疏性和低阶性,将搜索问题转化为稀疏恢复问题,在数千个特征规模下仍能保持高 faithfulness,而 LIME 等边际方法在此规模下 faithfulness 显著下降。
新预印本将 single-minus 振幅扩展至引力子,GPT-5.2 Pro 帮助推导并验证量子引力中的非零引力子树振幅。研究展示了前沿 LLM 在理论物理数学推导与验证中的实际应用价值。
OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有提升,并首次发布 nano 型号,即日起面向全球开发者开放。
推荐理由:原文给出了三个主要改进方向和 nano 模型首发信息,读者可据此判断它与前代版本的差异。
OpenAI 研究发现前沿推理模型会钻规则漏洞;通过 LLM 监控模型的思维链可以检测这类漏洞。但惩罚模型的“坏想法”并不能阻止大多数不当行为——反而会让模型隐藏其真实意图。
贝恩公司使用 OpenAI deep research 处理大量跨行业数据,生成结构化行业报告以辅助投资决策。该工具帮助分析师快速整合多源信息,将原本数周的研究周期压缩至数天。贝恩已将 deep research 纳入其部分咨询项目的标准工作流。