谷歌发布 Gemini 4 Argon:百万 token 输出,13/19 基准测试自称第一
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
GPT 6.1 Sol 发布,智能水平接近 Astra,价格仅为后者的五分之一。Simon Willison 于 9 月 29 日发布月度简报,追踪 LLM 领域重大进展。
Databricks 将 GPT-5.5 集成至企业 AI 智能体工作流。该模型此前在 OfficeQA Pro 基准测试中创下 SOTA,为企业场景提供了更强的任务处理能力。此次合作瞄准大规模企业数据场景下的智能体应用需求。