谷歌发布 Gemini 4 Argon:百万 token 输出,13/19 基准测试自称第一
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,官方称其速度提升 30% 以上,多数任务成本降低 30%,定价与 Sonnet 5 相同但各项基准测试均有提升。
Anthropic 与 OpenAI 于 9 月 22 日同日发布新模型,Claude Opus 5.5 定价下调 20% 至 $4/M(输入)/ $20/M(输出),而 OpenAI 将 GPT-6 Sol 和 GPT-6 Luna 定价为 GPT-5.6 系列的半价,GPT-6 Luna 最低至 $0.10/M(输入)/ $0.50/M(输出),引发了新一轮价格战。
Microsoft Research 开源了 GigaPath-Flash 和 GigaTIME-Flash,这是 GigaPath 和 GigaTIME 的蒸馏高效版本。
推荐理由:GigaPath-Flash 在保持 97% 性能的同时将计算量降低约 50 倍,使大规模病理研究从不可行变为可操作。
OpenAI 在 2026 Gartner Magic Quadrant 企业 AI 编码智能体评估中被评为领导者,Codex 因创新性和企业级部署能力获得认可。Gartner 报告指出 OpenAI 在愿景完整性与执行能力两个维度均处于领先地位。
OpenAI 发布 GPT-4.5 研究预览版本,号称是其迄今为止最大、最博学的模型。