谷歌发布 Gemini 4 Argon:百万 token 输出,13/19 基准测试自称第一
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前尚无法使用。正文仅一句"So much for Gemini 3.5 Pro."暗示该版本可能是对前代模型的重大升级。暂无参数规模、功能特性或可用时间等详细信息。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 限制扩展至 1M,支持复杂长周期工作流。模型已赋能 Google 内部编码和知识工作,在 CWE-bench v1 漏洞修复中达 68%、Vals Finance Agent v2 多步金融研究中领先、视频理解基准 LVBench 达 91.7%。
推荐理由:模型在复杂工作流中的具体表现有数字支撑(1M token 输出、CWE-bench 68%、2.7x 加速等),便于读者判断其对实际工作的价值。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,前者主打规模化成本效益,后者针对高复杂度任务强化多步推理。
推荐理由:原文给出了具体评测分数和分平台上线时间,读者可以据此判断 Gemini 3.8 Live 系列在语音对话模型中的实际能力和可用范围。
Google DeepMind 和 Google Research 发布 WeatherNext 3,号称是目前最先进、最准确的全球天气 AI 模型,由独立机构 Brightband 实时评估验证。
推荐理由:WeatherNext 3 在分辨率(5km)、更新频率(每小时)和降水预测精度(CRPS 提升 10%-60%)上均给出了可量化指标,用户可直接判断它对天气预报可靠性的实际影响。