谷歌发布 Gemini 4 Argon:百万 token 输出,13/19 基准测试自称第一
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google DeepMind 发布 Gemini 4 Argon,在 19 项基准测试中自称 13 项第一,包括 DeepSWE 得分 77.9%、Text Arena 第一(1525)、Terminal-Bench 4.0 从 19% 提升至 57.6%。
Google 宣布推出 Gemini 4 Argon AI 模型,但目前尚无法使用。正文仅一句"So much for Gemini 3.5 Pro."暗示该版本可能是对前代模型的重大升级。暂无参数规模、功能特性或可用时间等详细信息。
Google DeepMind 发布前沿模型 Gemini 4 Argon,输出 token 限制扩展至 1M,支持复杂长周期工作流。模型已赋能 Google 内部编码和知识工作,在 CWE-bench v1 漏洞修复中达 68%、Vals Finance Agent v2 多步金融研究中领先、视频理解基准 LVBench 达 91.7%。
推荐理由:模型在复杂工作流中的具体表现有数字支撑(1M token 输出、CWE-bench 68%、2.7x 加速等),便于读者判断其对实际工作的价值。
GPT 6.1 Sol 发布,智能水平接近 Astra,价格仅为后者的五分之一。Simon Willison 于 9 月 29 日发布月度简报,追踪 LLM 领域重大进展。
OpenAI 推出 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,专注于编码、计算机操作和专业工作,API 输入和输出 token 价格降至 Astra 标准价格的三分之一。
Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,官方称其速度提升 30% 以上,多数任务成本降低 30%,定价与 Sonnet 5 相同但各项基准测试均有提升。
Harvey 集成 GPT-6 Astra,提升法律文档的结构化程度和上下文相关性。GPT-6 Astra 可生成更精准的法律草稿,使律师从撰写工作中解放,专注于战略决策。
Anthropic 与 OpenAI 于 9 月 22 日同日发布新模型,Claude Opus 5.5 定价下调 20% 至 $4/M(输入)/ $20/M(输出),而 OpenAI 将 GPT-6 Sol 和 GPT-6 Luna 定价为 GPT-5.6 系列的半价,GPT-6 Luna 最低至 $0.10/M(输入)/ $0.50/M(输出),引发了新一轮价格战。
OpenAI 发布 GPT-6 Sol 和 Luna 两个模型,旨在将前沿智能带入日常工作场景,两个版本在能力和成本上提供不同平衡。具体参数、价格及可用性尚未公布。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音对话模型,前者主打规模化成本效益,后者针对高复杂度任务强化多步推理。
推荐理由:原文给出了具体评测分数和分平台上线时间,读者可以据此判断 Gemini 3.8 Live 系列在语音对话模型中的实际能力和可用范围。
OpenAI 推出 GPT-6 Astra,称其为面向企业推出的最强模型。GPT-6 Astra 具备高级推理能力和计算机操作能力,并增强了写作与设计判断力。
Google DeepMind 和 Google Research 发布 WeatherNext 3,号称是目前最先进、最准确的全球天气 AI 模型,由独立机构 Brightband 实时评估验证。
推荐理由:WeatherNext 3 在分辨率(5km)、更新频率(每小时)和降水预测精度(CRPS 提升 10%-60%)上均给出了可量化指标,用户可直接判断它对天气预报可靠性的实际影响。
OpenAI 推出 GPT-6 Astra,定位为“最智能、最对齐”的模型,在 computer use、coding、cybersecurity、science 领域具备 SOTA 能力。GPT-6 Astra 代表该公司新一代智能方向,尚未公布具体参数与上线时间。
GPT-6 Astra 是 OpenAI 迄今能力最强且部署最广泛的大语言模型,也是首款在 Preparedness Framework 下达到网络安全 Critical 级别的模型。
推荐理由:原文给出了该模型在 Preparedness Framework 下达到 Critical 级别的具体安全评估结论,读者可据此了解当前前沿模型的安全能力边界。
Astra 是 OpenAI 首个达到 Preparedness Framework 下关键网络安全能力阈值的模型,附带更强的发布安全防护措施。
推荐理由:原文给出了该模型的具体能力定位(达关键网络安全阈值)和安全保障层级( Preparedness Framework + 更强防护),读者可据此判断其适用场景与风险边界。
Microsoft Research 开源了 GigaPath-Flash 和 GigaTIME-Flash,这是 GigaPath 和 GigaTIME 的蒸馏高效版本。
推荐理由:GigaPath-Flash 在保持 97% 性能的同时将计算量降低约 50 倍,使大规模病理研究从不可行变为可操作。
OpenAI 发布 GPT-5.6,宣称每 token 智能更强、每美元性能更优,并支持按需调用以应对高难度工作。
Databricks 将 GPT-5.5 集成至企业 AI 智能体工作流。该模型此前在 OfficeQA Pro 基准测试中创下 SOTA,为企业场景提供了更强的任务处理能力。此次合作瞄准大规模企业数据场景下的智能体应用需求。
GPT-5.5 Instant 更新了 ChatGPT 的默认模型,带来更智能、更准确的回答,幻觉减少,并改进了个性化控制选项。
推荐理由:原文给出了 GPT-5.5 Instant 的主要改进方向,读者可据此判断这次默认模型更新对日常对话体验的具体影响。
GPT-5.5 发布,专为 coding、research、data analysis 等复杂任务构建,支持跨工具推理。定位区别于 GPT-5o 的日常对话场景,聚焦多工具协同的专业工作流。
OpenAI 发布 GPT-5.4,定位为其最强大且高效的前沿模型,专为专业工作设计,具备前沿的编码、计算机使用、工具搜索能力和 1M-token 上下文窗口。
推荐理由:原文给出了具体能力变化(编码、计算机使用、工具搜索、1M-token 上下文),读者可以据此判断它对专业工作流的影响。
OpenAI 推出图像生成模型 gpt-image-1,现已通过 API 向开发者和企业开放。开发者可直接将该模型集成到自有工具和平台,构建专业级、可定制的视觉内容。
OpenAI 推出 o3 和 o4-mini,定位为迄今最智能且具备完整工具访问能力的大语言模型。两款模型现已通过 API 可用,支持 Python/JavaScript 工具调用和多模态推理,在编程、Agent 任务等领域实现性能突破。o4-mini 作为轻量版本继承完整工具能力,为开发者提供更经济的高性能选择。
OpenAI o3 和 o4-mini 将前沿推理能力与完整工具集相结合,支持网络搜索、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索和记忆功能。
OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有提升,并首次发布 nano 型号,即日起面向全球开发者开放。
推荐理由:原文给出了三个主要改进方向和 nano 模型首发信息,读者可据此判断它与前代版本的差异。
OpenAI 发布 GPT-4.5 研究预览版本,号称是其迄今为止最大、最博学的模型。