GPT-5.5 Instant 更新 ChatGPT 默认模型
GPT-5.5 Instant 更新了 ChatGPT 的默认模型,带来更智能、更准确的回答,幻觉减少,并改进了个性化控制选项。
推荐理由:原文给出了 GPT-5.5 Instant 的主要改进方向,读者可据此判断这次默认模型更新对日常对话体验的具体影响。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
38 条精选近 30 天 4 条共收录 67 条
GPT-5.5 Instant 更新了 ChatGPT 的默认模型,带来更智能、更准确的回答,幻觉减少,并改进了个性化控制选项。
推荐理由:原文给出了 GPT-5.5 Instant 的主要改进方向,读者可据此判断这次默认模型更新对日常对话体验的具体影响。
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是一款新的文本转语音模型,在 Artificial Analysis TTS 基准上取得 Elo 1,211 分,位列“最具吸引力象限”。
推荐理由:原文给出了基准分数(Elo 1,211)和 audio tags 等具体能力变化,读者可以据此判断该模型在同类产品中的相对位置和适用场景。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先机器人大模型的重大升级版本。新模型在空间推理和多视角理解方面有显著提升,新增仪表读取(instrument reading)能力,可解读压力表、液位计和数字读数等工业仪表,并通过 agentic vision 结合视觉推理与代码执行实现高精度读数。
推荐理由:原文给出了仪表读取、多视角推理和安全约束等具体能力提升细节,读者可以据此评估该模型在具身智能任务中的实际可用性。
Google DeepMind 发布 Gemma 4 系列开源模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,基于 Gemini 3 的研究和技术,在 Arena AI 文本排行榜上 31B 模型位列开源模型第三、26B 排名第六,可超越参数量 20 倍的模型。
推荐理由:Gemma 4 提供了从移动端到高端 GPU 的多尺寸选择,并采用 Apache 2.0 许可,开发者可据此评估其对现有部署方案的影响。
Google DeepMind 推出 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI Audio MultiChallenge 上得分 36.1%(开启 thinking)。
推荐理由:原文给出了具体 benchmark 数据和多产品可用入口,读者可以据此了解 Gemini 3.1 Flash Live 在音频/语音任务上的能力边界和实际落地场景。
Google DeepMind 发布 Lyria 3 Pro,这是其高级音乐生成模型,支持生成长达 3 分钟的曲目,并能理解音乐结构(intro、verse、chorus、bridge)。
推荐理由:原文给出了能力变化(3分钟长曲目、结构感知)和多个产品落地入口,读者可以据此判断它对音乐创作工作流的影响。
OpenAI 发布 GPT-5.4,定位为其最强大且高效的前沿模型,专为专业工作设计,具备前沿的编码、计算机使用、工具搜索能力和 1M-token 上下文窗口。
推荐理由:原文给出了具体能力变化(编码、计算机使用、工具搜索、1M-token 上下文),读者可以据此判断它对专业工作流的影响。
Google 今日发布 Gemini 3.1 Flash-Lite,这是其最快的、成本效益最高的 Gemini 3 系列模型。
推荐理由:原文给出了具体定价、性能基准数字和 thinking levels 功能,读者可以据此判断该模型是否适合自己的高频率低成本场景。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),将 Pro 版的高级世界知识和生成质量与 Flash 级别的高速推理结合。
推荐理由:读者可以了解 Nano Banana 2 在速度与能力之间实现的具体平衡,以及它与 Pro 版的定位差异,便于在实际工作中选择合适的工具。
Google 正式发布 Gemini 3.1 Pro,正在向 Gemini API(AI Studio)、Gemini CLI、Google Antigravity、Android Studio、Vertex AI、Gemini Enterprise、Gemini App 及 NotebookLM 等产品线推广。
推荐理由:原文给出了 ARC-AGI-2 上 77.1% 的具体分数和相对上一版本的倍增数据,读者可以直接评估该推理能力的提升幅度。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),一个统一 4D 场景重建与追踪模型。
推荐理由:原文给出了具体性能数据和应用场景,读者可据此判断它在机器人、AR 等实时场景中的实际可用性。
Google DeepMind 发布 Gemini 3 Flash,这是 Gemini 3 模型家族的轻量版,保留 Pro 级推理能力的同时优化了延迟和成本。在 GPQA Diamond 达到 90.4%,SWE-bench Verified 得分 78% 超越 Gemini 3 Pro,速度是 Gemini 2.5 Pro 的 3 倍,token 消耗减少 30%。
推荐理由:原文展示了 Gemini 3 Flash 在 GPQA Diamond、SWE-bench Verified 等 benchmarks 上的具体性能数据,以及 3 倍速度提升和 token 减少 30% 的量化指标,读者可以据此评估其对现有开发流程的实际影响。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,支持 2K/4K 分辨率、最多十四张输入融合、改进的文字渲染及图像本地化,并集成 SynthID 数字水印。
推荐理由:该模型将 Gemini 3 Pro 的能力扩展到图像生成领域,并原生支持与 Google Search 的 grounding 融合,可输出数据驱动的可视化内容。
Google DeepMind 发布 Gemini 3 Pro,称其在 Terminal-Bench 2.0 得分 54.2%,并在编码、Agent 工作流和 zero-shot 任务上超越 2.5 Pro。
推荐理由:正文给出了 Terminal-Bench 2.0 得分 54.2%、百万 token 上下文窗口和预览定价,读者可以据此评估它相比 2.5 Pro 的实际提升。
Google DeepMind 发布 Gemini 3 Pro,声称是其最智能的模型。Gemini 3 Pro 在 LMArena 达到 1501 Elo,在 GPQA Diamond 取得 91.9%,在 Humanity's Last Exam 取得 37.5%(无工具使用)。
推荐理由:原文给出了具体基准分数和功能变化,读者可以据此评估 Gemini 3 Pro 在推理、编码和多模态任务上的能力定位。
Google DeepMind 发布 WeatherNext 2,预测速度提升 8 倍,分辨率达 1 小时级别。该模型基于 Functional Generative Network 架构,可从单点输入生成数百种天气情景,在 99.9% 的变量和预测时长上超越前代模型。
推荐理由:WeatherNext 2 在精度和效率上显著提升,已在多个 Google 产品中落地,开发者可通过多个平台获取数据和定制推理能力。
Google DeepMind 发布 SIMA 2,集成 Gemini 模型作为核心推理引擎,使智能体从指令跟随进化为可推理、可对话、可自我改进的交互式游戏伴侣,在未训练过的游戏(如 ASKA、MineDojo)中表现出接近人类的泛化能力。
推荐理由:SIMA 2 展示了将 Gemini 推理引擎与具身智能体结合的路径,包括自我改进和跨游戏泛化能力,为后续研究提供了可验证的方向。
OpenAI 在 API 中推出 GPT-4.1 系列模型,在编码、指令遵循和长上下文理解方面均有提升,并首次发布 nano 型号,即日起面向全球开发者开放。
推荐理由:原文给出了三个主要改进方向和 nano 模型首发信息,读者可据此判断它与前代版本的差异。