跳到正文
热点事件持续更新

AI研究员用荒诞提示词测试前沿模型引发讨论

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

AI研究员Simon Willison使用荒诞提示词“穿着渔网袜在火星上乱穿马路的犰狳”对四款前沿模型进行SVG生成能力对比测试,参与模型包括Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8-flash和Mistral Large 4。此举旨在探索传统基准测试饱和后如何评估前沿模型的新路径,Simon Willison认为“基准已饱和,前沿模型需用荒诞提示词测试”。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. Simon Willison
    Mistral Large 4 参与四款前沿模型 SVG 生成对比

    Simon Willison 用 `llm` CLI 工具对四款前沿模型进行 SVG 生成对比测试,任务为生成"穿着渔网袜在火星上乱穿马路的犰狳"图像,参与模型包括 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8-flash 和 Mistral Large 4。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。