AI研究员用荒诞提示词测试前沿模型引发讨论
热点事件持续更新
AI研究员用荒诞提示词测试前沿模型引发讨论
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
AI研究员Simon Willison使用荒诞提示词“穿着渔网袜在火星上乱穿马路的犰狳”对四款前沿模型进行SVG生成能力对比测试,参与模型包括Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8-flash和Mistral Large 4。此举旨在探索传统基准测试饱和后如何评估前沿模型的新路径,Simon Willison认为“基准已饱和,前沿模型需用荒诞提示词测试”。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 02:20
Mistral Large 4 参与四款前沿模型 SVG 生成对比报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- Simon WillisonMistral Large 4 参与四款前沿模型 SVG 生成对比
Simon Willison 用 `llm` CLI 工具对四款前沿模型进行 SVG 生成对比测试,任务为生成"穿着渔网袜在火星上乱穿马路的犰狳"图像,参与模型包括 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8-flash 和 Mistral Large 4。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。