跳到正文
原文
Simon Willison·· 6 小时前AI 评分25

Mistral Large 4 模型基准测试饱和与生成演示

Mistral Large 4

AI 导读

Mistral Large 4 等前沿模型的基准测试已趋于饱和。作者使用 `llm` 工具调用 Claude Opus 5.5、GPT-6.1-Sol、Gemini 3.8 Flash 及 Mistral Large 4,尝试生成“穿渔网袜在火星乱穿马路的犰狳”SVG 图像以展示默认推理级别差异。

来源:Simon Willison · simonwillison.net