英文原帖节选与中文翻译
Some food for thought when designing benchmarks… So, here’s a little computer-use (visual) comparison between GPT-5.6 Astra and Qwen3.8 Max.
关于基准设计的一点思考:这里对 GPT-5.6 Astra 与 Qwen3.8 Max 做了一个小型的计算机使用(视觉)对比。
原帖完整内容中文翻译
任务是在 Paint 界面中复现位于中央的参考图。两种模型与执行框架默认采用了完全不同的方法:Astra 尝试通过绘制并叠加几何形状来完成;Qwen 则逐像素绘制。
逐像素生成的结果自然更像原图,本质上相当于原图的低分辨率版本,因此 Qwen 生成的图像若按与原图的相似度评分,肯定会得到更高分。
但不能据此断言其中一个模型在其他任务上的泛化能力更强,也不能说 Qwen 的计算机使用能力或视觉理解能力优于 Astra。这个例子说明:当基准只比较最终结果时,评价会变得很微妙。