《我的世界》成AI新考场?高三生用游戏测评AI:DeepSeek-R1位列第三
游戏化AI评测MC‑Bench借助《我的世界》平台,通过直观的视觉对比,让AI推理能力在安全可控环境中得到检验,相较于传统评测方式更具优势。Adi Singh指出,游戏环境可成为测试自主推理能力的理想媒介,既安全又易于控制,能更真实反映AI的实际应用表现。
与传统AI评测难以全面衡量大模型实际能力相比,游戏化评测具备以下独到优势:
(1)模拟真实世界复杂度:游戏往往包含多层次挑战,可考验AI的问题解决能力、策略思维和适应能力;(2)评估AI的自主决策能力:在游戏环境中,AI需要独立做出决策,而不仅仅是执行预定义的任务;(3)可控环境:游戏提供了可重复测试的环境,可以在相同条件下对比不同AI的表现;(4)安全性:与直接在现实世界中部署AI相比,游戏环境为AI评测提供了更安全的测试空间。
因此,Adi Singh坚信游戏化评测有望成为未来AI评测的重要趋势,因为它不仅让AI研究变得更有趣,也让普通人能够更直观地理解AI发展水平。
选择《我的世界》作为评测对象,主要基于其全球知名度——作为全球销量最高的电子游戏之一,即使非玩家也能直观判断方块版“酒杯”的逼真程度。
全球用户群体方面,《我的世界》拥有上亿玩家,能吸引大量用户参与AI评测,形成众包数据。
易于理解和评判方面,相比代码输出或文本生成,视觉化的建筑作品更容易让普通用户参与评测,无需懂编程也能看出哪座建筑更有创意和写实。
测试AI的复杂能力方面,建造建筑不仅考验AI的生成能力,还涉及逻辑推理、规划、空间认知等能力,而这正是传统AI评测难以全面覆盖的。
从技术角度看,MC‑Bench本质上也是一个编程基准测试,AI模型需编写代码完成建造任务,例如“堆雪人”或“在宁静的沙滩上建造一座迷人的热带小屋”。但通过视觉化呈现,降低了参与门槛,使任何人都能参与AI模型评测,从而增加项目吸引力并为AI性能数据收集提供新途径。
大型AI公司支持,8名志愿者推动
当前MC‑Bench已公开上线(https://mcbench.ai/),用户可访问并评判AI生成作品,投票数据公开。根据官网,团队仅由8名志愿者维持日常开发维护。

Anthropic、Google、OpenAI和阿里巴巴等大型AI公司提供了模型访问权限用于基准测试,但未与项目建立官方合作关系。

MC‑Bench官方胜率排行榜显示,Claude 3.7 Sonnet位居第一,近来爆火的DeepSeek‑R1排在第三名。

目前MC‑Bench主要评估基础建造能力,以衡量AI从GPT‑3时代至今的进步。未来计划拓展至长期规划和目标导向型任务。
他补充说,MC‑Bench排行榜与个人体验高度一致,表明平台能为用户提供有价值见解。
AI评测的未来或许在于游戏化场景,如MC‑Bench通过《我的世界》让大众参与评判,为AI发展提供新视角,这种模式颇具潜力。