peopleevents
梁斌penny 2025-08-08 16:27+08:00Z
原微博

这种比赛不合理,Kimi第一把就抽到了最后的冠军,这能让人信服吗 //@阑夕:在无人关注的角落,决赛里的Grok 4被一脚踢死了。 查看图片 //@阑夕:Google自己办的比赛结果自己在半决赛就被淘汰了,决赛是o3 vs Grok 4。 查看图片 //@阑夕:昨晚的8强赛比较碾压,4个4:0结束战斗,今晚半决赛。 查看图片

@阑夕

这个好玩:Google举办了国际象棋的AI世界赛,选了8个最顶级的模型对弈,从8强赛到半决赛再到总决赛,全程在YouTube直播,分组情况如图。Google也解释了这次比赛的现实意义:随着大部分旗舰模型在基准测试里的得分接近满分,基准测试本身的意义已经没有那么大了,而且保不齐是否存在数据污染的情况——模型在训练过程中已经记住了那些基准测试题目。所以Google开发了Kaggle游戏竞技场,作为一个新的AI测试平台,这次的国际象棋只是开胃菜,以后还会引入更多的能够产生明确胜负结果的战略游戏,用来衡量在发布时分数永远都是第一名的各家模型到底谁吹牛逼的成分更多。而且游戏本来就是AI早期训练的重要环境,OpenAI在发布ChatGPT之前就花了很多时间教模型去玩Dota 2,还参加过电竞比赛,而Google更进一步的认为游戏也有资格担当一个理想的能力测试平台,因为结果可衡量、过程可视化、推理可验证、以及零和博弈的特点,都可以呈现出新的基准价值,并让人类窥见AI的思考方式。为了实现公平和透明,Kaggle游戏竞技场的系统全程开源,可被彻底检查,以后的游戏对局会把频次拉到海量级别,确保结果具有统计学上的正态性。

上一页932/995每页 10总共 9943下一页