Grok4实测成绩惊艳亮相
远超同行的亮眼表现
Grok-4的基准测试数据在网上疯传,成绩令人惊叹。在人类最后的考试(HLE)中,其初始成绩就达到35%,使用推理后更是飙升到45%,相比o3和Gemini在HLE上仅20%左右的得分,实现了大幅超越。在其他测试中同样表现出色,GPQA达到87-88%,SWEBench上,Grok-4Code拿下72-75%的成绩,从数据上看,在多个维度超越了现有顶尖模型。
成绩引发广泛关注
这样优异的成绩瞬间引发了各方关注。众多网友和业内人士纷纷对Grok4的表现发表看法。leo🐈评论称若这些成绩属实,都是最先进的成绩,期待其在实际使用中也有出色发挥。但也有不少人对此存疑,KAayushMazumdar就对SWE-Bench成绩的含金量提出质疑,因其测试的是模型解决真实软件工程问题的能力,若使用了额外工具或框架,成绩的可信度就会降低。

成绩争议浮出水面
题目公开引质疑
AI研究者xlr8harder指出HLE的所有题目都已公开,没有保留测试集,这使得模型有可能在训练时“见过”这些题目,导致成绩虚高。这一关键问题引发了对Grok4成绩真实性的争议。如果测试题目在训练中被使用过,那么所谓的高分可能并不能真实反映其在面对全新问题时的能力。
学界回应与思考
EthanMollick教授对此回应称,如果Grok4泄露的基准测试成绩属实,那么有保留的问题集将非常有用。因为传闻中的45%分数比o3和Gemini的20%左右有很大提升,这一巨大差异值得深入研究。但成绩到底是真实实力的体现还是因题目公开导致的虚高,仍有待进一步考证和更多信息的披露。
未来走向备受猜测
能否正式发布成谜
更多人关心这个表现优异却又充满争议的模型到底什么时候发布。ZhuoWang直接发问如果它这么好,何时发布。TheMandorlarian则表现得更加悲观,认为这个模型可能不会发布,觉得空洞的数字并不能代表什么。Grok4的未来充满不确定性,是正式发布接受更广泛的检验,还是如同一些人猜测的不会发布,目前尚无定论。
发展前景迷雾重重
即便Grok4目前成绩亮眼,但由于成绩争议的存在,其未来发展前景也蒙上了一层阴影。如果成绩最终被证实存在水分,那么它在后续的发展中可能会面临诸多挑战。而若成绩真实可靠,其发布后能否在实际应用中持续保持优势,为相关领域带来变革,同样充满未知,一切都有待时间来揭开谜底。

相关问答
Grok4在人类终极考试(HLE)中的成绩如何?
Grok4在HLE初始成绩达35%,使用推理后飙升到45%,远超o3和Gemini的20%左右。
SWEBench测试的是什么?
SWEBench测试的是模型解决真实软件工程问题的能力。
为什么有人质疑Grok4的成绩?
因为HLE测试题目已公开,模型可能在训练时见过,导致成绩虚高,SWE-Bench成绩若用了额外工具框架,含金量也会降低。
EthanMollick教授对Grok4成绩有何看法?
他认为若成绩属实,有保留的问题集将很有用,因45%比20%提升大,值得深入研究成绩真实性。
关于Grok4是否会发布有哪些观点?
有人直接发问何时发布,也有人悲观认为可能不会发布,觉得空洞数字无意义,其未来发布与否成谜。
Grok4在GPQA测试中的成绩是多少?
Grok4在GPQA测试中达到87-88%。
简短标题:Grok4第一波实测成绩惊人,是实力还是虚高?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
