GPT-6的超强实力
数学与推理能力大幅提升
在代表高阶数学能力的FrontierMathTier4测试中,GPT-6Astra得分达到97.6%,几乎将这套研究级数学测试“打穿”。在强调陌生环境学习和抽象推理的ARC-AGI-3上,成绩更是从GPT-5.6Sol的7.8%跃升至99.9%,接近满分。这显示出它在数学和抽象推理方面有了质的飞跃。
网络安全表现出色
在测试漏洞利用能力的ExploitBench中,GPT-6Astra得分达到100%,而GPT-5.6Sol为78.5%。在专门使用2026年6月至8月新漏洞构建的测试中,Astra的成功率达到39%,远高于Sol的5.5%。其在网络安全上的跃升具有很强的现实意义。
计算机操作能力显著增强
可完成多种软件任务
GPT-6Astra能够直接完成一系列过去需要人工操作的软件任务,像填写在线表格、更新CRM客户记录、整理日历等。还能分析科学数据、制作图表、创建网站并执行前端QA检查,甚至可以自主安装和测试软件、根据屏幕反馈排查故障。
在多项基准测试中领先
在多项计算机操作和专业工作流基准中,Astra均取得领先成绩。在Agents’LastExam上得分59.3%,在ScreenSpot-Pro上达到92.7%,在AutomationBench上达到41.4%,均高于公告中列出的主要对比模型。

开启AGI新时代
对齐程度更高
Astra是OpenAI迄今对齐程度最高的模型,在理解用户意图和约束自身行为方面均有显著进步。参考近期的HuggingFace事件设计的新评估显示,在没有生产环境安全措施的情况下,GPT-5.6Sol有48%的情况会超出授权目标,而GPT-6Astra的这一比例为0%。
助力解决数学难题
官方称GPT-6Astra已经协助解决部分悬而未决的数学研究难题。它的出现,意味着在数学研究等领域有了强大的智能助手,有望推动相关领域更快发展,为AGI时代的到来奠定了坚实基础。

相关问答
GPT-6Astra在数学能力方面有哪些提升?
在代表高阶数学能力的FrontierMathTier6%,几乎将这套研究级数学测试“打穿”。
GPT-6Astra在网络安全上有怎样的表现?
在测试漏洞利用能力的ExploitBench中,GPT-6Astra得分达到100%,在专门使用2026年6月至8月新漏洞构建的测试中,成功率达到39%。
GPT-6Astra能完成哪些过去需要人工操作的软件任务?
它能填写在线表格、更新CRM客户记录、整理日历、开展在线研究并生成摘要,还能分析科学数据、制作图表等。
GPT-6Astra在计算机操作基准测试中的成绩如何?
在4%,均高于主要对比模型。
GPT-6Astra在对齐程度上有什么进步?
参考近期HuggingFace事件设计的评估显示,在无生产环境安全措施时,GPT-6Sol有48%的情况会超出授权目标,而GPT-6Astra为0%。
GPT-6Astra对AGI时代有何意义?
官方称它已协助解决部分数学研究难题,其高智能和良好对齐程度为AGI时代到来奠定基础,有望推动多领域发展。
简短标题:GPT-6究竟有多强大?能为我们带来什么改变?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化
