Opus4.8凭啥说自己更“诚实”?是营销噱头还是确有其事?

2026-05-30 19:59:00  阅读 3978 次 评论 0 条
摘要:

5月29日,Anthropic推出ClaudeOpus4.8,其更“诚实”,在复杂任务中判断更稳,能主动提问、识别错误。官方评估显示,该模型放任代码缺陷却不加说明的概率低约4倍,更愿主动标出不确定性,减少无依据结论。

ClaudeOpus4.8的全新特性

提升智能体编程与多领域推理

ClaudeOpus4.8在智能体编程和多领域推理方面表现出色。它能更好地理解复杂任务,通过智能体之间的协作,高效完成编程相关工作。在处理多领域问题时,展现出卓越的推理能力,无论是数据分析、逻辑推导还是跨学科知识应用,都能应对自如。

增强知识工作能力

该模型的知识工作能力显著增强。它可以快速整合大量知识,为用户提供准确、全面的信息支持。在处理文档、解答专业问题等知识密集型任务中,ClaudeOpus4.8能够精准把握要点,给出高质量的回答,成为知识工作的得力助手。

Opus4.8凭啥说自己更“诚实”?是营销噱头还是确有其事?

诚实度”显著提升

主动标注不确定性

Opus4.8在面对不确定信息时,会主动标记疑点、表达不确定性,而不是强行给出答案。这使得用户能够清晰了解模型的认知边界,避免因错误信息导致的决策失误。

模型产生无依据结论的倾向明显下降。内部评估数据显示,相比前一版本,Opus4.8在自己生成的代码中放过错误不提及的概率约降低了四倍,这意味着模型在代码审查与质量控制环节的“自我纠错”能力显著增强。

配套功能与性能价格调整

新增effort程度控制

claude.ai新增effort程度控制,用户可平衡更高质量与更快响应。默认是high档,在编码任务中,token消耗与Opus4.7默认档接近,但效果更好;若选择extra或者max更高档位,模型会消耗更多tokens以换取更优结果。

性能和价格调整

Opus4.8的快速模式运行速度提升到2.5倍,模型成本则降到此前模型的1/3。定价方面,常规模式维持每100万输入令牌5美元、每100万输出令牌25美元;快速模式为每100万输入令牌10美元、每100万输出令牌50美元。在多项公开基准测试上,Anthropic也给出了具体成绩:Opus4.8在软件工程基准SWE‑BenchPro上取得了69.2%的得分,超过了GPT‑5.5和Gemini3.1Pro等竞品模型,在多个测试项目中占据优势,不过在终端编码类基准上仍由GPT‑5.5领先。

Opus4.8凭啥说自己更“诚实”?是营销噱头还是确有其事?

相关问答

ClaudeOpus8相比前代有哪些提升?

ClaudeOpus5倍,成本降至1/3,在部分基准测试中超过竞品。

Opus8的“诚实度”体现在哪些方面?

面对不确定信息时,它更倾向主动标记疑点、表达不确定性,减少无依据结论。如在代码生成中,放过错误却不提及的概率大幅降低。

新增的effort程度控制有什么作用?

用户可借此平衡高质量与更快响应。默认high档,编码任务中token消耗与Opus7默认档接近但效果好;选更高档位会消耗更多tokens换取更优结果。

Opus8在基准测试中的表现如何?

在SWE-BenchPro上得到5仍然领先。

快速模式下Opus8的性能和成本有什么变化?

快速模式运行速度提升到5倍,模型成本降到此前模型的1/3。常规模式和快速模式有不同的定价标准。

ClaudeOpus8适合哪些用户?

适合需要智能体编程、多领域推理、知识工作支持的用户,特别是对模型“诚实度”有要求,追求高效且希望控制成本的开发者和专业人士。

本文地址:https://www.caiair.com/post/claudeopus48-529372-142151.html
简短标题:Opus4.8凭啥说自己更“诚实”?是营销噱头还是确有其事?
转载声明:欢迎分享本文,转载请保留出处!发布者 财云量化