2026-09-23 04:49:48
icon loading...

OpenAI发布GPT-6 Sol与Luna,性能超越旗舰模型

摘要
OpenAI推出GPT-6 Sol与Luna两款新模型,价格降低50%,在多项基准测试中表现优于Anthropic旗舰产品。两款模型已上线企业及开发者平台,逐步向用户开放。

周二,OpenAI正式发布两款新生成式AI模型——GPT-6 Sol与GPT-6 Luna,旨在应对Anthropic最新推出的Claude Opus 5.5带来的市场竞争压力。

模型定位与竞品对标

GPT-6 Sol和Luna被设定为低于旗舰模型GPT-6 Astra的轻量级选项。Astra仍被视为处理复杂任务的首选,而这两款新模型则聚焦于日常办公场景,提供更快响应速度与更低使用成本。

其产品层级对应关系如下:
Astra 对应 Fable
Sol 对应 Opus
Terra 对应 Sonnet
Luna 对应 Haiku(升级版)

价格调整与成本优势

为提升市场吸引力,OpenAI将两款模型的API每令牌费用下调50%。其中,“令牌”是文本处理的基本单位,通常接近一个单词,企业按百万计费以管理大规模应用支出。

具体定价如下:
GPT-6 Sol:输入价每百万令牌2美元,输出价10美元(原为4美元和20美元)。
GPT-6 Luna:输入价每百万0.10美元,输出价0.50美元(原为0.20美元和1.20美元)。

整体来看,在同等性能层级下,OpenAI提供的解决方案具备更强的价格竞争力。

性能测试表现对比

在Zapier开发的AutomationBench测试中,评估AI代理在涵盖销售、营销、财务、人力等47个工具中完成完整工作流的能力,以通过率作为核心指标:

GPT-6 Sol在最高推理设置下得分为33.2%,每项任务成本0.27美元;而Claude Opus 5在顶级配置下得分26.9%,但每任务成本高出逾11倍。同时,该测试显示,GPT-6 Sol也略微领先于更昂贵的Claude Fable 5.1。

另一项名为“Agents' Last Exam”的长期任务评估测试中,衡量AI在55个子行业中的持续执行能力:

GPT-6 Sol在最高努力模式下取得56.4%完成率,不仅超过Claude Opus 5的最佳成绩,且任务成本低60%。

推理能力与自动化表现

OpenAI引入“推理努力”调节机制,允许用户根据需求增加模型自我校验的时间与计算资源,从而提升准确性,但相应提高运行开销。

在模拟真实计算机操作的OSWorld 2.0测试中,GPT-6 Sol得分为60.5%,几乎持平于Claude Opus 5的中等努力模式(60.3%),但成本降低约80%。该测试关注长期自动化任务的准确完成度,并支持部分得分。

上线进度与可用范围

GPT-6 Sol与Luna目前已在ChatGPT Work及Plus、Pro、Business、Enterprise和Edu订阅用户的Codex服务中上线。Luna亦通过桌面端向免费用户和Go会员开放。

目前尚未接入普通版ChatGPT应用。OpenAI表示,为确保系统稳定,将分阶段逐步推进模型部署。

声明:文章不代表币圈网观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险自担!转载请注明出处!侵权必究!
币圈快讯
查看更多
回顶部