【ng娱乐科技消息】9月23日,OpenAI正式发布GPT-6 Sol和GPT-6 Luna,API价格降至上一代的一半左右。其中,Luna每百万Token输入0.1美元、输出0.5美元,约合人民币0.7元和3.5元。作为对照,DeepSeek V4.1 Flash闲时的缓存未命中输入价为每百万Token 1元,输出价为4元,高峰时段则升至2元和8元。按照普通新请求计算,Luna已经更便宜,也没有峰谷定价带来的成本波动。
OpenAI
DeepSeek依然握有自己的价格王牌。它的闲时缓存命中输入只要每百万Token 0.02元,远低于Luna。V4.1 Flash的综合能力也明显更高,拥有100万Token上下文,并支持图文理解、工具调用和思考模式。然而,在缓存未命中的普通请求中,Luna已经率先把DeepSeek模型拉进了同一价格区间,这也意味着DeepSeek最具辨识度的低价标签,从此有了一个实力强劲的海外对手。

本月早些时候,OpenAI发布了GPT-6 Astra,并将其称为公司目前能力最强、对齐程度最高的模型。Astra面向高难度和高价值任务,但每百万Token 10美元输入、50美元输出的价格,决定了它很难成为日常工作中的默认选项。Sol和Luna承担的是另一项任务。OpenAI表示,两款模型沿用了与Astra相近的训练方法,将Astra在专业工作、事实准确性、编程、计算机操作和对齐方面的进展,带到速度更快、价格更低的产品层级。

新的API定价令人出乎意料。GPT-6 Sol从GPT-5.6 Sol促销期的每百万Token 4美元输入、20美元输出,降至2美元和10美元;GPT-6 Luna从0.2美元和1.2美元,降至0.1美元和0.5美元。对于这波降价,OpenAI将其归因于推理基础设施和缓存效率的改善,并称目的是为了直接让利用户。OpenAI CEO Sam Altman在发布后强调,真正重要的指标是完成一项任务要花多少钱,而在这个维度上,他认为市场上目前没有产品能够匹敌Sol和Luna。
产品分工也随之变得清晰。Astra继续负责最高能力上限,Sol面向需要较强推理、编程和Agent能力的主流专业任务,Luna则用极低价格承接高频、规模化工作。OpenAI此次争夺的重点,已经从榜单上的最高分延伸到每一美元能够完成多少工作。

官方公布的成绩显示,GPT-6 Sol的主要竞争力集中在专业工作和Agent任务上。在测试跨销售、营销、运营、客服、财务和人力资源等工作流的AutomationBench中,GPT-6 Sol以xhigh推理强度取得33.2%的成绩,高于Claude Opus 5最大推理强度下的26.9%,单项任务成本却只有后者的9%。它还超过了低推理强度的GPT-6 Astra,并以远低于Claude Fable 5.1的成本取得更高分数。在覆盖55个细分行业的Agents’ Last Exam中,GPT-6 Sol在最大推理强度下得到56.4%,超过Claude Opus 5在该评测中的最高成绩,单项任务成本低了约60%。事实准确性也有明显改善,OpenAI使用用户曾标记事实错误的匿名真实对话进行内部测试,GPT-6 Sol的错误数量约为GPT-5.6 Sol的一半,并开始接近Astra的可靠性。GPT-6 Luna在较高推理强度下,则以大约百分之一的成本追平GPT-5.6 Sol。
编程和电脑操作更强,OpenAI也开始卷白菜价了。编程是Sol最重要的应用场景之一。OpenAI披露,内部研究人员使用编程Agent的规模正在快速增长,若按照API价格计算,中位数研究人员每天消耗的Token价值已经超过600美元,位于第90百分位的研究人员则超过7000美元。Agent接手的任务越长,推理成本对使用频率的限制就越明显。在考察代码能否直接合并进真实项目的FrontierCode中,GPT-6 Sol相比上一代明显进步,并以更低成本追平Claude Fable 5.1 xhigh。在真实代码库的软件工程测试DeepSWE v1.1中,Sol最大推理强度得分为68.8%,距离Claude Fable 5的最高成绩69.9%只差1.1个百分点,单项任务成本约低80%。对比之下,DeepSeek V4.1 Flash的得分是74.2%。GPT-6 Luna在同一评测中得到66.6%,与Claude Opus 5和Fable 5中等推理强度的表现相近,但任务成本分别低93%和96%。它未必适合承担最复杂的软件工程项目,却可能成为代码检查、批量修改、轻量开发和多Agent并发任务中更经济的执行模型。
计算机操作方面,Astra仍然是OpenAI能力最强的选择,但Sol和Luna进一步改善了成本效率。在OSWorld 2.0离线测试中,Sol xhigh得到60.5%,与Claude Opus 5 medium的60.3%基本相当,单项任务成本低约80%;Luna最大推理强度的成绩超过GPT-5.6 Sol medium,成本只有后者的十分之一。模型的交流方式也继承了Astra的调整。OpenAI称,Sol和Luna会减少术语、古怪措辞及价值较低的细节,回答整体略短,同时更清楚地说明自己检查过什么、没有检查什么。
模型发布后,网友首批实测很快呈现出两种截然不同的评价。开发者Flavio Adamo提前试用GPT-6 Sol后表示,过去在GPT-5.6上通常需要约一小时的任务,如今经常可以在约20分钟内完成,Token消耗还不到原来的一半。我们用GPT-6 Sol实测威尼斯运河快艇游戏时,模型最终交付了可以直接游玩的Three.js成品,桥洞闯关、倒计时、航迹尾流、水面反射和追逐镜头等核心功能均能正常运行。视觉质量上的结论却没有那么乐观。aipulsedaily使用同一提示词让GPT-6 Sol与Claude Opus 5.5构建纽约Three.js场景,认为Opus 5.5更完整地呈现了街道、出租车、屋顶、布鲁克林大桥和中央公园,还增加了部分细节;Sol的结果更接近静态画面,缺少相机移动和持续渲染循环。不过考虑到Opus 5.5的API价格,GPT-6 Sol和Luna的卖点在于用可接受的能力,换取数量级上的成本和速度优势。
Artificial Analysis也给出了更克制的观察。其Intelligence Index和Coding Agent Index显示,GPT-6 Sol与Luna的总体智能水平和GPT-5.6系列大致持平,部分项目进步,也有部分项目回退,真正显著的变化来自成本下降。按照该机构测算,GPT-6 Sol max完成一次Intelligence Index任务的成本约为1.06美元,比GPT-5.6 Sol max的1.99美元低近一半;GPT-6 Luna max约为0.07美元,比上一代的0.18美元低约60%。两款模型的输出Token用量反而略有增加,Sol从约2.9万升至3.1万,Luna从4.1万升至5.1万,价格下降仍然抵消了用量增加。
Token单价之外,OpenAI还更新了GPT-6的提示词缓存。系统会提高默认缓存命中率,让Agent更充分地复用已有上下文,缓存输入读取可获得90%的折扣。开发者现在可以在控制台查看缓存比例和变化,也能检查哪些提示词未能命中缓存。推理强度和可用工具可以在对话中途调整,同时保留此前上下文的缓存;新的显式断点则允许开发者决定提示词前缀在哪里结束,以便优化复用范围。对于持续读取代码库、文档和历史对话的Agent而言,缓存节省的费用可能比公开单价下降更重要。
另外,GPT-6 Sol和Luna从今天起面向Plus、Pro、Business、Enterprise和Edu用户登陆ChatGPT Work与Codex,Free和Go用户可在桌面应用中使用GPT-6 Luna。两款模型暂未进入ChatGPT的普通Chat对话,相关权限会在当天逐步开放,通常来说,Codex的开放速度会更快一些。API用户已经可以通过gpt-6-sol和gpt-6-luna调用新模型。OpenAI产品负责人Tibo Sottiaux还宣布,Plus、Pro和Business账户将获得一次预存的使用额度重置,让订阅用户能够在现有周期内多使用一轮额度。
GPT-6 Astra发布时,OpenAI展示的是模型能力能够抵达多高的位置。但Sol和Luna上线后,OpenAI也开始考虑智能密度的经济效益。一方面,随着Luna的普通输入和输出价格进入DeepSeek V4.1 Flash的区间,两者的价格鸿沟已经被明显缩小;另一方面,OpenAI背后还有ChatGPT Work、Codex和API组成的、更完善的产品体系,价格接近以后,产品入口、工具支持、运行稳定性和开发者生态都会重新影响选择。DeepSeek用低价让整个行业重新计算Token的价值,OpenAI则把这种压力带进了全球前沿模型的核心战场。接下来,低价不会再是某一家公司的招牌,而会成为所有头部模型都绕不开的必答题。
版权所有,未经许可不得转载
-ng娱乐提交信息后,业务人员将尽快与您联系
用微信扫一扫,关注我们取得联系