资讯
只降价20%,账单却少八成,GPT-5.6杀入Claude地盘重算编程账
📌 概要
<p>同一个模型,官方价格只降了20%,你的账单却少了八成。</p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_f6a6ad3305064b3781196a632e2d14b4@000000_oswg86729oswg1080oswg368_img_000?x-oss-proce
<p>同一个模型,官方价格只降了20%,你的账单却少了八成。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_f6a6ad3305064b3781196a632e2d14b4@000000_oswg86729oswg1080oswg368_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>8月24日,OpenAI公布了一项与AWS一起做的测试结果:</p>
<p>在Terminal-Bench 2.1上,GPT-5.6 Terra在Kiro里完成一个成功任务的成本,降低了约82%。</p>
<p>Kiro是AWS的软件开发智能体平台,覆盖IDE、CLI和Web。</p>
<p>GPT-5.6家族的Sol、Terra、Luna三兄弟,已在里面跑了一个多月。</p>
<p>这82%,并非官方降价。</p>
<p>Terra最近一次调价是在7月30日,幅度20%。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_c193b18cbafe4368a613a3b899c03bba@000000_oswg70257oswg1080oswg276_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p class="img-desc">7月30日OpenAI调价公告,Terra降20%。</p>
<p>单价只降20%,账单却能砍掉八成。</p>
<p>中间差的那六十个百分点是从哪儿省出来的,才是真正值得我们关注的。</p>
<p>GPT-5.6登陆Kiro是今年7月的事儿。</p>
<p>先是13日,AWS宣布GPT-5.6 Sol、Terra、Luna在Amazon Bedrock正式可用。</p>
<p>紧接第二天,Kiro发博客宣布三款模型上线IDE、CLI和Web。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_d5f8fbb1e6e6400dae5905422ae3758e@000000_oswg268339oswg1080oswg714_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>这是OpenAI模型第一次进Kiro,刚好赶上Kiro公开预览一周年。</p>
<p>先把模型摆上货架,再拉去干活,一个多月后,OpenAI回来交作业:</p>
<p>两家联手把Kiro环境和OpenAI模型一起调了一遍,Terra完成一个成功任务的成本,降了约82%。</p>
<h2><strong>省下的</strong></h2>
<h2><strong>是走弯路的钱</strong></h2>
<p>7月30日那次调价,Terra降了20%,可到了Kiro的测试里,单任务成本降了82%。</p>
<p>那多省下的六成,是从哪儿来的?</p>
<p>方向就这么几个:</p>
<p>模型吐的token更少了,工具来回调的次数更少了,失败之后的重试和绕远路更少了。</p>
<p>所以省下的这一大块,并非每次调用的钱,而是那些原本会白花的调用的钱。</p>
<p>道理很简单:一个AI智能体把任务做砸一次,账单照记。它中途选错路径、跑偏三轮再回头,这些token也照收。</p>
<p>真实开发里,钱往往就是这么漏掉的。</p>
<p>OpenAI在官方博客中也点过同一套逻辑,效率来自三层:</p>
<p>发起请求、组织上下文的智能体框架,中间调度请求的编排系统,最后才是GPU上跑的模型本身。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_31572b2948f54e4796ecb1986195e1af@000000_oswg28996oswg908oswg608_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p class="img-desc">OpenAI拆解GPT-5.6的效率来源:请求从智能体框架出发,经编排系统调度,最后到GPU跑模型,每一层都在省。</p>
<p>省钱还能省到模型分工上。</p>
<p>OpenAI还举过一个用法:编码工作流可以先用Sol把问题想清楚、把计划定下来,再换Luna去实施那些已经定义清楚的改动、写测试、跑评估。</p>
<p>同一条流水线,不同环节配不同档位的智能。</p>
<h2><strong>模型只占账单一半</strong></h2>
<h2><strong>换个框架就换个价</strong></h2>
<p>Terminal-Bench 2.1这套题,不是让模型单独答卷。</p>
<p>它把模型丢进一个终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错、反复迭代。</p>
<p>所以跑出来的成绩,是「智能体+模型」这个组合的成绩。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_6aef4c7185444cc98d3a186967b43f21@000000_oswg147437oswg1080oswg476_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p class="img-desc">Terminal-Bench 2.1公开榜单,准确率右边多了一项成本。(图源:Terminal-Bench)</p>
<p>榜单里的四行数字最能说明问题:</p>
<blockquote>
<p>Claude Code配Fable 5,83.8%,552.67美元;</p>
<p>Codex配GPT-5.5,83.1%,2059.19美元;</p>
<p>Codex配GPT-5.6 Terra,78.4%,421.15美元;</p>
<p>Codex配GPT-5.6 Luna,75.7%,241.45美元。</p>
</blockquote>
<p>前两行分数只差0.7个百分点,账单却差了将近4倍。</p>
<p>同一个模型,装进不同的框架,配不同的上下文组织和工具策略,跑出来也根本不是一个价。</p>
<p>按Kiro官方给的数据,Terra在Coding Agent Index上拿77.4分,只比Claude Fable 5的77.2高一点。</p>
<p>它的卖点不在分数,在于这个分数所对应的价钱。</p>
<p>Kiro那套spec-driven的发力点也在这里,核心玩法就一句:不许上来就写代码。</p>
<p>它先把用户那句含糊的目标,拆成正经的需求文档、技术设计和可执行任务清单,再交给模型。</p>
<p>这样,模型到手的不再是一句含糊不清的话,而是一份理清楚的活儿。</p>
<p>熟悉Agent的人会立刻反应过来,这一步省的正是最昂贵的那部分开销。</p>
<p>模型跑偏、返工、推倒重来,烧掉的token往往比正经干活还多。</p>
<p>Kiro还在流程里留了两道闸栏:代码真正修改前,先停下来让人过一眼;活干完之后,再自动跑一轮测试验证对不对。</p>
<p>这两道闸拦下的每一次返工,都能省下真金白银。</p>
<h2><strong>Claude在亚马逊的地盘</strong></h2>
<h2><strong>GPT分走了一半</strong></h2>
<p>一年前,Kiro还只是个spec-driven的IDE,模型选择器是Anthropic的主场。</p>
<p>一年后,AWS在自家开发智能体平台上,一口气摆进三档OpenAI模型。</p>
<p>Sol、Terra、Luna跟Claude并排列进同一个下拉菜单,这画面搁一年前很难想象。</p>
<p>虽然GPT-5.6这次是「全家入驻」,但并未「全面开放」。</p>
<p>三款模型是渐进式、实验性开放,面向Pro、Pro+、Pro Max和Power用户,区域只有两个,美国的弗吉尼亚北部和欧洲的法兰克福,支持跨区域推理。</p>
<p>还有一条挺多人不适应的:这批模型在Kiro里走的是隐藏思维链,你看不到它的推理步骤,只看得到最终结果。</p>
<p>习惯了盯着Agent一步步推理的人,会觉得像把活扔进了一个不透明的盒子。</p>
<p>官方的说法是,这是预期行为,不影响输出质量。</p>
<p>三档模型在Kiro里明码标价。</p>
<p>7月14日刚上线那会儿,同样的任务,Sol扣2.4倍,Terra扣1.2倍,Luna扣0.6倍。</p>
<p>7月30日OpenAI那轮降价落地,第二天Kiro跟进:Luna从0.6倍一路砍到0.1倍,Terra从1.2倍降到1.0倍,只有Sol未动。</p>
<p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_af41a1d684024a9e81b408b9a35609fc@000000_oswg115017oswg1080oswg345_img_000?x-oss-process=image/format,jpg/interlace,1" /></p>
<p>AWS的态度摆在了明面上:一个开发平台,不能只绑一家模型。</p>
<p>同一个选择器里,两家前沿模型开始互相压价。</p>
<p>模型的评价标准也跟着变了:分数高不再默认能赢,花钱少同样能赢。</p>
<p>对开发者来说,选模型以前问的是「这个模型多少钱一百万token」,现在得问「让它把这件事做完,我到底要花多少」。</p>
<p><strong>参考资料:</strong></p>
<p>https://x.com/OpenAIDevs/status/2091966982015103068</p>
<p>https://openai.com/index/gpt-5-6-in-kiro/</p>
<p>本文来自微信公众号<a href="https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652721166&idx=2&sn=a2d922e478aa5c25f577c3bcbe1d9a7f&chksm=f02602b7bd61d908f50e96682cb3292de55c004f5f2e25fc248f9b6901f93b133f7656442d18&scene=0&xtrack=1#rd" rel="noopener noreferrer nofollow" target="_blank">“新智元”(ID:AI_era)</a>,作者:ASI启示录,编辑:元宇,36氪经授权发布。</p>