美国功夫7月9日,令人等待的GPT-5.6系列,终于全量上线。
同时推出的还有ChatGPT Work,就一句话:把Codex放到了ChatGPT里。
不是之前那种加个入口,是直接并了进去——Codex此刻已经造成了ChatGPT的一部门,就连app图标都换成了ChatGPT(能够保留原图标)。
13天前,OpenAI在GPT-5.6 Sol限量预览的文档中,只展示了编码、生物、网络安全等沉点评测,并暗示当模型更宽泛盛开时,将颁布一套扩大的评测了局。此刻也已经随着模型被一起放了出来。
而在正式成就单到来之前,另一种“民间评测”已经先一步起头。
不少获得早期接见权限的用户,已经在社交平台上分享了自己的使用履历。相比冰凉的benchmark,这些反馈更像是一次提前泄露的实战观察。
让我用最直白、最单一、最不绕弯子的话通知你……
GPT-5.6 Sol在难题攻坚上打不外Fable5,但是性价比更高、更适合日常办公。
相对便宜,并且超等快(这很沉要)。
划沉点:便宜、急剧、高性价比
在OpenAI 的正式颁布文档中,开篇就把话说得很直白:GPT-5.6的指标是“每个token带来更多智能、更强的每美元机能,以及在最难工作上按需挪用更高能力”。
首先,再次强调一下GPT-5.6系列的价值。
GPT-5.6分为Sol、Terra、Luna三个版本。依照OpenAI颁布的API价值,GPT-5.6按每100万token计费:Sol是输入5美元、输出30美元;Terra是输入2.5美元、输出15美元;Luna是输入1美元、输出6美元。
相识这个价值极度沉要,至少它会让用户原谅一些机能上的不及。好多人会把GPT-5.6 Sol对标Claude Fable 5,但从API单价看,GPT-5.6 Sol比Claude Fable 5便宜不少:输入价值只有后者一半,输出价值低40%。
并且OpenAI还提到GPT-5.6支持更可预测的prompt caching,缓存读取有90%的折扣,这会影响长高低文工作的现实成本。
除了价值,另一个出格值得关注的处所是速度——官方出格指出,Sol的速度最高可达每秒750个token。
用中文粗略理解,或许是每秒500到700个汉字。
这会把模型思虑和天生的部门大幅压缩,对通常谈天来说,将带来极度显著的秒回感。
我们在之前的文章里,已经提到了编码、生物、网络安全等沉点的评测,这次的评测更为全面,但在主题上并没有太大差距。
好比,在Agents’ Last Exam这个测试长功夫专业工作流的评估里,GPT-5.6 Sol达到了53.6分,比Fable 5高13.1分;即便只开medium reasoning,也能以约莫四分之一的估算成本超过Fable 5。
OpenAI还说,Terra和Luna能够在约莫1/16的成本下超过Fable 5。
只管官方benchmark并不料味着最终结论,但它至少说了然OpenAI这次的叙事沉点:
比的不只是谁更强,还有谁能以更低成本实现更多工作。
官方文档之表,在Artificial Analysis这套综合评测里,GPT-5.6实现工作时亏损的token显著更少,尤其是推理token少得夸大。就单元token产出和运行速度而言,效能险些高得离谱。
相比起冷冰冰的benchmark,还是热乎乎的直播更值得关注——凌晨一点,OpenAI开了一场直播,介绍了本次更新的全数内容。
在直播中,ChatGPT Work和GPT-5.6险些被放在了同样沉要的地位上,甚至ChatGPT Work越发沉要,奥特曼直接说那是个“really big deal”。
从直播来看,某种意思上,GPT-5.6反而像是一个专门为ChatGPT Work服务的模型底座。
而ChatGPT Work自身,说白了,就是把Codex放进了ChatGPT。
你看直播中的这个页面,是不是很熟悉?
OpenAI在介绍ChatGPT Work时直接写路:ChatGPT Work是ChatGPT里的一个Agent,能够跨利用和文件采取行动,必要时陪着一个项目工作数幼时,并把一个指标造成完制品。
滑稽的是,OpenAI也不是单一把Codex改名为ChatGPT Work——OpenAI说,从今天起头,Codex app会并入新的ChatGPT desktop app;Codex依然是面向开发者和技术人员的壮大编码Agent,但也会和Chat、Work一路呈此刻统一个桌面利用里。
OpenAI自己此前已经在把Codex往“所有人的出产力工具”方向讲了,说 Codex在援手分歧职业的人自动化日常工作、加快产出、削减知识工作的瓶颈。而此刻,真正归并的时辰,它反而把Codex的能力拆成了两个部门。
Codex这个入口依然存在,持续面向开发者和技术人员,掌管代码、仓库、PR、diff、review、多仓库项目等工程工作。
但Codex背后那套更有价值的器材——接工作、读高低文、挪用工具、分步骤执杏注最后交付了局的能力——被抽象了出来,放进了ChatGPT Work。
也就是说,ChatGPT此刻有三个入口:Chat掌管对话,Codex掌管编码,Work掌管通用办公工作。
姑且来讲,又往超等入口迈了一步。
现实履历:更适合日常工作
好多获得了GPT-5.6早期接见权限的网友分享了他们的使用履历。
总的来说,GPT-5.6 Sol杰出的处所并不在于极限攻坚(好多人提到它在机能上和Fable 5还有一段距离),但它在日常工作上得到了用户的信赖:用户愿意每天开着它,把大量日常工作、细节查抄、高低文判断和中央过程交给它。
有网友以为,Sol像一个有魅力、高效、有才华、让人羡慕的同事;Fable则像一个有点拧巴的天才,在自己执着的问题上极其杰出,但不太适合日常相处。
在他的履历里,Fable依然适合那些指标极其明确的工作,好比定向调试、安全问题和机能优化。由于这类工作有清澈的嘉奖函数,模型能够不休往一个确定指标上猛推。
但一旦回到更常见的日常工作,Sol的优势就显露出来了:它更顺手,更会共同,也更适合长功夫合作。
所以,或许更好的方式是让Fable去出经营策,而后拿Sol去执行。
另一位网友的评价则更靠近团队层面的行为变动。他说,自己的团队在使用模型时比力守旧,但GPT-5.6对他的团队产生了巨大影响:他们此刻亏损的token数量,是从前的5倍。
他同样以为GPT-5.6不如Fable 5聪明,但更靠得住。
说到“使用的token数量是从前的5倍”,我一路头还以为他在吐槽GPT-5.6对token亏损太快,看了评论区才知路并不是这样。
重要是由于用得多,所以亏损得多,这其中的关键在于他们愿意去用。
不外5倍的token亏损并不代表出产力提升了5倍,这位网友暗示,他们并没有5倍的好点子去推动出产力。
多出来的token,大部门不是用来堆更多产出,而是用来提高已有工作的质量,像是反复查抄每一个藐幼决策、处置各类边缘情况、补上一些容易被忽略的打磨环节什么的。
但至少,他的团队愿意把更多细节交给模型一路斟酌。
在代码能力上,网友Tim Neutkens的评价极度具体——他是Vercel的Next.js技术掌管人,也是Next.js的共同作者之一。这是个大型开源框架,在业内很有影响力,并且是现代前端里极度主流的一套框架。
他们已经测试了Sol两个多月(那么长),而在Next.js项主张日常工作中,Sol阐发相当杰出。他说Sol能理解架构弃取,调查复杂的Next.js项目,在建bug时思考代码库的其他部门,并且险些不必要太多领导,用很短的提醒就够了。
并且Sol已经参加了一些Next.js服务器的大型沉构工作。他们只必要指出高档次的改进方向,Sol就能端到端实现。
有个早期用户则给出了比力降温的评价,他以为GPT-5.6 Sol并不像Fable那样代表一次巨大的变动或全新架构,它更像是在GPT-5.5基础上充分打磨出的升级版。
思考到这次更新花了约莫三个月,它甚至很难说有什么了不得。
不外,再思考到它的价值(Sol和5.5同价)和能力的提升,GPT-5.6 Sol依然是目前订阅造下能用到的最好模型。
这位网友还提到了前端用户界面——不外这里指的是OpenAI自己的产品界面,而不是Sol的前端代码能力。
事实上,Sol的前端代码能力反而是早期评价里比力亮眼的部门。
不外对前端页面的审美几多有些见仁见智的意思,具体感触可能还是必要自己去尝试。
单一地说,GPT-5.6 Sol至少不像一次尺度意思上的大代际更新,终于也只是版本号+0.1的水平——只是GPT-5.5之后的一个幼版本。
固然,它在传布上的确获得了很大的成功。先是提前很久就起头吊胃口,又赶上了美国对前沿模型加强监管的布景;褂蠸ol、Terra、Luna这套太阳系定名,也给它蒙上了一层很严害的滤镜。
回到现实评价里,Sol的主题故事反而没有那么玄乎,只是比GPT-5.5更快、更适合日常工作,价值上也没什么变动。
按理来讲,这种变动其实是足够的,但放在人家Anthropic从4到5的升级旁边,还是差点意思。它在好多工作上不如Fable 5也算正常,价值和版本号差在这里。
说到大代际,有网友泄漏,GPT-5.6将是5.x系列中的最后一批模型(三个模型)。GPT-6可能在本月稍晚一些或者下个月颁布。
OMT:花圃里的两条路
只管听起来没佑装前沿模型沉大跃迁”那么刺激,但对Agent来说,性价比极度沉要。
通常谈天,用户问一句,模型答一句,成本再高也有限。但Agent要干活,就不是一句两句的事了——对高低文的读取以及对现实情况的查抄,造成的token亏损险些难以计量。
到了Agent时期,问题不只是“谁最聪明”,还蕴含“谁足够聪明、足够快,并且能被大量挪用”。
GPT-5.6这次就有点像是在回覆这个问题。值得关注的不只有Sol,它一次给出了三个版本,分工也很明确:复杂工作交给Sol,日常工作交给Terra,高频、轻量、容易验证的工作交给Luna。
若是说GPT-5.6是模型底座,ChatGPT Work就是它真正干活的处所。有了具体的使用场景,GPT-5.6的性价比才真正有了意思。
不是所有事件都要请最贵的专家来做,好多时辰,一个足够不变、足够便宜的模型,才是工作流真正跑起来的关键。
说起来,最近这两天的新模型颁布,有一点“便宜模型批量放送”的意思。
xAI昨天颁布的Grok 4.5、Meta刚刚推出的Muse Spark 1.1,主打的也都是便宜、急剧、高性价比。
事实上我并不是很爱看跑分,时时用AI的都知路,benchmark和现实使用上的体感是两码事,但价值是实打实的价值。
按每100万token计费,xAI的Grok 4.5的价值是输入2美元、输出6美元,xAI官方还强调它具备约2倍的token利用率;Meta刚推出的Muse Spark 1.1更低,输入1.25美元、输出4.25美元。
这其实是一个很大的变动。
从前,前沿模型的竞争很像跑车颁布会:比谁的马力更大,谁的极速更高,谁能在最难的测试里跑出最好成就。
但Agent时期更像商用车市场,用户不仅关切它能不能跑得快,还关切它省不省油、耐不耐用。
OpenAI、xAI和Meta看起来都在往这个方向靠:把足够强的模型做得更便宜、更快、更适合规;灿。
就Anthropic,在证了然自己的实力以来,依然在另一条路上持续狂奔。
Anthropic当然也在做工作流——甚至做得极度好,只不外它的沉点和OpenAI不太一样。我一向感触Anthropic的工具存在肯定的使用门槛,很强调合作质量和人的判断。
或者说,它并不那么防呆。所以才会有那么多的Claude使用指南,教你怎么把“最强AI工具”用到极致。
拿它凌晨刚刚推出的Reflect with Claude职能举例,它甚至专门让用户回看自己从前1、3、6、12个月若何使用Claude,分析常见工作和使用模式,并提醒用户思虑哪些事件适合交给AI,哪些依然应该自己实现。
单一地讲,OpenAI的工作流更强调规;灿,而Anthropic的工作流更强调高质量合作。它们的主流模型看起来也很切合这衷禅质。
我们很难单一评价这两条路线的正误,它们更像是花圃里的两条路。不外目前看来,占有最顶级模型的Anthropic似乎更胜一筹。
一方面是估值,市场给出了它的答案。另一方面,Fable(Mythos)只是Anthropic的顶级模型,它还有Opus、Sonnet和Haiku,在性价比上不定落了下风。
不外,看起来OpenAI今天的更新还是给Anthropic带来了一些紧迫感。
除了把Fable5的使用限度耽搁到了7月12日,它今晚还为所有效户沉置了限额。
居然,有竞争才有动力啊……
(作者:袁心玥)