船长的角落 Captain Nook
返回内容目录
公众号文章

Codex被"下架"了?其实是OpenAI这次升级更大——GPT-5.6 ChatGPT Work 保姆级教程

独立的Codex软件没有了,融进了ChatGPT Work。用铁柱入职第一周的真实任务当证据,讲清楚这次升级真正变的不是入口变多了,是判断力被交还给了用户。

2026-07-10约 7 分钟

前两天,OpenAI 把 Codex 这个口碑爆棚的产品下架了。评论区一片惋惜,说好东西又没了。我点进去看了一圈才发现,它不是没了,是被"升职"了。

独立的 Codex 客户端确实关了。但它没有消失,是被塞进了一个新软件——ChatGPT Work,底层换成了刚发布的 GPT-5.6,模型还破天荒分了 Sol、Terra、Luna 三档,桌面端一口气挤进 Chat、Work、Sites、Codex 四个板块。
第一反应是懵的:又要学一套新东西了?
用了几天之后我的判断反过来了。这次升级真正变的不是功能变多了,是 OpenAI 把一件本来该由你自己判断的事——"这活儿该用什么规格来处理"——第一次摆到了台面上,逼你去想。以前不管什么问题都扔进一个对话框,现在同一件事,进错入口、配错模型,体验能差出一整个数量级。
这条判断线怎么划,我用一个真实场景走了一遍——铁柱,入职第一天,从一份员工手册到一套能自己跑的周报工具,四个入口全用上了。

1 简单问题,别小题大做

铁柱收到的入职邮件里躺着 8 个文件,他没有一上来就把整包扔进去,先挑出最急的三个问题:报销怎么报、假怎么请、培训在哪天。这种问题的特点是答案就在一份文件里,不需要推理,只需要查得准。
他直接用 Chat,模型选了最轻的 Luna。19 页手册甩进去,一句"答案标注页码,手册没写的直接说没有",报销和请假的条款连页码都给出来了;培训时间手册里压根没提,它也没瞎编,老实说了句"未提及"。
这一步最容易被人做反的地方是:很多人下意识就把模型调到最贵最强的那档,觉得越贵越保险。其实一份文件查三个死问题,跟拿旗舰模型的差别几乎为零,纯粹是浪费。**判断复杂度,不是看这件事重不重要,是看它需不需要模型同时记住好几份材料、来回对比。**这份手册的活儿不需要,Luna 就是够用的答案。

2 材料一多,就得换个地方干活

三个问题解决完,麻烦真正开始——8 份文件要排成第一周待办、培训日程,还得分清哪些制度是新版哪些是旧版。这种活儿如果还窝在 Chat 里一份份聊,一来一回背景都得重复交代,效率会被拖垮。
铁柱换到了 Work。这个入口的关键不是"能处理更多文件",是它可以直接把一个本地文件夹设成工作区——8 份文件不用一个个上传,处理结果也实打实落在硬盘上,网页端和手机端碰不到,关掉软件明天还能接着改。模型也换成了 Terra,8 份文件挨个读下来,读到最后一份还能对上第一份提过的日期,这种"脑子里同时装几份材料"的活,是 Luna 大概率扛不住的。
这一步真正有意思的地方是它揪出的问题:《差旅与报销管理办法》有新旧两版,餐补住宿标准完全不一样,新版还写了一句"旧版作废"。AI 能做的只是把这种冲突标出来,具体按哪版报销,还得铁柱自己去找财务确认——这是一条硬边界:AI 负责发现矛盾,人负责拍板,谁也别指望它替你做决定。
材料整理完,铁柱没有停在这一步,而是让 Work 把结果沉淀成待办、日程、笔记,全部写进"输出"文件夹。这才是本地工作区真正省事的地方:几天后主管要一份学习汇报,他不用重新解释背景,直接在同一个任务里接着说,出提纲、改数字、出 PPT,一条线走到底,不用每次从零讲一遍前情提要。

3 整理完的东西,值得有个自己的入口

待办和日程都排好了,铁柱又多做了一步——把这些做成一个能天天打开看的入职工作台。这是 Sites,目前是公测功能,说一句话描述你想要的页面,出来的是一个真能点的网站,不是一张截图。
这一步很多人会略过,觉得有个文档就够了。但一份躺在文件夹里的清单和一个能点开、能打勾、能跳转的页面,打开它的心理成本完全不一样——前者是"我得去翻",后者是"我现在就看"。铁柱测试了三件事:任务能不能勾选,链接能不能跳转,改一处内容会不会把之前的内容冲掉。都没问题,选好可见范围,链接往手机上一发,工作台就算上线了。

4 会重复的活,交给能跑的工具

到周五,铁柱撞上一件每周都要干的事——把 Excel 工作记录整理成周报。这种活跟前面几个都不一样:涉及本地文件、字段固定、还要反复跑,这才是 Codex 真正该出场的地方——原来独立的那套编码 Agent 没有消失,只是现在从 ChatGPT 里直接就能叫出来。
他给的指令里加了一条硬性要求:日期或状态缺失就报错,不能自己编数据。他还故意删掉 Excel 里一条必填日期测试了一下,工具真的拦住了。这才是"工具"和"聊天"的分界线——聊天是问一次答一次,工具是你可以放心让它重复跑,跑错了它会告诉你,而不是替你瞎编一个看起来合理的答案。

5 出错代价最高的时候,才用最贵的模型

前面几步都是 Terra 在扛,但处理的始终是单份任务——整理日程的时候只看日程,写汇报的时候只看汇报。提交前的最后一关不一样,铁柱要把学习汇报、培训日程、待确认问题、周报初稿四样东西一次性摊开做交叉审校,这活儿他换成了旗舰档 Sol。
结果真找出了两处之前没发现的问题:两场培训时间撞车了;报销培训的参考资料还挂着已经作废的旧制度。这两处漏洞,之前 Terra 分开处理的时候完全没撞上——日程归日程、制度归制度,各看各的自然发现不了,只有把四份材料摊在一起交叉比对才能照见。
这也验证了前面那条判断线:**不是活儿越复杂就该无脑上最贵的模型,是出错的代价撑不撑得起返工的成本,才决定值不值得多花这份钱。**日常整理用 Terra 完全够用,只有到最后签字确认这一关,才轮到 Sol 上场。

6 真正变的是什么

Chat、Work、Sites、Codex 这四个入口,说到底对应的是四种不同的活:单份文件的明确问题、多文件的长期工作区、想要一个能点的成品页面、会重复跑的固定流程。Luna、Terra、Sol 这三档模型,对应的是任务复杂度和出错代价的三个台阶。
以前所有问题不分轻重都扔进一个对话框,AI 帮你兜底;现在 OpenAI 把这套判断权限交还给了用户——入口选错了,你会觉得"这软件怎么这么麻烦";模型配错了,要么小题大做浪费钱,要么算力不够漏了坑。真正需要升级的不是记住四个按钮和三个名字,是判断一件事到底有多复杂、错了要付多大代价——这条判断线,比任何一个功能说明都更值得记住。
铁柱从一份 PDF 开始,到手里多出待办、日程、学习汇报、个人工作台,还有一个能自己跑的周报工具,走的正是这条判断线。
今天用到的完整指令、文件结构和录屏顺序,会整理放进评论区,实操时卡在哪一步,直接留言喊我。

<section style="margin: 28px 0 12px 0; text-align: center; color: #d46b2c; font-size: 15px; font-weight: 700; line-height: 1.8;"> 保持对AI好奇 · 扫码上船 </section>

公众号尾图