GPT-5.6 之后,Codex 开始把“更强”变成一种需要经营的使用习惯
这段时间,Codex 最明显的变化,不是多了几个模型名字,也不是某个按钮挪了位置。
这段时间,Codex 最明显的变化,不是多了几个模型名字,也不是某个按钮挪了位置。
很多开发者开始把它交给真实任务:读一段陌生代码、跟着浏览器定位一个难复现的问题、改完一处逻辑再顺手检查 diff,甚至在多个仓库之间来回穿梭。与此同时,另一个原本不太起眼的问题被推到了台前:额度还剩多少?为什么又有重置?credits 到底算不算钱?
把 GPT-5.6、Codex 的一轮产品更新,以及最近的额度机制放在一起看,事情就清楚了。OpenAI 不是只在发布一个更强的模型,它也在试着把 Codex 从“有空试试的 AI 工具”,变成开发者每天都会打开、也需要认真管理的工作流。
当 AI 开始接手任务,限额才有了存在感
以前把 Codex 当聊天工具时,限额很少会成为问题。报错了贴一段日志,写不动了让它补个函数,或者让它解释一下陌生项目的目录结构。即使某次回答不够好,关掉窗口也没什么损失。
但 AI 编程工具一旦开始接手完整任务,使用方式就变了。你会让它先理解代码库,再拆分问题、修改文件、运行命令、检查结果。任务不再是一问一答,模型需要带着更多上下文工作,调用的工具更多,输出也更长。额度从一个页面角落的数字,变成了能否把当前任务做完的实际约束。
这也是为什么,最近关于 Codex 的讨论会同时出现两种声音:一边是“它终于能干活了”,另一边是“怎么又快到额度了”。这两句话并不矛盾。恰恰是因为用户开始愿意把更重的活交给它,额度才突然有了存在感。
GPT-5.6 的意义,不在于多一个版本号
7 月 9 日,OpenAI 将 GPT-5.6 同步带到 ChatGPT、Codex 和 API。模型家族分成三档:偏向前沿能力的 Sol,强调能力与成本平衡的 Terra,以及面向高效率、高吞吐场景的 Luna。API 侧还加入了程序化工具调用、显式 prompt caching 控制、持久化推理和多智能体编排等能力。OpenAI 的发布说明把这些能力列得很清楚。
普通开发者未必需要记住每一个名字,但应该注意其中的方向:模型不只是要把一段代码补得更像样,而是要在一个持续推进的过程里维持判断。它得记住自己查过什么,知道下一步该读哪个文件,必要时调用工具验证,而不是靠一句看似自信的回答收场。
这会改变大家衡量 Codex 的方式。过去常见的问题是“它能不能写出这个函数”;接下来更重要的问题是“我把这个任务交给它两个小时后,能不能少花一点时间收拾残局”。前者比的是单点能力,后者考验的是任务完成度、上下文管理和过程中的可靠性。
我认为,GPT-5.6 真正把 Codex 推过了一个临界点:它开始更有资格被当成一名会使用工具、需要被审查、但确实能分担工作的人,而不只是一个更懂代码的问答框。
Codex 这次更新,想解决的是“任务交接”
模型能力变强,不代表用户就会自动改变习惯。真正决定体验的,往往是上下文要不要反复搬运。
这轮桌面端更新里,Codex 可以直接在 Markdown 和代码 diff 中编辑、添加内联批注、根据选中的内容继续修改;GitHub Pull Request 的审查被放到侧栏;一个项目可以处理多个仓库;Computer Use 的速度也随 GPT-5.6 提升。Chat、Work 与 Codex 还被放进同一个桌面应用里。官方发布说明没有把这些功能包装成一个统一概念,但它们实际在做同一件事:减少任务交接。
以前,你可能在 IDE 里发现问题,切到浏览器查资料,再把错误复制进聊天窗口;改完后回到 GitHub 看 diff,最后还要自己确认有没有漏掉关联文件。每一次切换,都是上下文丢失的机会。
现在,OpenAI 想让 Codex 尽量留在任务现场。它可以看你正在看的页面,跟着项目中的改动继续工作,在 PR 旁边给建议,再回到代码里修改。对于轻量任务,这种整合未必让人惊艳;但任务越长、项目越杂乱,少一次上下文搬运就越值钱。
这也是本文不想把更新写成“新增五项功能”的原因。功能清单很快会过期,工作流的变化才会留下来。
GPT‑5.6 与 Codex 的价值,在于减少代码、终端、浏览器和 PR 之间的任务交接。
额度重置、credits 和套餐额度,根本不是一回事
讨论 Codex 的额度时,最容易发生的误会,是把所有“还能继续用”的东西都叫作额度。它们其实是三种不同机制。
第一层是套餐内已经包含的使用量。符合条件的 Plus 和 Pro 用户,先消耗的是这部分。第二层是限额重置。6 月的 Codex 更新为符合条件的 Plus、Pro 用户提供了可存储的重置机会,上线时包含一次免费重置;受邀者首次发送 Codex 消息后,邀请双方还可以获得一次可存储的重置,获得后 30 天内有效。
第三层才是 credits。它是套餐额度用尽后可购买的使用余额,符合条件的 Plus、Pro 用户可以在 Codex 的 Usage 页面购买,也可以设置自动充值。credits 可用于账户所支持的功能,但它不可转让、没有现金价值,也不是 API 余额;购买后通常有有效期。
把这三件事分清,才能读懂 OpenAI 的动作。重置解决的是“这次要不要继续做下去”;credits 解决的是“我已经需要持续使用了,怎么不中断”;套餐额度则决定了用户能以多低的门槛开始。
还有一点对普通用户尤其重要:Codex、ChatGPT Work、ChatGPT for Excel 等 agentic 功能,在适用套餐中会共享使用量和 credits。今后很可能出现一种新体验:你以为自己没怎么用 Codex,实际上是另一个代理功能先消耗了同一个池子。把它当成一个独立产品来理解,反而会看不懂自己的用量。
五小时窗口淡出了,但“无限使用”并没有到来
不少老用户最有感知的变化,是 Codex 不再把体验锁在那个熟悉的五小时窗口里。过去,人会盯着倒计时安排任务:这轮是留给复杂排查,还是拿来做几个小修改?时间一到,任务节奏也被迫中断。
现在的限制逻辑更像一个按任务消耗、并与其他 agentic 功能共享的池子。OpenAI 当前说明把影响用量的因素写得很直白:任务规模、代码库复杂度、模型选择和运行地点都会改变消耗;碰到限额时,用户可以加 credits、使用已有重置,或等待下一次恢复。更关键的是,如果限额是在一个正在执行的回合中触发,Codex 可以继续完成该回合,但仍受合理使用规则约束。最新的 Codex 使用说明已经不再把五小时窗口作为用户理解用量的中心。
这对使用体验是进步:你不用再为了一个固定时间窗,把真正需要连续推进的任务切得支离破碎。但它不等于无限使用。限制从一块钟表,变成了一本账;表面上更灵活,背后更要求用户理解什么样的任务会消耗更多资源。
这也让前面的“重置”和“credits”有了新的位置。取消固定五小时节奏,并不是少了边界,而是把边界交给任务消耗、套餐层级和付费余额共同决定。对轻度用户来说,这更顺手;对重度用户来说,能否预估成本反而更重要。
固定时间窗淡出后,套餐额度、重置、credits 和实际任务消耗共同决定可用量。
重置额度不是单纯送福利,它在购买一次真实使用
有人会把反复出现的额度重置理解为“平台知道大家总会撞限额,所以给一点补偿”。这当然是表层原因,但我不认为它抓住了重点。
OpenAI 更想要的,可能是用户第一次把 Codex 用到足够深。一次复杂重构、一次跨仓库排查、一次从网页问题回到代码修复的完整闭环,比十次“帮我写个函数”的试用更容易改变习惯。用户只有亲眼看到 Codex 真能把一件麻烦事推进下去,才会把它留在日常工作里。
而第一次深度使用恰好最容易被限额焦虑打断。用户会犹豫:这个任务要是消耗太多怎么办?中途没做完怎么办?下周是不是就不能用了?一次可用的重置,相当于把这层顾虑暂时拿掉,让用户先体验完整任务的价值。
所以,重置额度卖的不是一段免费算力,而是一次“不必先计算失败成本”的尝试。等用户开始依赖这种工作方式,credits 和自动充值才有意义。
这不意味着 OpenAI 的方案没有问题。按 token 计费比按消息计费更接近真实消耗,却也更难让普通人凭感觉估算。当前费率中,输入、缓存输入和输出的消耗不同;输出更长、使用更高速度模式的任务,成本也会更高。Codex Rate Card也承认,不同任务的实际消耗会有明显差异。
如果一个工具想成为日常基础设施,它得足够强,也得让用户大致知道成本从哪里来。OpenAI 现在给出了用量面板、credits 和自动充值,算是迈出了第一步;但对个人开发者而言,更重要的仍是可预测性,而不是某次活动赠送了多少。
这套组合拳确实在提高用户好感:模型能力给人一个继续用下去的理由,重置额度降低第一次重度使用的顾虑,取消固定五小时节奏则让长任务不再总被倒计时打断。OpenAI 6 月公布的数据已经显示,Codex 超过 500 万周活用户,比 2 月桌面端上线后增长超过 6 倍。OpenAI 的数据是当时的增长基线;按最新核实口径,Codex 活跃用户现已突破 800 万。
这个数字比任何一句“大家都在用”更直观。OpenAI 不是只靠更强的模型拉新,它也在用重置额度、降低固定时间窗口的束缚和更灵活的 credits,把尝鲜用户往持续使用者推。用户当然知道这是一种商业设计,但只要它让真实任务更容易完成,用户好感就会跟着增长。
另一边的 Claude:对中国开发者,这不是“体验不好”
写 Codex 的这一轮激励,很难绕开 Claude。它的代码能力确实很难让人假装看不见。我也理解那种心情:明明想用,项目里却不敢把它当成不可替代的一环。不是因为模型突然变弱了,而是你不知道它会怎样判断你。
从 6 月底起,中文开发者社区不断出现账号受限、申诉困难的反馈。没有公开、可信的总量统计,所以我不想把它夸大成一个精确的“封号数字”。但对一个把 Claude Code 接进日常工作的用户而言,看到这些反馈已经足够让人犹豫:账户出了问题,谁来解释原因,谁又能保证下一个不是自己?
更伤好感的是 Claude Code 那段被披露的隐藏检测逻辑。公开报道显示,它会结合系统时区、代理和潜在的中国 AI 公司关联线索,识别中国关联访问。Anthropic 将其解释为防范未授权使用、转售和模型蒸馏的实验,之后撤回了该追踪代码。
Anthropic 有它的合规与安全理由,模型蒸馏和批量滥用也不是一句“用户自由”就能打发的事。但我不接受把普通开发者一并视为需要防范的对象。安全审查、反滥用、限制敏感能力,都可以拿到台面上谈;把地区、时区和公司控制关系藏进工具的判断里,则会让用户觉得自己不是客户,而是一条待筛选的风险线索。
说得难听一点,这种做法很狗。能力再强也挡不住信任被磨掉。很多人现在把 Anthropic 简称为“A\”,不完全是在玩梗,里面有一点调侃,也有一点防备:它确实能写代码,但你不知道它在背后怎样给你分类。
Anthropic 的官方支持地区列表没有中国大陆。更进一步的是,它在 2025 年公开说明:除了不向未支持地区提供服务,它还会限制受未支持地区控制的公司;其举例直接点名中国,并将限制延伸到由这类地区总部公司直接或间接持股超过 50% 的境外实体。
当然,这不是说 OpenAI 就对中国大陆用户格外友好,或已经提供无摩擦的正式服务。它没有。本文想指出的差别是:当 OpenAI 在符合条件的用户中用模型升级、重置和 credits 鼓励深度使用时,Anthropic 选择把中国关联主体的可访问性收得更紧。对中国开发者而言,这两种策略都提醒了一件事:不要把关键工作流押在一个随时可能因地区政策、账号策略或供应商判断而失效的单一闭源服务上。
对开发者而言,模型能力、使用成本和服务可访问性共同构成工具依赖的风险。
普通开发者不必追额度,但该开始经营工作流
GPT-5.6 之后,选 Codex 不该只问“它是不是最强”。更实际的判断有四个。
第一,它能否稳定完成你原本会拖到明天的任务。比如读懂一个陌生模块、定位一次间歇性错误,或者把一个重复操作变成可运行的脚本。第二,它给出的结果是否足以抵消你审查、修改和返工的时间。第三,当你把它用于真实项目时,额度和成本是否仍然可预测。第四,它的服务可用性是否足够稳定,不会因为地区、账户或供应商策略突然打断你的工作流。
这四个问题比任何一张模型排行榜都更接近实际使用。免费的重置可以拿来尝试一次完整任务,但不值得为了消耗它而强行制造任务;credits 可以解决中断,却不该替代对任务边界的管理。
我会建议把 Codex 用在“上下文多、重复性高、验证路径清楚”的事情上:先让它读项目并给出计划,再要求它只改一个小范围,最后自己审查 diff 和测试结果。这样既能看到模型是否真的帮上忙,也能知道一次有价值的协作大概会消耗多少。
GPT-5.6 带来的变化,最终不只是 Codex 又聪明了一点。它让 AI 编程工具进入了一个更现实的阶段:开发者要开始决定,哪些工作值得交给它,哪些成本值得承担,以及在工具的能力、费用和可访问性之间,自己愿意承担多大的依赖。