很多人打开 Codex CLI 配置完全指南 后,真正犹豫的不是能不能跑通,而是 Codex 用 gpt-5 系列模型到底贵不贵。这个问题不能只看单次请求,因为 Codex CLI 的成本由输入 token、输出 token、上下文长度、重试次数共同决定。短任务通常很便宜,长上下文任务会突然变贵。
先给结论:日常任务不贵,长上下文会拉开差距
如果只是让 Codex CLI 解释一个文件、补几行代码、修一个明确报错,gpt-5 系列通常比直觉便宜。以常见公开区间为例:短上下文输入约 $0.10-$0.30 / 1M tokens,输出约 $1.00-$2.50 / 1M tokens。一次 20k 输入、2k 输出的任务,成本大约 $0.004-$0.011。一天 50 次,也就 $0.2-$0.55。

但 Codex CLI 不是纯聊天。它会把仓库结构、错误日志、工具说明、之前对话塞进上下文。一旦输入超过长上下文阈值,单价可能跳到 $0.40-$0.80 / 1M tokens。同样 200k 输入、3k 输出,可能从几分钱变成 $0.10-$0.16。差距不在模型名,而在上下文是否被撑大。
短输入和长输入的计价差异要拆开看
可以把计价想象成两段路:短输入段负责常规问答,长输入段负责大仓库、长日志、多轮工具调用。gpt-5 系列的贵不贵,主要看平均输入落在哪一段。
短输入任务:
输入 18,000 tokens,输出 2,500 tokens
若 input $0.125 / 1M,output $1.00 / 1M
成本 ≈ 18,000 / 1,000,000 × $0.125 + 2,500 / 1,000,000 × $1.00
≈ $0.00225 + $0.0025
= $0.00475
长上下文任务:
输入 220,000 tokens,输出 4,000 tokens
若长档 input $0.60 / 1M,output $1.50 / 1M
成本 ≈ 220,000 / 1,000,000 × $0.60 + 4,000 / 1,000,000 × $1.50
≈ $0.132 + $0.006
= $0.138
从 $0.005 到 $0.138,差了近 30 倍。有人觉得 Codex 很便宜,是因为任务一直停在短输入区;有人一天花掉几美元,是被长上下文拖进了高价区。
一个真实 Codex 任务的成本估算
拿修一个 Python 测试失败举例。Codex CLI 需要先读仓库说明,再运行测试,读取 traceback,修改测试或源码,再跑一次。假设第一轮输入包含系统提示、仓库摘要、相关文件片段和错误日志,共 30,000 tokens;输出 diff 和解释 3,500 tokens。按短档 $0.125/$1.00 估算,成本约 $0.0074。
真实使用很少一轮结束。第二轮要读修改后的文件,第三轮要看测试通过日志。三轮累计输入可能达到 85,000 tokens,输出 9,000 tokens,成本约 $0.0196。如果其中一轮把长日志全部带入上下文,进入长档,成本可能再翻一倍。你可以先在 模型价格表 里核对当前分组倍率,再决定要不要用 gpt-5 系列处理大仓库任务。
配置片段:先确认走哪个分组
在 Codex CLI 配置里,模型名和 api_base 会直接决定单价。一个可验证的配置片段如下:
# ~/.codex/config.toml
model = 'gpt-5'
api_base = 'https://api.yushou.xyz/v1'
max_context = 'auto'
如果你把 model 换成更便宜的分组,成本会下降;但如果任务本身需要长上下文,便宜分组未必更省,因为它可能把上下文截断,导致你反复补文件。
怎么判断成本是被长上下文吃掉的
看账单时不要只看总 token,要看输入占比。Codex CLI 的输入往往比聊天大很多。常见信号包括:输出只有几百 token,输入却有几万 token;同一仓库重复提问,每次 input 都在 20k 以上;任务失败后继续追问,历史对话不断累积;一次运行多个工具,日志和 diff 都进入上下文。
如果这些同时出现,成本大概率不是 gpt-5 本身贵,而是上下文管理太粗。给 Codex CLI 喂信息时,尽量只放相关文件。修一个测试,不需要把整个 README、所有源码、所有配置都塞进去。可以用命令行限定范围:
codex -m gpt-5 '只读取 tests/test_parser.py 和 src/parser.py,解释测试失败原因'
这条命令的关键不是 gpt-5,而是“只读取”。它把输入从几万 token 压到几千 token。若你走第三方 API,遇到 401 或 base_url 不通,可看 第三方 API 配置避坑。
到底贵不贵:按使用方式分三档
第一档,轻量问答:一天 20-50 次,平均输入 15k 以内,gpt-5 系列基本可以忽略成本。第二档,中等代码修改:一天 10-20 次,每次 30k-80k 输入,成本可能在 $0.1-$0.6。第三档,大型仓库或多文件重构:单次输入 100k 以上,且多轮累积,可能 $0.2-$1.0 一次。它不是一定贵,而是必须用上下文预算来管。
按月看更直观。假设每周有 8 次大仓库分析,每次输入 150k、输出 5k,按长档 $0.50/$1.20 估算,一次约 $0.081,一个月约 $2.6。再加上 60 次小任务,每次 $0.006,一个月约 $0.36。总成本不到 $3。这个价格对日常开发不算离谱,但前提是你没有把整仓库日志反复塞进去。
如果你只是想稳定跑 Codex CLI,又不想被长上下文账单吓到,可以先按 配置教程 选一个合适分组,再检查模型、api_base、上下文长度和重试策略。最后,如果你打算把这类调用接到自己的开发流程里,可以先用 寓守API 看一下当前单价与分组倍率,再决定 gpt-5 系列是否适合长期跑 Codex。
相关阅读:把主题读全
寓守API:一个 Key 调用 Claude / GPT / Gemini