截至 2026 年 9 月 22 日,官方价格页显示,Hosted Shell 和 Code Interpreter 的容器费用从 1 GB 容器每 20 分钟 0.03 美元起,模型 Token、工具调用和文件搜索还要另算。(developers.openai.com)
本周建议:先用真实任务记录 7 天 的模型 Token、容器时长、工具调用、失败重试、并发峰值和存储量,再决定是否上线。OpenAI Hosted Sandboxes 成本适合用“任务级总成本”核算,不适合只看一次模型请求价格。
这篇文章适合三类人:独立开发者,想快速上线能运行代码和生成文件的 Agent;小型团队,需要比较托管沙箱与自建执行环境;平台工程师,负责制定 Agent 预算、配额和扩容规则。
先拆清 Agents API 与执行环境
OpenAI Agents API 负责的是 Agent 编排。它管理模型调用、上下文、工具使用、会话和多 Agent 协作;Hosted Sandboxes 则提供运行代码、读写文件、安装依赖和生成产物的执行空间。官方说明中,OpenAI Hosted Sandboxes 使用标准容器费率,模型使用费用单独按照所选模型的 API 价格计算。(openai.com)
因此,你的账单至少分成三层:
- 模型成本:输入 Token、缓存输入 Token、输出 Token,以及上下文变长后的额外推理。
- 工具成本:Web Search、File Search、函数工具或外部 MCP 服务调用。
- 执行环境成本:容器内存等级、运行分钟数、最低计费时间、安装依赖和会话保留。
还有两层经常被漏掉:
- 失败成本:代码报错、工具超时、网络失败后,重试可能再次触发模型和容器费用。
- 运维成本:日志、告警、权限审查、密钥轮换、故障恢复和人工复核。
Hosted Sandboxes 适合原型、试运行和中小规模生产任务。它不代表“免费执行环境”,也不等于把全部基础设施责任转移后就没有成本。
按计费项目建立成本底表
截至本文核查日期,OpenAI 官方价格页列出了以下工具和容器价格。容器价格按容器内存档位计费;页面同时说明,符合条件的容器会按分钟计费,但每个会话有 5 分钟最低计费时间。(developers.openai.com)
| 成本项目 | 官方计费口径 | 预算时要记录什么 |
|---|---|---|
| 1 GB 容器 | 0.03 美元/20 分钟/容器 | 创建数量、实际运行分钟数、是否频繁短任务 |
| 4 GB 容器 | 0.12 美元/20 分钟/容器 | 是否因依赖安装或数据处理升级内存 |
| 16 GB 容器 | 0.48 美元/20 分钟/容器 | 大文件、并行任务、内存峰值 |
| 64 GB 容器 | 1.92 美元/20 分钟/容器 | 高内存任务是否真的需要该档位 |
| Web Search | 10 美元/1000 次调用 | 每个任务平均搜索次数及搜索内容 Token |
| File Search 存储 | 0.10 美元/GB/天,1 GB 免费 | 知识库大小、保留天数、删除策略 |
| Tool call | 2.50 美元/1000 次调用 | 函数工具、外部工具或平台动作次数 |
官方还明确指出,内置工具产生的 Token 按所选模型的 Token 价格计算;Web Search 的搜索内容 Token 也会进入模型输入侧。换句话说,一次搜索可能同时产生“工具调用费+模型输入费”。(developers.openai.com)
模型价格不要写死在业务代码里。你应当在成本表中单独记录:
模型输入成本 = 输入 Token ÷ 1,000,000 × 输入单价
模型输出成本 = 输出 Token ÷ 1,000,000 × 输出单价
缓存输入成本 = 缓存 Token ÷ 1,000,000 × 缓存单价
官方价格页当前也列出了 Codex 模型的输入、缓存输入和输出价格,但模型名称、价格和计费政策可能变化,上线前应重新核对官方模型价格表。(developers.openai.com)
⚠️ 不要把“Agents API 没有单独平台费”理解成“Agent 运行免费”。官方公告说 Agents API 本身不额外收费,但你仍需支付模型和工具使用费用;Hosted Sandboxes 还要按照标准容器费率计算。(community.openai.com)
用一次任务还原真实成本
一次云端 AI Agent 任务可以按下面的链路拆开:
用户输入
→ Agent 规划
→ 模型推理
→ 工具调用
→ 代码执行
→ 文件读写
→ 结果整理
→ 产物下载或人工复核
对应的任务成本公式可以写成:
单任务成本
= 模型输入成本
+ 模型输出成本
+ 工具调用成本
+ Web Search 成本
+ 容器运行成本
+ 文件搜索存储成本
+ 外部存储与网络成本
+ 失败重试成本
+ 人工复核成本
这里有 4 个隐性放大器。
第一,上下文会变长。Agent 连续执行多轮任务时,前面的工具结果、错误日志和文件摘要可能继续进入后续上下文。即使用户只发起一次任务,模型输入 Token 也可能增加。
第二,失败会重复计费。比如代码执行失败后,Agent 重新分析错误、再次调用工具、重新运行容器,这不是一次请求的简单延长,而是多段成本叠加。
第三,短任务可能受到最低计费时间影响。如果你为每个小任务单独创建容器,实际运行时间很短,也可能按最低计费时间计算。应记录“任务数量”和“每个任务的容器会话数量”,不要只统计总运行秒数。
第四,并发会改变成本曲线。多 Agent 并行执行时,每个子任务都可能拥有独立上下文和执行环境。并发提升了吞吐,也可能同时放大容器数量、工具调用和失败重试。
用月度变量建立预算模型
对于低频个人任务、团队日常任务和持续运行 Agent,月度预算都应从任务量变量开始,而不是先设定一个固定金额。
月度成本
= N ×(模型成本/任务 + 工具成本/任务 + 容器成本/任务)
×(1 + R)
+ 存储成本
+ 外部网络与日志成本
+ 人工复核成本
其中:
N:每月任务数;R:失败重试率;- 容器成本/任务:容器内存档位 × 计费分钟数;
- 存储成本:平均存储量 × 保留天数 × 官方存储单价;
- 并发峰值:用于判断是否需要预留更高执行容量,而不是直接乘到所有任务上。
例如,你可以分别记录以下变量:
| 运行等级 | 重点变量 | 建议预算动作 |
|---|---|---|
| 低频个人任务 | 每月任务数、单任务时长、文件大小 | 先用 Hosted Sandboxes,不急着自建 |
| 团队日常任务 | 日任务量、失败重试率、并发峰值、工具调用数 | 设置项目级配额和异常告警 |
| 持续运行 Agent | 长会话时长、并行子 Agent、存储保留、人工介入率 | 比较托管容器、自建环境和云端 Mac 的总拥有成本 |
你至少要保留一条“最坏日”数据:当天任务量、峰值并发、最长运行时间和失败次数。平均值适合估算日常成本,最坏日才决定是否会突然超预算。
用条件分支决定托管还是自建
Hosted Sandboxes 适合替代早期自建执行环境,但不适合所有生产系统。官方文档建议,当你需要自己的镜像、计算资源或私有网络时,选择自托管沙箱;自托管环境还需要你负责执行器连接、密钥隔离、环境隔离和故障处理。(developers.openai.com)
你可以按以下条件做决策:
- 若任务量仍在探索阶段,任务时长不稳定,团队没有专职运维人员,则选 Hosted Sandboxes。
- 若主要工作是运行脚本、处理文件、生成报告,且不需要私有网络,则优先选 Hosted Sandboxes。
- 若需要固定操作系统镜像、特殊系统依赖、私有数据库或内网访问,则回退到自建执行环境。
- 若并发峰值已经持续出现,容器创建和销毁成为主要开销,则重新比较长期自建成本。
- 若任务需要图形界面、macOS 工具链、Xcode 或真实 Mac 环境,则不要强行把代码执行沙箱当成云端 Mac。
- 若数据必须留在指定网络边界,或需要企业级审计、区域处理和自定义密钥策略,则先完成安全评估,再决定是否托管。
自建环境的成本不只是云主机。你还要计算镜像维护、补丁升级、执行器重连、日志采集、监控告警、扩容、故障恢复、权限配置和安全事件响应。低频任务通常承担不起这些固定成本;高并发和强合规任务则可能值得自建。
用配额控制并发和异常账单
并发提高后,预算控制的重点不是简单禁止并行,而是把并发上限、任务优先级和重试策略绑定在一起。这样才能避免吞吐提升后,容器数量和失败成本同步失控。
建议至少拆成三类:
- 探索型任务:允许较短超时、较少重试和较小文件限制。
- 批处理任务:允许排队,限制并发,优先使用可预测的输入和输出。
- 生产任务:必须记录完整审计日志,超过预算或权限范围时进入人工审批。
每类任务都设置 5 个硬限制:
- 单任务最长执行时间;
- 最大重试次数;
- 最大输入文件大小;
- 最大输出文件大小;
- 项目级并发上限。
再增加 3 个告警条件:
- 单任务成本超过历史中位数的指定倍数;
- 单小时容器数量突然上升;
- 失败重试率连续多个采样窗口升高。
OpenAI 的使用与成本页面支持查看 Usage Dashboard、请求级 Token 使用信息和项目维度数据。你应把这些记录与 Agent 自己的 task_id、session_id、container_id 和业务订单号关联起来,避免平台账单与业务成本无法对应。(help.openai.com)
如果你还需要跨区域访问外部 API,先检查网络延迟和出口策略。VPSSpark 的帮助中心可作为账号、远程环境和运维记录的入口;涉及美国东部接口访问时,也可以参考美国东部线路说明,但不要把线路产品费用混入 Hosted Sandboxes 的官方容器账单。
用 7 天采样完成上线验证
正式上线前,建议连续记录至少 7 天。这不是为了得到一个漂亮的平均数,而是为了发现长尾任务和异常重试。
每条任务至少记录:
- 任务类型;
- 输入 Token、输出 Token 和缓存 Token;
- 模型名称;
- 工具调用次数;
- Web Search 次数;
- 容器内存档位;
- 容器开始时间、结束时间和会话数量;
- 文件输入、输出和保留时间;
- 失败原因与重试次数;
- 峰值并发;
- 是否需要人工复核;
- 最终业务结果是否成功。
7 天后计算 4 个指标:
平均任务成本 = 总成本 ÷ 成功任务数
有效任务成本 = 总成本 ÷ 有效交付任务数
失败放大率 = 重试产生的成本 ÷ 初始任务成本
人工占比 = 人工复核成本 ÷ 总成本
如果“有效任务成本”明显高于“平均任务成本”,说明你的系统可能被失败任务、重复执行或人工返工拖高。此时先修复提示词、工具超时、输入格式和权限边界,再考虑迁移执行环境。
最终迁移判断
继续使用 Hosted Sandboxes,通常满足以下条件:任务量仍在变化;容器运行费用可预测;不需要私有网络;文件和密钥边界能接受;团队暂时不想承担基础设施维护。
迁移到自有执行环境,通常发生在以下情况:固定镜像和依赖越来越复杂;私有网络成为硬要求;高并发下容器成本和调度成本持续上升;你已经有成熟的监控、补丁、扩容和故障恢复能力。
迁移到云端 Mac,则是另一类决策。若 Agent 需要 macOS、Xcode、iOS 构建、桌面应用测试或真实 Apple 工具链,Linux 代码执行沙箱不是最佳长期方案。自建 Mac 的问题在于采购、闲置、远程接入、系统升级和并发排队;临时任务或测试阶段,使用 VPSSpark 的云端 Mac 环境通常更容易按项目拆分资源,但具体费用仍应以实际配置和租赁周期核算,不能拿 Hosted Sandboxes 的容器价格替代。
你可以把本文公式和 7 天字段表保存到团队预算文档,也可以在 VPSSpark帮助中心中查找 Agent 运行成本记录与远程开发环境相关资料。先把每个任务的真实成本算清,再决定继续托管、迁移自建,还是切换到更适合 Mac 工具链的云端环境。
用 VPSSpark 云端 Mac,灵活承载你的 Agent 工作负载
当 Agent 需要运行代码、处理文件或执行图形化任务时,VPSSpark 云端 Mac 可提供更完整的远程运行环境。
按实际任务量选择合适的 Mac 套餐,减少自建硬件、环境维护和闲置资源带来的额外成本。