IT加油站

GPT-6 Astra Ultrafast提速至300词元

18浏览 • 14小时前 • 科技综合 • MA124288

事件日=9月30日 距交付1天 标题去空格=29字符 素材来源=无可用官方素材

OpenAI 在 9 月 30 日的 2026 年开发者日(DevDay)上推出名为 Ultrafast 的新服务层级,主打词元(Token)生成速度。官方给出的口径是:在 Codex 中最高可提供 8 倍词元生成速度,走 API 调用时最高 6 倍;具体到 GPT-6 Astra Ultrafast,OpenAI 称其在 Codex 中可实现每秒 300 个词元。

来源:IT之家 9 月 30 日报道 https://www.ithome.com/1/008/524.htm

速度:Codex 拿到 8 倍,API 只有 6 倍

同样是 Ultrafast,两条通道的加速幅度并不一致——Codex 侧最高 8 倍,API 侧最高 6 倍。每秒 300 词元这个数字是按 Codex 场景给出的,API 调用方拿到的实际吞吐会低于它。对开发者来说,这意味着想吃满这波速度提升,路径是走 Codex,而不是把模型直接搬到自己的推理管线里。

官方还提到,Ultrafast 后续将推出 GPT-6.1 Sol Ultrafast 版本,目前公开信息只有这一个名字。

API 定价:输出每百万词元 300 美元起

IT之家查询到的 gpt-6-astra API 售价如下,按输入长度分为两档(分界线为输入是否超过 272K Token):

  • 短上下文(输入 < 272K Token):输入 $60.00 / 1M tokens,输出 $300.00 / 1M tokens
  • 长上下文(输入 > 272K Token):输入 $120.00 / 1M tokens,输出 $450.00 / 1M tokens
  • 缓存输入:短上下文 $6.00 / 1M tokens,长上下文 $12.00 / 1M tokens
  • 缓存写入:短上下文 $75.00 / 1M tokens,长上下文 $150.00 / 1M tokens

把两档放一起看有个细节:长上下文把输入价直接翻倍,输出价却只从 $300 涨到 $450,上浮五成。也就是说,超长上下文任务的成本压力主要落在输入侧,输出侧并没有同比例加码。

缓存经济学:命中缓存的输入只有原价十分之一

缓存输入 $6.00 对应基础输入 $60.00,正好是十分之一;缓存写入 $75.00 则是基础输入的 1.25 倍。这套定价的逻辑很直白:第一次把一段输入内容存进提示词缓存要额外多付 25%,之后每次命中都按一折计费。长上下文档同样保持这个比例($12 / $120 / $150)。

对频繁复用同一份系统提示、代码库上下文或长文档的工作负载,缓存命中率几乎决定了实际账单量级;反之,一次性调用走缓存写入反而是净亏。

可用范围:API 已开放,订阅侧限 Pro 500 与企业

Ultrafast 已开放 API 调用。订阅侧,Pro 500 用户和企业用户可以在 ChatGPT Work 与 Codex 中体验该层级。OpenAI 帮助中心此前确认,GPT-6 Astra 是 Work 与 Codex 中功能最强的模型,其推出期为 2026 年 9 月 3 日至 9 月 4 日,并在那段时间提供额外的用量重置。

综合定价与速度两组数据,Ultrafast 更像是给两类人准备的:一类是在 Codex 里跑大规模代码生成、对等待时间敏感的重度用户,一类是输入高度可复用、能把缓存命中率做高的 API 集成方。输出每百万词元 300 美元起步的价格,也意味着它短期内不会是低频调用场景的默认选项。

#OpenAI #GPT-6 #Codex #Ultrafast