Asana 用 GPT-6 Astra 优化浏览器智能体,GPT-6.1 Sol 测试成本降低 76 倍
Asana cuts model costs 76x in browser tests with GPT-6.1 Sol
Asana 使用 Codex 中的 GPT-6 Astra 优化 StackAI 浏览器智能体在 GPT-6.1 Sol 上的工作流,使测试中的模型成本降低 76 倍、运行速度提升 5 倍。
这项案例拆解了浏览器智能体的成本瓶颈,并展示缓存历史、扩大历史容量和批量清理截图如何共同改善成本与运行时间。
Asana 在浏览器测试中使用 GPT‑6.1 Sol 将模型成本降低 76 倍
在 Codex 中使用 GPT‑6 Astra,Asana 在测试中让其浏览器代理的成本降低 76 倍、速度提升 5 倍,从而能够为客户提供能力更强的模型。

公司规模:大型企业
地区:北美
行业:科技
产品:Codex
76 倍
使用优化后的 GPT-6.1 Sol 工作流,预估模型成本降低
5 倍
使用优化后的 GPT-6.1 Sol 工作流,浏览器运行速度提升
$0.47
使用优化后的 GPT-6.1 Sol 工作流,平均预估模型成本
收听文章 5:37
分享
借助 Codex 中运行实验的 GPT‑6 Astra,Asana 优化了浏览器代理在 GPT‑6.1 Sol 上的工作流,使其成本降低 76 倍、速度提升 5 倍。
Asana 通过其StackAI(在新窗口中打开)平台,帮助客户在各类业务应用中实现工作自动化。该平台是 Asana收购的(在新窗口中打开)。借助 StackAI,客户无需编写代码即可构建工作流,用于浏览网站、填写表单和收集信息。在 Asana 的规模下,这些工作流中的微小低效都会累积起来。
Asana 的 StackAI 首席技术官 Frank Hidalgo 博士着手提高浏览器代理的运行速度并降低成本。他让 Codex 中的 GPT‑6 Astra 调查该代理、测试改进方案并比较结果。据他估计,手动完成这些工作需要一到两个月,而实际只花了一周左右。
Asana 的 144 次运行研究(在新窗口中打开)测试了 GPT‑6.1 Sol 和另外三个前沿模型,本文中称为模型 A、B 和 C。最终形成的 GPT‑6.1 Sol 优化工作流,平均每次运行的预估模型成本为 0.47 美元,耗时约四分钟;与使用模型 B 的原始生产配置相比,成本降低 76 倍,速度提升 5 倍。
“这就是人类团队与智能体团队在实践中的运作方式。工程师确定方向,GPT-6 Astra 运行实验,结果再通过 Command 投入生产。这展示了 Asana 如何让人类与智能体团队协同运作。”
——Asana 首席产品官 Arnab Bose
使用 GPT‑6 Astra 找出浏览器代理的低效之处
为了加快进度,Hidalgo 首先使用 Codex 中的 GPT‑6 Astra 梳理代码库,并说明代理如何构建每个模型请求。GPT‑6 Astra 发现,代理会缓存固定指令和工具定义,却不会缓存不断增长的页面文本和屏幕截图历史,因此每次请求都会以全价重新发送这些历史记录。
代理还会在几乎每一步丢弃旧屏幕截图并删减文本。每次修改都会改变历史记录,因此仅缓存历史记录并无帮助;丢失这些信息还可能迫使代理重新访问已经读过的页面。
借助 GPT‑6 Astra,将预计两个月的研究缩短至一周
Hidalgo 审查了 GPT‑6 Astra 提出的修复方案,并选出三项进行测试:
将缓存范围扩展至代理的浏览历史
增加代理可保留的文本量
改为分批移除屏幕截图,而不是每一步都移除
GPT‑6 Astra 首先进行快速测试,以确定哪些变量会产生影响。由于代码并非为受控实验而设计,随后它对代码进行了重构,使一个前端和一个后端能够并行支持多种工作流,且每种工作流都可使用各自的设置。
Astra 完成了整项研究:历史记录预算分别为 120,000 和 480,000 个字符,并采用六种缓存和截图策略;每种策略都在四个模型上分别测试了三次(见下表)。表现最佳的策略是允许截图累积到 20 张,然后再删减到只保留最新的一张。这样一来,每次删除之间的较长时间内,较早的历史记录都能保持不变。结合更大的历史记录预算,这便构成了优化后的工作流。每种配置执行的任务都相同:从一个公开的演示目录中,为 32 本书各收集六个字段;这代表了部分 Asana 客户在 StackAI 上运行的任务。
| 模型 | 说明 | 价格 |
|---|---|---|
| 模型 A | 另一家前沿实验室推出的较小、价格较低的模型,于 2025 年秋季发布 | 价格为 GPT‑6.1 Sol 的一半 |
| 模型 B | 最初用于生产环境的模型,与模型 A 来自同一家实验室,于 2026 年夏季发布 | 与 GPT‑6.1 Sol 价格相同 |
| 模型 C | 模型 B 的更新版本,于 2026 年秋季发布 | 与 GPT‑6.1 Sol 价格相同 |
| GPT‑6.1 Sol | OpenAI 的模型 |
GPT‑6 Astra 运行了这些工作流,并检查了请求、使用记录和输出;另有独立的模型会话审查了相关工作。每个会话的请求、数据轨迹和结果都记录在 Asana 的软件交付平台 Command(在新窗口中打开) 中,方便团队之后审查整项研究。团队通过 Command 将研究发现转化为工单,再转为拉取请求,最终将改动部署到生产环境。
“如果手动完成,这需要我一到两个月。使用 Codex 中的 GPT-6 Astra,只花了大约一周:我会在睡觉前设置一个 /goal,早上再查看结果。”
—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官
将模型成本降至每次运行 0.50 美元以下
对于模型 B,优化将估算的模型成本从每次运行至少 36.21 美元(部分原始运行在完成前就达到了步骤上限)降至 1.24 美元,成本降低了 29 倍。GPT‑6.1 Sol 上的优化工作流还要便宜 2.6 倍,每次运行仅为 0.47 美元。优化工作流的每次运行都完成了任务并返回正确答案。
三次运行的平均值。≥:基线数据包含达到上限的运行,因此其平均值是下限。
右侧两处折叠线表示与优化后的模型 B 相比。模型 B 在研究第一阶段运行;模型 C 和 Sol 6.1 在同一项研究的第二阶段运行(虚线)。
仅使用 GPT‑6.1 Sol 并采用更大的历史记录预算时,新的缓存和截图策略将成本降低了 4 倍,从每次运行 1.97 美元降至 0.47 美元。每次调用的成本约降低了 3 倍,因为 89% 的输入来自缓存,缓存价格仅为未缓存价格的 5%。运行速度也有所提升:模型 B 在原始设置下至少需要 22.5 分钟,而 GPT‑6.1 Sol 的优化工作流约需四分钟。
三次运行的平均值,SD 误差线。≥:平均值包含达到上限或未完成的运行,因此实际值至少为该数值。
柱形使用蓝色主题。比较缓存效果时,请参照较大预算的 480k 柱形。
运行标记和 SD 误差线是根据源图像近似还原的;底层运行值和标准差不可用。
三次运行的平均值,SD 误差线。≥:平均值包含达到上限或未完成的运行,因此实际值至少为该数值。
柱形使用蓝色主题。比较缓存效果时,请参照较大预算的 480k 柱形。
运行标记和 SD 误差线是根据源图像近似还原的;底层运行值和标准差不可用。
调查还显示,历史记录管理会影响智能体是否能够生成答案。给 GPT‑6.1 Sol 更多空间保留浏览历史后,生成答案的运行次数从较小历史记录预算下的 18 次中 3 次,提升到较大预算下的 18 次全部成功,且答案均正确。对 Hidalgo 来说,这项工作的商业价值在于让客户能够使用更快、能力更强的模型,同时保持运营成本可持续。
“成本曾经限制了我们能为客户提供哪些模型来处理这些工作负载。通过提高智能体的效率,我们可以为客户提供更好、更快的模型,同时降低运营成本。”
—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官
扩大实验与产品测试规模
Asana 已在 StackAI 中发布浏览器导航方面的改进,并正在开发工具,让类似实验更容易重复开展。团队计划逐步将这类测试纳入平台评估,让客户和内部团队在配置智能体时能够比较成本、运行时间和答案质量。
“交付速度已不再是瓶颈;人的注意力才是。我们正接近这样一个时代:每位工程师都是一名产品经理,带领一支智能体团队。”
—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官
Asana 目前正在 Codex 中使用 GPT‑6 Astra,在产品功能发布前进行测试:Astra 会浏览平台、尝试不同输入,并报告错误,供人工质量保证审核人员检查。Hidalgo 认为,这是新型软件开发生命周期的基础,届时许多云端智能体会话将并行测试各项功能。
完整研究请参阅Asana(在新窗口中打开)和StackAI(在新窗口中打开)博客。
加入工作新时代
全球有超过 100 万家企业正借助 OpenAI 取得切实成果。
继续阅读

Oracle 如何借助 ChatGPT 和 Codex 将数天工作缩短至数分钟 2026 年 10 月 8 日

1Password 借助 Codex 将工程效率提升 21% 2026 年 9 月 8 日

loveholidays 如何借助 Codex 让每个人都能成为创造者 2026 年 8 月 26 日
研究
最新进展
安全
产品
- ChatGPT(在新窗口中打开)
- ChatGPT Business(在新窗口中打开)
- ChatGPT Enterprise(在新窗口中打开)
- ChatGPT 教育版(在新窗口中打开)
- Codex
- Dots(在新窗口中打开)
- 发行说明
API 平台
商业
开发者
公司
支持
更多
条款与政策
(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)
OpenAI © 2015–2026 您的隐私选项
英语 美国
来源:OpenAI News · openai.com