跳到正文
OpenAI News·· 14 小时前精选AI 评分60

Asana 用 GPT-6 Astra 优化浏览器智能体,GPT-6.1 Sol 测试成本降低 76 倍

Asana cuts model costs 76x in browser tests with GPT-6.1 Sol

AI 导读

Asana 使用 Codex 中的 GPT-6 Astra 优化 StackAI 浏览器智能体在 GPT-6.1 Sol 上的工作流,使测试中的模型成本降低 76 倍、运行速度提升 5 倍。

推荐理由

这项案例拆解了浏览器智能体的成本瓶颈,并展示缓存历史、扩大历史容量和批量清理截图如何共同改善成本与运行时间。

正文 · AI 翻译

Asana 在浏览器测试中使用 GPT‑6.1 Sol 将模型成本降低 76 倍

在 Codex 中使用 GPT‑6 Astra,Asana 在测试中让其浏览器代理的成本降低 76 倍、速度提升 5 倍,从而能够为客户提供能力更强的模型。

联系销售

Image 1: White Asana logo over a blue layered-paper texture.

公司规模:大型企业

地区:北美

行业:科技

产品:Codex

76 倍

使用优化后的 GPT-6.1 Sol 工作流,预估模型成本降低

5 倍

使用优化后的 GPT-6.1 Sol 工作流,浏览器运行速度提升

$0.47

使用优化后的 GPT-6.1 Sol 工作流,平均预估模型成本

收听文章 5:37

音频 1

分享

借助 Codex 中运行实验的 GPT‑6 Astra,Asana 优化了浏览器代理在 GPT‑6.1 Sol 上的工作流,使其成本降低 76 倍、速度提升 5 倍。

Asana 通过其StackAI⁠(在新窗口中打开)平台,帮助客户在各类业务应用中实现工作自动化。该平台是 Asana收购的(在新窗口中打开)。借助 StackAI,客户无需编写代码即可构建工作流,用于浏览网站、填写表单和收集信息。在 Asana 的规模下,这些工作流中的微小低效都会累积起来。

Asana 的 StackAI 首席技术官 Frank Hidalgo 博士着手提高浏览器代理的运行速度并降低成本。他让 Codex 中的 GPT‑6 Astra 调查该代理、测试改进方案并比较结果。据他估计,手动完成这些工作需要一到两个月,而实际只花了一周左右。

Asana 的 144 次运行研究⁠(在新窗口中打开)测试了 GPT‑6.1 Sol 和另外三个前沿模型,本文中称为模型 A、B 和 C。最终形成的 GPT‑6.1 Sol 优化工作流,平均每次运行的预估模型成本为 0.47 美元,耗时约四分钟;与使用模型 B 的原始生产配置相比,成本降低 76 倍,速度提升 5 倍。

“这就是人类团队与智能体团队在实践中的运作方式。工程师确定方向,GPT-6 Astra 运行实验,结果再通过 Command 投入生产。这展示了 Asana 如何让人类与智能体团队协同运作。”

——Asana 首席产品官 Arnab Bose

使用 GPT‑6 Astra 找出浏览器代理的低效之处

为了加快进度,Hidalgo 首先使用 Codex 中的 GPT‑6 Astra 梳理代码库,并说明代理如何构建每个模型请求。GPT‑6 Astra 发现,代理会缓存固定指令和工具定义,却不会缓存不断增长的页面文本和屏幕截图历史,因此每次请求都会以全价重新发送这些历史记录。

代理还会在几乎每一步丢弃旧屏幕截图并删减文本。每次修改都会改变历史记录,因此仅缓存历史记录并无帮助;丢失这些信息还可能迫使代理重新访问已经读过的页面。

借助 GPT‑6 Astra,将预计两个月的研究缩短至一周

Hidalgo 审查了 GPT‑6 Astra 提出的修复方案,并选出三项进行测试:

  • 将缓存范围扩展至代理的浏览历史

  • 增加代理可保留的文本量

  • 改为分批移除屏幕截图,而不是每一步都移除

GPT‑6 Astra 首先进行快速测试,以确定哪些变量会产生影响。由于代码并非为受控实验而设计,随后它对代码进行了重构,使一个前端和一个后端能够并行支持多种工作流,且每种工作流都可使用各自的设置。

Astra 完成了整项研究:历史记录预算分别为 120,000 和 480,000 个字符,并采用六种缓存和截图策略;每种策略都在四个模型上分别测试了三次(见下表)。表现最佳的策略是允许截图累积到 20 张,然后再删减到只保留最新的一张。这样一来,每次删除之间的较长时间内,较早的历史记录都能保持不变。结合更大的历史记录预算,这便构成了优化后的工作流。每种配置执行的任务都相同:从一个公开的演示目录中,为 32 本书各收集六个字段;这代表了部分 Asana 客户在 StackAI 上运行的任务。

模型 说明 价格
模型 A 另一家前沿实验室推出的较小、价格较低的模型,于 2025 年秋季发布 价格为 GPT‑6.1 Sol 的一半
模型 B 最初用于生产环境的模型,与模型 A 来自同一家实验室,于 2026 年夏季发布 与 GPT‑6.1 Sol 价格相同
模型 C 模型 B 的更新版本,于 2026 年秋季发布 与 GPT‑6.1 Sol 价格相同
GPT‑6.1 Sol OpenAI 的模型

GPT‑6 Astra 运行了这些工作流,并检查了请求、使用记录和输出;另有独立的模型会话审查了相关工作。每个会话的请求、数据轨迹和结果都记录在 Asana 的软件交付平台 Command⁠(在新窗口中打开) 中,方便团队之后审查整项研究。团队通过 Command 将研究发现转化为工单,再转为拉取请求,最终将改动部署到生产环境。

“如果手动完成,这需要我一到两个月。使用 Codex 中的 GPT-6 Astra,只花了大约一周:我会在睡觉前设置一个 /goal,早上再查看结果。”

—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官

将模型成本降至每次运行 0.50 美元以下

对于模型 B,优化将估算的模型成本从每次运行至少 36.21 美元(部分原始运行在完成前就达到了步骤上限)降至 1.24 美元,成本降低了 29 倍。GPT‑6.1 Sol 上的优化工作流还要便宜 2.6 倍,每次运行仅为 0.47 美元。优化工作流的每次运行都完成了任务并返回正确答案。

三次运行的平均值。≥:基线数据包含达到上限的运行,因此其平均值是下限。

右侧两处折叠线表示与优化后的模型 B 相比。模型 B 在研究第一阶段运行;模型 C 和 Sol 6.1 在同一项研究的第二阶段运行(虚线)。

仅使用 GPT‑6.1 Sol 并采用更大的历史记录预算时,新的缓存和截图策略将成本降低了 4 倍,从每次运行 1.97 美元降至 0.47 美元。每次调用的成本约降低了 3 倍,因为 89% 的输入来自缓存,缓存价格仅为未缓存价格的 5%。运行速度也有所提升:模型 B 在原始设置下至少需要 22.5 分钟,而 GPT‑6.1 Sol 的优化工作流约需四分钟。

三次运行的平均值,SD 误差线。≥:平均值包含达到上限或未完成的运行,因此实际值至少为该数值。

柱形使用蓝色主题。比较缓存效果时,请参照较大预算的 480k 柱形。

运行标记和 SD 误差线是根据源图像近似还原的;底层运行值和标准差不可用。

三次运行的平均值,SD 误差线。≥:平均值包含达到上限或未完成的运行,因此实际值至少为该数值。

柱形使用蓝色主题。比较缓存效果时,请参照较大预算的 480k 柱形。

运行标记和 SD 误差线是根据源图像近似还原的;底层运行值和标准差不可用。

调查还显示,历史记录管理会影响智能体是否能够生成答案。给 GPT‑6.1 Sol 更多空间保留浏览历史后,生成答案的运行次数从较小历史记录预算下的 18 次中 3 次,提升到较大预算下的 18 次全部成功,且答案均正确。对 Hidalgo 来说,这项工作的商业价值在于让客户能够使用更快、能力更强的模型,同时保持运营成本可持续。

“成本曾经限制了我们能为客户提供哪些模型来处理这些工作负载。通过提高智能体的效率,我们可以为客户提供更好、更快的模型,同时降低运营成本。”

—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官

扩大实验与产品测试规模

Asana 已在 StackAI 中发布浏览器导航方面的改进,并正在开发工具,让类似实验更容易重复开展。团队计划逐步将这类测试纳入平台评估,让客户和内部团队在配置智能体时能够比较成本、运行时间和答案质量。

“交付速度已不再是瓶颈;人的注意力才是。我们正接近这样一个时代:每位工程师都是一名产品经理,带领一支智能体团队。”

—Frank Hidalgo,博士,Asana 的 StackAI 首席技术官

Asana 目前正在 Codex 中使用 GPT‑6 Astra,在产品功能发布前进行测试:Astra 会浏览平台、尝试不同输入,并报告错误,供人工质量保证审核人员检查。Hidalgo 认为,这是新型软件开发生命周期的基础,届时许多云端智能体会话将并行测试各项功能。

完整研究请参阅Asana⁠(在新窗口中打开)和StackAI⁠(在新窗口中打开)博客。

加入工作新时代

全球有超过 100 万家企业正借助 OpenAI 取得切实成果。

联系销售团队

继续阅读

Image 2: Oracle — Cover

Oracle 如何借助 ChatGPT 和 Codex 将数天工作缩短至数分钟 2026 年 10 月 8 日

Image 3: 1Password > Card image > Fiber ridge close-up

1Password 借助 Codex 将工程效率提升 21% 2026 年 9 月 8 日

Image 4: loveholidays customer story art card v4

loveholidays 如何借助 Codex 让每个人都能成为创造者 2026 年 8 月 26 日

研究

最新进展

安全

产品

API 平台

商业

开发者

公司

支持

更多

条款与政策

(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)(在新窗口中打开)

OpenAI © 2015–2026 您的隐私选项

英语 美国

来源:OpenAI News · openai.com