返回 文章 apply CMS 文章

GPT-6 Astra:每小时不到6美元,就能雇一个AI工程师

GPT-6 Astra 以每小时不到 6 美元的成本,展现出可自主完成 AI 工程任务的新型模型能力。

GPT-6 AstraAI工程师代理式编码子代理管理
成长分 / 100 72 综合收获、行动、留存与影响

GPT-6 Astra:每小时不到6美元,就能雇一个AI工程师
为什么值得读基于超过 200 亿 token 的真实任务测试,而非单一基准,结论更具实践参考价值。

揭示了代理式编码模式在管理子代理、监控实验和长期项目连贯性上的实际表现。

关键洞察
  1. GPT-6 Astra 属于一类新型模型,本身就是完全合格的 AI 工程师。
  2. 它能帮助选择并训练模型、标注数据、保持流水线饱和、埋点并读取日志、一次性部署和调试整个系统。
  3. 它能分发、指挥和评估子代理,并在单个代理线程的数十亿 token 中保持连贯性。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:3461

我们没资格谈论那些,但我们获得了早期访问权限,并把它用在了我们能想到的每一个实际、真实的任务上。在消耗了超过 200 亿个 Astra token 之后,我们可以确认最令人惊讶的发现:GPT-6 Astra 属于一类新型模型1,它们本身就是完全合格的 AI 工程师。它们现在能帮助你选择并训练模型、标注数据(既帮你标注,又用你的标注进行主动学习,类似 SAM)、保持流水线饱和、埋点并读取日志、一次性部署和调试整个系统、分发并指挥和评估子代理(包括运行其他模型的代理),并在单个代理线程的数十亿 token 中保持连贯性。

每小时 6 美元这个数字可能听起来令人惊讶,但这正是我们在测试中看到的——在最高每百万 token 50 美元的费率下,每秒 33 个 token。鉴于 Astra 比 Sol 和 Fable 更节省 token(由 Artificial Analysis 独立确认),这通常意味着 Astra 同时还是你能买到的最好的快速且智能的模型(假设我们的预览延迟在正式发布时保持不变),Spark 1.3 除外。

管理子代理集群(单独调整、有界并发)

当然,如果你只是在 Ultra 上使用 Astra,你会烧掉远不止每小时 6 美元……因为它在并行化方面实在太强了。根据实际任务,我们经常并行扩展到 20-50 个代理,当然全部由一个主 Astra 代理管理。

监控自己的运行,启动和停止波次

这基本上就是你付钱让初级 AI 工程师做的事——照看运行、盯着数据、发现问题、修复、重新运行,如此循环往复。你可以花每天 200-1000 美元雇人,或者你可以花 100 美元雇 GPT-6 干两天来做这件事。

制作模型基准、处理预算、做估算、扩大运行规模、获取人工评分

因为当然,你需要所有这些能力来运行你自己的 AI 工程项目,因为当然,OpenAI 内部已经在用 GPT-6 做这件事……

或者你可以让 Astra 轻松搭建你自己的个人 Arena.ai 克隆,用于调整你的提示词、为你的任务挑选模型,或者对齐你自己的偏好模型!

你应该得出的总体结论是,OpenAI 显然训练出了一个能够自动化其自身大部分 AI 工程工作的模型,而现在是时候让你学会利用 Astra 和 Fable 级模型,并对你现在能用代理做什么抱有远远、远远更不合理的期望了。

我们正在 Grok、Fable 和其他类似的前沿模型上开展类似工作,但 OpenAI 在试用限制上最为慷慨,所以有了这篇报告——不过这里讨论的代理式编码模式很可能适用于所有此类 2026 年末的前沿模型。

这次测试的规模使这些发现尤其有用。管理子代理、监控实验以及在长期项目中保持连贯性的能力,感觉比任何单一基准都更重要。我仍然会在可靠完成工作的层面上比较成本,包括人工审查和运营风险,而不仅仅是模型运行时间。

让我犹豫的是 SaaS 替代那部分——构建你自己的 GitHub+Vercel 很有趣,直到写出它的模型发布了新版本,而你突然成了自己从未真正理解的代码的维护者。每小时 6 美元租的是工程师,但你最终拥有的代码库才是真正的订阅。