我们在 AEO 中进行的朴素自动研究投资已经产生了令人印象深刻的 ROI,因此自然而然地,是时候认真对待它了。我们受到了《Claude Code 实际会选择什么》的启发,并决定按照我们的偏好对其进行扩展/调整。
在经过数十亿 token的原型设计、对齐和扩展流程之后,这就是 Latent Space Frontier AEO 追踪器。我们的
方法论扩展了
AmplifyingAI 的,在 7 个
1(开启搜索)上运行 6 种提示变体,覆盖 161 个
类别,从
ASR 模型,甚至到一些古怪的类别,比如
企业支出以及
薪资软件。
答案提取由 Astra 完成,并针对一项专有的 AEO 评分进行打分,该评分对首选、备选、提及赋予权重,但也会对轻微和强烈的反推荐赋予负权重(这类情况虽少见,但确实存在)。因为我们知道你会需要,我们还提取了影响 Agent 推荐结果的被引用最多的来源,以及对主要失败案例的分析。
基本结果
以下是全球(各自类别中)最具主导地位的产品:
其中有一些熟悉的名字——这引出了一个自然的问题:数据污染,而我们已经对此进行了检查。由于我们没有什么可隐瞒的,每一对提示词与答案都是可检查的。
然而,偏见确实存在——当模型被要求推荐编程 Agent 时,Fable/Opus 喜欢 Claude Code,Sol/Astra 喜欢 Codex,Grok 喜欢 Cursor,Muse 喜欢 Muse Code,SWE-1.7 喜欢 Devin,等等。我想知道为什么。你也可以看到其他“软偏见”浮现出来……
话虽如此,也有一些值得注意的例子:GPT 模型推荐 Claude,这是一种值得称赞的无偏见表现:
有28 个类别(在我们总共 161 个类别中)在所有受调查的前沿模型中都有一个普遍占主导的首选。
还有更多“势均力敌的竞争”和“永远是伴娘,从未是新娘”的类别,这些应当成为关键的 AEO 战场。
Sol 对 Astra,Opus 对 Fable
新模型类别的新预训练代表着一个新机会,可以借此检视各实验室在其数据和 RL 优先级上正朝着什么方向前进,并检视初创公司在 AEO 上的投资是否正在获得回报。我们准备了特别报告来分析我们的排名,观察同一实验室不同模型代际之间模型选择上非常重大的翻转。
我们有单独的 Opus→Fable 和 Sol→Astra 摘要页面。对于某些翻转,我们重点呈现了中立分析,说明竞争对手在每种场景中做得更好的地方。
效率对置信度,以及推荐来源
我们在 Sol→Astra 与 Opus→Fable 之间最令人惊讶的发现之一是,Anthropic 似乎正在让其模型偏向于搜索更多来源(Sol 中位数为 9 个来源,Astra 中位数为 5 个,Opus 中位数为 11 个来源,Fable 为 15 个)。Astra 似乎总体上要“自信”得多,或者说“高效”得多,取决于你怎么看——当你稍微改写问题时,Astra 改变主意的可能性要低得多。随着选择随机性的下降,AEO 的价值本身也随之上升。
来源分析也在一定程度上强烈预测了各家实验室优先做什么、不优先做什么。
然而,这里的样本量很小,而且只代表我们能从尝试的工具调用中抓取到的内容,而非预训练数据集。我们能够验证的是,由 Ora 和 Vercel 衡量的 AEO 实践,比如 markdown 内容协商,是真实存在的,而失败会阻碍模型阅读你的内容。
仅供娱乐
以下是根据 LLM 得出的世界顶级天使投资人(还有一些去重工作待做……)。
查看更多
我们还做了一个小小的家庭问答类游戏,你可以在其中看看自己的先验认知是否与数据相符。很有趣!
如果感兴趣,我们愿意接受进一步的建议和商业咨询来开发这个项目。请联系 @latentspacepod 或发送邮件至 [email protected](我们现在有商务经理了!哇!)
正如我们在方法论文章中所指出的,我们确实非常努力地想要纳入 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode,但错误和速率限制使它们无法被纳入这第一轮分析。如果您代表这些公司,请告诉我们如何提高限制。
