Cursor 是一个由研究团队构建的 AI 驱动编码平台,该团队训练智能编码模型并将其投入生产,平台具备持续的背景智能。当开发者输入代码时,Cursor 会维护一个实时代码上下文模型——实时预测编辑、重构代码并管理上下文。
要提供这种体验,需要在编辑器的反馈循环内做出响应。这一约束将服务问题从批量式推理转变为实时、低延迟推理。Cursor 与 AI 原生云 Together AI 合作,为此循环构建基础设施——使用 NVIDIA Blackwell 架构并调整推理栈以满足严格的延迟目标。
为什么编辑器内的延迟不同
编辑器内的智能体在开发者积极编辑时生成输出,因此时机决定了建议是否落在模型生成时所使用的同一局部上下文中。一旦开发者移动到代码的不同区域,输出通常不再与它原本要支持的状态对齐。
在 Cursor 中,这些智能体在开发者继续工作时调试问题、生成功能并执行重构。这种工作负载需要可预测的最坏情况延迟(在并发下)、跨重叠请求的一致上下文处理,以及在持续负载下的稳定运行。
在 NVIDIA Blackwell 上的工程实践
为了大规模满足延迟预算,团队选择了 NVIDIA Blackwell GB200 NVL72 和 NVIDIA HGX™ B200,它们具有更高的内存带宽和张量吞吐量,以支持更快的服务。在生命周期早期部署生产工作负载意味着要在整个栈——硬件、固件、主机软件和服务层——推动可靠性和优化。
使用 NVIDIA Blackwell 的前沿基础设施:Together AI 与 Cursor 合作,交付并协作 NVIDIA Blackwell 的早期部署。对于 Cursor,早期硬件访问是一个产品优势,Together 工程师致力于快速升级和替换,以交付这一新的前沿基础设施。这些努力使这些新芯片快速可靠地供 Cursor 使用。
在 ARM 主机上的全吞吐量:GB200 NVL72 将 GPU 与基于 ARM 指令集的 NVIDIA Grace™ CPU 配对。许多高性能推理生态系统假设 x86 主机。将推理栈移植到 ARM 需要对 GB200 NVL72 进行内核和主机级调优。
针对 Blackwell Tensor Core 的自定义内核:Blackwell 引入了针对低精度格式优化的新 Tensor Core 指令。Together AI 为 Blackwell 构建了内核,直接针对这些指令,捕获了更多硬件吞吐量。
跨 NVIDIA GB200 NVL72 的高效并行:GB200 NVL72 以全互联拓扑连接 72 个 NVIDIA Blackwell GPU。在该域上分布模型会增加芯片间的通信和同步开销。Together 为 GB200 NVL72 设计了并行网格,使协调成本保持可控——计算收益延续到推理中。
缩短从权重到生产的周期
Cursor 的研究团队内部训练模型——将专有数据与针对编码工作流的定向优化相结合——并生成新的候选权重。与 Together AI 的合作建立了一条可重复的路径,将这些权重转移到类似生产环境的端点进行即时测试。
该路径中的一个关键步骤是量化。实时服务在严格的内存和计算预算下运行,而量化通过使用更少的比特表示权重来减少两者。在编码场景中,质量下降可能表现为微妙的逻辑错误或语法错误,因此量化必须在改善延迟和成本的同时保持输出质量。
Together AI 实现了一个基于 NVIDIA TensorRT LLM 和 Blackwell 上 NVFP4 的量化管道——在激进压缩与 Cursor 编码模型所需的质量标准之间取得平衡。当 Cursor 生成新的候选权重时,Together 对其进行量化、验证,并在数天内启动测试端点。Cursor 运行内部评估套件,然后在生产流量下进行 A/B 测试,最后完成切换。切换过程由验证和实时流量检查控制。

下一步——从延迟到吞吐量
Cursor 的生产部署在多个数据中心的 NVIDIA Blackwell GPU 上运行。NVIDIA GB200 NVL72 处理推理,基础设施支持模型迭代,因为 Cursor 的研究团队会发布新的权重。
随着延迟路径在生产中运行,重点转向吞吐量和利用率。Cursor 和 Together AI 正在 NVIDIA Blackwell 平台上构建更高吞吐量的端点,以随着使用量的增长改善每 GPU 的经济效益。
