
突破发生在一个假日周末。2022年阵亡将士纪念日。当硅谷大部分人在烧烤时,Dan Fu、Tri Dao和他们的同事即将证明AI界的共识是错误的。
传统观点认为:Transformer注意力机制已经优化到位。GPU专家已经从硬件中榨取了每一滴性能。剩下的提升空间不多了。
然后Dan、Tri和他们的同事发表了FlashAttention。
时任特斯拉AI高级总监的Andrej Karpathy当天下午在推特上提到了它。几小时内,它就在AI研究圈中迅速传播。“说实话,我们发布时没指望有人会看到,”Dan回忆道。“我们原本准备在周二早上发布一些博客和代码。但周一晚上7点我们看到Karpathy发了推文——那时我们才知道这件事引起了关注。”

先前关于稀疏性和低秩方法的研究显示了理论上的加速,但实际性能提升只有10%。FlashAttention团队采取了不同的方法:理解实际的GPU内存移动和计算模式。通过将经典的数据库系统原理(关于数据局部性和内存层次结构的不起眼的东西)应用于注意力机制,他们实现了2-3倍的加速。
对于背后的研究人员来说,其意义是明确的。GPU优化中仍有巨大的未开发潜力。这篇论文成为了如今AI领域最具影响力的内核研究团队之一的基础,也是AI原生云的关键构建块。
没人谈论的问题
以下是大多数人对AI不了解的地方:拥有最好的模型和最好的硬件是不够的。瓶颈在于它们之间的差距:将数学运算转换为芯片指令的软件层。这就是内核发挥作用的地方。
研究人员设计的架构与实际在硬件上快速运行的架构之间存在巨大差距。许多基础架构(ResNets、LSTMs、RNNs)是在扩展范式确立之前设计的。随着研究人员将模型扩展到数千亿参数,硬件也随之发展。GPU变得越来越专业化,成为矩阵乘法机器,针对主导现代AI的Transformer架构进行了优化。
内核是数学抽象与芯片现实之间的转换层:它精确地告诉GPU如何移动数据和高效执行计算。做对了,就能释放硬件的全部潜力;做错了,硬件就会闲置。
对于AI原生应用(以AI为核心构建的产品)来说,这个差距是生死攸关的。你无法在低于最佳容量的基础设施上构建响应迅速的AI原生应用。当推理成本比应有水平高出两倍时,你无法扩展AI原生业务。AI原生云需要从芯片层开始优化的AI原生基础设施。
一周完成一年的工作
2025年3月,我们的内核团队已发展到约15人:既有寻求系统挑战的机器学习研究人员,也有进入AI领域的GPU资深专家。我们刚刚获得了NVIDIA新款Blackwell GPU的访问权限,这是最新一代硬件,其能力与前代产品有根本性不同。
挑战很具体:NVIDIA团队花费一年时间为Blackwell开发优化内核,投入了数十名工程师并拥有对硬件的深入了解。而我们只有一周时间。
我们需要一种能让我们快速行动的工具。这个工具就是ThunderKittens,一个我们与斯坦福大学研究人员合作开发的库。
“我们有将内核适配到新硬件的经验,也知道这需要时间,”Dan说。“例如,FlashAttention-3在Hopper全面可用一年后才发布。我们希望构建工具,以便更容易地为新一代硬件快速构建内核,而ThunderKittens就是答案。”
ThunderKittens围绕NVIDIA的张量核心构建,这些是GPU上专门用于矩阵乘法的硬件单元。通过围绕张量核心构建抽象,ThunderKittens将原本1000多行的CUDA代码减少到100–200行。
团队夜以继日地工作,将ThunderKittens适配到Blackwell的新特性:第五代张量核心,运行速度比上一代快2–2.5倍;一层新的张量内存,提供额外256KB的超快片上存储;以及CTA对,允许线程块进行更深入的协调。

在获得硬件访问权限的一周内,我们为Blackwell提供了一些最快的FP4和FP8 GEMM内核,在H100上比cuBLAS快高达2倍。
学术引擎
ThunderKittens并非凭空而来。它是这个团队构建方式中更广泛模式的一部分。
Dan Fu在UCSD领导一个实验室,专注于高风险的基础研究,包括他个人热衷的FFT算法项目(一个大多数行业研究人员永远不会触及的细分领域)。Together AI联合创始人兼首席科学家Tri Dao在普林斯顿大学。Simran Arora在加州理工学院。
这种模式是共生的:在学术界降低风险,在Together AI将其产品化。博士生加入公司。Together AI的实习生在学术实验室从事更长期的研究。想法双向流动。
这种理念塑造了招聘。我们寻找的不是只想交付代码或积累引用次数的人。我们想要那些为内存访问模式而失眠的人。那些在数据流图中发现美的人。那些真正对将前沿研究投入生产感到兴奋的人。研究本质上涉及反复的失败。你必须由真正的兴趣驱动,高于一切。即使是像FFT这样不热门的领域,如果真正有趣,也值得追求。
这个团队已成为下一代系统研究人员的跳板,这些人能够弥合理论与生产之间的差距。我们已经“毕业”了Yucheng Lu教授,他现在是上海纽约大学HeavyBall研究组的助理教授和负责人。
Together Megakernel:从281ms到77ms
将该学术引擎应用于生产用例的一个例子涉及一家领先的实时语音代理公司。他们带着一个硬性约束来到Together:首个64个token的时间超过约100ms会破坏对话体验。在他们之前的设置中,部署在NVIDIA B200 GPU上,他们达到了281ms。对大多数工作负载来说很快。但对他们的需求来说还不够快。
Together的内核团队与他们合作选择了一个模型架构,然后手动优化了一个Megakernel实现,该实现在单个内核中运行整个模型,目标是达到NVIDIA H100的HBM带宽上限。

结果:在Llama-3.2-1B上达到77ms,相比之前的部署性能提升了3.6倍,单位经济效益提升了7.2倍。在Qwen 2.5 1.5B上:127ms,低于B200基线的292ms。
Together Megakernel是开源研究的生产实现,最初与斯坦福大学的合作者共同开发。与FlashAttention同属一个研究谱系,它是硬件-软件协同设计,缩小了理论可能性和部署系统实际交付之间的差距。
世界级研究遇上生产现实
以下是Together AI的不同之处:我们的内核团队不仅仅是一个发表论文的研究组织。我们面向客户,直接与战略合作伙伴合作,改进他们的部署。
以Cursor为例。当你构建一个AI原生产品时,每一毫秒的延迟都至关重要,开发人员实时等待代码补全,通用基础设施无法满足需求。你需要针对特定工作负载、特定模型、特定SLA要求的定制优化。
这就是你与Together AI合作时得到的:直接接触顶级内核研究团队。我们分析你的工作负载。我们识别瓶颈。我们编写自定义内核来消除它们。我们不是超大规模云服务商,在那里你只是大池塘里的一条小鱼,提交支持工单并希望有人最终查看你的问题。
对于拥有最严格SLA的客户(那些需要实时响应的客户,那些大规模运行且每个效率百分点都转化为数百万成本节省的客户),我们构建定制解决方案。针对系统瓶颈的自定义内核。针对特定模型架构的自定义优化。我们研究团队的全部力量都集中在让你的部署尽可能快上。
这就是AI原生云在实践中的样子:世界级研究团队与AI原生构建者携手合作,缩小理论可能性和生产实际运行之间的差距。
协作、好奇、不懈
我们的团队文化建立在求知欲和协作之上,而非竞争——大约15人,具有Dan Fu所说的“干劲十足”的心态。
“我们是友善的人,”Dan说。“没有摇滚明星式的自负。只有对这个时代感到兴奋并热爱一起解决难题的人。”
团队主要有两种类型:想要系统挑战的机器学习人员,以及转向机器学习的GPU/图形人员。两者都需要学习另一半。“你要理解所有部分,这样才知道它们如何协同工作,”Dan解释道。
我们在寻找那些想要深入技术细节、不放过任何角落的人——不只是让某样东西工作,而是理解它为什么工作、如何能工作得更好、以及支配其行为的基本原理是什么。
这项工作有时并不光鲜。当内核优化落地时,不会有任何公告。只有更快的训练时间、更低的成本、更高的吞吐量:这些决定生产系统能否运行的指标。
但这些边际收益比几乎其他任何东西都重要。
这就是模型训练三周与三个月之间的差别;API 响应 100 毫秒与 1 秒之间的差别;为相同结果花费 1000 万美元计算成本与 500 万美元之间的差别。对于下一代 AI 原生应用和公司来说,这些边际收益决定了你的产品是感觉即时还是迟缓。你的单位经济是否可行。你是能扩展到数百万用户,还是停留在数千用户。
数据质量很重要。模型架构很重要。训练技术很重要。但如果你不能让硬件高效工作,其他一切都无法规模化。
对于某类工程师——那些在内存访问模式和计算效率中发现美感,想要在使一切成为可能的无形支架上工作的人——这是最令人兴奋的地方。
加入我们
我们正在为内核研究团队招聘。如果你对性能优化充满热情,并渴望在硬件与 AI 的交汇处工作,立即申请。
