
九篇论文作为列表来看信息量很大。更好的阅读方式是按照它们在技术栈中的位置来理解。前沿AI并非构建在单一层次上。它是从智能体到GPU内核的研究产物,如果周围层次无法跟上,任何单一层次的提升都是浪费。
这是我们工作的核心。从顶层的智能体到底层的内核,我们的研究触及每一层,每一层又为下一层提供输入。这些研究成为Together平台的一部分,而平台上运行的生产工作负载又指引我们解决下一个研究问题。Aurora——我们在ICML上关于自适应推测解码的论文——就是一个明显的例子:同样的工作路线如今已作为我们的ATLAS推测器在生产环境中部署。
以下是今年的工作,按层次从上到下排列。
前沿智能体
技术栈的顶层:构建能够完成实际工作的智能体,并对其进行诚实评估。
涵盖10多个领域的100多项数据科学任务,统一在单一评估和训练API下。 数据科学智能体一直难以公平衡量,每个基准都有其自己的接口,而且许多任务无需打开数据即可解决。DSGym标准化了测量方法并堵住了这个漏洞。
它将多种评估套件统一到一个API下,共享数据集、智能体和指标的抽象,并在一个独立的执行环境中运行每个任务,智能体必须处理数据而非回忆答案。在改进现有套件的基础上,它增加了90项基于学术文献的专家生物信息学任务和92项端到端的Kaggle式建模竞赛。同样的环境反过来作为训练引擎:轨迹生成和合成查询流水线产生经过执行验证的数据,我们利用这些数据将4B模型训练成最先进的开源数据科学智能体,无需人工标注。诚实评估、从同一框架合成数据、微调、重新评估,全部在一个框架内完成。
作者:Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou。合作者来自斯坦福大学、杜克大学和哈佛大学。
实现智能体工作负载1.5至3.6倍的推理吞吐量提升,仅需三行代码即可采用。 并行智能体工作负载不再因负载而崩溃,而解决方案并非更快的模型。
问题在于推理引擎不知道自己在运行智能体。它将多轮工作流的每一步视为独立请求,在负载下延迟增加高达7.14倍。ThunderAgent将工作流本身作为调度器可以端到端推理的一等对象。除了吞吐量提升外,它还在RL rollout中实现了1.8至3.9倍的加速,磁盘节省高达4.2倍,优于现有系统。
作者:Hao Kang, Ziyang Li, Xinyu Yang, Weili Xu, Yinfang Chen, Junxiong Wang, Beidi Chen, Tushar Krishna, Chenfeng Xu, Simran Arora。合作者来自佐治亚理工学院、卡内基梅隆大学和伊利诺伊大学厄巴纳-香槟分校。
数学、GPU内核、竞技算法和生物学四个领域的最前沿发现,全部使用开放模型。 此前所有达到这一水平的成果都依赖于封闭的前沿模型,其API无法检查或运行。TTT-Discover使用开放的120B模型和一种不变的方法,每个问题仅花费几百美元就达到了这一水平。
AI发现的通常方法是搜索:对冻结模型进行数千次提示,并保留最佳样本。TTT-Discover则在其面临的单个问题上,在测试时运行强化学习,因此每次尝试都成为下一次的训练数据,模型在工作中不断改进,并且使用相同的采样预算,普通的best-of-N方法永远无法赶上。相同的设置,未经更改,在数学上为已有60年历史的Erdős问题设定了更紧的界(超过了之前使用封闭模型的AI记录),发现了比GPUMode排行榜上最佳先前提交更快的GPU内核,在竞技编程竞赛中取得了第一名级别的成绩,并在生物学中的单细胞去噪基准测试中创下了新高,所有这些都基于开放的gpt-oss-120b。代码和创纪录的内核均已公开。
作者:Mert Yuksekgonul, Daniel Koceja, Xinhao Li, Federico Bianchi, Jed McCaleb, Xiaolong Wang, Jan Kautz, Yejin Choi, James Zou, Carlos Guestrin, Yu Sun。合作者来自斯坦福大学、英伟达、加州大学圣地亚哥分校和阿斯特拉研究所。
模型塑造
如何训练和塑造模型:推理、微调和强化学习。
在完全没有验证器的情况下,对专家回答的胜率达到25%,而监督微调仅为5.9%。 你可以在没有检查器的任务上获得RL级别的推理能力,比如诗歌写作或财务分析,而不仅仅是数学和代码。
基于RL的推理通常假设有一个可以评分正确性的验证器。RARO(相对对抗推理优化)用对抗游戏取代了它:一个模型既充当产生专家质量答案的策略,又充当相对批评者,学习从两个答案中选择更好的一个。带有平局选项的成对比较对训练稳定性至关重要。在Countdown上,RARO达到了54.4%的准确率,而使用真实验证器的RL为57.7%,尽管没有使用验证器;相比之下,SFT或迭代DPO无法超过40.7%。学习到的批评者可以兼作测试时重排序器,将DeepMath在7B规模上从57.5%提升到68.4%。
*作者:Locke Cai, Max Ryabinin, Ivan Provilkov *
正确回答最多增加10%,来自你已经付费的生成结果。 优势在于更好的答案选择,而非更多计算。
当你采样多个答案但没有预言机时,独立评分每个答案会失败,评判者几乎给所有答案打10分,失去了区分能力。V1通过近线性的瑞士锦标赛验证器将选择重新定义为比较。训练方法V1-PairRL教会单个模型同时生成和成对验证自己的输出,即使没有测试时验证,也能提高基础准确率。
作者:Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan, Xiaoxia Wu, Junxiong Wang, Alpay Ariyak, Qingyang Wu, Samir Khaki, Rishabh Tiwari, Long Lian, Yucheng Lu, Boyi Li, Alane Suhr, Ben Athiwaratkun, Kurt Keutzer。与加州大学伯克利分校、NVIDIA 和 Mila 的合作者。
算法优化
降低推理的数学成本:推测解码、量化、强化学习推理。
在 MiniMax M2.1 229B 和 Qwen3-Coder-Next 80B 等全新前沿模型上实现 1.5 倍的初始加速,并且在流量变化时,相比强静态推测器额外获得 1.25 倍加速。 推测解码在第一天就很快,并且运行时间越长,速度越快。
大多数部署离线训练推测器并冻结它,因此部署缓慢,并且随着流量和目标模型的变化而过时。Aurora 将在线推测器学习重新定义为在生产环境中运行的异步强化学习问题:接受和拒绝的令牌作为奖励信号,训练服务器持续更新推测器,新权重以零停机时间热替换到服务器中。
作者:Junxiong Wang, Fengxiang Bie, Jisen Li, Zhongzhu Zhou, Zelei Shao, Yubo Wang, Yinghui Liu, Qingyang Wu, Avner May, Sri Yanamandra, Yineng Zhang, Ce Zhang, Tri Dao, Percy Liang, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu.
系统优化
训练和服务模型的系统:分离、批处理、调度、上下文并行。
在单个 8xH100 节点上进行 500 万令牌上下文训练,注意力内存最多减少 87.5%。 无需更大的集群即可进行超长上下文训练。
注意力层内的激活内存限制了长上下文训练,增加 GPU 也无法突破这一上限。UPipe 一次处理少量注意力头,并在不同阶段重用相同的缓冲区,从而将 32B Transformer 的峰值注意力内存减少高达 87.5%。结果是在单个节点上实现 500 万令牌,比先前方法高出约 25%,在两个节点上实现 800 万令牌,同时保持相同的吞吐量。它是 DeepSpeed-Ulysses 的即插即用替代品,基于相同的 FlashAttention-3 内核,并且代码已开源。
作者:Ravi Ghadia, Maksim Abraham, Sergei Vorobyov, Max Ryabinin.
MoE 解码延迟最多降低 39%,无需重新训练,无需更改架构。 你免费回收了批处理悄悄破坏的稀疏性。
混合专家模型本应很廉价,因为每个令牌只触及少数专家,但一旦批处理,这种稀疏性就会崩溃:在批大小为 16 时,每个令牌需要八个专家的模型最终会加载大约 82 个专家。OEA 的批感知路由在推理时分两个阶段恢复稀疏性,第二阶段让令牌共享批已加载的专家,以零延迟成本换回质量。在 AIME24、GPQA、LiveCodeBench 和 MATH 500 上精度保持稳定,并且只有一个超参数需要调整。
作者:Costin-Andrei Oncescu, Qingyang Wu, Wai Tong Chung, Robert Wu, Bryan Gopal, Junxiong Wang, Tri Dao, Ben Athiwaratkun。与哈佛大学和普林斯顿大学的合作者。
内核
堆栈的基石:原始硬件在此转化为可用速度。由FlashAttention、ThunderKittens和Megakernel背后的团队构建。
我们建立了首个多GPU内核生成基准测试。它包含87个真实分布式工作负载,而当今最先进的前沿模型仅能解决不到三分之一。
ParallelKernelBench从Megatron-LM、DeepSpeed、NeMo-RL和TensorRT-LLM等生产代码库中选取了87个问题,涵盖12种并行形式。每个问题要求模型用使用对称内存进行直接NVLink通信的CUDA内核替换PyTorch和NCCL参考实现。零样本情况下,最佳模型解决了87个中的28个。在包含编译、正确性和性能反馈的智能体循环中,Gemini 3 Pro从24个正确提升至35个,并在26个问题上超越了PyTorch基线。其中少数几个的运行速度比任何公开实现都快。单GPU代码生成正在被攻克。多GPU才是瓶颈所在,因为通信而非计算决定了上限。
作者:Willy Chan, Nathan Paek, Simon Guo, Simran Arora, Daniel Y. Fu.
论文:https://www.alphaxiv.org/abs/2606.parallel-kernel-bench
数据一览
首尔会场位置
全部九篇论文将在2026年7月6日至11日于首尔举行的ICML 2026上展示。欢迎莅临B714展位深入了解。
我们将在整个会议期间驻守展位。欢迎前来:
1/ 与论文作者交流任何一篇论文
2/ 观看从智能体到生产推理的研究落地
3/ 与团队会面,了解我们下一步的工作
加入我们,共同构建
我们正在招聘希望跨全栈(而非仅某一层)工作的研究员和研究工程师。请访问together.ai/careers查看空缺职位,或来展位找我们。
