
摘要
当前的数据科学基准依赖于不兼容的评估接口。此外,许多任务可以在不使用底层数据的情况下解决。我们通过引入DSGym来解决这些限制,这是一个在自包含执行环境中评估和训练数据科学智能体的集成框架。使用DSGym,我们训练了一个最先进的开源数据科学智能体。
arXiv论文:https://arxiv.org/abs/2601.16344
GitHub仓库:https://github.com/fannie1208/DSGym
数据科学是现代科学发现的计算引擎。然而,评估和训练基于LLM的数据科学智能体仍然具有挑战性,因为现有基准在异构执行环境中评估孤立的技能,使得集成成本高昂且公平比较困难。
我们引入了DSGym,这是一个统一框架,通过单一API集成多样化的数据科学评估套件,并提供数据集、智能体和指标的标准化抽象。DSGym统一并改进了现有基准,同时通过新颖的科学分析任务(来自学术文献的90个生物信息学任务)和具有挑战性的端到端建模竞赛(92个Kaggle竞赛)扩展了范围。除了评估,DSGym还为智能体训练提供了轨迹生成和合成查询管道——我们通过在2k个生成示例上训练一个4B模型来展示这一点,实现了开源模型中最先进的性能。

(a) 典型的科学发现过程。DSGym专注于数据驱动的调查阶段,任务涵盖10多个领域和文件类型。
(b) DSGym概述。该框架通过合成数据生成支持评估(数据分析和预测任务)和训练。
框架和数据集
DSGym的主要贡献之一是将代码执行的复杂性抽象到容器中,这些容器可以实时分配以安全执行代码;这些容器预装了依赖项和可供处理的数据。
DSGym为所有基准提供了统一的JSON接口,每个任务表示为:数据文件、查询提示、评估指标和元数据。我们力求设计模块化和简单化。这样,用户添加新任务、智能体框架、工具和评估脚本应该更简单。DSGym中的任务分为两个主要轨道:
数据分析(通过程序化分析进行查询回答)。数据预测(端到端机器学习管道开发)。
除了集成MLEBench和QRData等已有基准外,DSGym还引入了原始数据集。具体来说,我们通过创建两个新颖的套件来扩展总体范围:DSBio(来自学术文献的90个生物信息学任务,探索特定领域的工作流程)和DSPredict(92个Kaggle竞赛,涵盖时间序列、计算机视觉、分子性质预测和单细胞扰动)。下图总结了这两个套件的创建过程:

为了支持任务执行和数据生成,DSGym 提供了一个数据生成管道来执行查询并生成轨迹,将框架转变为一个可以有效训练模型的数据工厂。
使用这个管道,我们生成了 3,700 个合成查询。在应用基于 LLM 的质量过滤后,我们获得了 2,000 个高质量的查询-轨迹对用于监督微调。我们的结果(如下所示)表明,这些数据可以有效地提高模型在数据科学任务上的性能,即使对于小模型也是如此。
结果
我们在此展示主要发现。更多结果可在论文中找到。
解决记忆化差距
第一个重要的结果涉及记忆化。我们观察到,许多现有的基准查询提供的信号很弱:即使没有数据文件访问权限,仍有相当一部分查询是可解的,这表明 LLM 可能在训练期间已经了解了这些任务。

因此,我们确保标记并排除这些可能出现在模型训练集中的示例。DSGym 应用质量过滤和仅提示快捷方式过滤来移除此类任务,生成精炼的数据集:DAEval-Verified、QRData-Verified、DABStep 和 MLEBench-Lite。
基准性能与失败模式
在创建这些新基准后,我们在通用数据科学和特定领域科学任务上测试了前沿专有和开放权重 LLM。
我们训练的 4B 模型(Qwen3-4B-DSGym-SFT-2k)在通用分析基准上取得了与更大模型相当的性能。
有趣的是,大多数模型在这些基准上仍远未获得满分。为了理解模型在这些任务上失败的原因,我们对每个模型和任务族随机抽取了 50 个失败轨迹进行了手动错误分析。这一分析揭示了一个有趣的模式:通用分析任务显示出多样化的失败模式,其中统计知识差距和规划错误最为常见,而科学分析任务则主要由单一失败模式主导。

四个 LLM 在 (a) 通用分析任务(QRData 和 DAEval)和 (b) 科学分析任务(DSBio)上的错误类型细分。对于每个模型和任务族,我们均匀抽取 50 个失败轨迹,并手动分配主要错误类别。一个关键转变出现了:通用任务上的失败主要由统计知识和规划问题主导,而 DSBio 上的失败则绝大多数由领域基础错误驱动(各模型占比 85–96%)。
数据预测性能
DSPredict 评估智能体构建完整机器学习管道的能力——从原始数据到最终模型——模拟 Kaggle 竞赛的复杂性。
我们在 DSPredict-Easy 和 DSPredict-Hard 划分上评估模型。性能通过以下指标衡量:
有效提交:成功生成格式正确的输出文件。中位数/百分位数:相对于原始竞赛排行榜的性能。奖牌:达到相当于铜牌、银牌或金牌的分数阈值。
我们使用一个简单的类 CodeAct 脚手架。每个智能体的总时间限制为 10 小时,每次代码执行限制为 2 小时。
我们对 DSPredict 结果的分析揭示了关于 LLM 智能体在端到端机器学习工作流中当前能力和局限性的几个关键见解。
高可靠性,低竞争力:虽然前沿模型(如 GPT-5.1 和 Claude 4.5)在创建功能管道方面表现出色——实现了超过 85% 的有效提交率——但它们难以具有竞争力。很少有模型能在“困难”任务上持续击败人类中位数。
一个主要瓶颈是模型倾向于选择阻力最小的路径。当面临技术摩擦或复杂数据时,智能体通常默认采用简单基线或“安全”启发式方法,而不是追求高性能建模策略。
推理与规模:高推理模型(GPT-5.1-high)显示出显著领先优势,这表明数据科学所需的“怀疑性”坚持——调参、验证和迭代——目前比原始参数数量更为关键。
结论
DSGym 提供了一个统一的框架来评估和训练数据科学智能体。我们揭示了当前方法中的一个基本挑战:模型在通用任务上严重依赖记忆,而在科学问题上却未能将分析扎根于领域知识。
通过提供涵盖两种任务类型的标准化基准,DSGym 使得系统研究如何构建真正推理数据而非回忆模式的智能体成为可能。我们还发布了一个功能强大的开源数据科学智能体,易于开发和部署。我们希望这一资源能加速迈向更可靠、更通用的数据科学自动化的进程。
