DataPrep-Bench:首个统一基准,评估LLM作为训练数据准备工具的能力
大语言模型(LLM)的性能在很大程度上取决于训练数据的质量,但业界此前缺乏一个统一的基准来衡量LLM及其驱动的数据工作流在端到端数据准备方面的表现。近日,来自北京大学、上海人工智能实验室等机构的研究团队推出了 DataPrep-Bench,这也是首个在统一框架下同时评估LLM数据构建与数据质量评估能力的基准。
核心能力:数据构建与质量评估
研究团队将LLM驱动的数据准备拆解为两个互补的能力维度:
- 数据构建:将原始数据源转化为可用于监督训练的标注数据;
- 数据质量评估:在正式训练前,预测候选数据集对下游任务的训练价值。
值得注意的是,这里的“质量”并非指文本表面的流畅性,而是指数据对下游训练的实际效用。
基准设计:跨领域与多模型验证
DataPrep-Bench覆盖了六个领域(如金融、科学、医学等)和多个基础模型。在数据构建任务中,所有方法在相同原始数据上运行,然后通过在输出数据上结合Dolly-15k微调基础模型来评分。研究团队还发布了 Data-Construction-Skill,一个基于技能引导的智能体,在Llama-3.1-8B金融数据集上相比纯Dolly基线提升了近20个绝对百分点,在知识提取密集型领域与最强的智能体和基于DataFlow的方法表现相当。
在数据质量评估任务中,评分函数通过其与下游性能的皮尔逊相关系数来评估。团队提出了 分布对齐分数(DAS),一种基于MMD(最大均值差异)的分布评估器,用于衡量候选数据集与领域代理之间的分布差异。DAS在六个领域中的四个取得了最强的跨模型相关性,并且在数学、科学和医学领域同时达到了 r > 0.70,优于现有的基于质量、多样性和启发式的评估方法。
行业意义:推动数据为中心的AI发展
DataPrep-Bench的出现填补了LLM在数据准备能力评估上的空白。随着LLM在数据生成、清洗和标注中的应用日益广泛,如何系统性地衡量这些“数据准备者”的表现成为关键问题。该基准不仅提供了标准化的评估协议,还释放了可复现的基线方法和数据集,有助于推动数据驱动型AI的进步。
对于从业者而言,DataPrep-Bench的发布意味着可以更客观地对比不同数据准备策略的效果,从而优化训练数据流水线。特别是DAS评估器的提出,为实时数据质量监控提供了新的工具。
小结
DataPrep-Bench是首个将数据构建与质量评估置于同一下游验证框架下的基准,它强调了数据准备作为LLM能力提升的同等重要目标。未来,随着更多智能体方法和评估工具的出现,数据准备环节有望成为LLM应用落地的关键突破口。