SheepNav
新上线今天0 投票

困难样本与坏标签:不确定性采样在标签噪声下的表现测试

主动学习(Active Learning)通过挑选最具信息量的样本,能有效降低标注成本。但一个直觉上的矛盾是:模型最不确定的样本,往往也是最难被正确标注的。那么,不确定性采样(Uncertainty Sampling)的失败,究竟是因为它选到了更多错误标签,还是因为错误集中在困难区域而格外有害?

近期一篇来自 arXiv 的论文(编号 2608.13601)针对这一问题展开了系统测试。研究者 John Myron Uy 在三个公开的二分类表格数据集上,对比了基于边际(margin)的不确定性采样与随机采样,在三种标签噪声条件下的表现:干净标签、随机分类噪声(RCN)以及有界难度依赖噪声(难度越高的样本,噪声越大)。

实验设计相当严谨:使用 100 对配对随机种子、9 个期望噪声率(从 0 到 0.30)、标注预算从 20 到 120(干净标签延伸至 400),并采用逻辑回归作为基学习器,在每个预算下通过交叉验证重新选择正则化参数。

核心结果显示:在干净标签下,不确定性采样在所有数据集上均提升了归一化平衡准确率曲线下面积(AUC),提升幅度在 1.09 到 1.77 个百分点之间。然而,当引入难度依赖噪声后,情况变得复杂:在 Breast Cancer Wisconsin 数据集上,难度依赖噪声在 8 个噪声率中的 6 个上比 RCN 更削弱不确定性采样的优势;但在 Banknote Authentication 和 MAGIC Gamma Telescope 数据集上,这一现象并未出现。

进一步的“暴露匹配”(exposure-matched)分析发现,没有证据表明结构化错误位置会带来额外的普遍惩罚。换句话说,不确定性采样获取更多错误标签这一点,并不能完全解释其性能下降;错误的具体位置(是否集中在困难区域)的影响因数据集而异。

有趣的是,在干净的 MAGIC 数据上,不确定性采样在提升平衡准确率的同时,却降低了平均精度(average precision)和固定假阳性率下的真正例率。这说明,评估指标的选择会显著影响对采样策略优劣的判断。

结论:不确定性采样在标签效率上确实有优势,但其鲁棒性高度依赖数据集、预算、噪声结构以及评估指标。该研究提醒我们,在实际应用中,不能盲目信任不确定性采样,尤其是在标签质量参差不齐的场景下。

该论文共 14 页,包含 5 张图和 4 张表,并提供了代码和可复现材料。对于从事主动学习研究和应用的开发者而言,这项研究提供了一个重要的视角:在考虑标注成本的同时,必须将标签噪声的分布特性纳入考量。

延伸阅读

  1. 查询知道该遗忘什么:线性注意力中的第二擦除方向
  2. 对比学习赋能对撞机实验:可解释异常检测新框架ORCA
  3. 鲁棒双模型协作随机向量功能链接网络
查看原文