新上线今天0 投票
为何AI检测无法保障学术诚信:新研究揭示误判与规避悖论
学术机构正广泛使用商业AI检测工具来维护学术诚信,但一项新研究揭示了这些工具的根本性缺陷:它们无法区分AI辅助编辑与完全由LLM生成的草稿,可能将合规的AI辅助行为误判为学术不端。研究团队在arXiv上发布的预印本中,通过对2013-2015年与2023-2025年四个领域的已发表英文摘要进行受控实验,量化了这一政策失效问题。结果显示,在tau=0.50的代理标签下,轻量级的“仅润色摘要”编辑(代表合规的AI辅助)被标记为AI生成的比例高达64%至80%(Pangram/GPTZero),而未经修改的近年原文被误标率仅为9%至15%,且非STEM领域远高于STEM领域(p<0.001)。研究还发现,检测得分与长token及学术词汇密度相关,而非仅与作者意图相关。更令人担忧的是,使用Undetectable AI等工具进行“人性化”改写后,AI标记率降至4%以下,即规避几乎完全成功,而诚实使用AI辅助的学者反而面临更高的制裁风险。该研究明确指出,检测器分数不应作为学术不端的唯一证据。