精选今天0 投票
TAPR:任务感知提示重写器,让非专家也能用好大模型
背景与挑战
大语言模型(LLM)的性能很大程度上依赖于提示词(Prompt)的质量,但精心设计提示词对普通用户而言门槛较高。为降低这一使用障碍,研究者提出了任务感知提示重写器(TAPR),通过自动将用户原始提示改写为任务优化提示,从而提升下游任务的模型表现。
方法与亮点
TAPR 采用强化学习训练,具体使用组相对策略优化(GRPO),并借助LLM-as-judge对改写后的提示及对应任务输出进行双重评估,以指导模型学习。在问答、摘要、算术推理等多样任务上的实验显示,TAPR 在提示改写能力上持续优于基础模型。
实验与结果
研究者以 Phi-4-mini-instruct 作为 TAPR 的基础模型进行微调,实验表明 TAPR 生成的提示包含更清晰、更具指导性的语言,在 Natural Questions 和 GSM8K 等基准上取得了更高的准确率。
意义与展望
TAPR 的意义在于自动化提示工程,让非专家用户也能高效使用 LLM,同时为提示优化提供了一种可复现的强化学习范式。未来,TAPR 有望扩展至更多任务类型,并与其他模型优化技术结合,进一步释放 LLM 的潜力。
论文代码已公开,可访问 arXiv 获取更多细节。
