SheepNav
精选今天0 投票

不用大模型也能打榜:TW3Cast 用冻结路由表在 GIFT-Eval 上冲到第三

一个「不含智能体、不含大模型」的第三名

在时间序列预测基准 GIFT-Eval 上,一个名为 TW3Cast 的系统拿到了 130 个条目中的第 3 名(按平均 MASE 排名,统计截至 2026-09-14)。有意思的是,排在它前面的两个条目都属于榜单的「智能体(agentic)」类别——也就是用智能体或语言模型去推理、生成或挑选预测结果的系统。

TW3Cast 反其道而行:它不跑智能体,也不跑语言模型。作者 Nathan Thierry 和 Andre-Louis Rochet 在论文中给出的核心设计,是一张「算一次、然后冻结」的路由表。

路由表:97 种配置,四种模式

GIFT-Eval 包含 97 组「数据集 × 频率 × 预测跨度」配置。对每一组配置,TW3Cast 的路由表会指定以下四种模式之一:

  • 专家(specialist):对 Chronos-2、TiRex 或 Toto 做 LoRA 或全量微调,且训练数据经过显式规则清洗与增强;
  • 分位数混合(quantile blend):混合结果中包含一个专家;
  • 基座模型混合:多个基座模型直接融合;
  • 选择锦标赛(tournament):在从训练集切出的回测上跑一轮比拼。

关键在于,表里的每一个决策都是在训练集回测上做出的。一旦某个专家在该回测中击败锦标赛方案,它就会被接纳进路由表——这意味着一个候选方案的成本只有几 MB 存储和几分钟 GPU 时间,而且候选失败不会改变任何已有结果,试错代价极低。

三道「护栏」防止选择偏差

作者显然意识到,在训练集上做选择容易产生乐观偏差,因此设置了三重保护机制:

  1. 精度与校准双重准则:不只看准确率,也看预测分布的校准程度;
  2. 非对称边际:对「训练期间见过该序列」的候选方案施加更严格的准入条件;
  3. 保守的逐窗口门控:以窗口为单位进行把关。

此外,选择规则本身也是在一轮「时间元回测」中确定的,而不是拍脑袋设定。

数字说明了什么

论文给出了几组对比:

  • 单个最佳基座模型单独使用:平均 MASE 排名 33.8;
  • 所有配置都使用锦标赛方案:38.0;
  • 完整路由器:19.4。

从 33.8 到 19.4,提升并非来自更大的模型或更多的算力,而是来自**「为每种场景挑对工具」这件事本身**。这恰好呼应了当下时间序列领域的一个争论:通用大模型是否真能通吃所有预测任务,还是「基座模型 + 场景化路由」才是更务实的路径。

可复现性

作者释放了路由表、专家索引、固定版本的基座模型 revision、提交的分数文件,以及公开榜单分数的带日期快照,并声称论文中每一个榜单数字都可以由一个脚本重新生成。在基准成绩争议不断的当下,这种程度的可复现承诺本身就是一个信号。

需要说明的是,该论文目前为 arXiv 预印本(arXiv:2609.28506),尚未经过同行评审,榜单排名也会随时间变动。

延伸阅读

  1. Proaction 借助 Codex 实现销售额增长 60%,每月节省 75+ 小时
  2. 五角大楼砸3000万美元打造AI测谎仪,专家为何称其「最糟糕的组合」?
  3. 五角大楼拟投3000万美元打造AI测谎仪,专家称方向错误
查看原文