SheepNav
精选今天0 投票

这些初创公司正在追逐LLM的下一个重大突破

自2017年谷歌研究人员发表《Attention Is All You Need》以来,Transformer架构已成为所有主流大语言模型(LLM)的核心引擎。然而,随着模型规模和输入长度的增长,其固有的计算瓶颈日益凸显。如今,一批初创公司正试图挑战Transformer的统治地位,探索新的架构以推动AI的下一波发展。

Transformer的局限

Transformer的核心优势在于密集注意力机制,它通过将文本中的每个词与其他所有词进行比较来捕捉语义。这种机制在短文本上表现出色,但处理长文本时计算量呈指数级增长。例如,一篇1万字的文档可能需要执行5000万次乘法运算,这导致巨大的能耗和成本。OpenAI总裁Greg Brockman表示,公司今年在计算上的投入将达到500亿美元。

后Transformer时代的探索

为了克服这些瓶颈,研究人员和初创公司开始探索替代方案。其中一种思路是稀疏注意力,它只让部分词对进行交互,从而降低计算复杂度。另一种方向是状态空间模型,如Mamba,它通过线性复杂度处理序列,大幅减少计算量。此外,混合架构将Transformer与其他机制结合,试图取长补短。

这些探索催生了一批新兴初创公司,例如Subquadratic,其名称暗示了降低计算复杂度的目标。尽管这些公司面临巨大挑战,但它们也拥有灵活性和创新动力,可能在未来AI格局中占据一席之地。

未来的不确定性

虽然Transformer的统治地位尚未被撼动,但AI领域的发展充满变数。业界普遍认为,LLM不会消失,但其底层架构可能迎来变革。正如MIT Technology Review在年度榜单中所指出的,新一代模型(被称为“LLM+”)正在孕育之中。初创公司的努力可能推动这一进程,但最终哪些技术能胜出,仍需时间检验。

延伸阅读

  1. AI for Science:需要推理,而非仅仅数据
  2. AI群聊:输入目标,与六位AI头脑实时语音对话
  3. Vidaya:融合可穿戴、实验室与DNA数据,打造你的专属健康寿命评分
查看原文