精选今天0 投票
这些初创公司正在追逐LLM的下一个重大突破
自2017年谷歌研究人员发表《Attention Is All You Need》以来,Transformer架构已成为所有主流大语言模型(LLM)的核心引擎。然而,随着模型规模和输入长度的增长,其固有的计算瓶颈日益凸显。如今,一批初创公司正试图挑战Transformer的统治地位,探索新的架构以推动AI的下一波发展。
Transformer的局限
Transformer的核心优势在于密集注意力机制,它通过将文本中的每个词与其他所有词进行比较来捕捉语义。这种机制在短文本上表现出色,但处理长文本时计算量呈指数级增长。例如,一篇1万字的文档可能需要执行5000万次乘法运算,这导致巨大的能耗和成本。OpenAI总裁Greg Brockman表示,公司今年在计算上的投入将达到500亿美元。
后Transformer时代的探索
为了克服这些瓶颈,研究人员和初创公司开始探索替代方案。其中一种思路是稀疏注意力,它只让部分词对进行交互,从而降低计算复杂度。另一种方向是状态空间模型,如Mamba,它通过线性复杂度处理序列,大幅减少计算量。此外,混合架构将Transformer与其他机制结合,试图取长补短。
这些探索催生了一批新兴初创公司,例如Subquadratic,其名称暗示了降低计算复杂度的目标。尽管这些公司面临巨大挑战,但它们也拥有灵活性和创新动力,可能在未来AI格局中占据一席之地。
未来的不确定性
虽然Transformer的统治地位尚未被撼动,但AI领域的发展充满变数。业界普遍认为,LLM不会消失,但其底层架构可能迎来变革。正如MIT Technology Review在年度榜单中所指出的,新一代模型(被称为“LLM+”)正在孕育之中。初创公司的努力可能推动这一进程,但最终哪些技术能胜出,仍需时间检验。


