Signal YCurated AI News
更新于 8/20 09:5261 个信源

这些初创公司正在追逐LLM的下一个重大突破

通用 AI8/10 17:00MIT Technology Review · AI查看原文 ↗
摘要

本文指出,Transformer虽统治LLM领域九年,但稠密注意力机制带来的计算成本与上下文窗口限制日益凸显,一批初创公司正尝试用新架构取代它。

核心要点
  • Transformer架构源自2017年论文“Attention Is All You Need”,现为所有主流大语言模型的核心引擎。
  • 稠密注意力要求每个token与所有其他token进行乘法比较,计算量随文本长度近似平方增长。
  • 处理一篇1万词的文档,Transformer可能需要执行5000万次乘法运算。
  • OpenAI总裁Greg Brockman称,公司今年将在计算上投入500亿美元;国际能源署预测数据中心耗电量到2030年将翻倍。
  • 近期推理模型和超长上下文等进展被视为对Transformer缺陷的权宜性修补,而非自然延伸。
原文佐证
  • “The entire AI industry is built on transformers,” says Justin Dangel, cofounder and CEO of the AI startup Subquadratic.
  • A document 10,000 words long might require a transformer to perform 50 million multiplications.
AI 洞察
Transformer的算力瓶颈正在催生新的架构竞赛。若初创公司能够突破稠密注意力的限制,可能从根本上降低大模型的训练与推理成本,使AI能力从少数巨头下沉到更多参与者;同时,现有巨头在Transformer上的海量投资也可能形成路径依赖,成为转型中的掣肘。